产品推荐 2026-07-28

xinfer:纯 Rust 极速跨平台的大语言模型推理软件

纯 Rust 实现的极速大语言模型推理引擎,无需 Python 依赖。

开源软件Linux工具

产品简介

xinfer Infer 是用纯 Rust 编写的高性能大语言模型推理引擎,无需 PyTorch 或 Python 运行时,实现极快推理速度和低资源占用。适合需要高效、可移植 LLM 部署的开发者、研究人员和企业用户,解决传统推理工具依赖重、性能瓶颈的问题。

xinfer 主界面

核心功能

  • 零 Python 依赖,纯 Rust 后端
  • 极速推理,支持 Flash Attention 和 CUDA 优化
  • 轻量级设计,核心代码少于 5000 行
  • 跨平台支持 CUDA 和 Metal
  • 生产就绪,兼容 OpenAI API 和内置 Web UI

快速开始

  1. 使用 curl 命令安装 DEB 包或通过 npm 安装 xinfer
  2. 运行 xinfer 命令指定模型路径或 HuggingFace ID 启动推理
  3. 添加 --ui-server 参数启动内置 Web UI 或通过 API 端点访问

界面预览

与其他方案对比

对比项xinfer同类方案
依赖环境纯 Rust 实现,无需 PyTorch 和 Python 运行时通常依赖 PyTorch、CUDA Python 等,环境配置复杂
推理性能支持原生 Flash Attention、KV 缓存压缩等,极速推理受限于 Python 运行时开销,推理速度较慢

适合谁用

  • 需要部署大语言模型服务的开发者
  • 在消费级 GPU 上运行大型模型的研究人员
  • 追求高性能和低延迟 AI 应用的工程师

下载与版本

当前最新版本为 v0.14.1,发布于 2026-07-24。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/guoqingbao/xinfer