产品简介
LLM-TPU 是开源工具,专为SOPHGO BM1684X/BM1688 TPU设计,帮助用户轻松部署大语言模型和多模态AI模型,解决部署复杂、推理效率低的问题,适合AI开发者和研究人员。

核心功能
- 一键编译部署主流AI模型
- 支持多种模型如Qwen、Llama、DeepSeek等
- 多模态推理支持文本、图像、视频和音频
- 高效推理优化包括量化和KV Cache
- 提供Python和C++演示代码及预编译模型
快速开始
- 克隆仓库:git clone https://github.com/sophgo/LLM-TPU.git
- 进入目录:cd LLM-TPU
- 运行演示:./run.sh --model qwen2.5vl
界面预览


与其他方案对比
| 对比项 | LLM-TPU | 同类方案 |
|---|---|---|
| 部署便捷性 | 提供一键编译和预编译模型,命令行快速启动 | 通常需要手动配置环境和复杂编译流程 |
| 模型覆盖范围 | 支持数十种主流LLM和VLM模型,持续更新新模型 | 可能只支持少数模型或更新较慢 |
适合谁用
- 需要在SOPHGO TPU边缘设备部署AI模型的开发者
- 进行AI模型研究和实验的科研人员
- 希望快速运行生成式AI的企业用户
下载与版本
当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/sophgo/LLM-TPU