产品简介
AlignBench 是首个多维度全面评估中文大语言模型对齐性能的评测基准。它解决现有评测不能准确反映模型真实表现的痛点,采用规则校准的模型评价和思维链分析,确保高可靠性和可解释性。适合研究人员、开发者和评测团队用于系统化评估。

核心功能
- 多维度中文对齐评测,覆盖8个类别
- 规则校准的LLM-as-Judge评价方法
- 思维链增强评分可解释性
- 高质量动态更新数据集
- 自动化评估流程
快速开始
- 第一步:实现待评测模型的API调用类,运行get_answers.py脚本生成模型回答。
- 第二步:配置GPT-4 API密钥,运行judge.py脚本进行多维度评价和打分。
- 第三步:运行show_result.py脚本计算最终结果并保存为xlsx文件。
界面预览

与其他方案对比
| 对比项 | AlignBench | 同类方案 |
|---|---|---|
| 评测维度 | 多维度全面评估,覆盖基本能力到专业知识等8类 | 单一或有限维度评测 |
| 评价方法 | 规则校准的LLM-as-Judge,结合思维链生成分析 | 人工评价或简单自动化方法 |
| 数据质量 | 高质量动态更新数据,来自真实用户问题 | 静态或人工构造数据 |
适合谁用
- 需要评估中文大模型对齐水平的研究人员
- 进行大语言模型开发的开发者
- 参与模型评测竞赛的团队
下载与版本
当前最新版本为 master,发布于 。支持 Windows、macOS、Linux。
⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。
注意事项
- 本工具仅供学习和研究使用,请遵守相关法律法规。
- 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
- 项目源码地址:https://github.com/THUDM/AlignBench