产品推荐 2026-07-28

AlignBench:免费的中文大模型对齐评测工具(源码)

AlignBench是评测中文大模型对齐水平的基准工具。

开源软件跨平台工具

产品简介

AlignBench 是首个多维度全面评估中文大语言模型对齐性能的评测基准。它解决现有评测不能准确反映模型真实表现的痛点,采用规则校准的模型评价和思维链分析,确保高可靠性和可解释性。适合研究人员、开发者和评测团队用于系统化评估。

AlignBench 主界面

核心功能

  • 多维度中文对齐评测,覆盖8个类别
  • 规则校准的LLM-as-Judge评价方法
  • 思维链增强评分可解释性
  • 高质量动态更新数据集
  • 自动化评估流程

快速开始

  1. 第一步:实现待评测模型的API调用类,运行get_answers.py脚本生成模型回答。
  2. 第二步:配置GPT-4 API密钥,运行judge.py脚本进行多维度评价和打分。
  3. 第三步:运行show_result.py脚本计算最终结果并保存为xlsx文件。

界面预览

AlignBench 界面截图

与其他方案对比

对比项AlignBench同类方案
评测维度多维度全面评估,覆盖基本能力到专业知识等8类单一或有限维度评测
评价方法规则校准的LLM-as-Judge,结合思维链生成分析人工评价或简单自动化方法
数据质量高质量动态更新数据,来自真实用户问题静态或人工构造数据

适合谁用

  • 需要评估中文大模型对齐水平的研究人员
  • 进行大语言模型开发的开发者
  • 参与模型评测竞赛的团队

下载与版本

当前最新版本为 master,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/THUDM/AlignBench