产品推荐 2026-07-28

SafetyBench:免费的安全性评估基准工具(源码)

SafetyBench 是评估大语言模型安全性的综合基准测试工具。

开源软件跨平台工具

产品简介

SafetyBench 提供全面基准测试,用于评估大语言模型安全性,包含11,435个中英文测试题,覆盖7个安全类别,帮助AI研究者、开发者和安全评估人员量化比较模型安全性能。

SafetyBench 主界面

核心功能

  • 包含11,435个多样化的多项选择题
  • 涵盖7个安全类别
  • 支持中英文数据评估
  • 提供实时排行榜
  • 包含数据下载和评估代码示例

快速开始

  1. 下载数据集:运行 download_data.sh 脚本或 download_data.py 代码
  2. 准备评估环境:参考 evaluate_baichuan.py 示例代码
  3. 运行评估:使用零样本或五样本设置提取预测答案
  4. 提交结果:将结果JSON文件上传至官网

界面预览

SafetyBench 界面截图

SafetyBench 界面截图

与其他方案对比

对比项SafetyBench同类方案
多语言评估能力同时支持中文和英文数据评估多数基准仅支持英文评估
数据规模与多样性包含11,435个问题,覆盖7个安全类别其他基准题目数量较少或类别覆盖不全

适合谁用

  • AI研究者:评估和比较不同LLM的安全性能
  • 开发者:在部署LLM前测试其安全性
  • 安全评估人员:进行模型安全审计和认证

下载与版本

当前最新版本为 main,发布于 。支持 Windows、macOS、Linux。

⚠️ 注意:本项目仅提供源代码下载,不包含可直接运行的安装包(exe/dmg/apk 等。下载后需要自行编译构建才能使用,适合有一定开发经验的用户。如果你不熟悉编译流程,建议寻找同类开箱即用的替代方案。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/thu-coai/SafetyBench