Hasty Briefsbeta

双语

Inspect: An open-source framework for large language model evaluations

6 hours ago
  • Inspect 是由英国AI安全研究所与Meridian Labs联合开发的前沿AI评估开源框架。
  • 它提供可组合的构建模块(数据集、智能体、工具、评分器),便于评估的创建和复用。
  • 包含200多种预构建评估方案,可直接在任何模型上运行。
  • 提供丰富的工具支持,例如用于监控的Inspect View和用于编写与调试的VS Code扩展。
  • 支持灵活的工具调用,包括自定义工具、MCP工具以及内置工具(bash、Python、网络搜索等)。
  • 支持智能体评估,内置智能体、多智能体基元,并支持外部智能体(如Claude Code)。
  • 具备沙箱系统,可在Docker、Kubernetes等环境中运行不可信的模型代码。
  • 提供Python API和全面的文档,用于创建和运行评估。