Inspect: An open-source framework for large language model evaluations
6 hours ago
- Inspect 是由英国AI安全研究所与Meridian Labs联合开发的前沿AI评估开源框架。
- 它提供可组合的构建模块(数据集、智能体、工具、评分器),便于评估的创建和复用。
- 包含200多种预构建评估方案,可直接在任何模型上运行。
- 提供丰富的工具支持,例如用于监控的Inspect View和用于编写与调试的VS Code扩展。
- 支持灵活的工具调用,包括自定义工具、MCP工具以及内置工具(bash、Python、网络搜索等)。
- 支持智能体评估,内置智能体、多智能体基元,并支持外部智能体(如Claude Code)。
- 具备沙箱系统,可在Docker、Kubernetes等环境中运行不可信的模型代码。
- 提供Python API和全面的文档,用于创建和运行评估。