I graded 36 popular MCP servers on agent usability. A third got a D or F
5 hours ago
- 作者扫描了36个流行的MCP服务器,发现尽管协议合规,但三分之一在智能体可用性方面存在问题。
- 关键发现:大多数失败源于工具模式中缺少参数描述,通常是因为zod或OpenAPI定义缺少`.describe()`调用。
- mcpgrade工具为MCP服务器提供了类似Lighthouse的评分卡,只需一个命令即可运行,无需API密钥。
- 结果:15个服务器获得A级(例如brave-search、exa),11个获得D/F级(例如MongoDB、Notion、Airtable),2个无法扫描。
- 发现1:生态系统存在“未记录参数流行病”——例如firecrawl服务器的134个错误中有132个源于缺少描述。
- 发现2:小型目录通常得分较高,但纪律性(例如拥有15个工具的shrimp-task-manager获得A级/96分)证明了大型、文档齐全的目录是可行的。
- 发现3:合规检查器无法衡量可用性;具有手动文档的存档服务器可能比积极开发的服务器表现更好。
- 发现4:静态分数与实际模型行为相关——文档齐全的服务器实现了100%的工具选择准确率,而像firecrawl这样的模糊目录降至84%,并且只拒绝了50%的超出范围任务。
- 最佳实践包括:每个工具描述回答什么/何时/返回;每个参数包含格式和示例的描述;对固定值使用枚举;verb_object命名;能够自我纠正的错误消息。
- mcpgrade提供24条规则及具体修复方法;维护者可在改进后重新扫描。