So you want to use OpenRouter?
21 days ago
- 不同的提供商在提供相同模型时,在GPQA和TAU-Bench等基准测试中的表现可能有很大差异,工具调用分数波动可达20分。
- 有些提供商无法正确处理视觉模型输入,在声称成功(HTTP 200)的同时返回错误或不正确的描述。
- 推理努力参数可能被某些提供商接受但忽略,需要跟踪每个提供商的实际推理令牌数。
- 量化设置(例如fp8与fp4)并不能很好地指示模型质量;基准测试是更可靠的筛选依据。
- 由于提供商解析器失败,工具调用可能以原始文本形式出现在响应中,因此需要在客户端进行解析。
- 推理模型可能返回HTTP 200但内容为空且没有工具调用,这算作失败,需要重试。
- 某些提供商(如StreamLake和Together)可能会出现空完成(无内容,无使用对象)。
- 提供商对在历史记录中传递推理内容执行不同的规则,不匹配会导致错误。
- 在开发者笔记本电脑上进行测试可能无法重现生产环境中的问题,例如按IP进行速率限制。
- 固定一组提供商是有风险的,因为提供商可能下架模型、限制速率或失败,导致完全服务中断。