Hasty Briefsbeta

双语

So you want to use OpenRouter?

21 days ago
  • 不同的提供商在提供相同模型时,在GPQA和TAU-Bench等基准测试中的表现可能有很大差异,工具调用分数波动可达20分。
  • 有些提供商无法正确处理视觉模型输入,在声称成功(HTTP 200)的同时返回错误或不正确的描述。
  • 推理努力参数可能被某些提供商接受但忽略,需要跟踪每个提供商的实际推理令牌数。
  • 量化设置(例如fp8与fp4)并不能很好地指示模型质量;基准测试是更可靠的筛选依据。
  • 由于提供商解析器失败,工具调用可能以原始文本形式出现在响应中,因此需要在客户端进行解析。
  • 推理模型可能返回HTTP 200但内容为空且没有工具调用,这算作失败,需要重试。
  • 某些提供商(如StreamLake和Together)可能会出现空完成(无内容,无使用对象)。
  • 提供商对在历史记录中传递推理内容执行不同的规则,不匹配会导致错误。
  • 在开发者笔记本电脑上进行测试可能无法重现生产环境中的问题,例如按IP进行速率限制。
  • 固定一组提供商是有风险的,因为提供商可能下架模型、限制速率或失败,导致完全服务中断。