A $500 RL fine-tune of a 9B open model beat frontier models on catalog review
2 days ago
- 该剧本包含一个开源模型、专有任务数据和一个强化学习阶段。
- 桥水基金在专家投资者的标签上训练了一个开源模型,以较低的成本将错误减少了30%。
- Harvey使用强化学习在开放权重模型上创建了一个法律代理,其性能优于GPT-5.5和Claude Opus 4.8。
- Intercom在数十亿客户互动上后训练了自己的垂直支持模型,以比前沿模型更低的成本解决了更多问题。