Hasty Briefsbeta

双语

Rene-1: Open-weight classifier sets SOTA on Decision Index (+9 over Jev)

11 hours ago
  • Rene-1 31B FP8 是一种非生成式决策模型,它在一次前向传播中读取文档,并为类型化问题的每个选项返回校准概率。
  • 它支持三种问题格式:是/否、选项选择,以及带置信度和概率分布的序数评分。
  • 它可以通过 Transformers 的 pipeline 或 AutoModel(trust_remote_code=True)使用,并且需要支持 FP8 的 NVIDIA GPU,例如 Ada Lovelace、Hopper 或 Blackwell。
  • 模型权重在 FP8 下为 33.3 GB,完整模型可放入单张 GPU;典型峰值内存为 44.5 GB,更大的请求需要 80 GB 及以上的 GPU。
  • 在 Decision Index 0.2 上,Rene-1 在 37 个基准上实现了 64.18 的平衡技能,中位校准误差为 0.046,在 B200 上对 641 个 token 的 5 个问题的中位延迟约为 92 毫秒。
  • 它专为分类、路由、分诊、策略检查和序数评分而设计,但不适合自由文本生成、多步推理、非英语文本,或没有人工监督的高风险个人决策。
  • 已知限制包括在 ACOS、ChessBench 和 SGD 等基准上技能较低,在 PhishNChips、SGD 和 POP909 上校准较弱,并且它不会为其答案提供解释。