Hasty Briefsbeta

双语

Frontis-MA1: Open 35B model toward recursive self-improvement

14 hours ago
  • OpenMLE 是一个用于机器学习工程(MLE)中递归自我改进(RSI)的开放式全栈系统,包括环境(Gym)、算子学习(RL)和长周期搜索(Evo)。
  • Frontis-MA1 (35B) 经过后训练成为元进化代理,使用四种原子操作符(草拟、改进、调试、交叉),通过执行接地 SFT 和 RL 进行训练。
  • 在 MLE-Bench Lite 上,Frontis-MA1 使用 OpenMLE-Evo-Max 将奖牌平均值从 39.39% 提升至 71.21%,超越了 GPT-5.5 + Codex,接近 GPT-5.6 Sol。
  • 训练后的模型和搜索框架均迁移到保留的 NatureBench Lite 上,分别将 Match-SOTA 从 50% 提升至 70%,从 20% 提升至 50%。
  • 完整的栈——权重、Gym、沙箱、训练、搜索和评估——已开源,用于可复现的 AI4AI 研究,以迈向 RSI。

相关文章

加载中…