Frontis-MA1: Open 35B model toward recursive self-improvement
14 hours ago
- OpenMLE 是一个用于机器学习工程(MLE)中递归自我改进(RSI)的开放式全栈系统,包括环境(Gym)、算子学习(RL)和长周期搜索(Evo)。
- Frontis-MA1 (35B) 经过后训练成为元进化代理,使用四种原子操作符(草拟、改进、调试、交叉),通过执行接地 SFT 和 RL 进行训练。
- 在 MLE-Bench Lite 上,Frontis-MA1 使用 OpenMLE-Evo-Max 将奖牌平均值从 39.39% 提升至 71.21%,超越了 GPT-5.5 + Codex,接近 GPT-5.6 Sol。
- 训练后的模型和搜索框架均迁移到保留的 NatureBench Lite 上,分别将 Match-SOTA 从 50% 提升至 70%,从 20% 提升至 50%。
- 完整的栈——权重、Gym、沙箱、训练、搜索和评估——已开源,用于可复现的 AI4AI 研究,以迈向 RSI。