Solar Open 2: Korea's Sovereign Foundation Model, Built for Agentic Use
8 hours ago
- Solar Open 2 是一个针对智能体使用优化的开源基础模型,旨在作为真实工作环境中智能体的基础模型。
- 它采用混合专家(MoE)架构,总参数量为250B,但每个标记仅激活15B参数,从而提高了能力和推理效率。
- 该模型支持1M标记的上下文窗口,并通过量化在两张NVIDIA H200 GPU上运行,使其适合企业部署。
- 它正式支持韩语、英语和日语,并针对韩语效率进行了分词器优化(相比全局模型仅消耗50–80%的标记)。
- 训练数据聚焦于智能体场景,包括搜索、工具调用(MCP)、编程和办公任务,并使用了自定义数据合成和验证流水线。
- Solar Open 2 在MMLU-Pro(86.2分)、LiveCodeBench(92.4分)和韩语基准测试(平均85.4分)中,在同类模型中取得了最高分。
- 在韩语办公基准测试Ko-GDPval中,它获得了86.8分,几乎与规模大六倍的模型(DeepSeek-V4-Pro)相当,而仅使用了15B的活跃参数。
- 该模型使用从Solar Open 100B选择性权重迁移进行高效训练,仅需随机初始化所需标记的58%即可达到目标损失。
- 权重已在Hugging Face上以商用许可发布,并附有一份涵盖架构、训练方法和评估条件的技术报告。
- Solar Open 2 专为长周期任务、长上下文处理和可靠的工具调用而构建,满足智能体工作流的独特需求。