Show HN: Germany's new sovereign AI model Kolibri
4 hours ago
- Kolibri是来自Aleph Alpha的开放权重大型语言模型,支持德语和英语,于2026年10月3日以Apache 2.0许可证发布,总参数量781亿,但每个token仅激活34.6亿参数。
- 它从头在德国和芬兰的基础设施上训练,设计为主权AI,完全运行在客户控制的硬件上,符合欧洲法律。
- 该模型使用混合专家架构,每层384个专家,每个token激活6个的路由器,以及专门的标记器(UniBPE),与GPT-5的标记器相比,德语token数量减少11-15%。
- 其50层中的40层使用滑动窗口注意力以提高效率,实现原生上下文长达262,144个token,并验证到1,048,576个token。
- 它对德语提示进行德语推理,具有可调节的推理努力(无/低/中/高),并训练在证据不足时拒绝回答(Merlin-Arthur协议),在未知问题上达到44%的弃权率。
- 优势包括在其活跃参数规模的模型中数学成绩优异(AIME 2025:英语96.9,德语87.5),在长上下文和公司文档任务上表现强劲,以及主权部署。
- 弱点包括事实回忆较低(闭卷测试),多轮工具调用和编码代理性能较弱,内存需求约78 GB GPU内存,仅支持德语和英语,以及依赖新的vLLM插件。
- Kolibri适用于德语主权应用,如公共机构、银行和医疗保健,这些领域数据隐私和弃权很重要,以及用于长德语文档的RAG;不适合编码代理、琐事或低内存环境。