Accelerating Gemini Nano Models on Pixel with Frozen Multi-Token Prediction19 days agohttps://research.google/blog/accelerating-gemini-nano-models-on-pixel-with-froze...Google研究人员提出一种方法,可将多令牌预测技术融入冻结的生产模型(如Gemini Nano v3),以加速设备端推理,无需单独的草稿模型。该方法通过轻量级多令牌预测头利用主模型内部状态,解决了移动设备的能源和内存限制,消除了内存冗余并降低了延迟。在Pixel 9和10设备上集成多令牌预测后,AI通知摘要和校对等功能实现了显著加速(超过50%)和节能,同时保持输出兼容性。未来工作将探索并行解码和分支技术,以在严格的移动约束下更高效地处理语言歧义。
Bonsai 27B (1-bit LLM): The First 27B-Class Model to Run on a Phone7 days agohttps://prismml.com/news/bonsai-27bBonsai 27B是Bonsai系列的新型多模态模型,基于Qwen3.6 27B,也是首个能够在手机上运行的该能力级别模型。它有两种变体:Ternary Bonsai 27B(5.9 GB)适用于笔记本电脑的高质量处理,以及1-bit Bonsai 27B(3.9 GB)适用于手机的低内存占用,两者均采用端到端的低比特权重,无高精度逃脱机制。该模型在各项基准测试中分别保留了全精度基准性能的95%(Ternary变体)和90%(1-bit变体),在数学、编码和工具调用等智能体工作负载方面表现出色。Bonsai 27B支持智能体AI的本地执行,通过将数据保留在设备上以降低成本和增强隐私,并支持与云端模型的混合部署。它实现了高速处理(在RTX 5090上最高达163 tok/s),适配手机内存限制,具备262K令牌上下文、多模态视觉和推测解码功能。此次发布代表了智能密度范式的转变,推动了Apache 2.0许可证下日常设备上的AI部署,并计划推出更大规模的模型。
Model 4: Our best model yet for local dictation and cleanup on Maca day agohttps://www.epilude.com/news/introducing-model-4Epilude Model 4是本地模式的第四代设备端模型,自推出以来实现了最大的质量跃升,同时保持了1.5 GB的下载体积与速度,且所有数据均不会离开用户的Mac设备。本地模式采用双模型结构:语音模型负责将语音转为文本,清理模型则优化转录内容——包括删除填充词、修正标点、处理自我修正及匹配语调;Model 4是基于Qwen家族新微调的清理模型,专注于听写优化,未更改语音模型。评估采用零容忍标准:对改变语义或泄露指令的关键错误进行严格检测,基于90个听写场景的内部基准测试;Model 4比Model 3多通过9个场景,关键语义错误减少56%,在中途自我修正、日期、混合语言对话及随意语气处理方面表现突出。构建Model 4的核心经验表明:标注质量比数据量更重要——修正错误标注的训练样本显著提升了自我修正能力,且多轮模型权重平均方案通过消除罕见故障模式,效果优于单一模型。Model 4存在局限:对冗长散漫的段落及口语化提问处理仍有困难,云端模式在整体性能上保持领先;需Apple Silicon芯片与16 GB内存以实现完整AI清理功能,但在配置较低的设备上可离线运行基础格式化,所有数据本地处理的设计保障了隐私安全且无需额外成本。