Flux 3 X Mimic: The Next Generation of Video-Action Models6 days agohttps://bfl.ai/blog/flux-3-mimicFLUX 3是一个多模态基础模型,可生成视听内容,并作为用于机器人技术的FLUX-mimic视频动作模型的骨干。视频预测是计算量最大的部分,占训练成本的95%以上,因为它迫使模型学习物理世界动态,如接触和运动。在FLUX 3中添加动作预测最初使视频质量下降了10%,但在3500个训练步骤后,模型恢复了全部性能,同时还能预测动作。基于FLUX 3构建的FLUX-mimic,使用轻量级动作解码器从视频预测路径的中间特征中解码动作,在机器人操作中实现了最先进的成功率。Self-Flow技术统一了生成和表示学习,提高了世界模型质量和机器人下游任务性能。FLUX-mimic的样本效率比视觉-语言-动作模型高出10倍,并且可以在单个NVIDIA RTX 5090 GPU上运行,世界表示延迟低于80毫秒。该模型已在奥迪的真实工厂环境中部署,处理诸如套件组装、装配以及传统自动化无法处理的软材料处理等任务。FLUX-mimic能够自然地从任务失败中恢复,例如抓取失误,而无需针对每个错误场景进行显式演示。
Inkling: Our Open-Weights Model15 days agohttps://thinkingmachines.ai/news/introducing-inkling/该公司发布了名为Inkling的新AI模型,这是一款混合专家架构的Transformer模型,拥有9750亿总参数和410亿活跃参数。Inkling支持高达100万标记的上下文窗口,基于45万亿标记的多模态数据进行预训练,并可通过Tinker平台进行微调。Inkling的核心特性包括多模态推理(文本、图像、音频)、可调控的思维强度以平衡性能与效率,以及在推理、代理编码和安全基准测试中的卓越表现。与Inkling同时发布的还有Inkling-Small预览版(2760亿总参数,120亿活跃参数),该版本为特定工作负载提供类似能力,同时具有更低的成本和延迟。该模型的开发过程涉及大规模强化学习训练(超过3000万次推演),这不仅提升了推理能力,还促成了更简洁的推理风格。Inkling被设计为广泛适用的定制化基础模型,特别强调校准性、指令遵循能力和抗审查机制(认知特性)。安全评估显示Inkling具备强大的保障措施,在FORTRESS和StrongREJECT等基准测试中表现优异。Inkling可通过TogetherAI、Hugging Face等多个平台和合作伙伴获取,其完整权重已公开发布以支持定制化需求。
Bonsai 27B (1-bit LLM): The First 27B-Class Model to Run on a Phone16 days agohttps://prismml.com/news/bonsai-27bBonsai 27B是Bonsai系列的新型多模态模型,基于Qwen3.6 27B,也是首个能够在手机上运行的该能力级别模型。它有两种变体:Ternary Bonsai 27B(5.9 GB)适用于笔记本电脑的高质量处理,以及1-bit Bonsai 27B(3.9 GB)适用于手机的低内存占用,两者均采用端到端的低比特权重,无高精度逃脱机制。该模型在各项基准测试中分别保留了全精度基准性能的95%(Ternary变体)和90%(1-bit变体),在数学、编码和工具调用等智能体工作负载方面表现出色。Bonsai 27B支持智能体AI的本地执行,通过将数据保留在设备上以降低成本和增强隐私,并支持与云端模型的混合部署。它实现了高速处理(在RTX 5090上最高达163 tok/s),适配手机内存限制,具备262K令牌上下文、多模态视觉和推测解码功能。此次发布代表了智能密度范式的转变,推动了Apache 2.0许可证下日常设备上的AI部署,并计划推出更大规模的模型。
Introducing Muse Spark 1.121 days agohttps://ai.meta.com/blog/introducing-muse-spark-meta-model-api/?_fb_noscript=1Meta发布Muse Spark 1.1,这是专为代理任务升级的多模态推理模型,在工具/计算机使用、编码和多模态理解方面均有改进。该模型具备100万token的上下文窗口,支持多智能体协调以加速项目处理,并通过Meta Model API提供公开预览。Muse Spark 1.1在计算机工作流、编码(调试、迁移)、多模态感知和安全性方面表现卓越,具有强大的对抗鲁棒性。早期合作伙伴如Replit和Box称赞其为大规模代理工作负载和企业应用提供的全面能力。Meta强调持续的研究势头,表示更多先进模型正在训练中,朝着个人超级智能的方向迈进。
ThinkingCap-Qwen3.6-27B: Qwen3.6 capabilities with 50% fewer thinking tokens24 days agohttps://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27BThinkingCap-Qwen3.6-27B模型是Qwen3.6-27B的精调版本,旨在平均减少50%的思考tokens的同时保持答案质量。它可以与Transformers和vLLM等库以及Google Colab、Kaggle和Docker等平台一起使用,用于本地部署。领域外评估显示,在GPQA-Diamond等基准测试上,tokens减少幅度高达67.8%,同时在知识、数学和多模态任务等领域保持准确性。在GSM8K和ARC-Challenge等留出数据集上的领域内评估展示了更高的token效率,tokens减少幅度高达74.1%,并且准确性有所提高。安全基准测试表明防护机制得以保留,拒绝率与基础模型相似,且在安全提示上的tokens减少了约20-24%。该模型支持GGUF量化,可通过llama.cpp和兼容的运行时进行高效的本地推理,量化版本可在相关的仓库中找到。使用示例包括图像-文本到文本任务,并且模型需要特定的采样参数(例如temperature=1.0),以获得最佳性能。
Gemma 4 on Cerebras - The Fastest Inference Is Now Multimodala month agohttps://www.cerebras.ai/blog/gemma-4-on-cerebras-the-fastest-inference-is-now-mu...Gemma 4 31B 在 Cerebras Inference 平台上能以超过每秒 1800 个 token 的速度运行,实现快速的多模态应用。这是首个在 Cerebras 上支持图片输入的 Google DeepMind 模型,可处理截图、文档、图表和 UI 界面状态。Cerebras 实现了创纪录的速度和低延迟,使 Gemma 4 适合实时视觉和代理式工作流程。Gemma 4 31B 在智能程度上与 Claude Haiku 4.5 相当,但运行速度快 18 倍,并且是 Apache 2.0 协议下的开放权重模型。该模型的高速度变革了产品开发,允许即时迭代和复杂的多模态循环。作为一种密集高效模型,Gemma 4 31B 旨在保证质量,同时避免了混合专家模型的大规模资源占用。应用示例包括实时截图分析、长上下文总结和用户界面调试。Gemma 4 31B 已在 Cerebras Inference 云服务的公共预览版中提供,用于多模态工作负载。