Hasty Briefsbeta

双语

Show HN: Swift-Qwen3.8-27B, -58.3% thinking, x1.95 speed, accuracy of xhigh

2 hours ago
  • Swift-Qwen3.8-27B 是 Qwen3.8-27B 的一个推理高效的衍生产品,它使用的思考令牌减少了 58.3%,同时保持了几乎相同的性能(损失小于 1%),在任务上实现了高达 1.95 倍的加速。
  • 该模型可以用于多种推理方法:Transformers pipeline、vLLM 服务器、SGLang 服务器、Docker,以及 ukisai.com 上的免费 OpenAI 兼容 API。
  • 训练过程中通过惩罚推理标记令牌来减少过度思考,并包含来自 ThinkingCap-Qwen3.6-27B 的迁移组件。
  • 基准测试(GPQA-Diamond、MMLU-Pro、AIME 2026 等)显示,在推理努力和量化(INT4)部署中,令牌显著减少(26-50%),而准确率变化很小。
  • 权重在 Swift Open License v1.0 下提供,对于年收入低于 100 万美元的组织,免费用于研究和商业用途。