4 hours ago
- Hetzner 正在通过兼容 OpenAI 的 API 实验 LLM 推理,但该服务仍处于早期阶段,没有计费、SLA 或生产保证。
- 目前唯一可用的模型是 Qwen/Qwen3.6-35B-A3B-FP8,这是一个 35B 参数的混合专家模型,具有 3B 活跃参数,支持文本和图像。
- 初步测试显示性能快速:中位首个令牌延迟 153 毫秒,每秒输出 224 个令牌,但这些并不能代表生产负载下的表现。
- 该产品的潜力在于 Hetzner 能够利用其低成本硬件运营和 GPU 利用率,但目前的 GPU 产品线缺乏更大模型所需的大规模多 GPU 系统。
- 该实验的未来取决于 Hetzner 是否扩展到更大的 GPU 集群和更广泛的模型目录,这可能使其成为推理服务领域的重要竞争者。