Hasty Briefsbeta

双语

How We Made a Text-to-Speech Model Respond in Sub-50 ms

2 months ago
  • Qwen3-TTS 1.7B CustomVoice 在单个 NVIDIA H100 SXM 上实现了 10 RPS 和低于 50ms 的 p95 TTFA。
  • 与 vLLM-Omni、SGLang-Omni、VoxServe 和 M* 相比,只有提出的实现能够在 10 RPS 下保持低于 50ms 的 p95 TTFA。
  • 成本效益:每 1M 字符约 $2,而 ElevenLabs 为 $100,Cartesia 为 $49,且 TTFA 更低。
  • 实时 TTS 定义为低可听延迟的 TTFA、零欠载、负载下的容量以及无格式错误的输出。
  • 优化包括去除前导静音、调整帧累积以及为三个模型模块设计的统一调度器。
  • 调度器优先考虑首次音频延迟,并将紧急请求与兼容的工作分批处理,以最大化 GPU 效率。
  • 利用 Code Predictor 的固定结构进行预分配的 KV 缓存和 CUDA 图;使用状态缓存的增量解码处理 Codec。
  • 其他优化:针对预定义批处理大小的 CUDA 图、避免不必要的 CPU-GPU 同步,以及用于语音到语音的输入流式处理。
  • 未来计划扩展到图像、视频、世界模型和微调,愿景是实现实时多模态推理。