Hasty Briefsbeta

双语

In-House LLM Serving at Netflix

a day ago
  • Netflix 使用 vLLM 和 Triton 构建了内部 LLM 服务平台,并集成到现有生产基础设施中。
  • 关键决策包括选择 vLLM 作为引擎以实现可扩展性和可调试性,并在 Triton 中使用 vLLM 后端进行模型打包,以解耦前端升级。
  • 该系统支持兼容 OpenAI 的 HTTP 前端和 gRPC 以确保生态系统兼容性,并采用红黑或版本化部署策略实现零停机发布。
  • 已解决的运维挑战包括通过模型缓存优化启动序列、统一指标端点,以及使用 vLLM V1 扩展受限解码以克服 CPU 瓶颈。
  • 未来的投入将集中在系统提示压缩、异步调度、向量化对数处理器和低精度模型上,以提升性能和效率。