Hasty Briefsbeta

双语

Gemini Distillation Service

a day ago
  • Gemini蒸馏服务利用较大“教师”模型的输出和推理来训练较小的“学生”模型。
  • 它弥合了前沿模型能力与生产效率之间的差距,提供更低的延迟和成本。
  • 与监督微调(SFT)不同,蒸馏同时利用了教师模型的最终响应和内部推理路径。
  • 支持的模型:教师模型 gemini-3.1-pro,学生模型 gemini-2.5-flash。
  • 适用于高容量、对延迟敏感的应用、缺乏真实数据的场景、复杂推理任务以及教师模型显著优于学生模型的情况。
  • 设置需要列入允许列表、启用Agent Platform API、具有IAM管理员角色并使用us-central1区域。
  • 数据集是存储在Cloud Storage中的纯提示JSONL文件;建议至少1000个示例以保证质量提升。
  • 配置包括教师生成的candidateCount以及超参数,如epochCount(1-100)和learningRateMultiplier(0.25-4)。
  • 可以通过REST API提交任务,并支持从之前蒸馏的检查点进行持续调优。
  • 通过API或Google Cloud控制台进行监控(早期访问期间存在已知的UI限制)。
  • 完成后会创建一个端点;通过发送预测请求并与基础模型和教师模型进行比较来评估。
  • 限制:最多5万个示例,文件大小1GB,输入令牌8K,输出令牌24K,仅文本,不支持CMEK,以及超参数范围限制。
  • 通过联系支持获取访问权限,默认访问期为30天,并发配额为4个。