a day ago
- Gemini蒸馏服务利用较大“教师”模型的输出和推理来训练较小的“学生”模型。
- 它弥合了前沿模型能力与生产效率之间的差距,提供更低的延迟和成本。
- 与监督微调(SFT)不同,蒸馏同时利用了教师模型的最终响应和内部推理路径。
- 支持的模型:教师模型 gemini-3.1-pro,学生模型 gemini-2.5-flash。
- 适用于高容量、对延迟敏感的应用、缺乏真实数据的场景、复杂推理任务以及教师模型显著优于学生模型的情况。
- 设置需要列入允许列表、启用Agent Platform API、具有IAM管理员角色并使用us-central1区域。
- 数据集是存储在Cloud Storage中的纯提示JSONL文件;建议至少1000个示例以保证质量提升。
- 配置包括教师生成的candidateCount以及超参数,如epochCount(1-100)和learningRateMultiplier(0.25-4)。
- 可以通过REST API提交任务,并支持从之前蒸馏的检查点进行持续调优。
- 通过API或Google Cloud控制台进行监控(早期访问期间存在已知的UI限制)。
- 完成后会创建一个端点;通过发送预测请求并与基础模型和教师模型进行比较来评估。
- 限制:最多5万个示例,文件大小1GB,输入令牌8K,输出令牌24K,仅文本,不支持CMEK,以及超参数范围限制。
- 通过联系支持获取访问权限,默认访问期为30天,并发配额为4个。