2 days ago
- Gemini 蒸馏服务通过使用较大教师模型的输出和推理模式来训练较小的学生模型,从而在保持深度推理能力的同时降低延迟和成本。
- 蒸馏使用教师模型的响应和原始思维,这与仅使用最终文本输出的监督微调不同。
- 早期访问期间支持的模型:教师模型 gemini-3.1-pro,学生模型 gemini-2.5-flash。
- 推荐用于高吞吐量、延迟敏感型应用、缺乏真实数据、复杂推理任务以及教师与学生模型之间存在显著性能差距的场景。
- 前提条件:项目已加入白名单并启用 Agent Platform API,IAM 角色为 aiplatform.admin,并在 us-central1 区域运行任务。
- 数据集必须为 JSONL 格式,仅包含提示条目;无需真实答案;建议至少 1000 个示例。
- 配置教师模型生成参数:candidateCount(1-5,默认 4)和学生模型超参数:epochCount(1-100,默认 4)和 learningRateMultiplier(0.25-4,默认 1)。
- 通过 REST API 将任务提交到 Agent Platform;支持新任务和基于先前蒸馏检查点的持续调优。
- 通过 API 或控制台监控任务;控制台在教师模型采样进度和训练轮次显示方面存在已知的 UI 限制。
- 评估时,定位已注册的端点,发送预测请求,并将输出与基础模型和教师模型的输出进行比较。
- 限制:最多 50,000 个示例,文件大小 1 GB,每个条目输入令牌 8,000 个,输出令牌 24,000 个,仅支持文本,不支持 CMEK,仅支持单步蒸馏。
- 通过 cloud-ai-tuning-service-support@google.com 申请访问权限;默认并发配额为 4;初始访问权限有效期为 30 天。