An open vision-language model for diverse medical applications
20 hours ago
- MedGemma 是基于 Gemma 3 的医学视觉语言基础模型集合,包含4B、27B和27B文本参数的变体。
- 它在医学基准测试上优于同等规模的生成模型,在医学图像问答上提升2.6–10%,在胸部X光分类上提升15.5–18.1%,在智能体任务上提升10.8%。
- 这些模型包括 MedSigLIP,一个在数百万图像-文本对上训练的医学图像编码器,实现了跨模态的数据高效分类和检索。
- 微调 MedGemma 提供了鲁棒的任务特定适应,与基础 Gemma 3 相比,在训练数据有限时尤为有效。
- MedGemma 在保持通用能力的同时在医学任务中表现出色,在成本、本地部署和数据主权方面具有优势。
- MedGemma 和 MedSigLIP 的开源发布旨在加速医学研究及医疗领域的下游AI应用。