EmbeddingGemma 2
6 hours ago
- EmbeddingGemma 2 是一个轻量级多模态嵌入模型,基于 Gemma 4 架构构建,采用 Apache 2.0 许可证发布,拥有 7.4 亿参数。
- 它将文本扩展到代码、图像、视频和音频,在共享嵌入空间中实现统一,支持在消费级硬件上进行跨模态搜索和检索。
- 在其规模中属于同类最佳,在 MTEB Code 和 MAEB 等基准测试上取得领先分数,通常能匹配或超越更大模型。
- 模块化设计允许仅使用 2.7 亿参数进行纯文本工作负载,并可选择视觉编码器(1.7 亿参数)和音频编码器(3 亿参数)。
- 通过 Matryoshka 表示学习(MRL)实现存储高效,支持向量维度从 768 降至最低 128,存储减少高达 6 倍。
- 通过量化优化设备端性能,在 Google Pixel 11 Pro 上,纯文本模式仅需约 191MB 内存,完整多模态模型约需 567MB。
- 扩展的 8K 令牌上下文窗口支持本地处理长达 5.5 分钟的音频、29 张图像或 58 帧视频。
- 与上一版本相比,在代码性能(MTEB Code)上实现了显著的 9.92 分提升,并在所有模态上设立了新的质量与参数比率标准。
- 通过本地嵌入生成实现数据隐私和离线功能,并与 Gemma 4 等生成模型配合,用于设备端 RAG 流水线。
- 可在 Hugging Face、Kaggle 下载,并集成到 LiteRT、MediaPipe、transformers.js 及多种开发框架中。