谷歌(Google)发布了 EmbeddingGemma 2。这款开放权重模型拥有 7.4 亿参数,将文本、代码、图像、视频帧和音频放入同一个共享嵌入空间。

采用 Apache-2.0 许可的权重于 10月6日发布,支持 Transformers、sentence-transformers、llama.cpp、vLLM、Ollama、LM Studio、MLX 和 Transformers.js。模型用于检索和路由,而非生成文章:它将不同类型的输入转换为向量,以便比较相似度。

为什么重要

开发者在手机或笔记本电脑上构建私有搜索时,现在可以为语音备忘录建立索引并检索视频片段,无需先串联语音识别、图像描述生成和独立的文本嵌入模型。这减少了本地检索的多个环节,但模型实际是否有用,仍取决于用户自己的数据和延迟预算。

EmbeddingGemma 2 采用模块化设计。文本与代码骨干网络拥有 2.7 亿参数,视觉模块增加 1.7 亿参数,音频模块增加 3 亿参数。所有配置都映射到 768 维,Matryoshka 训练允许应用将向量截断为 512、256 或 128 维,以减少存储量。

谷歌称,在 Pixel 11 Pro 上,仅文本的量化权重使用约 191 MB 活跃运行内存,完整模型则约为 567 MB。按照谷歌的打包方案,8192 token 上下文最多可容纳 5.5 分钟音频、29 张图像或 58 个视频帧。

公司的评测给出的 MTEB Code 得分为 78.68,高于第一代 EmbeddingGemma 的 68.76。谷歌还称,它在参数少于 10 亿的多模态嵌入模型中质量领先。这些是发布当日的测量结果,没有经过独立复现;比较具体检索任务时,模型卡是更合适的依据。

此次发布的模型与 Gemma 4 共用分词器和音频编码器设计。当嵌入模型为本地生成模型提供输入时,这可以减少重复组件。谷歌还发布了媒体搜索和视频时刻检索的示例应用。

接下来有价值的实际证据将来自混合私有数据集上的测试。在这些场景中,跨模态召回、索引时间和内存比单一综合基准测试更重要。

核实

说法标签一手来源独立核实
谷歌于 2026年10月6日发布 EmbeddingGemma 2已核实谷歌公告权重与模型卡
模型拥有 7.4 亿参数,模块化组件包括 2.7 亿参数的文本模块、1.7 亿参数的视觉模块和 3 亿参数的音频模块已核实谷歌公告模型卡列出了架构
在 Pixel 11 Pro 上,量化后的活跃运行内存约为文本模型 191 MB、完整模型 567 MB据公司称谷歌公告无
MTEB Code 得分从 68.76 升至 78.68据公司称谷歌公告无
Apache-2.0 许可的权重已提供已核实模型仓库仓库可访问