EmbeddingGemma 2 发布:Google 把多模态向量检索带到手机和边缘设备
Google DeepMind 发布基于 Gemma 4 的 EmbeddingGemma 2,将文本、代码、图片、视频和音频映射到统一 768 维向量空间,并以 Apache 2.0 许可推动端侧多模态检索。
10月6日,Google DeepMind 发布 EmbeddingGemma 2,这是一个面向本地推理的开放多模态向量模型。它基于 Gemma 4 架构,把文本、代码、图片、视频和音频映射到统一的 768 维向量空间,提供 Apache 2.0 许可。与只解决“文字相似度”的传统 embedding 不同,它的目标是让开发者在手机、桌面端或边缘设备上直接搭建跨模态搜索与检索增强应用。
背景:向量模型正在从云端 API 下沉到设备
很多 AI 应用的瓶颈并不在生成模型,而在“先找到什么”。企业知识库、相册搜索、视频片段定位和代码检索,都需要把不同类型的内容变成可比较的向量。过去常见做法是调用云端 embedding API,再把数据上传到外部服务;这会带来隐私、延迟、网络稳定性和持续计费问题。
EmbeddingGemma 2 采用模块化设计:完整模型约 7.4 亿参数,同时可以只启用文本/代码、视觉或音频相关模块。Google 开发者资料给出的上下文长度为 8192 token,并支持 Matryoshka 表示学习,把向量截断到 512、256 或 128 维,以换取更低的存储和检索成本。
影响:多模态 RAG 的第一步可能变得更轻
对开发者而言,最直接的变化是“同一空间检索”。例如,用户用一句话找视频中的设备故障画面,或用图片反查内部维修文档,系统可以先用统一 embedding 找候选内容,再交给生成模型做解释。若索引和查询都在本地完成,企业还可以把原始图片、录音和文档留在内网,只把必要的摘要交给云端模型。
Google 的资料还给出约 191MB 的文本模式内存占用和约 567MB 的全模态示例,这使它更接近移动端和边缘端产品的工程约束。不过,内存数字不能直接等同于真实体验:设备芯片、量化方式、批量大小、索引规模和冷启动时间都会影响最终效果。EmbeddingGemma 2 解决的是“能不能本地做向量化”,不是自动解决数据清洗、召回评估和权限控制。
适合哪些人关注?
做本地知识库、相册/媒体搜索、隐私办公、端侧 Agent、跨模态推荐和代码检索的团队,都可以把 EmbeddingGemma 2 放进小规模 PoC。产品经理应重点验证三件事:跨模态召回是否真的提升,低维向量是否牺牲关键结果,以及离线索引更新能否在设备上持续运行。