10月6日,Google(谷歌)CEO Sundar Pichai宣布推出全新的 EmbeddingGemma 2 模型,这是该公司首个开源的原生多模态嵌入模型。此次发布是在该公司去年为开发人员推出EmbeddingGemma之后一年。对于那些没有意识到的人来说,嵌入模型是一种机器学习工具,可以将单词、句子、图像或音频等复杂数据转换为称为向量的数字列表。

这款模型的最大亮点是“原生多模态”和“端侧运行”,它把文本、代码、图片、视频和音频这五种任务,全都装进一个仅7.4亿参数的小模型中,而且可以在手机端侧设备上直接运行。
EmbeddingGemma 2 模型基于Gemma 4架构构建,具备 7.4 亿参数,并采用 Apache 2.0 开源授权,旨在确保即使在运算资源受限的环境下,依然能维持强大的本机推论效能。Embedding Gemma2的主要能力包括:1、原生多模态检索,在共享的768维向量空间中直接解锁跨文本、代码、图像、视频和音频的搜索。
卓越的代码理解:在代码搜索和技术检索方面显著优于EmbeddingGemma1,非常适合本地代码库索引和智能体代码搜索。
模块化内存占用:在运行时仅选择性加载所需的编码器:2.7亿(文本/代码)、4.4亿(文本+视觉)、5.7亿(文本+音频)或7.4亿(完整多模态),全部投射到同一个兼容的向量空间中。
灵活的向量存储:Matryoshka表示学习(MRL)支持从768维动态截断至128维,在保留大部分原始质量的同时降低向量数据库存储需求。
为具体展示新模型的强大潜力,Google 同步推出了一款专为 Mac 打造的实验性应用程序 AI Edge Foresight,深度锁定智慧笔记与个人知识检索两大应用情境。在进行视讯或实体会议时,这款应用程序会在背景安静运作;使用者只需随手记下简短的关键字提示,系统便会自动结合实时生成的会议逐字稿,瞬间将这些速记扩充为语意通顺且完整的笔记。最重要的是,所有音讯与逐字稿均严格限制在本机处理,绝不上传云端,为商务与个人隐私提供最高层级的保障。
除了会议记录,AI Edge Foresight 也能化身专属的个人知识库。使用者可将其连结至项目资料夹、参考文件、图表与行事历,并全面支援本机档案及 Google Drive。透过对话式的检索与摘要功能,使用者能直接向系统提问,快速精准地找出所需信息。此外,Google 更加码导入了「实时助理」(Live Assistance)功能,让应用程序能持续聆听工作脉络,并自动回答使用者的问题,免去手动翻找档案的繁琐过程。
在硬件资源占用方面,Google 强调经过量化处理后的 EmbeddingGemma 2 负担极低。以 Google Pixel 11 Pro 为例,纯文字版权重仅需占用约 191MB 的活动存储器(RAM),而完整的多模态版本也仅需约 567MB。除了 Mac 版的展示工具,手机端的 Google AI Edge Gallery 也将迎来「Instant Media Search」(实时媒体搜寻)与「Video Moments Finder」(影片片段寻找)两项全新升级,让使用者能透过文字或图片,轻松在本机媒体库中搜寻内容,甚至一键定位特定的影片片段。
推荐阅读:
美股收盘:非农报告提振降息预期 三大指数集体收涨 标普、纳指再创新高






