先看证据
向量服务不是一次性依赖
Google于2026年10月6日发布EmbeddingGemma 2。这是一款向量模型,不负责像聊天模型那样直接生成回答,而是把文本、图像、视频和音频转换成可比较的表示,供搜索、检索、分类和相似度计算等任务使用。Google称上一代EmbeddingGemma累计下载超过2000万次,新版则将输入范围扩展到多种模态。
模型发布之外,Simon Willison在Hacker News上的评论提出了一个更贴近系统运维的问题:当一个模型服务不再提供时,已经生成并保存的向量怎么办?向量通常不是用户临时看一眼就丢弃的中间结果,而是批量计算后放进索引,供之后反复检索。模型因此成为索引生产链上的长期依赖,服务是否持续可用会影响的不只是下一次调用。
停服风险会沿着索引传导
向量记录的是模型对内容的表示。若服务商停止提供某个模型,团队可能需要改用另一个模型重新计算内容向量,并更新相关索引。新模型即使能力更强,也不能据此假定它生成的向量可以直接替换旧模型的结果。对积累了大量内容的系统来说,这个过程可能带来计算、时间和工程工作,而不只是换一个API地址。
Willison提到,OpenAI在2024年4月曾表示愿意承担用户将内容重新嵌入新模型的财务成本。他的担忧是,不能把这种安排当成所有供应商都会兑现的承诺。这并不是对不同服务合同的成本测算,也没有给出重算向量需要多少资源。它更像一个架构层面的提醒:如果索引是生产系统的重要组成部分,模型停供后的责任与预算就不该只留在供应商的产品规划里。
多模态扩大了模型依赖的范围
EmbeddingGemma 2将文本、图像、视频和音频映射到同一个768维向量空间,让不同模态的内容可以进入基于向量相似度的检索流程。它采用可拆分的编码结构:文本部分为270M参数,视觉编码器为170M,音频编码器为300M,合计740M。文本部分可以单独运行,视觉和音频编码器则可按需加载。视频默认每秒采样一帧,再交由视觉编码器处理。
这些设计让团队可以按任务组合模型组件,也让同一套检索系统有机会覆盖多种内容。但索引范围一旦从文本扩展到图片、视频和音频,模型供给变化可能影响的不再是单一文本库。统一向量空间讲的是模型如何表示输入,并不意味着所有业务都必须一次性接入所有模态。实际部署仍要根据数据类型加载组件,并考虑这些内容各自的索引如何维护。
压缩向量省存储,也要接受质量取舍
模型支持Matryoshka Representation Learning,也就是生成向量后可以截短到较低维度,以减少向量存储量。模型卡建议截短后重新归一化,同时提醒维度降低可能损失部分效果。这为团队提供了存储和检索质量之间的调节空间,但没有消除选择:截短多少、效果损失是否可接受,需要结合具体检索任务判断。
这项能力与停服问题解决的是不同成本。截短向量针对的是存储占用,Apache 2.0开放权重针对的是模型能否在托管路径之外继续使用。前者不让团队免于供应商变更带来的模型迁移,后者也不会自动缩小既有索引的存储需求。技术负责人如果把两者都笼统归入“降低成本”,就容易漏掉各自的边界。
开放权重是接管路径,不是免费迁移
EmbeddingGemma 2采用Apache 2.0许可,给团队留下了两条不同的运行路径。日常可以使用托管服务,把部署和运维交给服务商;如果服务商不再托管这个模型,团队可以运行开放权重版本,或寻找能够运行它的其他服务商。Willison强调的正是这种组合:愿意为托管服务付费,但不希望服务停供就失去继续使用原模型的可能。
接管原模型和迁移到新模型不是一回事。自托管仍要求团队承担部署与资源管理,而更换模型可能需要重新计算已有向量。一个可执行的做法,是把模型版本、权重获取路径和向量生成流程与索引一同纳入资产管理,并区分两类预案:托管中断时怎样续跑原模型,以及决定换模型时怎样评估索引重建工作。开放权重提供的是连续性缓冲,不是免除运维或迁移成本的保证。