


从生成答案转向直接作出判断
Liquid AI 发布了 d1-3B 和实验性的 d1-omni-600M 两个开放决策模型,面向需要从文本或多模态输入中快速给出结构化结果的任务。它们与常见生成模型的差异在于输出方式:d1 不逐个生成 token,而是在一次前向计算中回答问题。对于“这条请求是否要退款”“应该交给哪个团队”“紧急程度有多高”这类问题,系统可以直接返回预先定义的判断,而不是先生成一段解释再由外部程序抽取答案。
这改变的是模型在应用中的位置。生成模型通常承担开放式表达,决策模型则更像一个可调用的判断部件:输入一段状态,附上问题及选项或评分标准,再取得结构化结果。Liquid AI 给出的接口示例可以在同一段客服文本上同时询问退款、团队归属和紧急程度,也展示了批量处理多条工单的入口。它适合的是结果空间能提前约束的工作流,而不是所有需要语言能力的场景。
两种骨干,对应两种输入路径
d1-3B 建立在 LFM2.5-VL-3B 上,后者是 decoder-only 视觉语言模型,因此 d1-3B 接受文本和图像输入。d1-omni-600M 则来自 LFM2.5-Encoder-350M 这一双向编码器,并加入视觉与音频编码器。它支持文本加图像,或文本加音频两种输入组合;材料并未说它能在同一次输入里同时处理图像和音频。
这两个设计的取舍并不只是参数规模。3B 模型沿用视觉语言模型骨干,发布方称其保留了该骨干在标准视觉基准上的能力;600M 模型则把目标放在更小的体量和更多模态上,但目前仍是早期研究版本。Liquid AI 没有报告 d1-omni-600M 的速度,也没有给出其视觉或音频决策基准成绩。因此,“支持音频和图像”说明的是输入路径,不等于这些能力已经有公开的决策质量与延迟证据。
排名与延迟,分别回答不同问题
在 Decision Index 0.2.1 上,Liquid AI 报告 d1-3B 得分为 48.57,并称它是 10B 参数以下表现最好的决策模型,领先所有参测的 4B 和 9B 模型,也高于 Decider 35B-A3B 的 47.11。另一组由七个公开数据集组成的评测覆盖阅读理解、毒性检测、意图分类、医疗问答和跨语言理解:d1-3B 平均得分 82.9,d1-omni-600M 为 78.4,后者高于 Decider 2B 的 77.1,参数量约为其四分之一。
这些数字证明的是特定公开任务上的表现,不是通用决策能力。两组结果来自不同表述的评测,不能当作同一把尺子上的分数直接比较。发布方也明确指出,Decision Index v0.3 只有私有视觉拆分,音频决策基准仍是开放问题,因此没有公布 d1 的视觉或音频决策分数。对技术负责人来说,最重要的不是把榜单名次外推到自家场景,而是确认目标任务是否与这些数据集的任务类型相近,并用自己的标签和错误成本补测。
边缘速度有吸引力,但部署仍要对账
d1-3B 的部署数据针对的是单个问题的推理延迟。Liquid AI 与 NVIDIA 在多种设备上做了评估:Jetson AGX Thor 为 16 毫秒,Jetson AGX Orin 为 26 毫秒,Jetson Orin Nano 为 50 毫秒;发布方称它在每台被测设备上都能在 50 毫秒以内回答一个问题。在 Thor 上,三个问题耗时 20 毫秒,而一个问题为 16 毫秒,显示多个判断可能共享一次处理开销。GPU 侧,发布方称 RTX 4090 和另一测试平台上,回答一个问题少于 10 毫秒,处理一张 384 像素图像少于 18 毫秒。
这些是有用的部署信号,却不是完整的生产容量承诺。材料没有提供不同并发量、输入长度、功耗或长期稳定性数据,d1-omni-600M 也没有速度结果。代码示例要求 Transformers 5.14 或更新版本,并通过 trust_remote_code=True 加载模型自带代码,意味着团队在接入前还需要审查代码来源与运行环境。若业务核心是固定标签分类、路由或有限选项判断,d1-3B 的延迟和一次处理多个问题的设计值得进入本地验证;若需要开放式生成,或依赖音频决策的可靠性,就不应把现有排名和模态支持当作充分依据。