先看证据

7.89GB,对比BF16的54GB27B模型
Saluki精确每权重位数未披露关键事实
发布方称9项基准平均保留96%关键事实
88/120,对比原版84Underdog Bench
42/100,对比原版35并行工具调用
修复30/50,对比原版33SWE-bench

压缩目标从通用保真转向代理任务

Conway Research 旗下的本地助手 Underdog 发布了 Saluki 27B:一个基于 Qwen3.8-27B、面向本地运行和工具调用的 GGUF 模型,采用 Apache 2.0 许可。它把原版 BF16 模型所需的 54 GB 压到 7.89 GB,并可在原版 llama.cpp 中运行,试图解决 27B 级模型难以放进本地部署环境的问题。

这次发布值得技术负责人细读的地方,不是单看模型文件缩小了多少,而是压缩后能力分布并不平均。Underdog 将工具调用作为优化重点,发布方的测试显示它在部分工具任务上超过原版,却在竞赛数学和推理上明显落后。换句话说,Saluki 展示的不是“更小但等价”的模型,而是一种按目标任务重新分配压缩损失的做法。

压缩链条有公开部分,也有黑箱

据发布材料的描述,Saluki 建立在 Qwen3.8-27B 之上,先采用 ISTA-DASLab 的低比特 GGUF 版本,再经过 Underdog 自己的一轮处理。ISTA 方案中的 GSQ 为各张量学习低比特标量网格,RCO 则在固定文件体积预算下,为张量分配量化类型。这个中间版本最小为 8.4 GB,标称 2.50 bits per weight。

Underdog 随后将文件缩到 7.89 GB,命名为 IQ2-mix,并称额外处理针对工具调用。但完整配方没有公开,Saluki 的精确每权重位数也未披露,因此“2-bit”应理解为约 2-bit 的混合量化,而不是每个权重都精确存为两位。团队可以据此理解它的技术谱系,却不能仅凭公开说明复现它如何换得工具调用分数。

分数显示了收益,也标出了损失

最有力的工具调用证据来自发布方在同一测试框架下的对照:关闭 thinking、temperature 设为 0,Saluki 在从 BFCL v4 取出的 120 项 Underdog Bench 上得分 88,原版为 84。另一组 100 项并行工具调用任务中,Saluki 为 42,原版为 35。差距值得关注,但测试规模有限,模型卡也提醒小幅差异可能受运行波动影响,不能据此推断所有工具链都将得到提升。

其他结果说明,这种取舍不是免费的。SWE-bench Verified 的 50 个 issue 中,Saluki 修复 30 个,原版修复 33 个;AIME 2025 分数为 79.2 对 96.7,AIME 2026 为 80.0 对 94.6。发布方还称九项基准平均保留 96%,但公开材料没有充分说明平均值如何归一化和加权。平均保留率不能替代按实际任务检查单项退化。

运行时兼容性也是部署收益

Saluki 的部署卖点不止是 7.89 GB 文件,而是能接入 stock llama.cpp 及基于它的应用,无需换成专用运行时。作为对照,材料提到更小的 Bonsai 2 文件为 5.95 GB,也报告了自己的基准结果,但需要 PrismML 的 llama.cpp 分支,因为原版 llama.cpp 不接受它的打包格式。两者的评测框架各不相同,不能把分数直接排成同一张榜单;可比较的是部署路径上的依赖差异。

硬件和模态也要单独核算。7.89 GB 指 Saluki 主 GGUF 文件,不等于完整应用的全部运行内存需求;材料称它支持完整 GPU offload,但没有给出不同设备上的速度数据。主文件是文本模型,图像输入还需额外搭配 629 MB 或 928 MB 的 vision 文件。对本地代理团队而言,减少运行时摩擦可能很实用,但不能把它误读成“单文件多模态模型”或已经验证的性能保证。

把它当作候选配置,而不是通用替代品

在采用前,也应把数学、多步推理和代码修复等能力列入回归集,并记录额外 vision 文件及运行时要求。更根本的限制是,Underdog 的压缩配方尚未公开,独立第三方复现结果在现有材料中也未提及。Saluki 因而更适合作为“面向代理的压缩是否有用”的可部署案例,而不是已经证明全面胜过原版 Qwen3.8-27B 的替代品。它给技术负责人的可执行判断是:先按任务选模型,再用本地基准决定压缩是否值得。