先看证据

Claude、GPT、Gemini、Mistral四个模型参与
四者都用 `llm` 命令行生成 SVG关键事实
提示词是穿网袜的犰狳在火星乱穿马路关键事实
各模型使用默认推理设置关键事实
原文未提供统一评分或重复试验结果关键事实
Large 4于2026年10月公开预览关键事实

玩笑提示词变成了可查看的产物

2026年10月6日,Mistral发布了Large 4的公开预览。围绕这款模型,Simon Willison在Hacker News上回应了一条关于基准测试饱和的玩笑:前沿模型仿佛已经要面对“穿网袜的犰狳在火星上乱穿马路”这样的测试。他随后用`llm`命令行工具,让Claude Opus 5.5、GPT-6.1 Sol、Gemini 3.8 Flash和Mistral Large 4都生成描绘这一场景的SVG。

这件事值得读,不是因为它证明了谁赢,而是因为它把模型比较的对象从排行榜上的一个数字,换成了读者可以打开查看的输出。SVG查看器让人能直接看到生成结果是否呈现了要求中的主体和场景。这样的对照容易引发具体讨论,但它仍然是一项演示,不是经过设计的模型评测。

看得见,不等于量得准

把任务写成一张SVG,确实带来了一种实用的可观察性。读者可以检查文件能否渲染,也可以判断图像是否大致遵循提示,而不必先相信一个汇总分数。对工程团队而言,这适合做早期冒烟检查:在投入更完整的评测之前,先确认模型是否能产出符合基本要求的文件,并暴露明显的失败方式。

但这份材料没有给出统一评分标准、重复生成次数、统计分析,也没有公布胜者。提示词相同,只说明四个模型收到相同的文字,不说明它们的输出质量已经用同一尺度衡量。一次生成只能说明某个模型在某次调用中产出了什么,不能据此判断总体图像能力,更不能把偶然的成功或失误推广到其他任务。

默认推理设置留下了混杂因素

Willison按每个模型的默认推理设置运行这组提示。这样做贴近普通用户直接调用模型时的体验,却没有控制完整的生成条件。即使输入文字相同,默认设置不同也可能影响产物;现有材料没有提供足够信息,把模型本身的差异与运行配置的差异分开。

因此,这项比较可以回答一个有限的问题:用这些模型各自的默认方式处理这个提示,实际会看到怎样的SVG。它不能回答在相同推理预算或相同配置下哪个模型更好。团队若要将这种演示推进到选型,应先统一可控制的运行参数,再重复生成,并预先确定评价维度,例如提示中的元素是否齐全、文件是否可用以及结果是否适合下游工作。否则,讨论很容易停留在几张图带来的印象上。

架构宣传不能由一张图来验证

Mistral将Large 4描述为原生多模态MoE模型,并称它从头训练于自有欧洲数据中心,使用了3,800张NVIDIA Grace Blackwell GPU。官方公告称总参数量约1万亿、激活参数490亿,模型文档则分别列为1.05万亿和520亿。文档还列出16亿参数的视觉编码器。这些信息有助于理解产品定位,但这组SVG比较没有测量稀疏路由、训练规模或视觉编码器各自带来的效果。

规格本身也存在需要保留的差异。Mistral模型文档给出的上下文长度是1M,Vals页面列出的是512k;现有材料没有解释参数数字和上下文长度的不同口径。技术负责人不应替这些差异推断原因,也不应将其与某一次生成结果连成因果关系。对实际选型而言,应该分别核验规格来源,并在目标工作负载上做受控测试。

让怪提示词承担合适的工作

“基准测试已经饱和”是讨论中的判断和玩笑,不是这次对比得出的研究结论。奇特提示词的价值在于,它能让参与者迅速看到一个具体产物,也能暴露模型是否漏掉要求或生成不可用文件。它适合用来发现问题和启动评测设计,却不能代替覆盖多个任务、统一条件和反复运行的评估方案。

对技术负责人,一个可执行的判断是把这类SVG任务放在评测的入口,而不是出口:先作为轻量冒烟测试,随后再对真正影响业务的任务定义标准、固定配置并重复验证。Mistral Large 4当时仍是公开预览,Mistral称权重预计在当月底发布。无论模型规格如何演进,单张图都只是一条观察记录。它可以让团队更具体地讨论模型,却不能单独决定模型排名或生产选型。