先看证据
合规要求明确,技术路线并未被指定
OpenAI于2026年10月5日公布面向欧盟文本溯源规则的方案:部分API模型允许客户主动开启文本水印,符合条件的欧盟ChatGPT和Codex文本则计划在接下来几周逐步加入水印;检测器先向获批研究人员和专家机构开放。这不是一个对所有产品、所有地区同时生效的统一开关,而是一套分层部署安排。
这个时间点有法律背景。欧盟《人工智能法案》第50(2)条自2026年8月2日起适用,要求生成式AI提供商以机器可读方式标记生成文本,并使其可被检测;法律并没有规定必须采用水印,也列有适用范围和例外。对于该日期前已投放市场的系统,部分义务有至12月2日的有限宽限期。因此,OpenAI选择水印是其合规路径,不是欧盟指定的唯一方案;公告发布在适用日之后,也不能简单理解为规则尚未生效。
textGrain把信号藏在选词的统计规律里
textGrain不是在文本中插入隐藏字符或特殊标点,而是在模型生成时影响词语选择,让输出呈现不可见的统计模式。技术报告描述的做法是依据密钥和上下文对词表分组,再用熵预算限制采样随机性的变化;检测器检查文本是否呈现与该密钥相关的统计依赖。换句话说,水印不是贴在句子上的标签,而是生成过程留下的概率痕迹。
这种设计有一个重要前提:文本必须保留足够的原始生成信号,检测才可能奏效。模型不能为了留下水印就任意改变表达,因此采样变化受到约束;而文本越短、可选择的表达越少,或内容经过改写,统计痕迹就越可能变弱。OpenAI称会继续补充技术报告细节,并计划开源这项技术,但这两项都是公告中的后续计划,并不意味着检测能力已经成为公开、普适的服务。
检测率取决于文本条件,不是一个固定分数
在目标误报率为1%的测试中,心理学类文本长度从200 tokens增至400 tokens,水印检出率约从80%升至95%。同一评测中,数学文本的检出率明显更低,因为这类内容的词语选择空间较小。这个差异说明,检测器的表现不只是模型或算法的属性,也受文本长度和内容类型影响;即使把误报率设在同一目标上,不同文本也不会得到同样可靠的结果。
编辑会进一步削弱信号。在400-token文本测试中,未编辑时检出率约为92%;用同义词替换10%的词后,检出率降至约66%,替换25%后则降至约17%。OpenAI帮助中心还称,其测试覆盖欧盟24种官方语言;在目标误报率为1%的测试中,西班牙语检出率最高为69.0%,罗马尼亚语最低为42.2%。这些是特定评测条件下的结果,不应被读成任何语言、任何长度或经过翻译改写的文本都能达到的日常检测水平。
分层上线是在管理不确定性
API客户可在全球范围为部分模型选择开启水印,但默认关闭;欧盟符合条件的ChatGPT和Codex文本则计划逐步启用;检测器另外采用申请和审核制。这几种安排承担的角色不同:API客户可以把水印纳入自己的披露流程,面向欧盟的产品部署回应法规环境,而有限开放的检测器则让研究者先评估误报、漏报和负责任使用方式。OpenAI表示,检测结果不会显示用户身份、提示词或对话内容,但这并不消除检测结论本身的不确定性。
对技术负责人来说,最容易犯的错误是把“可检测”当成“可判定”。检出水印只能说明文本呈现了与某种生成过程相关的信号,不能说明谁写了文本、谁对其内容负责,也不能证明文本准确。反过来,检测器没有检出水印,也不能证明文本由人类创作,因为水印可能被编辑削弱或被漏检。图像和音频的公开验证工具仍将继续开放,但文本检测器的不同权限安排,正体现了OpenAI对文本水印可靠性的谨慎判断。
把水印放进溯源链,而不是当作裁决
对接入生成式模型的团队,实际判断不应是“要不要相信检测器”,而是水印能否为现有的来源披露流程增加一项有用信号。API水印默认关闭,意味着团队需要主动评估是否启用、如何向用户说明,以及文本经过编辑、翻译或整合后如何处理。测试时也应覆盖自身的内容类型和编辑流程,而不只看未经修改的英文长文本表现;现有结果已经显示,这些条件会显著改变检测率。
更稳妥的做法,是把机器可读水印与来源凭证、平台审核和人工核查并用,并明确它们各自能回答的问题。水印可以辅助判断某段文本是否带有特定模型的统计信号,却不能独自完成作者鉴定、责任追踪或事实核验。若一个工作流程准备仅凭一次检测结果处罚作者、拒绝内容或认定违规,现有证据并不支持这种用法。技术团队应把检测器当作有限的溯源工具,而不是给文本盖上的真伪章。