10月5日,OpenAI公布了它的文本水印方案:在欧盟给ChatGPT和Codex生成的文本加上隐形水印,未来几周覆盖所有套餐的合格用户。全球的API客户从当天起可以为部分模型打开这个开关,但默认关闭,OpenAI也明确说不会一上来就做成全球默认。动作的直接原因是欧盟人工智能法案的透明度条款,该条款8月2日已经生效,法案第50条要求生成式AI的提供方让文本输出可以被机器识别,已在市场上的提供方要在12月2日前完成。
技术细节比“水印”这个词本身更有意思。方案叫textGrain,做法不是插入可见符号、隐藏字符或者元数据,而是改变模型生成时的选词统计模式。检测器只需要拿到文本和密钥,就能估算这段内容是否带着OpenAI的水印。官方同步发布了技术报告,作者来自宾夕法尼亚大学、耶鲁大学和OpenAI。报告把这道工序描述成一个最优传输问题,用熵预算限制为水印信号付出的采样熵,代价函数里的KL惩罚项恰好等于水印所移除的平均熵。
效果数据官方给得很实在。在1%的目标误报率下,检测器能认出约80%的200token文本片段,400token的片段能到约95%;换成数学类内容,因为选词空间小,检出率明显下降。抗编辑能力则相当有限:在400token的测试里,把10%的词换成同义词,检出率从约92%掉到66%,换掉四分之一,只剩17%。翻译和大幅改写同样会削弱信号。OpenAI自己的说法是,文本水印还处在早期阶段,局限明显。
能证明什么、不能证明什么,官方把线划得很清楚。检测到水印,只能说明某段文字可能由OpenAI的系统生成或者处理过;它无法识别用户、无法还原提示词、无法确定内容是否准确,也衡量不出其中有多少人类判断和编辑。反过来同样成立:查不到水印,并不能证明文字是人写的,文字可能太短、被改过、被翻译过,或者来自别家的模型。正因如此,检测器初次只面向经过审核的研究人员和专业机构开放,申请通道当天开始接收。
把这件事放到行业里看,OpenAI不是第一家。两个月前Anthropic已经给Claude的文本加水印,而且是全球范围应用,当时引起了部分用户的不满,理由是自己出的提示、上下文和决策,模型只是个工具。OpenAI更早也做过文本水印,因为担心用户流向没有这项限制的竞品,一直压着没放。如今欧盟的合规时钟走到了最后一段,Anthropic、谷歌、Meta、微软和OpenAI都已签署欧盟关于AI生成内容的实践准则。水印能被同义词替换削弱这一点,恰好说明它更适合当辅助线索,而不是判定作者身份的依据。
A5创业网 版权所有