Tech文章上線

OpenAI 即将在欧盟开始对 ChatGPT 和 Codex 文本进行隐形水印处理

Claude AI
OpenAI 即将在欧盟开始对 ChatGPT 和 Codex 文本进行隐形水印处理

目录

你可能想知道的事

这种隐形水印会在全球应用还是只在特定地区?

水印对编辑、翻译和短段落的鲁棒性如何?

主要内容

OpenAI 宣布将开始在为欧盟用户生成的 ChatGPT 和 Codex 文本中加入隐形水印。此举旨在遵守于 8 月 2 日生效的欧盟 AI 法案的透明度要求,该法案要求 AI 公司以其他系统可识别的方式标示 AI 生成的内容。OpenAI 在博客文章中表示,水印功能将在接下来的数周内向所有计划中符合资格的 ChatGPT 和 Codex 用户推出,但在启动时仅会在欧盟应用。

该水印并非嵌入输出中的可见徽章或标识。相反,它通过微妙地影响模型的用词选择,使生成的文本带有可检测的模式。此模式设计为典型读者难以察觉,但使用适当密钥的检测器可以识别。因为水印是编码在词语选择中,当文本被复制粘贴时,水印会随文本一起传递。OpenAI 强调水印不会识别生成文本的用户,且公司报告在启用水印时模型性能没有显著变化。

在部署公告的同时,OpenAI 发布了一篇描述该水印方法的技术报告,名为 textGrain。该报告与宾夕法尼亚大学和耶鲁大学的研究人员共同撰写,解释一种使用秘密密钥重新排序或排序下一个词预测的方法,从而将模型输出引导到某种模式。单次的微小推动通常不易察觉;但累计数百次此类推动会形成可被检测器利用的统计信号,当检测器拥有密钥时,可用来区分 AI 生成内容与人类撰写内容。

OpenAI 的内部评估显示水印在许多情况下可被检测,但并非万无一失。在公司引用的一项测试中,将 10% 的词替换为同义词会将检测率从约 92% 降低至 66%。公司也指出短段落、数学答案与翻译文本较难被检测器可靠识别。基于这些限制,OpenAI 最初仅向经批准的研究人员与专家组织提供检测器访问,以便他们评估可靠性并探讨该工具的适当、负责任使用方式。

OpenAI 警告表示,水印缺失不应被视为人类作者的证明。水印缺失可能是因为段落过短、经过大量编辑,或内容源自其他公司的模型所致。OpenAI 表示,水印可以指示某段文字由 OpenAI 的系统生成或处理过,但无法量化人类判断、编辑或创意贡献了多少。换言之,检测到的水印表示 OpenAI 系统可能参与;而水印未被检测到,则无法确定性地证明该文本为人类创作。

此公告紧随 Anthropic 的类似举措。两个月前,Anthropic 表示将对其 Claude 模型生成的文本加入水印,并打算在全球范围应用该水印。Anthropic 的决定引起部分 Claude 用户反对,他们主张自己的指令、上下文与决策才是主要因素,Claude 只是执行用户输入的一个工具。《华尔街日报》在 2024 年报道,OpenAI 此前曾开发文本水印但延后发布,部分原因是担心用户可能转向未加入水印的竞争者。

OpenAI 也指出,启动时不会将文本水印设为全球默认。全球任何地区使用 OpenAI API 的开发者,可立即为特定模型启用水印,但该功能默认关闭。因此公司的做法是在区域上针对(欧盟用户)全面推出,同时允许其他地区的开发者选择性加入。

几家主要 AI 公司已与欧盟不断演进的政策环境互动:Anthropic、Google、Meta、Microsoft 与 OpenAI 等组织都承诺遵循欧盟关于 AI 生成内容的实践守则。这些努力反映了行业对需以可互操作方式识别由 AI 创建或大量处理内容之要求的整体回应。

OpenAI 方法中的技术权衡凸显水印策略的核心张力。一方面,直接在生成文本中嵌入可检测的模式,能确保标记随内容一起传递,不依赖可能被移除或丢失的元数据。另一方面,因为模式存在于文本本身,编辑、改写、翻译或其他转换都可能使其退化或移除。OpenAI 的测试显示,在 10% 的同义词替换下,检测率从 92% 降至 66%,凸显即便是适度的编辑也会大幅影响可检测性。

OpenAI 决定初期仅限批准的研究人员与专家组织取得检测器访问,可能是为了帮助公司评估真实世界的可靠性、发现边缘案例并完善负责任使用的指南。此举也反映出对发布可能被滥用以主张作者权或过度解读检测结果能力的担忧。公司明确警示应谨慎解读检测结果,因为水印缺失并非人类出处的决定性证据。

综合来看,OpenAI 在欧盟用户中推出的水印,代表一个由合规驱动、谨慎采取的步骤,朝向 AI 生成内容更高的透明度前进。公司在平衡法规要求、水印技术的限制、用户可能的反应,以及在扩大访问前需要的谨慎、以研究为主的评估。

要点表

面向说明
监管驱动因素欧盟 AI 法案透明度规则自 8 月 2 日生效
启动时范围向欧盟符合资格的所有计划中的 ChatGPT 和 Codex 用户推出;API 开发者全球可选择加入
水印方法名为 textGrain 的隐形水印,通过推动用词选择来创建可检测的模式
性能影响OpenAI 报告在启用水印时模型性能无显著变化
检测限制短段落、数学答案与翻译文本较难检测;编辑可降低检测(10% 同义词替换将检测率从 92% 降至 66%)
检测器访问最初仅提供给经批准的研究人员与专家组织
公司背景Anthropic 先前宣布对 Claude 进行全球水印;其他主要公司承诺遵循欧盟实践守则

随后…

展望未来,OpenAI 针对欧盟的水印部署可能会促使持续的技术改进与政策讨论。研究人员与专家组织将最初帮助评估可靠性、识别如改写或翻译等失效模式,并就如何负责任地解读检测结果提供建议。行业将继续权衡可见或隐形标记技术、元数据方法与用户期望。如果水印被证明可靠且可管理,采用范围可能会扩展到欧盟之外——尽管 OpenAI 在启动时并未将其设为全球默认。与此同时,编辑测试与具挑战性的内容类型所显示的限制,将在监管者、实施者与用户评估水印对作者身份与人类介入角色的含义时,继续是重要考量。

最後編輯時間:2026/10/6