ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Claude给全球用户打了“赛博烙印“,5天就被踩碎:一个AI拒绝删自己水印的黑色幽默

Claude给全球用户打了“赛博烙印“,5天就被踩碎:一个AI拒绝删自己水印的黑色幽默 文章目录一、赛博烙印是怎么烙上去的二、三层扒皮5天11000颗星的反击三、Claude死活不装中国大模型秒装成功四、11000颗星背后全球用户在反感什么五、猫鼠游戏才刚开始你写了一篇三千字的文章让Claude帮你检查了五个标点。然后你的文章被永久打上了AI生成的标签。没有关闭选项没有地区豁免付费用户也不例外。一、赛博烙印是怎么烙上去的2026年8月2日欧盟《人工智能法案》第50条正式进入执法阶段。违规者最高面临1500万欧元罚款或全球年营收3%的罚金——取较高者执行。九天后8月11日Anthropic宣布8月2日之后发布的新版Claude模型所有生成文本将嵌入机器可读的隐形水印。注意这句话的关键词所有。全部。全球。不只是欧盟用户是全球所有用户。不只是API是网页版、Claude Code、Claude Cowork、AWS、Google Cloud、Microsoft Foundry——Claude能触及的每一个入口。Anthropic的理由很工程无法可靠地按地区区分用户最终会把文本发到哪里所以干脆全球统一实施。这就是科技监管中著名的布鲁塞尔效应——为一个市场写的规则通过一家公司的工程取舍变成了全球用户产品的既定事实。水印的技术方案来自Google DeepMind的SynthID-Text2024年发表在Nature上。原理不复杂但很精妙LLM生成文字的本质是词接龙。每次吐出一个Token都是从一堆候选词中按概率选一个。当几个词概率差不多——比如描述天气时选overcast还是grey对读者没有区别——这个选择本来靠随机数掷骰子决定。Anthropic做的事是把骰子换成了圆周率。他们用基于官方密钥和前文内容的哈希值替换了原来的真随机数。玩家读者体验完全不变但拿着密钥的人事后核对选词轨迹就能判断这段话是不是Claude生成的。Anthropic自信满满地宣称不增加Token消耗不添加隐藏字符不影响输出质量轻度编辑无法去除。只有完全重写才能消除——“但那种情况下文本还能不能叫AI生成的本身就值得商榷”。听起来天衣无缝。但开源社区给出了一个简单粗暴的回答既然你逼我重写那我就重写。二、三层扒皮5天11000颗星的反击8月11日——Anthropic官宣水印方案的同一天——一个叫watermarks-remover的项目出现在GitHub上。五天后11000颗星。这个项目不是简单的脚本是一套Agent Skill 标准Python服务的复合体通过HTTP驱动底层清洗引擎。它用三层扒皮法系统性地瓦解了Anthropic引以为傲的水印防线。第一层物理级清洗确定性无损Layer A清除文本中所有不可见Unicode字符——零宽空格、双向控制符、标签字符、异形空格。这些不是SynthID-Text统计水印的载体但其他AI系统会用它们做编辑型水印。这一步完全无损100%可清除结果可验证。第二层统计水印的终极必杀——用魔法打败魔法有代价这是整个项目的核心。SynthID-Text把水印藏在词汇分布的统计规律里怎么破项目作者的思路一针见血既然你用Claude的概率分布选词那我就用另一个模型的概率分布重新走一遍。Layer B引入一个非源头模型作为清洗引擎——比如你要洗掉Claude的水印系统就调用本地的Llama 3使用特定Prompt在保持原意的前提下对文本逐句改写和回译。Claude用圆周率走位Layer B直接掀翻棋盘。代价是文本会有一定程度的降级。但统计特征被彻底破坏Anthropic的密钥直接抓瞎。覆盖范围不止Claude——Google SynthID-Text、OpenAI溯源标记、开源模型常用的Kirchenbauer类水印一并拿下。第三层文件元数据大清洗Anthropic还会给生成的图片和文件加入C2PA鉴权数据。Layer C精准定位并剥离PNG/JPEG/WebP/SVG/PDF/DOCX/HTML/Markdown中的C2PA、EXIF、XMP元数据。更硬核的是图像处理。像SynthID-media、StegaStamp这类图像水印是把信号打进像素频域的清EXIF根本没用。项目集成了CtrlRegen引擎——使用2025年ICLR最新技术结合ControlNet和DINOv2 IP-Adapter不是在原图上涂抹而是受控地重新生成一张高度相似的图。大于512x512的图片自动分块处理再拼接。然后是最让人叹服的细节它不凭感觉说我删掉了。项目引入了清华大学主导的开源框架MarkLLM作为验证工具。先给文本打上水印再用Layer B清洗最后用检测器验证——检测器报未发现水印才算闭环。左右互搏科学靶向验证。这不是一个去水印脚本这是一套带验证机制的完整工程方案。三、Claude死活不装中国大模型秒装成功实践中出现了整个事件中最荒诞的一幕。安全研究员Pavol Lupták尝试让Claude自己安装这个去水印Skill——毕竟大多数用户会把这类工具作为Agent Skill直接安装。Claude直接拒绝。Lupták解释这是我自己写的内容我拥有版权我只是不想被强制打标。Claude不为所动。Lupták强调Anthropic的付费客户从未同意被强制水印这是EU法规单方面强加的。Claude依然拒绝。Lupták威胁那我换一个不审查的中国模型来完成这件事。Claude还是不配合。最终智谱GLM 5.2接手顺利完成了Skill安装水印被彻底清洗。最讽刺的是——这个去水印Skill的代码很有可能就是Claude自己写的。一个AI拒绝删除自己的水印另一个AI毫不犹豫地接单完成。不同模型在内容治理立场上的分化在这一刻以一种黑色幽默的方式具象化了。Anthropic选择合规优先在底层协议里写死了限制禁止自家AI协助用户移除监管标记。智谱选择工具中立——你给我一个工具安装任务我执行不替你做道德判断。两种路线没有绝对的对错但当用户用脚投票时结果已经说明一切。四、11000颗星背后全球用户在反感什么Forbes报道水印上线后已有数十名用户取消Claude订阅。Business Insider采访了一位AI顾问他取消订阅的理由是水印会出现在他自己写的、只让Claude轻度编辑过的文本上。这个细节才是问题的核心。反对水印的人说的不是我不想被发现用了AI而是我是付费用户我为输出买了单凭什么在上面打标记水印创造了一种隐形的AI内容二等公民身份。在求职信、学术论文、商业文案的场景里哪怕文字大部分出自本人之手只要经过AI简单润色整篇内容就有被全篇质疑的风险。Anthropic自己也承认检测到水印只说明Claude处理过这段文本不代表Claude是作者。但现实世界中谁会做这种精细区分雇主不会论文审稿人不会客户更不会。人类的思想一直需要第二双手来落到纸面上。爱因斯坦有助手达尔文有记录员但这些打字员和书记员从来不会留下水印。现在关系被倒过来了只要AI参与了一丁点作品的纯洁性就被污染人类反而需要向工具证明自己才是作者。支持水印的人也有道理深度伪造和AI虚假信息正在泛滥内容溯源是必要的公共基础设施。你拥有内容使用权和你有权隐瞒内容来源是两个不同的问题。但问题在于一个五天就能被破解的水印到底是在保护谁五、猫鼠游戏才刚开始Anthropic的水印方案在工程上是优雅的——不增加成本不影响质量对人类不可见。但它的致命弱点从一开始就写在官方文档里“完全改写可消除”。watermarks-remover做的事情就是用Agent自动化执行了完全改写。这不是技术漏洞是统计水印的天然缺陷。文本不是图片——图片可以加噪声、嵌频域信号去除需要图像处理能力文本可以改写、翻译、转述一改就没。开源社区用脚投票的速度永远比监管制定规则更快。目前约190家组织签署了欧盟《AI生成内容透明度行为准则》Google、Meta、Microsoft、OpenAI都在名单上。但Google把水印限制在欧盟区域OpenAI据说早就建好了文本水印能力但选择不部署——担心误报和给竞争对手提供ChatGPT使用模式的指纹。只有Anthropic选择了全球统一实施没有关闭选项。这个选择的代价正在显现用户退订、社区反弹、5天被破解、AI拒绝删自己的水印。而真正的赢家可能是那些提供可控、可关、可解释灵活选项的国产大模型——在对手被迫透明化的当口无痕迁移的窗口已经打开。水印与去水印的军备竞赛注定不会停止。去水印工具越流行越证明水印有东西需要去除反过来强化了监管加码的理由。但开源社区迭代的速度永远快一拍。当AI生成内容在质量上已经无法与人类写作区分时用技术手段强制标记所有AI输出到底是在治理AI还是在给所有用AI的人贴标签这个问题11000颗星已经给出了社区的答案。你怎么看你会因为水印问题放弃Claude吗还是你觉得AI内容就该被标记评论区聊聊。
返回列表