ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

播了半年,听众才发现主持人是AI

播了半年,听众才发现主持人是AI 悉尼有一家叫CADA的音乐电台工作日的白天有一档节目叫《Workdays with Thy》。主持人Thy声音年轻、亲和每个工作日陪着听众四个小时一播就是将近半年。这半年里没人觉得哪里不对。她报歌、串场、聊几句轻松话题语气自然节奏也稳。2025年4月一位叫Stephanie Coombes的作家起了疑心。她发现这个Thy在网上查不到任何一次公开露面没有能对上号的照片也没有过往的采访。她追问下去电台才承认Thy不是真人是AI生成的虚拟主持声音用ElevenLabs的声音克隆技术做出来克隆的对象是电台母公司ARN的一名真实员工。事后回看破绽就藏在那张照片里。有报道指出Thy的头像用的是ARN一名员工的脸只是换了个名字而电台网站上其他主持人的照片文件名里都嵌着本人的名字唯独Thy这张写的是另一个名字。一个平时没人会点开细看的地方成了这档节目最先露出的马脚。在澳大利亚这件事不违法。当时没有任何法律要求电台披露主持人是不是AI。CADA没有触犯规则它只是没说。可正是没说这两个字点着了后面所有的争论。▲图Thy在悉尼的白天档播了近半年。争议的起点不是电台用了AI而是它默认听众不需要知道。瞒得住是因为已经听不出来争论的第一层是技术已经好到听不出来。半年没人起疑不是听众不上心而是合成的声音加上生成的稿子在正常收听的状态下确实找不到破绽。过去分辨真人和合成靠耳朵就够。一段机器合成的语音语调平、换气假、连读生硬听两句就露馅。现在不一样了。合成语音能带上语气的起伏能在该停顿的地方停顿能把一句串场说得像临场发挥配上大模型写的稿子内容也接得上时事、对得上当天的歌单。同一类技术正在把两个人对谈式的播客整段整段地生成出来一次做几十种语言。放到一档四小时的音乐节目里这些早就够用了。听众失去的不是判断力是判断的依据。你没法再从声音本身找出破绽因为破绽被磨掉了。于是问题从听不听得出变成该不该告诉你分辨这件事一旦交不回给耳朵就只能交给规则。Thy事件真正扎人的地方不在于电台用了AI而在于它默认这件事不必让听众知道。一档每天四小时的陪伴节目建立在一个人格之上听众以为这个人格是真的其实是虚构的。争议由此而来这不是技术问题是知情问题。你可以接受机器陪你聊天前提是你知道对面是机器。行业里已经有人给出了最直接的答案——干脆不用。2025年12月美国规模最大的广播集团之一iHeartMedia成文规定旗下电台上麦的主持、台歌串词、节目包装每一个声音都必须是真人内部备忘录的原话是每个声音必须是人。幕后的排期、剪辑、数据分析用AI可以话筒前不行。这是一种极端而清晰的立场与其事后解释哪一段是AI不如让话筒前根本没有AI。▲图面对同一个问题一头是干脆不用一头是用可以但必须声明。Thy出事出在中间那片还没有规矩的地带。中国把另一个答案写进了法规另一个方向不是禁止是强制说明。2025年9月1日《人工智能生成合成内容标识办法》正式施行。它把音频和文本、图片、视频并列明确列为必须标识的AI生成合成内容。也就是说AI配音、语音克隆、AI生成的播客节目全都在监管范围里。办法对音频给出的标识方式很具体在音频的起始、末尾或者中间适当的位置加一段语音提示或者加一段音频节奏提示。所谓音频节奏提示是一段特定节奏的信号配套的国标把它定成短长短短这样的模式。一句话一段AI生成的声音要么开口告诉你它是AI要么在音频里留下一个能被机器读出来的节奏印记。把这套规则放回Thy这件事上结论就变了。在中国一档《Workdays with Thy》从第一天起就得让听众知道台前是AI无论它做得多像真人。分辨的责任从听众的耳朵挪到了内容方的标识义务上你不必再听得出因为对方必须先讲明。广播要重新学会自报家门这件事对广播的意味比对播客更直接。广播是单向的、伴随性的收听。人们开着车、做着饭并不盯着屏幕就让声音陪着。正因为不盯着声音的可信度就是这门生意的地基话筒后面是一个真人是广播默认了一百年、从没被追问过的前提。Thy把这个前提第一次摆到了台面上——当台前可能是AI而听众无从分辨这块地基就需要一个新的支撑不是让声音更像真人而是让台前是不是真人这件事本身变得可查。国内的AI音频不是纸面上的推演。已经有平台把AI接进了有声内容的录制和后期用自有版权的语料训练出音频大模型十几秒就能克隆一个人的音色。技术早就到位先落地成规矩的是标识。广播花了一百年让听众习惯了话筒后面站着一个人。现在这条默认不再自动成立要补的是一套办法让听众重新能弄清话筒后面到底是谁。Thy在悉尼播了半年没人问是因为没人想到要问。等到想问的人多起来声音值不值得被信任就不再取决于它像不像真人而取决于说话的一方肯不肯先讲清楚自己到底是不是人。这一步规则已经先于习惯迈了出去。
返回列表