这是人工智能写的吗?越来越难以分辨 - FT中文网
登录×
电子邮件/用户名
密码
记住我
请输入邮箱和密码进行绑定操作:
请输入手机号码,通过短信验证(目前仅支持中国大陆地区的手机号):
请您阅读我们的用户注册协议隐私权保护政策,点击下方按钮即视为您接受。
FT商学院
这是人工智能写的吗?越来越难以分辨

检测软件能迅速给出答案,但误报风险以及被指控所带来的污名,正导致社会对书面文字失去信任。

为了第一时间为您呈现此信息,中文内容为AI翻译,仅供参考。
00:00

{"text":[[{"start":7.89,"text":"马克斯•斯佩罗(Max Spero)在网上读到内容时,会先凭直觉判断这是否由AI生成,然后才会用他的检测软件进行验证。"}],[{"start":16.4,"text":"这位前谷歌(Google)软件工程师曾多年从事机器学习工作,因此他的直觉比大多数人更为细腻。他寻找的并不是大型语言模型的典型标志——破折号、幻觉以及流畅而讨喜的语气。相反,他关注的是一种空洞感。“我会看信息密度,”他说,“人写下每个词时,背后都有明确意图;而AI生成文本时,却没有。”"}],[{"start":43.19,"text":"过去一年,斯佩罗逐渐成了这群规模虽小却意志坚定的“语言侦探”心目中的英雄。这些自封的语言侦探专门揭露他们认为是欺骗性使用AI的行为。"}],[{"start":55.44,"text":"当你看到“新网页中有三分之一是用AI撰写的”或“Kindle电子书中有五分之一是用AI撰写的”这类标题时,研究人员通常使用了斯佩罗的AI检测器Pangram。Pangram曾处于“Shy Girl”丑闻的中心:尽管作者米娅•巴拉德(Mia Ballard)否认使用过这项科技,有关使用AI的指控仍导致该小说被书店下架。今年夏天,Pangram又被用来指控特立尼达作家贾米尔•纳齐尔(Jamir Nazir)向享有盛誉的共和联邦短篇小说奖(Commonwealth Short Story Prize)提交了一篇由AI创作的小说。"}],[{"start":88.57,"text":"法官、顾问、律师以及报纸(包括《纽约时报》The New York Times、英国《金融时报》*和《华尔街日报》The Wall Street Journal)发表的文本,都曾被AI检测工具标记。许多使用这类检测软件的人表示,他们并不反对AI本身,反对的是围绕AI使用的不诚实行为。出版平台Substack的首席执行官克里斯•贝斯特(Chris Best)说,将AI生成的内容冒充人工创作“污染了公共资源”;该平台正与Pangram合作,扫描其新闻通讯。"}],[{"start":119.44999999999999,"text":"斯佩罗偶尔也会在社交媒体上介入,发布截图,并表示愿意用他的模型处理文本。"}],[{"start":125.72999999999999,"text":"他与联合创始人布拉德利•埃米(Bradley Emi)于2023年创办了Pangram。埃米同样毕业于斯坦福大学(Stanford),曾任特斯拉(Tesla)机器学习科学家。两人当时担心,如果我们再也无法区分机器生成的内容和自己创作的内容,将会发生什么。Pangram的核心主张是,在AI时代,真实性比以往任何时候都更有价值。"}],[{"start":null,"text":"

"}],[{"start":149.01999999999998,"text":"但在这场“猫鼠游戏”中,也有人不太相信我们能够清楚划分人类文本与AI生成文本的界线。牛津大学(Oxford)、剑桥大学(Cambridge)和哈佛大学(Harvard)等高校都支持学生使用生成式AI,但不赞成使用商业AI检测器扫描学生作业。"}],[{"start":165.92999999999998,"text":"作者们指出,通常被归因于AI的各种写作痕迹,在人类写作中同样普遍存在;无论是检测软件还是直觉判断,都可能出错。许多人担心误指控会带来后果。一位科技行业从业者说,争取绝对确定性的战斗,在OpenAI的ChatGPT于2022年末发布的那一刻就已经败下阵来。"}],[{"start":188.82,"text":"一些被指控使用AI的作者也在反驳,有人声称使用AI并没有错,也有人表示,人们对合成内容的偏执已经导致了“猎巫”。纳齐尔一再表示,他在创作获得共和联邦短篇小说奖总冠军的短篇小说《林中巨蛇》时没有使用AI。他将AI和Pangram比作厄里斯(Eris)——这位不和女神扔下一枚苹果,引发了特洛伊战争。"}],[{"start":214.03,"text":"他告诉英国《金融时报》:“我们用自己的全部语言训练了这个东西。现在,我们已经无法相互信任。”"}],[{"start":null,"text":"
一群希腊男女神祇围坐在宴会桌旁,厄里斯拿出一个金苹果,引发了他们之间的紧张气氛。
"}],[{"start":222.66,"text":"围绕作品作者归属的争论并不是什么新鲜事。公元1世纪,罗马诗人马提亚尔(Martial)曾写诗斥责一名他指控窃取其诗句的诗人,称其为“剽窃者”(plagiario)。多年来,作家们也一直将作品交给代笔人、研究助理和编辑处理,却不承认他们的贡献。"}],[{"start":242.5,"text":"如今的不同之处在于规模。AI能够以极快的速度轻松生成文本,这意味着我们有理由认为,网上看到的大量内容可能是由人工智能生成的。"}],[{"start":254,"text":"Pangram、GPTZero、Winston AI和Copyleaks等AI检测工具,允许用户输入可疑文本片段,并生成百分比评分,显示其估计的文本中有多少是由AI生成的。这些工具提供有限的免费版本,订阅费用最高可达每月74.99美元。"}],[{"start":273.28,"text":"但要确切了解这些检测器是如何得出评分的,并不容易。检测器不会公开其全部技术原理,包括训练所使用的文本,也不会向用户详细说明评分的具体构成。"}],[{"start":286.25,"text":"概括而言,检测器寻找的是各种模式:并非某一个被认为能识别AI的特征词——比如经常被提及的“delve”——而是与大型语言模型可能作出的选择相吻合的词语组合。"}],[{"start":298.66,"text":"实现这一目标有多种方式。加州大学圣塔芭芭拉分校(University of California, Santa Barbara)的研究人员提出了“发散式N元语法分析”(DNA-GPT)方法:将一段文本截成两半,再利用AI续写一个新的结尾,随后比较这两部分。"}],[{"start":312.34000000000003,"text":"布鲁塞尔自由大学(Vrije Universiteit Brussel)研究人员最近开展的一项探测器可靠性研究显示,Pangram的表现名列前茅,但它采取了更为耗时的方法。Pangram收集了数百万篇在ChatGPT发布前由人类撰写的文本——从亚马逊(Amazon)用户评论、诗歌到长篇文章,内容不一——随后让各种聊天机器人生成与之对应的“合成镜像”文本,并将这些成对文本输入其模型,以训练模型识别二者的差异。"}],[{"start":339.44000000000005,"text":"随着新的AI模型问世,训练也会不断更新。斯佩罗说:“我们花了一年时间,才做得比市场上的其他产品更好。之后又用了一年时间,研究AI辅助文本与完全由AI生成文本之间的问题。现在,我们已经有了一个不错的模型。”"}],[{"start":null,"text":"
Pangram的界面允许用户输入可疑的文字摘录,并给出这些内容由AI生成的概率
"}],[{"start":358.84000000000003,"text":"GPTZero是最早一批AI检测器之一,由26岁的田逸华(Edward Tian)开发。田逸华曾在调查机构Bellingcat担任调查研究员。他将AI检测器所寻找的模式比作马赛克。其软件最近被用于识别安永(EY)和普华永道(PwC)编制的报告中的AI幻觉;该软件还采用了一个基于AI生成文档和人类撰写文档训练的分类器。"}],[{"start":383.48,"text":"上传用于AI检测的文本会被拆分成片段,并作为token处理,转换为数值表示。这些数值会与AI生成文本和人类文本所产生的数值进行比对,以查看二者是否存在重叠——比对的不仅是用词,还包括词语的位置、出现频率、句子和段落。文本越多,可供分析的模式也就越多。"}],[{"start":405.57,"text":"AI撰写文本的特征"}],[{"start":407.78,"text":"• AI写作常见“三段式”结构(X、Y和Z)"}],[{"start":412.38,"text":"• 后接一串词语的破折号"}],[{"start":414.83,"text":"•“能做X但不能做Y”的表述"}],[{"start":417.53999999999996,"text":"• “更深层次”是AI写作中经常出现的词语之一"}],[{"start":421.53,"text":"经人工编辑的文本"}],[{"start":423.44,"text":"• 重复使用“from”会改变节奏,导致行文参差不齐"}],[{"start":428.06,"text":"• 这句冗长的连写句被拆分开来"}],[{"start":431.4,"text":"使用人性化工具"}],[{"start":433.41999999999996,"text":"• 文字不那么圆熟精致"}],[{"start":435.53999999999996,"text":"• 同样出现了“三段式”结构"}],[{"start":438.17999999999995,"text":"• “能做X但不能做Y”的表述仍然保留"}],[{"start":441.79999999999995,"text":"• 重写后的结尾部分是一个冗长、拖沓的连句"}],[{"start":446.21,"text":"这就是为什么,即使有人改动了几个词或调整了几行文字,领先的检测工具仍能识别出AI的使用痕迹。一些工具还加入了抄袭分析功能和AI图像识别器。"}],[{"start":458.7,"text":"检测公司创始人深知,自己正与AI实验室以及旨在打乱并改写文本、消除明显AI使用痕迹的“人性化”工具展开竞赛。AI实验室有意让其生成内容尽可能自然。"}],[{"start":472.74,"text":"然而,真正的问题在于误报——模型可能会错误地将人类撰写的文本判定为AI生成。OpenAI在报告称误报率为9%后,于2023年停止了自己的检测项目。2024年,一名用户称,某检测器误将《独立宣言》(Declaration of Independence)判定为98%由AI生成。一项受到广泛报道的斯坦福大学研究发现,英语非母语写作者的文本更容易被错误标记为AI生成。研究作者认为,这可能是因为他们在语言表达和用词方面的变异性较为有限。"}],[{"start":507.74,"text":"这正是AI检测器的证据阈值变得重要的地方。"}],[{"start":511.81,"text":"卡内基梅隆大学(Carnegie Mellon University)经济学家布赖恩•贾巴里安(Brian Jabarian)去年9月发表了一项研究,对比了三款商业AI检测工具:Pangram、OriginalityAI和GPTZero。他将近2,000份人类撰写的文本样本及其AI生成的对应文本输入这些工具,随后设置了不同的证据阈值。降低阈值后,虽然被识别为AI生成的文本数量会增加,但出现误报的概率也会略有上升。"}],[{"start":539.02,"text":"Pangram称,其最新模型的误报率仅为0.0041%,也就是说,每处理约2.4万份文件,才会出现一次误报。问题在于,我们是否愿意接受这一次错误指控的风险。贾巴里安表示:“这不是科技公司可以决定的事情,而是整个社会需要作出的决定。”"}],[{"start":null,"text":"
两个人坐在国家花园一处绿树成荫的地方,在树荫下读书。
"}],[{"start":559.37,"text":"纳齐尔称,自己是遭到不实指控的人之一。5月,他的短篇小说获得加勒比地区共和联邦短篇小说奖后,一个匿名的X账号发布了一张截图,显示Pangram将该小说认定为100%由AI生成。"}],[{"start":575.12,"text":"其他人也纷纷表示,即使没有检测器,他们也知道那是AI。“我大约5秒钟就能看出那是GPT,”帕兰泰尔(Palantir)前工程师纳比尔•S•库雷希(Nabeel S Qureshi)写道。"}],[{"start":587.33,"text":"评论人士指出了他们认为是AI痕迹的内容。“不是蜜蜂整齐的忙碌……而是腹部的声响”采用了AI输出中常见的“不是X,而是Y”句式。“她走路的样子,能让长椅变成男人”被认为是毫无意义的AI隐喻,而“安静的杂务、耐心的双手、未点亮的灯”则是AI文本中常见的三项并列排比。还有一些人开始怀疑,这位作者本人是否真实存在——他们注意到,他的照片构图异常对称。"}],[{"start":617.61,"text":"纳齐尔在特立尼达阳光明媚、绿意盎然的家中接受采访时说,没错,那张照片经过数字处理,以使画面更美观;但不,他的故事并非由AI撰写。比如关于长椅的那句话,就是他想表达:一个女人可以美丽到让无生命的物体都仿佛活过来。"}],[{"start":636.46,"text":"他表示:“这是一种文学技巧。难道这些读者不懂神秘主义吗?萨尔曼•拉什迪(Salman Rushdie)的一本书中有一处描写,人们漂浮在空中——那也没有真的发生。”"}],[{"start":648.5400000000001,"text":"纳齐尔现年62岁,是一名退休公务员。他比那张广为流传的照片显得更加不修边幅:留着花白胡茬,戴着一副厚厚的黑框眼镜,眼镜架在额头上。谈及过去几个月发生的事情时,他的情绪在善意的调侃(“那张照片拍得真不错”)、因自己的文章受到批评而感到的受伤,以及对外界指称他使用AI的恼怒之间不断切换。"}],[{"start":null,"text":"
贾米尔•纳齐尔获奖公告,以及英联邦基金会(Commonwealth Foundation)发布的一张照片
"}],[{"start":673.7800000000001,"text":"他说,自己参赛的故事取材于童年记忆:穿过甘蔗地去上学。他的写作风格被一些读者形容为生硬、矫饰,这源于他长期从事技术报告写作,以及一生阅读印度拉宾德拉纳特•泰戈尔(Rabindranath Tagore)和巴勒斯坦诗人麦哈慕德•达维希(Mahmoud Darwish)等人的诗歌。但他不用AI——连编辑也不用。“我不用AI,我用GI,”他说,“上帝的智慧。”"}],[{"start":699.7,"text":"由于健康状况不佳——周围神经病变使他难以打字,而且他正在接受淋巴瘤化疗——他使用语音转文字工具口述诗歌和故事。不过,他反复强调,自己没有使用任何形式的AI写作工具。"}],[{"start":714.7700000000001,"text":"他的批评者并未因此改变看法。宾夕法尼亚大学沃顿商学院(Wharton School of the University of Pennsylvania)AI研究员兼副教授伊桑•莫里克(Ethan Mollick)曾在网上批评这篇小说。他说:“这其实非常明显。AI擅长很多事情,但写小说并不是其中之一。”"}],[{"start":732.0300000000001,"text":"纽约州立大学石溪分校(Stony Brook University SUNY)计算机科学系助理教授图欣•查克拉巴蒂(Tuhin Chakrabarty)是那篇关于电子书使用AI的论文的共同作者。他指出,这篇故事中有6处使用了“嗯”(hum)一词;他说,ChatGPT在虚构类文本中经常使用这个词。他不介意点名批评那些他认为试图把AI生成的文字冒充成自己作品的人。“我研究版权法,我认为使用AI应该受到某种污名化,”他说。"}],[{"start":760.0300000000001,"text":"英联邦基金会展开调查,并表示支持纳齐尔。但文学杂志《格兰塔》宣布,将不再刊登获奖作品。《格兰塔》出版人西格丽德•罗辛(Sigrid Rausing)说:“在现阶段,确实无法判断一篇作品是否真实。”不过她补充说,自己并不反对AI。“如果一位作家利用AI素材创作实验性文本,并对此保持透明,只要作品足够优秀,我很乐意阅读并出版。”"}],[{"start":788.1100000000001,"text":"这类实验似乎不太可能。2023年,作家詹姆斯•弗雷(James Frey)告诉法国杂志《蓬皮杜+》,他正在利用AI创作自己的新书,并表示不会透露哪些部分由他本人撰写、哪些部分由AI完成。这部充满玩味的作品尚未问世。"}],[{"start":805.2400000000001,"text":"商业领域同样笼罩着沉默。尽管许多公司公开谈论AI及其积极影响,但它们似乎不愿在书面报告中明确说明具体如何使用AI。当使用AI导致错误时——毕马威(KPMG)、安永、普华永道和德勤(Deloitte)所完成的工作就曾出现这种情况——相关公司会受到批评。"}],[{"start":826.4600000000002,"text":"伦敦迈哲睿律师事务所(Mishcon de Reya)科技负责人、律师阿什莉•威廉斯(Ashley Williams)问道:“如果这些是人为错误,指责声会不会同样强烈?我认为,这表明我们都还在摸索应该如何使用AI——界线应当划在哪里。”"}],[{"start":841.8700000000001,"text":"一名顾问表示,透明度之所以不足,是因为公司担心客户会认为AI生成的报告天生质量较低。他说:“AI非常擅长生成程式化内容,但客户可能没有意识到,仍然需要专业人士审阅并改写文件。人们对AI生成的文本存在一种偏见,认为其分量较轻。”"}],[{"start":null,"text":"
夜间,一名女子坐在地上阅读一本被灯光照亮的书,周围站着参加节庆活动的人群。
"}],[{"start":863.4100000000001,"text":"欧盟计划在今年年底前为AI生成的文本引入水印,这是活动人士多年来一直要求的措施。Anthropic已经率先表示,其新款Claude模型将包含这些肉眼无法察觉的标记。"}],[{"start":877.3900000000001,"text":"然而,水印非但未必能厘清问题,反而可能使情况更加复杂。编辑、改写和复制文本都可能抹去水印。Anthropic指出,没有水印并不能证明未使用AI。"}],[{"start":890.8000000000001,"text":"宾夕法尼亚大学(University of Pennsylvania)沃顿商学院(Wharton School)的莫里克认为,既然任何检测器或水印都不可能百分之百无误,这意味着我们已经越过了AI的“白垩纪—古近纪界线”(K-T boundary)——这一地质标志代表着一次灭绝事件。"}],[{"start":904.45,"text":"他说:“真实性将成为各地面临的问题。我们仍在协商:写作中哪些部分应由人类完成,哪些部分可以接受由AI完成。”"}],[{"start":915.1,"text":"行为准则正处于变化之中。如果在文学创作中使用AI不可接受,那么,只要质量过关,且节省的时间体现在价格上,AI是否就可以用于法律文书草案和审计等更为务实的文本?AI起草的电子邮件究竟是有用的工具,还是对收件人的侮辱?AI起草和编辑的内容是否必须始终披露?而基于直觉或检测工具作出的AI指控,是否会导致更严密的监控和更多语义上的曲解?"}],[{"start":945.76,"text":"“我认为,未来将达到一种平衡——人类写作与AI写作并存,”AI检测工具GPTZero的创始人田逸华说。他认为,随着越来越多人将AI融入日常生活,关于抄袭的指责会逐渐减少。但他表示,我们仍需寻找彼此沟通的方式,而不让机器充当中介。"}],[{"start":966.85,"text":"“写作不仅仅是产出,它反映了我们的批判性思维。”他说,“其中有一种值得保留的美。”"}],[{"start":974.6700000000001,"text":"*英国《金融时报》编辑实务守则规定,不得使用生成式AI工具撰写拟发表的文章或文章文本,也不得使用这类工具制作其他面向读者的内容。"}]],"url":"https://audio.ftcn.net.cn/album/a_1787989224_6092.mp3"}

版权声明:本文版权归FT中文网所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
设置字号×
最小
较小
默认
较大
最大
分享×