登录×
电子邮件/用户名
密码
记住我
请输入邮箱和密码进行绑定操作:
请输入手机号码,通过短信验证(目前仅支持中国大陆地区的手机号):
请您阅读我们的用户注册协议隐私权保护政策,点击下方按钮即视为您接受。
人工智能

从内容到数据,人工智能时代的竞争

卢盈瑾:围绕人工智能的争议开始追溯模型能力建立在什么之上,训练材料从何而来等,已从企业内部的技术选择进入版权、监管与公共政策讨论。

模型究竟学习了什么,它所依赖的内容又从何而来,过去主要是技术问题,如今已经进入版权与监管讨论。2024年,欧盟《人工智能法案》(AI Act)正式通过,对通用人工智能模型提出新的透明度要求,包括公开足够详细的训练内容摘要,并建立遵守欧盟版权法的政策。这些规定并未直接解决训练材料的版权归属或授权争议,但内容来源不再只是模型开发中的技术细节,也成为监管需要处理的问题。

当前生成式人工智能的能力,很大程度上建立在大规模数据训练之上,其中包括新闻报道、书籍文本、视觉图像与设计素材。进入训练体系后,这些作品不再只以面向读者或观众的完整内容存在,也成为模型可以处理的数据,用于学习语言结构、视觉特征与文化语境。围绕人工智能的争议因此不再只集中于模型能够做什么,也开始追溯这些能力建立在什么之上。训练材料从何而来,谁拥有相关权利,又可以在什么条件下被使用,已经从企业内部的技术选择进入版权、监管与公共政策讨论。

文化被纳入训练体系

2023年底,《纽约时报》(The New York Times)对OpenAI和Microsoft提起诉讼,指控两家公司未经许可使用其新闻作品训练人工智能模型,并认为部分模型输出可能与原有新闻产品形成替代关系。案件此后持续推进,部分不正当竞争及《数字千年版权法》(DMCA)相关主张被法院驳回,但核心版权争议仍未结束。进入2026年,双方仍围绕训练材料和证据开示等问题发生争议。案件尚无最终结果,但受版权保护的内容能否以及如何用于模型训练,已经成为需要由法院处理的问题。这场诉讼也让原本隐藏在模型开发过程中的内容使用方式进入公众视野。新闻作品一旦进入训练体系,就不再只以完整文章的形式存在,而会被纳入模型处理和学习数据的过程。

新闻之外,同样的问题也存在于图像、设计、文学和其他文化生产领域。生成式人工智能需要大量文本与视觉材料来学习语言结构、视觉特征和文化语境,从古典绘画、当代设计到网络文学、新闻报道和公共表达,都可能成为训练材料的一部分。作品进入这一体系后,多了一种与阅读、观看和消费不同的用途。它可以被转化为机器能够处理的数据,用来训练模型识别语言、形式和不同类型的表达。文化内容因此不仅具有面向人的传播与市场价值,也可能具有面向机器的资源价值。谁能够合法获得这些内容,如何整理和使用它们,以及能否将它们持续纳入模型开发,也就成为人工智能生产体系中的现实问题。

从文化到数据的转化逻辑

商业授权已经把这种关系带入市场交易。2023年底,德国媒体集团阿克塞尔•施普林格(Axel Springer)与OpenAI达成合作,ChatGPT可以使用其旗下包括《政客》(Politico)与《商业内幕》(Business Insider)在内的媒体内容生成新闻摘要,OpenAI也可以使用相关内容改进模型。与未经授权使用内容所引发的诉讼不同,这类协议让内容所有者通过授权、归因和商业安排,将新闻资料正式提供给人工智能系统。新闻由此同时具有两种经济角色,一边仍是面向读者的内容产品,另一边则成为可以授权给技术公司的内容资源。

在中国市场,内容平台则把人工智能放进原有的创作与IP运营体系。阅文集团(China Literature)拥有大规模网络文学与IP内容,并持续探索AI辅助创作、翻译和内容开发。与新闻机构把内容授权给外部模型不同,这类平台同时拥有内容、作者工具和应用场景。对平台而言,人工智能可以进入作者创作、内容开发和跨语言传播等不同环节,大规模内容资产也可能因此形成新的资源优势。这里需要区分的是,平台拥有大量作品,并不等于这些作品已经被统一转化为模型训练语料。更值得观察的是,当内容资产与生成技术集中在同一平台内部,内容的组织能力本身也成为技术竞争的一部分。

数据本身早已是人工智能发展的关键资源。加拿大计算机科学家、图灵奖得主约书亚•本吉奥(Yoshua Bengio)与扬•勒昆(Yann LeCun)、杰弗里•辛顿(Geoffrey Hinton)对深度学习的总结显示,现代人工智能的发展与数据、计算能力和模型方法密切相关。英国政治经济学者尼克•斯尔尼切克(Nick Srnicek)在平台资本主义研究中,则把数据的获取和积累视为平台经济的重要资源。放到文化领域,内容库、版权关系和获取渠道也就不再只是文化产业内部的问题,它们直接关系到人工智能系统能够获得什么内容,以及以什么方式获得。

内容竞争也延伸到了信息分发环节。今年8月,欧盟委员会依据《数字服务法案》(Digital Services Act, DSA),正式将ChatGPT指定为超大型在线搜索引擎(Very Large Online Search Engine, VLOSE)。欧盟委员会公布的信息显示,ChatGPT在欧盟的平均月活跃用户为1.591亿,已经远高于《数字服务法案》针对最大型在线服务设定的4500万用户门槛。这并不意味着ChatGPT与传统搜索引擎完全相同,但欧盟已经把它作为具有大规模信息入口作用的服务纳入监管。生成式人工智能涉及的也不再只有内容如何进入模型。随着越来越多用户直接通过模型寻找资料、理解问题和获得答案,内容如何抵达公众也成为同一套技术系统中的另一部分。

传统搜索引擎通常把用户导向不同来源,原始网站仍然是阅读和获取信息的重要终点。生成式人工智能则可以在检索之后继续整理、综合信息并直接给出回答。对内容所有者来说,问题因此不只是作品是否进入训练体系,还包括作品能否在回答中被发现、引用,以及用户是否仍会回到原始来源。训练数据与信息分发原本属于两个不同环节,现在却可能由同一类人工智能服务连接起来。谁拥有内容,谁能够调用内容,谁控制用户看到信息的入口,也就成为同一条价值链上的不同问题。

规则尚未确定的资源体系

训练、授权、检索和分发都涉及制度规则。欧洲通过《人工智能法案》(AI Act)对通用人工智能模型提出透明度和版权合规要求,又通过《数字服务法案》(DSA)处理大型在线服务带来的系统性风险。美国仍有大量边界通过版权诉讼被检验,《纽约时报》与OpenAI、Microsoft之间的案件只是其中最受关注的案例之一。不同制度尚未给出统一答案,但内容的来源、权利关系、使用条件和分发方式已经超出技术公司的内部决策范围,进入公共治理。

人工智能时代的竞争不只在算力和算法之间,也在内容的获取、授权、组织和分发之间。对创作者和文化机构来说,作品仍然首先是面向人的表达,也是版权、收入和声誉的来源。但对模型公司和平台来说,同一批内容还可能成为训练材料、授权资产和信息来源。两种价值体系因此在同一份内容上相遇。技术公司需要足够丰富和可靠的材料来训练模型、生成回答,内容所有者则需要知道自己的作品如何被使用,能否获得授权收益,以及原始来源是否仍能在新的信息入口中被看见。尚未确定的是这些用途之间如何划定权利与收益边界,以及创作者、内容机构、平台和模型公司各自拥有多大的决定权。

(注:Janus Y. Lu 卢盈瑾,文化经济研究者,关注文化创意产业中的价值生成与系统机制。本文仅代表作者个人观点。)

版权声明:本文版权归FT中文网所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。

读者评论

用户名:
FT中文网欢迎读者发表评论,部分评论会被选进《读者有话说》栏目。我们保留编辑与出版的权利。
用户名
密码

德国东部与俄罗斯的旧有联系助推德国选择党崛起

在周日一场事关重大的投票前,乌克兰问题已成为梅克伦堡-前波美拉尼亚州的分歧性议题。

AI时代,我们的孩子还能茁壮成长吗?

卡文迪什:只要孩子们拥抱AI带来的“非凡”机遇,增强批判性思维能力,并避免社交媒体的干扰,就能茁壮成长。

Lex专栏:推迟“AI末日”也将让投资者受益

除了可以避免酿成灾难的显而易见的声誉风险,放缓步伐的一个好处是将减少投入训练新模型的巨额资金。

德国军工初创企业寻求汽车制造商帮助欧洲重整军备

ARX Robotics表示,希望“借助我们已有的产业实力”,满足对无人军用载具飙升的需求。

日本央行迎来利率决策关键时刻

日本央行的利率决定必须在国内经济风险、全球市场冲击以及特朗普政府前所未有的压力之间取得平衡。

美联储会违背特朗普的意愿加息吗?

《市场前瞻》是英国《金融时报》对未来一周市场的指南。
设置字号×
最小
较小
默认
较大
最大
分享×