2026 年,Reddit 与 Google 那份签约价约 6000 万美元/年的数据授权合同即将到期续约。加上同期与 OpenAI 签订的姊妹合同,两份协议目前合计为 Reddit 贡献约 1.3 亿美元的年化数据授权收入。分析师预测,续约后两份合同总价可能跳升至 5.5 亿美元。那么,这些价格是怎么定出来的?更广义地,数据资产应该如何定价?
相较于其他资产,数据资产有很强的独特性,这也决定了对其定价的难度。首先,数据价值高度依赖使用场景。同一份消费者行为数据,对快消品公司价值巨大,对工业品公司可能无用。同一份语料,对训练通用大模型和训练专业医疗模型贡献完全不同。同一份卫星图像,对量化基金和对保险公司用途差异巨大。数据的价值不存在于数据本身,而存在于"数据 + 买方 + 使用场景"的匹配里。
更关键的是,即便锁定一个买方,数据价值也无法在签约时被完全确定。一份语料、一份医疗数据库、一份用户画像,它的真实贡献要在与买方现有资产、产品迭代、其他数据源的交互中才能逐步显现。买方在使用之前能做的估值——无论是样本测试、试点项目还是历史回测——都只是粗略判断,无法穿透"未来交互"这一层。这两层因素叠加,意味着数据资产很难有"内在价值"可估。任何外部估值方法——估值标准、定价模型、交易所挂牌价——都很难穿透"使用场景 + 买方组合 + 未来交互"这几层不确定性。
面对这种独特性,市场没有等待理论成熟,而是自发演化出一套精巧的合同设计。
一是短约加续约重谈。Reddit 与 Google 的合同期是 2 到 3 年,与 OpenAI 类似。这等于双方默认"现在定不准,到期再谈"。续约本身成了价格发现机制——双方都已经从中间几年的实际使用中积累了信息。
二是混合对价。2024 年 News Corp 与 OpenAI 签订的总价超过 2.5 亿美元的 5 年合同中,News Corp 拿到的不是纯现金,而是现金加 OpenAI 的服务抵用额度。这种安排的逻辑是:如果数据真的值钱,那建立在数据上的 OpenAI 服务也会值钱,两者绑在一起对冲了"现在不知道数据值多少"的风险。
这些条款的功能不是定价,而是让交易能在双方都不知道价格的情况下发生。它把"定价"这件事,从一次性事件变成了一个反复进行的过程。
与市场作为价格发掘机制并行的,是中国正在展开的一个自上而下、全链条推进的数据要素市场制度实验。中国把数据列为继土地、劳动力、资本、技术之后的第五大生产要素。从 2022 年"数据二十条"、2023 年组建国家数据局,到财政部数据资源入表于 2024 年 1 月施行,再到上海、深圳、北京三大数据交易所运营,制度链条完整且自上而下。
这套制度设计与市场发掘价格的机制,不是相互替代的关系,而是可以形成互补。制度框架解决的是市场赖以运转的基础条件——权属界定、入表口径、交易场所、合规边界。这些是单靠双边交易无法演化出来的基础设施。但价格本身,仍然只能在交易中浮现。制度无法替代交易,正如交易也无法自发产生制度。
换个角度说:好的制度设计不应替市场决定价格,而应让市场发掘价格的过程发生得更充分、更顺畅。让真实交易能持续发生、让续约博弈能积累信息、让买方间竞争能形成基准、让合同条款能在迭代中演化——这是制度可以、也应该承担的角色。
Reddit 2026 年续约最终谈出来的价格——无论是 5.5 亿美元、3 亿美元还是其他数字——都比任何模型更接近"这份数据值多少钱"这个问题的真实答案。因为它来自市场,而且是带着两年新信息回来的、第二轮的市场。
(作者系港大经管学院金融学副教授。本文仅代表作者观点。责任编辑邮箱:tao.feng@ftchinese.com)