医疗AI面临证据难题 - FT中文网
登录×
电子邮件/用户名
密码
记住我
请输入邮箱和密码进行绑定操作:
请输入手机号码,通过短信验证(目前仅支持中国大陆地区的手机号):
请您阅读我们的用户注册协议隐私权保护政策,点击下方按钮即视为您接受。
FT商学院
医疗AI面临证据难题

这项科技的进步尚未转化为现实护理水平的显著提升。

为了第一时间为您呈现此信息,中文内容为AI翻译,仅供参考。
00:00

{"text":[[{"start":7.36,"text":"凯拉•西克雷斯特(Kayla Secrest)是一名刚毕业的医生,正在密歇根州一家医院开始住院医师培训项目;就在这时,她第一次遭遇了令人沮丧的人工智能。"}],[{"start":17.62,"text":"管理人员实施了一套算法,每15分钟扫描一次患者记录;一旦发现脓毒症预警信号,就会发送警报。这正是AI行业喜欢强调的那类创新:将一项日常却至关重要的任务自动化。"}],[{"start":32.760000000000005,"text":"但她原本希望这能减轻工作负担,很快便落空了。她回忆说:“几个月下来,我意识到,‘天哪,我的每一位患者都会触发这条警报’,于是我开始视而不见。”她把这种情况比作寓言中那个喊“狼来了”的男孩。"}],[{"start":49.300000000000004,"text":"最终,她和同事们对这一工具失去了信心,通知弹出时也不再急忙赶往患者床边。直到后来她才发现,这一工具未经病房或急诊科真实繁忙环境下的广泛测试,就已在数百家医院投入使用。"}],[{"start":64.94,"text":"人们对AI将对医疗健康产生的影响作出了诸多宏大论断,许多不堪重负的医生和医院都希望,AI能够缓解对其服务日益增长的需求。"}],[{"start":76,"text":"但西克雷斯特等人的经历表明,AI开发者与医疗专业人士的工作之间存在脱节:AI工具一旦离开实验室的人工环境,进入难以预测的一线医疗健康领域,其后续运行往往缺乏独立监督。"}],[{"start":90.51,"text":"专家认为,在某些情况下,这种缺乏审查的状况会直接给患者带来风险。它还可能使人们更难证明特定工具能够改善治疗效果,或证明相关投资是合理的。"}],[{"start":null,"text":"

弗兰克尔心血管中心(Frankel Cardiovascular Center)室内花园区域内,身穿白色实验服的凯拉•西克雷斯特
"}],[{"start":104.60000000000001,"text":"耶鲁数字伦理中心(Yale Digital Ethics Centre)副研究科学家、曾任英国卫生和社会关怀部(Department of Health and Social Care)人工智能事务负责人的杰丝•莫利(Jess Morley)说,科技公司往往侧重于“统计验证”——关注工具的准确性,而不是其临床功效。"}],[{"start":118.26,"text":"她说:“但医疗健康领域真正关心的是后一点:我们想知道,AI是否确实能改善患者的治疗结果。令人震惊的是,目前几乎没有可靠证据表明AI确实能改善患者的治疗结果。”"}],[{"start":132.48000000000002,"text":"AI的支持者认为,与其他行业相比,AI在医疗健康领域的普及速度更快;AI还在一定程度上通过减轻医生的行政负担来改善医疗服务,例如实现笔记记录自动化。英伟达(Nvidia)医疗健康业务负责人金伯莉•鲍威尔(Kimberly Powell)6月表示:“十多年来,我们已经非常清楚地看到,医生的时间都被打字工作占用了。”"}],[{"start":155.84000000000003,"text":"OpenAI表示,美国医院网络AdventHealth报告称,使用ChatGPT for Healthcare后,部分行政事务的耗时减少了80%;与此同时,对OpenAI与肯尼亚Penda Health合作项目的独立评估显示,使用其AI助手的临床医生,诊断错误减少了16%。"}],[{"start":173.29000000000002,"text":"其他潜在应用包括利用可穿戴设备监测患者、分析海量数据以预测未来患病的可能性,以及加快药物研发进程。"}],[{"start":182.41000000000003,"text":"在诊断和医学影像等领域,人工智能影响的证据已经无可争辩。斯克里普斯研究转化研究所(Scripps Research Translational Institute)所长埃里克•托波尔(Eric Topol)援引一项2024年的研究称,在人工智能辅助下由胃肠病学家开展的结肠镜检查,发现的息肉数量显著多于未使用这项科技开展的检查。"}],[{"start":null,"text":"
一张三维磁共振成像扫描图,详细呈现躯干、脊柱和内脏
"}],[{"start":202.23000000000002,"text":"但托波尔说,医疗健康管理者并未采用已有可靠应用记录的工具,反而被生成式AI的“惊艳效应”所吸引。这一进展因ChatGPT于2022年推出而受到瞩目,使这项科技能够总结海量医学文献,帮助医生作出决策。"}],[{"start":220.29000000000002,"text":"监管漏洞和性能数据匮乏,使人们难以判断生成式AI带来的收益是否超过风险。他认为,当务之急应是“在真实世界的医疗实践中……确定收益与危害的比例”。"}],[{"start":234.21,"text":"托波尔认为,主要人工智能机构几乎没有兴趣利用模型开发完成后收集的数据来评估模型性能,以检验其结果能否在实际应用中重现。他说:“科技巨头擅长开发模型,并在实验室对模型进行测试和验证。但总的来说……他们并没有真正表现出我们希望看到的那种对(真实世界)试验的热情,也没有为此提供资金支持。”"}],[{"start":259.8,"text":"

透明度不足

"}],[{"start":261.46000000000004,"text":"临床医生兼研究人员黄伟康(Andrew Wong)在密歇根大学(University of Michigan)任职期间,调查了这款存在缺陷的脓毒症工具的表现,并与同事一道同开发者合作,改进了该工具的性能。"}],[{"start":273.41,"text":"他说,公司往往会就AI工具如何改善工作流程、节省资金作出高度具体的表述,但却没有义务公开相关信息,而这些信息本可以更容易地核实上述所谓的好处。"}],[{"start":286.34000000000003,"text":"这可能包括:“模型是如何训练的、使用了何种数据集、开发模型采用了什么方法,以及他们在哪里验证模型以得出所报告的性能统计数据”。"}],[{"start":297.47,"text":"黄伟康(现任犹他大学(University of Utah)临床AI研究主任)说,如果缺乏这样的透明度,测试这些工具的工作将落到各家机构身上。这些工具的有效性可能取决于患者人口特征、医院的工作惯例等因素,而并非所有机构都有资源开展测试。"}],[{"start":null,"text":"
"}],[{"start":316.38000000000005,"text":"乌得勒支大学医学中心(Utrecht's University Medical Centre)数据科学与生物统计学系助理教授康斯坦萨•安道尔•纳瓦罗(Constanza Andaur Navarro)表示,对AI工具变革性影响的过度炒作,可能在开发过程的早期就出人意料地出现。她与同事分析了介绍新型AI模型的论文,发现这类论文极易出现她所谓的“夸大宣传”。研究发现,在21篇建议将某一特定工具用于日常实践的摘要中,有20篇“完全没有对所开发模型进行任何外部验证”。"}],[{"start":347.14000000000004,"text":"全球各地对医疗健康领域人工智能的监管方式各不相同。但德累斯顿工业大学(University of Dresden)医疗器械监管科学教授斯蒂芬•吉尔伯特(Stephen Gilbert)表示,在一个方面,这些监管方式却十分相似:工具进入市场后的监测往往只是“由制造商撰写、没有原始数据的经过处理的报告”,这意味着第三方很难对其进行审查。"}],[{"start":370.08000000000004,"text":"斯坦福大学(Stanford University)今年发布的一份报告发现,美国食品药品监督管理局(Food and Drug Administration, FDA)在2025年批准了258款AI医疗器械,其中大多数无需开展新的临床试验。获批器械中,只有2.4%获得了这类试验数据的支持;在药品进入患者手中之前,这类数据通常被视为强制要求。"}],[{"start":391.83000000000004,"text":"一些人认为,这些研究凸显了这样一件事的重要性:在生成式AI时代,需要重新思考长期以来用于确保医疗产品安全的方法。"}],[{"start":401.87000000000006,"text":"随机对照试验旨在评估某种分子或设备,例如血压袖带;这类分子或设备一旦投入临床使用,便不会再发生变化。但耶鲁大学(Yale University)的莫利表示,驱动大型语言模型的算法却一直在变化。"}],[{"start":417.06000000000006,"text":"一些监管机构在考虑提高防护标准的同时,也在努力避免阻碍这项新科技的发展。"}],[{"start":423.82000000000005,"text":"英国药品和保健产品监管局(Medicines and Healthcare products Regulatory Agency)首席执行官劳伦斯•塔伦(Lawrence Tallon)表示:“我们需要比目前更快、更广泛地让临床医生使用这些AI工具,因为它们改善医疗保健的潜力……真的非常、非常大。”"}],[{"start":437.66,"text":"MRHA的医疗健康领域人工智能监管全国委员会本月提出了多项措施,包括在新工具证明其安全有效之前,对其实施有条件的授权,并对已经投入使用的工具进行持续监测。"}],[{"start":null,"text":"
一幅展示上半身三维磁共振成像扫描的插图,突出显示内部结构和血管
"}],[{"start":451.35,"text":"塔伦认为,该委员会建议开展的真实世界监测将有助于建立一套扎实的证据,证明AI正在多个方面对临床实践产生实际影响;不过,该委员会的结论尚未得到正式采纳。"}],[{"start":465.03000000000003,"text":"他还强调,默克(Merck)和摩德纳(Moderna)借助AI研发的癌症疫苗近期取得了令人瞩目的成果,这证明了这项科技的潜力——在一些更先进的应用领域,它确实能够大幅改善癌症和罕见病患者的治疗结果。"}],[{"start":479.05,"text":"美国也有类似思路。德累斯顿工业大学监管专家吉尔伯特一直在与美国食品药品监督管理局合作开展一项试点项目,研究用于心血管疾病、糖尿病和心理健康问题等领域的AI模型,能否凭借在真实世界使用中生成的证据获得监管批准。这些慢性疾病最终将影响几乎每一位美国人。"}],[{"start":502.62,"text":"但一些临床医生警告说,监管尚未跟上人工智能能力的发展速度,而这种发展速度在医学和医疗健康领域前所未有。"}],[{"start":512.41,"text":"英国国家医疗服务体系(NHS)顾问麻醉师兼企业家John Paul Jeans援引模型评估与威胁研究(METR)的证据。该非营利研究机构测试先进AI系统,并测量AI系统在无需人工协助的情况下,以50%的成功率能够完成的软件任务时长。该机构发现,自2023年以来,这一任务时长大约每四个月翻一番。"}],[{"start":536.53,"text":"他表示:“如今制定任何监管规定时,都应检验它在AI能力翻番三次之后,是否仍能为公众带来实效。如果规定是针对摆在我们面前的这款工具制定的,那么在正式发布之前就很可能已经过时。”"}],[{"start":552.62,"text":"另一个令人担忧的问题是,医院及其他机构是否具备评估AI工具所需的资源和专业知识。明尼苏达大学公共卫生学院(University of Minnesota School of Public Health)的佩奇•农(Paige Nong)于2024年牵头开展的一项研究发现,在接受调查的医院中,只有略多于半数在使用相关工具进行资源分配或患者护理之前,评估过这些工具是否存在潜在偏见。"}],[{"start":null,"text":"
3D CT扫描图像,显示结肠及周围腹部结构的详细视图,用于虚拟结肠镜检查
"}],[{"start":575.66,"text":"她说:“一家本已相对人手不足的乡村小医院,可能根本没有能力开展这类评估。”这加剧了人们的担忧:AI的持续推进可能会进一步扩大医疗领域的不平等。"}],[{"start":588.5,"text":"加州大学伯克利分校(University of California, Berkeley)的医生兼研究人员齐亚德•奥伯梅尔(Ziad Obermeyer)在研究本院用于资源分配的一款“风险分层”AI工具时,发现了这一问题。他发现,该工具将过去的支出作为预测未来需求的替代指标,导致那些有医疗健康需求、但过去未能获得医疗服务的人——包括少数族裔和不会说英语的人——继续被忽视。"}],[{"start":611.04,"text":"他说,总体而言,数以亿计患者的医疗费用支出决策正受到这类工具的影响。"}],[{"start":617.7099999999999,"text":"“这些技术的采用规模已经大得惊人,我认为很多人并不了解这一点。”"}],[{"start":623.03,"text":"

难以获取的数据

"}],[{"start":625.12,"text":"要成功监测性能,可能会面临技术障碍。美国食品药品监督管理局前首席副局长艾米•阿伯内西(Amy Abernethy)表示,要从临床环境中收集更多证据,需要建设相应基础设施,而这类基础设施过去一向难以搭建。"}],[{"start":641.75,"text":"她说,具有讽刺意味的是,“我们需要算法和AI……来真正帮助我们清理数据,这样我们就能以高得多的细致程度评估算法以及其他医疗健康服务干预措施”。"}],[{"start":653.91,"text":"她表示,还需要制定相关法律,确保医疗健康主管部门能够轻松共享记录,并限制其处理这些数据时所承担的法律责任。"}],[{"start":null,"text":"
身穿白大褂、手持平板电脑的凯拉•西克雷斯特站在弗兰克尔心血管中心的医院走廊里
"}],[{"start":663.78,"text":"奥伯梅尔认为,患者数据往往被分散存储在各家医院内部,并受到严格保护,以维护隐私。他补充说:“监管机构很难对公司说:‘既然你们声称这个算法很出色,那就拿出一份该算法从未见过的数据集,展示它在这份数据集上的表现。’……因为这样的数据很难找到。”"}],[{"start":685.51,"text":"为绕开这一问题,他与人共同创办了Dandelion Health公司。该公司与美国各地的医院合作,建立了一个“极为多元且规模庞大”的数据集,供AI开发者测试其算法。"}],[{"start":699.16,"text":"其他研究人员正在学术环境中开展试验,以完善更有效的方法,生成能够证明AI工具对患者健康影响的数据。"}],[{"start":708.5,"text":"杜克大学(Duke University)的萨米•舒法尼•埃尔法西(Sammy Chouffani El Fassi)表示,开发者需要为医疗健康工具的性能主张提供佐证,这一需求正日益得到认可。他正与业界和学术界的研究人员合作,开发帮助外科医生作出更佳决策的应用程序。"}],[{"start":725.29,"text":"萨米•舒法尼•埃尔法西说:“我们并不是要弄清这款工具是否有效。我们要问的是,这款工具将如何影响患者的治疗结果?”"}],[{"start":735.99,"text":"他补充说:“我们正努力摆脱理论层面,转而产生真正的临床影响。”"}]],"url":"https://audio.ftcn.net.cn/album/a_1789744339_2043.mp3"}

版权声明:本文版权归FT中文网所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
设置字号×
最小
较小
默认
较大
最大
分享×