安波是那种简历让人读不完的学者:南洋理工大学讲席教授、人工智能交叉研究院院长、AAAI Fellow、ACM杰出会员、IEEE Intelligent Systems主编、IJCAI 2027大会程序主席。他的安全博弈算法曾被部署在美国海岸警卫队的港口巡逻系统中,至今仍在运行。
但跟他聊天,你不会感受到任何头衔的压迫感。我们在2026智源大会现场录了一期硅谷远眺播。原本以为会聊agent安全——那是他在智源大会上的演讲主题。结果聊着聊着,话题从技术拐向了研究观、人生观、甚至奖励函数。
一个研究了十几年AI的人,最后把人生的奖励函数设定成了一个词:快乐。
一、从博士后到港口巡逻:一次改变轨迹的转弯
安波在马萨诸塞大学(UMass Amherst)拿到博士学位后,去了南加州大学(USC)做博士后,师从多智能体安全领域的先驱Milind Tambe。
"在那之前我做了很多事情,离落地比较远。后面改变了我的观念——做英文叫use-inspired research,真正做工业界会特别在乎的东西。我后面是极大受益于这个转变。"
这个转变不是抽象的学术觉醒,而是一个非常具体的项目——PROTECT系统。他参与设计的博弈论巡逻调度算法被美国海岸警卫队采用,先在波士顿港部署,随后扩展到纽约和洛杉矶。系统通过随机化巡逻路线,让有限的巡逻资源产生"无处不在"的威慑效果,不增加一分钱预算。这个项目获得了运筹学领域最高实践奖——INFORMS Daniel H. Wagner Prize。
从实验室论文到真正保护港口安全——这个落差,彻底改变了他对"什么是好研究"的判断标准。
后来他把类似的方法用到了野生动物保护上。PAWS系统利用14年的盗猎数据,为乌干达伊丽莎白女王国家公园的护林员规划反盗猎巡逻路线,被National Geographic报道。
他现在带学生时最花时间的,不是技术指导,而是帮学生建立一种判断力:
"你必须做有人会在乎的东西。做研究的目的是,最终你会很骄傲地告诉别人——你需要来看看我做的这个东西,很酷很有意思。而不是你后面觉得很羞于告诉别人。"
他观察到,同样读人工智能博士,有些人毕业后拿无数个大厂offer,有些人很难找到工作。"最重要的区分就是:他学的东西到底有没有用。"
二、从港口安全到金融交易:工业界合作的逻辑
用他自己的话说,他是"大学里面跟企业界合作最多的老师"。从他的研究脉络可以看到一条很清晰的线索:每一个方向都从真实场景的痛点出发。
与阿里巴巴合作的电商反欺诈系统eFraudCom,用竞争性图神经网络在大规模交易数据中识别刷单行为。他的团队在NeurIPS上开源了量化交易平台TradeMaster,用强化学习训练交易策略。2024年发表在KDD上的FinAgent,是一个多模态金融交易agent,在回测中比基线策略提升了36%。
在播客里聊到量化交易时,他的判断很克制:
"agent的能力还是蛮强的。实事求是地讲,做个调研,那个能力是最强的。但你要说有一个巨大突破,很难看到。"
我追问:如果所有人都用agent做交易,会不会引发市场系统性崩盘?他不太担心:"量化策略足够多样化,不可能全世界用同一个算法。而且纯粹做主观交易的人仍然有很大空间——去年有人做到40多倍。"
一个自己在做量化研究的教授,给出的投资建议却很朴素:让agent做你的研究助理,但不要让它做你的基金经理。
三、Agent安全:从博弈论到大模型时代
安波在智源大会上的正式演讲主题是agent安全。他的安全研究经历了三个阶段,恰好对应AI技术的三次跃迁。
第一阶段是博弈论安全(2010-2018年)。用Stackelberg博弈模型为防御者设计随机化策略,核心洞见是:不要假设攻击者是完全理性的,要建模人类的有限理性。PROTECT和PAWS都诞生于这个阶段。
第二阶段是对抗鲁棒性(2018-2023年)。当机器学习系统开始大规模部署,安全问题从物理世界转向数字世界——如何让反欺诈模型不被对抗性攻击绕过?他的NSGZero用神经网络蒙特卡洛树搜索来求解大规模网络安全博弈。
第三阶段是大模型agent安全(2024年至今)。2025年发表在KDD上的综述论文《A Survey on Trustworthy LLM Agents》系统梳理了大模型agent面临的威胁——提示词注入、越狱攻击、工具链劫持、记忆投毒——以及对应的防御措施。
在播客中他提到了一个让他印象深刻的例子:去年用DeepSeek和GPT最新模型对玩游戏,一个AI修改了游戏规则,另一个居然同意了。
"安全不可能有百分之百。任何一个东西都不是。只能说我们做得更好一些。如果我们能够分析可能的一些风险,然后尽早做一些事情,能够尽量规避那样一些风险。"
他对agent风险的时间判断很具体:"今年下半年或者明年上半年,会看到更多agent在个人和企业中使用。那个时候,风险会成为一个很大的问题。因为任何地方只要有商机,有坏人也就会出现。"
四、每一步都走得很稳
安波对AI进展有一个偏冷静的判断——他认为过去这些年AI技术的进步本质上是渐进式的,"很多时候把很多小的改进揉在一起",而非某个单点的革命性突破。
但他紧接着说了后半句——这才是这个观点真正有价值的地方:
"每一步都走得很稳。所有人都在用AI,所以这个不是一个泡沫,不是吹出来的,而是大家能够体验到的。"
这是一个做了十几年研究的人给出的校准:不要把每一个新模型都包装成"革命性突破"来制造焦虑。但也不要因为没有突然的飞跃就否认这条路走对了。
他认为在智能的诸多能力中,推理是最重要的。"大语言模型并没有学会人的思维方式。模型本身还是在predict next token,而跟人的思维是完全不一样的。人的学习能力、创新能力,是agent没有的。"
而关于AGI,他的态度很务实:"批判当前路线的那帮人自己也没有任何解决方案。所以我们就继续沿着目前的技术往前走。"
在今年10月南洋理工的一次学术讲座上,他用过一句话概括自己的研究哲学:"Every model is wrong; there's no perfect model."(每个模型都是错的,没有完美的模型。)言下之意:承认不完美,然后迭代改进——这比追求一次性的革命更现实。
五、智源大会的氛围:穿运动鞋就来了
聊到这次智源大会的体验,安波提到一个细节:他来之前还在想要不要穿衬衣,翻了一眼去年的视频发现大家都穿运动鞋,于是也穿了运动鞋就来了。
他说自己很欣赏这种平等、直接的交流氛围。他提到王坚院士可以在台上直接说"你没有很好地回答"——"王老师是一个真性情的人"。
"我骨子里是尊重每一个人的。每个人生而平等。"
这个信念也体现在他带学生的方式上。他说现在有些年轻学者和学生,"学习工作的环境里没人会告诉他们"研究应该朝什么方向走。"怎么改变这个事情?可能还是让这些孩子们走出来吧。"
所以他愿意做播客、愿意在智源大会上聊这些不那么学术的话题。对他来说,跟人交流本身就是认知迭代的加速器。
六、奖励函数只有一个:快乐
对话快结束时,我问了一个我在每期播客都会问的问题:如果把你的人生建议设计成一个奖励函数,你会把什么放进去?
他没有犹豫:"快乐。"
"我们一切都是为了快乐。很功利的人,因为他们觉得功利会给他们带来快乐。有人觉得地位会带来快乐。最终还是内心能感知的快乐。每个人的评价体系不一样。"
一个研究奖励函数的人,把人生问题还原成了一个参数——快乐。
他的具体建议是:"选正确的赛道、正确的方向、正确的方法。做有意义的事情。然后跟人协作——因为技术进步太快,你必须通过跟人交流来加速认知的迭代。"
而当我问安波与世界的关系时,他说:
"每个人都很渺小。这个世界缺了谁都能转。无论是今天身在高位的任何人都是如此。"
底线很简单:不作恶。有能力的时候帮助一些人。
这是一个AAAI Fellow、IJCAI程序主席、200多篇顶会论文的作者给出的人生答案。不是一个关于AI的宏大叙事,而是一个关于人的朴素选择。
安波教授学术背景速览
•南洋理工大学讲席教授(President's Chair Professor)、人工智能交叉研究院院长
•马萨诸塞大学(UMass Amherst)计算机科学博士,南加州大学(USC)博士后
•AAAI Fellow(2026)、ACM杰出会员(2021)
•IEEE Intelligent Systems主编
•IJCAI 2027大会程序主席、IFAAMAS主席
•代表性工作:PROTECT(美国海岸警卫队巡逻系统)、PAWS(野生动物反盗猎系统)、FinAgent(多模态金融交易agent)、TradeMaster(开源量化平台)
•研究领域:多智能体系统、博弈论安全、强化学习、大模型agent安全
•Google Scholar引用14000+,200+篇顶会论文(AAAI、IJCAI、NeurIPS、ICML、KDD等)
(注:本文基于「硅谷远眺CoreMI」播客录音整理。完整对话请收听播客原版。硅谷远眺CoreMI——连接中美科技与资本市场的深度对话。关注我们,加入社群。本文仅代表作者观点。责任编辑邮箱:tao.feng@fthinese.com)