《影响亚洲》报道 · 亚洲领袖

Anima Anandkumar加入联合国科学委员会

2026年3月,Anima Anandkumar进入了一个不同的领域。

2026年3月,Anima Anandkumar进入了一个不同的领域。这位California Institute of Technology布伦计算与数学科学教授加入United Nations秘书长科学咨询委员会,使一位大规模人工智能和科学计算专家进入这个旨在为United Nations高级领导人提供建议的机构。她的任务不再局限于让算法发挥效能,也包括帮助机构判断哪些机器辅助的科学主张值得信任、投资和公共权威背书。

此次任命正值人工智能进一步深入实验室、国防研究、药物研发和数学推理领域。在这些场景中,如果另一位研究人员无法核验完整证据链,再流畅的答案也价值有限。错误的代价可能包括实验失败、资助方向偏差或工程系统不安全。阿南德库马尔在形式化方法领域的研究提供了一种应对方案:将统计系统接入数学环境,验证每一步是否遵循既定规则。

核查本身并不是一项全球政策。先进的科学人工智能依赖于稀缺的处理器、专业工程师、精心策划的数据和可靠的电力。拥有最大预算的大学和公司可以测试更多假设,再现更多结果并吸引更多人才。没有这种能力的机构可能会成为其他地方发现的客户。阿南德库马尔的领导力测试是将严格性与准入性联系起来,以便更严格的标准不会成为参与的另一个财务障碍。

形式化证明改变了机器能够作出何种断言

2026年4月,阿南德库马尔与加州理工学院数学家谢尔盖·古科夫获得美国一项聚焦人工智能与数学的国防研究计划支持。双方合作研究安德鲁斯—柯蒂斯猜想这一群论中的未解难题。研究人员在证明助手环境Lean中对该猜想进行形式化表达,并利用大型人工智能系统协助寻找数学突破。

该项目建立在阿南德库马尔团队一系列工具的基础上。2023年推出的LeanDojo创建了一个连接自动推理与Lean的开放框架。LeanAgent在此基础上进一步开发出一个旨在持续积累数学知识的系统。TorchLean则将形式化验证用于神经系统,包括控制器和物理信息网络。这些项目共同推动评估标准从输出看起来是否可信,转向其是否满足可由机器检验的规范。

这种差异会带来商业后果。筛选分子的制药公司、验证控制器的航空航天供应商和测试风险模型的银行面临不同监管要求,但都需要证据证明系统的运行没有超出既定限值。形式化方法可以减少对演示质量的信任依赖,也能为保险公司、监管机构和客户留下审计记录,供其在自动化系统失效时判定责任归属。

证明助理并不能确保每项科学结论都正确。它可以验证推导是否符合已编码的假设,但这些假设可能描述了错误的现象,或遗漏了重要条件。一项经过完美检验的定理,可能与企业拟运行的物理系统毫不相关。数据仍可能存在偏差,测量可能含有噪声,目标也可能选择不当。因此,验证只是增加了一层保障,并不能取代实验、领域专业知识或独立复现。

经济层面的问题在于,这一层在哪些场景中能创造足够价值,从而证明其成本合理。把问题形式化需要熟练劳动力,证明搜索也会消耗计算资源。高影响场景可以承受这项开支,因为避免一次失败本身就很有价值。探索性科学则可能只需较轻的控制措施。阿南德库玛可以帮助制定分级方案,让保障程度随风险上升,而不是让课堂计算和安全关键系统承担相同负担。

联合国面临遗留的核查难题

联合国秘书长科学咨询委员会发挥着连接科研与机构决策的作用。其职权范围涵盖科学、技术、伦理、治理和可持续发展,并由一个旨在汇集不同学科和地区成员的网络提供支持。阿南德库马尔以杰出科学家成员之一的身份加入,与联合国系统内的首席科学家和科学领袖共同任职。该职位使她能够参与政策讨论,但并不赋予她对会员国或科技公司的行政控制权。

该委员会的2026年前瞻研判汇集了11个附属网络的192名科学家和技术专家。研究发现,AI正从孤立工具转变为系统级基础设施,而治理缺口、获取机会不平等和机构能力薄弱是主要风险。这一判断具有重要商业意义。一旦政府和实验室围绕AI建立采购体系、科研工作流程和公共服务,改变存在缺陷的系统便会代价高昂。

阿尼玛·阿南德库马尔也承接了一项在其获任前已形成的议程。该委员会研究了前沿AI的验证问题,并警告称,检验相关主张可能需要综合运用软件、硬件、审计和计算记录。2026年3月发布的一份关于欺骗性行为的简报指出,检测工具尚不完善,并呼吁建立共同评估标准及开展国际合作。她的贡献应把这些广泛关切与形式推理这一学科联系起来,同时不能暗示数学证明可以审计所有社会或政治影响。

务实的标准需要多个层次。开发者应披露系统版本、评估条件和重大局限。科研用户应记录数据来源、计算设置和未能成功复现的情况。独立评估方需要获得安全权限,以检验影响重大的主张。采购合同应明确事故报告、模型变更以及客户审查证据的权利。每项要求都有成本,但含糊不清通常会在失败后把更大的成本转嫁给用户。

共同标准可以减少重复尽调,从而扩大市场。如果科学人工智能服务的证据包能获多个司法辖区认可,医院、制造商或公共实验室会更愿意采购。设计不良的标准也可能巩固在位者,因为只有最大供应商承担得起复杂认证。联合国的价值在于界定结果与可互操作证据,而不是规定一套昂贵的技术栈。

任何全球基准都无法涵盖所有情境。一个接受过形式数学训练的推理系统,并不能由此证明其临床有效性;以英语为中心的评估,也可能遗漏其他语言中的失效问题。标准应区分可追溯性和变更控制等普适属性,与由相关科学及监管机构制定的领域测试。阿南德库马尔的技术公信力有助于抵制把这种区别压缩为单一分数的冲动。

算力获取是一项治理决策

科学计算历来是资本密集型领域,但人工智能进一步拉大了机构之间的差距。领先系统需要先进芯片、高速网络、存储设施和工程支持。云服务虽能将部分固定成本转化为运营费用,但持续开展实验仍然昂贵。能够进行大量试验的实验室可以更快获取信息、更早发表成果,并在使用过程中持续改进系统。

公平不能只是发放临时算力额度,却让机构继续依赖遥远的供应商。持久的获取能力需要区域基础设施、技术培训、可靠的数据治理和维护预算。共享设施可以提高利用率,联合采购则能增强大学和公共实验室的议价能力。开放的评估套件可以减少重复劳动。这些机制不像新模型发布那样引人注目,却决定了谁能开展科学研究,而不只是使用科研成果。

亚洲既有具备全球竞争力的计算中心,也有在严峻条件制约下运作的机构。阿南德库马尔曾在印度理工学院马德拉斯分校攻读工程学,随后在美国发展学术事业,这使她与一个科研能力差异悬殊的地区建立了职业联系。印度、东南亚和太平洋地区不能被视为单一市场。电力成本、云服务可用性、公共资金以及专业人才的获取,在各国之间乃至一国内部都存在差异。

算力政策也会影响企业权力。当实验室围绕单一云平台或加速器构建工作流程时,迁移数据和软件可能代价高昂。供应商可以补贴初期研究使用成本,再通过长期依赖收回价值。公共资助方应要求系统具备可迁移性、使用核算透明,并能导出记录。互操作性既是一项技术偏好,也是一项竞争政策。

开放软件有所助益,但无法消除硬件鸿沟。LeanDojo及相关框架使研究人员能够检视方法并在既有成果基础上继续研究,但仍需机器、形式化语料库和能够操作这些工具的人员。真正有效的普及计划应衡量已完成的研究、本地专业能力和成果可复现性,而不是发放了多少账户或额度。

科学市场需要经得起检验的证据

人工智能辅助科研正在吸引资本,因为它有望缩短发现周期。但如果结果无法在开发者的环境之外复现,投资逻辑就会削弱。更快得出不可靠结论,只会把成本推向下游;届时,验证失败、监管延误和开发中止的代价可能高得多。因此,验证应与实验室质量体系和数据管理一样,被视为科研基础设施加以评估。

投资者和资助委员会需要能够区分搜索效率与科学有效性的报告。有效指标包括机器提出的结果中通过形式化检验的比例、独立复现率、每项经验证结果的计算成本,以及方法在未见问题上的表现。只报告生成假设的数量,奖励的是活动量而非知识成果。

基准污染是另一项资本风险。系统看似解决了问题,可能只是因为训练数据中存在相关材料,或反复评估让开发方向逐渐迎合测试。前瞻性挑战、封存测试集和带时间戳的记录可以提供更有力的证据。形式化证明能够验证结果的内部逻辑,而来源控制则有助于确认结果确实是在所声称的条件下产生。

国防资助的数学研究凸显了开放与安全之间的张力。一些方法受益于公开审视;另一些细节则可能因影响国家能力而受到限制。商业伙伴也会保护知识产权。标准应允许可信评估方开展保密审查,同时公布足够信息,让更广泛的群体了解其局限。完全保密会妨碍问责,而不加区分地披露则可能削弱合理的保障措施。

验证本身也能形成竞争壁垒。大型供应商可能建立专有测试套件,并要求客户接受其内部保证。独立工具和通用证据格式提供了另一种选择,使小型企业无需重建整套合规体系即可证明质量,也让买家能够依据品牌和计算规模以外的标准比较不同系统。

无行政权力的影响力

阿南德库马尔无法支配国家科研预算,也不能强制供应商接受测试。该咨询委员会的影响力取决于其分析的实用性、所建立的联盟,以及联合国机构是否愿意将建议纳入采购和发展项目。因此,具体明确至关重要。呼吁科学应负责任且具包容性,往往比为此提供资金更容易获得认同。

具体成果可以包括:为高后果科学人工智能制定最低证据要求,绘制区域算力地图,制定独立复现模板和公共采购原则。董事会还可推动建设供跨境研究人员使用的共享设施,以及由本地机构牵头的多语言评估项目。这些举措将把治理表述与资本配置连接起来。

独立性必须保持可见。Anandkumar曾任Nvidia人工智能研究高级总监,直至2023年;现为Caltech教授。其产业经验有助于她理解先进系统如何构建,而目前的学术职位则让她有空间质疑供应商的主张。清晰披露合作关系、资金来源与技术依赖,将增强她参与制定的任何标准的权威性。

最理想的结果,不会是对机器辅助科学的一枚普遍认可印章,而是一个证据得以流动的市场:一项结果可以跨越工具、机构和国界接受核验,研究人员也能参与其中,而无须接受对单一供应商的永久依赖。Anandkumar的数学工作表明,如何让论断可供检验。人们将以其能否把这种严谨带入政策、并让科学能力延伸至已有购买能力的机构之外,来评判她在联合国的角色。