《影响亚洲》报道 · 亚洲领袖

Jitendra Malik将感觉运动学习置于语言之前

马利克2026年的研究与教学议程提出,智能源于对物理世界的观察与行动,而非仅凭语言。商业上的制约在于,机器人经验成本高昂、彼此割裂且关乎安全。

Jitendra Malik主张,人工智能在尝试描述世界之前,应先从世界中学习。他2026年在加州大学伯克利分校的研究与教学议程强调感觉运动学习,即让系统把感知、行动与物理后果联系起来。这一理念向一个主要把巨额资本投入语言训练模型的行业提出了挑战。

经文本训练的模型可以对指令、代码和记录的知识进行推理,但机器人必须应对摩擦、平衡、遮挡、不确定性以及错误动作的后果。它不仅需要知道杯子是什么,还要知道该握多紧、杯子装满后会发生什么,以及何时该停下。这些能力源于互动。

马利克是加州大学伯克利分校亚瑟·J·奇克讲席教授,也是计算机视觉领域的奠基人物之一。他通过研究、教育和培养人才发挥领导作用。他对具身智能的关注可能影响实验室和企业的投资方向。核心商业问题是,机器人技术能否建立一个可与支撑文本训练模型的网络规模资源相媲美的数据经济。

实体体验成本高昂

文本和图像可以大规模复制和处理。机器人数据则需要硬件、空间、维护和监督。一次抓取可能耗时数秒,失败的动作还可能损坏物体或机器。不同机器人生成的传感器和控制数据格式各异,导致数据集难以整合。

这种稀缺性带来了集中度风险。拥有大规模设备队伍的公司能够收集更多交互数据并更快改进,而大学和初创企业很难与之匹敌。在相关科学尚未成熟之前,市场就可能向同时掌握硬件和数据的机构集中。

马利克的学术职位使共享资源尤为重要。公共数据集、标准接口和可复现任务有助于保持该领域的开放性。它们无法取代专有车队数据,但可为比较和教育提供共同基础。

数据质量比单纯的时长更重要。如果系统从未遇到杂乱环境、失败或恢复过程,反复执行简单动作的价值有限。数据集应涵盖人为干预、不确定性和多样化环境。人类接管的时刻尤其具有参考价值。

仿真必不可少,但无法实现自主可控

模拟可以生成数百万次交互,而不必让硬件承担风险。研究人员可以改变光照、物体属性和布局,训练策略并测试罕见事件。图形技术和学习型世界模型的进步,使模拟环境日益实用。

仿真与现实之间仍有差距。接触动力学、可变形物体和传感器噪声都难以复现。在整洁虚拟厨房中表现完美的策略,可能因袋子弯折或摄像头镜头沾污而失效。仿真可以加速学习,但现实环境中的验证才是决定安全性的关键。

马利克在计算机视觉领域的背景之所以重要,是因为感知系统长期以来一直面临领域偏移问题。学习不变结构、结合合成与真实数据,并利用有限样本进行适应的方法,可以缩小这一差距。机器人技术需要在行动层面具备同等严谨的方法。

企业应披露其声称的能力有多少真实世界数据支撑,以及系统曾在何处接受测试。在预先布置的环境中呈现视觉效果出众的演示,并不能证明系统具备普遍运行能力。基准测试应包括新颖物体、干扰因素和故障恢复。

行动改变了智能的含义

基于文本训练的模型可能给出错误答案,却不会直接驱动设备。机器人一旦出错,则可能造成人员受伤、库存损坏或生产线停摆。因此,智能还必须包括判断何时不应行动、何时应当求助。

感觉运动学习可以让系统在实际操作中处理不确定性。系统能够估计某个物体是否处于其经验范围内,并选择风险较低的动作。它还可以通过改变视角或轻柔触碰来收集信息。这些行为更接近科学实验,而非下一个词元预测。

评估应奖励经过校准的犹豫和安全恢复能力,而不应只看任务完成情况。一台成功率为95%、却会造成严重故障的机器人,可能不如另一台完成任务更少但能恰当升级处置的机器人实用。商业买家需要的是结果分布,而不是高光集锦。

马利克可以帮助界定围绕干预、探索与失败的研究问题。这些问题会影响学生和企业设计系统的方式。在自主能力扩展至控制程度更低的环境之前,该领域需要建立安全行动的理论与基准。

基础模型需要实体载体和交互界面

机器人公司正在开发可跨任务和硬件运行的模型。通用模型能够解读图像和语言、规划行动并生成控制指令。其前景在于所学能力可以迁移,无需为每项任务分别编写程序。

迁移之所以困难,是因为机器人本体各不相同。双指夹爪、灵巧手和移动机械臂的能力各异,传感器位置和控制频率也很重要。模型需要采用能够将目标和外部世界与具体机器区分开的表征方式。

标准化操作接口可以提升可移植性,正如软件标准曾推动计算生态系统扩张。如果专有控制能够形成差异化优势,硬件制造商可能会抵制。然而,当模型和数据可以在不同平台间迁移时,买方将从中受益。

大学可以在不同类型的机器人上测试架构,并公开失败模式。马利克在伯克利开设的学习型机器人课程,可以培养工程师贯通视觉、控制和机器学习进行思考,而不是将每个领域视为彼此孤立的专业。

用工模式应及早设计

机器人学习往往依赖人工示范任务、标注数据、重置环境,并在出错时接管操作。有关自主性的说法可能掩盖这些人的工作。企业应衡量并披露每运行一小时所需投入的人工时间。

远程操作可能在未来多年仍是商业系统的一部分。它能在模型不断改进的同时使部署产生实用价值,但其经济性取决于每人能监管多少台机器人,以及需要介入的频率。操作人员的安全和工作条件同样重要。

工厂、仓库和照护场所的工作人员掌握着研究人员所需的实践知识。让他们参与任务设计,有助于发现边缘情况并创造更好的岗位。部署计划应纳入培训和转岗安排,而不应将劳动力被替代视为外部后果。

马利克对感觉运动能力的重视印证了这一观点,因为人类示范不只是带标签的输出,而是具身化的专业知识。系统应当从这些知识中学习,组织也应认可其价值并给予报酬。

亚洲既是市场,也是研究环境

亚洲拥有先进制造业、物流网络、老龄化社会和快速增长的服务经济。日本、韩国、中国和新加坡拥有强大的机器人生态系统,而印度和东南亚则有不同的劳动力经济结构和运营条件。在一个市场得到验证的系统,未必能自动移植到另一个市场。

工厂提供结构化环境与可重复任务,因此成为早期采用者。服务与家庭场景变化更大,语言、建筑布局、物品与社会预期都会不同。如果具身模型要实现泛化,数据采集就需要区域多样性。

大学、制造商和运营商之间的合作可建立具有独立评估机制的测试场地。数据共享协议应在保护商业信息和员工隐私的同时,让有价值的发现得以传播。

马利克的国际影响力和伯克利网络可以连接这些社群。目标不应是建立由单一公司控制的统一数据集,而应是打造能够反映不同身体特征和环境、彼此互通的资源。

机器人产业需要可信的规模化规律

对语言模型的投资,得到数据、算力、模型规模与基准测试表现之间清晰关系的支持。机器人领域则缺乏同样可靠的规模定律。更多交互可能有所帮助,但硬件多样性和物理噪声使回报具有不确定性。

研究人员应测试性能如何随演示数据、机器人规模、任务多样性和模拟训练而变化。企业需要了解,数据量翻倍究竟能提升泛化能力,还是仅仅重复已知场景。高效学习或许比规模最大的机器人模型更有价值。

计算的经济性也有所不同。训练可以集中进行,但推理往往必须在低延迟、有限功耗条件下运行。边缘硬件、连接能力和安全系统都会增加成本。一个可行的产品,需要整个系统创造的价值超过人力和资本成本。

马利克坚持立足现实,有助于该领域聚焦真正的能力。能够出色讨论物理学的模型,并不等同于可以安全适应环境的机器人。投资应以持续运行所得的证据为依据。

学术领导力可以维护评估的严谨公正

大学也有自身的激励机制与利益冲突,但它们可以公开方法、比较不同系统,并研究不受产品周期容纳的问题。马利克于2026年当选英国皇家学会会士,是对其职业生涯的认可:他将基础视觉研究与广泛应用联系起来。这一地位使他拥有要求更有力证据的平台。

基准测试应能抵御过度拟合,并随系统进步持续更新。测试环境可以预留隔离,由独立运营方实施试验。安全事件与人工干预也应计入评分。

资助机构可以通过支持共享测试设施和长期研究,而非只资助新的模型架构,来强化这种严谨性。可靠的机器人技术需要维护、系统工程和反复测量。这些投入或许较少带来轰动性的发布,但能形成企业和公共机构可用的证据。

Jitendra Malik的感觉运动研究提醒人们,智能不只是一项答案,更是在会作出反作用的世界中采取行动。当企业和研究人员能够把昂贵的实体经验转化为可迁移学习,同时不掩盖失败或人工支持时,机器人技术才会规模化。构建这种数据经济不如人形机器人演示引人注目,却将决定哪些具身系统能够成为可靠的基础设施。