Yejin Choi正在挑战人工智能领域最具深远影响的一项假设:进步需要规模越来越大的模型、更多算力,以及少数几家有能力同时为两者提供资金的公司。她在斯坦福大学的研究探索了另一条道路——规模更小但能力出色的系统、更好的推理算法、专业化模型之间的协同,以及承认人类价值观确有差异的对齐方式。
这一论点关乎科学,但影响延伸至经济层面。如今,前沿模型开发需要在芯片、数据中心和能源方面投入巨额资金。这使权力集中于资产负债表雄厚且能优先获得硬件的供应商。多数企业随后通过应用程序编程接口或云平台租用服务,同时接受自己无法掌控的定价结构和技术路线图。
Stanford University迪特尔·施瓦茨基金会人本人工智能教授崔艺真并非试图证明规模毫无价值。更大的系统已经带来重要进步。她的贡献在于将效率、多样性和推理质量确立为衡量进步的重要维度,而不再视其为次要约束。到2026年,这项工作的意义已超出实验室:企业和政府都在探索部署人工智能的方法,避免让每一项决策都依赖成本最高的通用模型。
计算效率关乎市场结构
前沿竞赛让规模获得双重回报。大规模训练可以提升能力,而高昂成本又筑起一道壁垒,保护有能力承担这类投入的机构。部署之后,同一批提供商还可通过云服务、办公软件、搜索及消费者应用获得分发优势,由此形成使用数据、收入与进一步投资彼此强化的循环。
小型模型可能打破这一循环。针对特定任务设计的系统可以在成本更低的硬件上运行,响应更快,并将敏感数据保留在组织内部或设备端。银行可以用一个模型提取文档信息,用另一个模型处理代码,只在复杂推理时调用更强大的系统。企业不需要一个无所不知的单一模型,而需要成本可接受的可靠服务。
崔氏对模型编排的关注正是针对这一架构。编排层不强求单个网络处理所有请求,而是可以分派任务、汇总输出并调用工具。这种方式类似于设计完善的组织:专业人员处理熟悉的问题,疑难情况则逐级上报。如果路由准确,系统便能提升单位算力的性能。
编排机制本身也会带来新的故障模式。错误的路由决策可能将敏感信息发送给不适合的模型,或生成一份没有任何组件能够完全负责的答案。系统彼此调用还可能增加延迟。安全团队必须追踪更多依赖项、版本和供应商。推理环节节省的成本,可能以集成和监控成本的形式重新出现。只有当研究成果形成运营方能够审计和维护的架构时,研究才会对行业产生影响。
同一标准也适用于推理。基准测试往往只奖励最终答案,却不衡量所耗资源、结果的稳定性,或模型是否走了捷径。较小的系统在实验室条件下可能表现良好,但遇到指令含糊或数据漂移时或会失效。如果评估涵盖总成本、校准度、稳健性和拒绝作答的能力,崔氏对规模化发展的主张将最具说服力。
多元价值观对齐直面全球产品难题
人工智能对齐经常被表述为寻找一套模型应当遵循的统一价值观。崔的研究强调多元主义:个人和社会之间可能存在合理分歧,人工智能系统应呈现这种复杂性,而不是将其压缩成单一的文化默认标准。少数模型正被部署到语言、法律和社会规范各异的多个国家,这一点尤其重要。
对科技公司而言,多元主义带来了产品与治理问题。全球模型必须遵守不可妥协的安全边界,同时适应本地语境。它必须区分有害歧视与偏好的真实差异。用户应当了解,一项回答究竟反映了预设政策、模型学习到的分布,还是不确定性。这些决定不能完全交由不透明的优化过程处理。
商业领域很容易把本地化视同翻译。然而,多语言研究一再表明,模型质量因语言而异,尤其是在数字训练材料有限的语言中。流畅的句子可能掩盖薄弱的事实理解能力。崔艺真在向United Nations安全理事会作简报时指出了性能不均等问题,并主张建设可访问、稳健且高效的系统。在数百种语言与数字服务快速普及并存的亚洲,这一警示具有现实意义。
医院、公共机构或金融机构不能想当然地认为,英语基准测试能够预测模型在印地语、韩语、印度尼西亚语或某种地区语言中的表现。它们需要有代表性的评估数据、本地专家和申诉机制。规模较小的专业模型或有助益,因为它们可以针对特定领域调整,并在本地控制下运行。但如果可用的本地数据质量不佳,它们也可能固化偏见。规模不能取代治理,效率也不能证明公平。
科学人工智能提供了严苛的试验场
崔氏目前的研究也延伸至科学推理,包括旨在辅助蛋白质研究、实验和复杂问题求解的系统。科学是一项很有价值的检验,因为语言听起来合理远远不够。模型的主张必须符合物理证据、数学一致性或可复现结果。错误可能浪费实验室时间,在健康相关工作中还会造成实质性风险。
专用系统或许具备优势。它们可以结合领域数据、检索、模拟和工具,而非依赖参数记住每一项相关事实。经过训练、能够使用经验证数据库或执行代码的紧凑型模型,在狭窄任务上可能优于更大的对话系统。其推理过程也可能更易于约束。
然而,科学发现难以用简单的基准衡量。已发表文献存在阳性结果偏倚,实验条件也各不相同。模型可能复现共识,却错过非传统但正确的假设。当测试问题与训练数据相似时,模型也可能利用数据泄漏。崔氏对更智能算法的强调必须辅以前瞻性评估:在实验前作出预测,并依据系统不可能预先见过的结果进行检验。
商业化构成了另一道边界。大学可以发布论文和模型;企业则需要支持、安全保障、责任安排和稳定的性能。高效的科研系统若要挑战前沿服务商,就需要工具和分发渠道。开源社区、云服务商和初创企业或许能将研究成果转为应用,但从原型走向受监管部署仍有很长的路。
学术领导力通过人才与标准发挥作用
崔艺珍的影响力并非来自掌控庞大的企业预算,而是通过研究议程、学生、公共机构,以及该领域评判进步的标准发挥作用。作为斯坦福大学计算机科学教授和斯坦福以人为本人工智能研究院高级研究员,她能够把技术工作与政策及社会科学问题连接起来。这一职位赋予她广泛影响力,却不能让她直接决定企业如何部署这些理念。
这种区别在领导力排名中至关重要。学者可以指出更优方向,但行业激励机制仍可能偏向规模扩张。前沿能力能够吸引客户、人才和媒体关注;效率提升往往被用于处理更多查询,而非降低总体算力需求。与由专业模型组成的分散生态相比,投资者可能更青睐拥有经常性收入的中心化平台。要改变这一轨迹,需要足够有力的证据来影响采购和资本配置。
崔可以推动评估体系在报告准确率的同时,也报告能耗、延迟和成本。基准测试应检验多种语言和价值体系,披露不确定性并防止数据污染。公共资助方可以支持共享算力资源,使效率研究不再局限于那些已经接近大型科技公司的实验室。接受这一框架训练的学生可以把相关方法带入业界。
另一个风险是在人与人之间制造小型与大型系统的虚假对立。有些问题确实需要前沿规模的系统,而小型模型也可能由成本高昂的大型模型蒸馏而来。更实际的目标是建立分层市场,让用户选择成本最低且能达到既定标准的系统。如此一来,算力强度将成为一项工程决策,而非默认选项。
替代方案必须具备可操作性
到2026年下半年,人工智能买家开始提出更为严谨的问题:每项完整工作流的成本是多少?模型能否在私有环境中运行?不同语言和用户群体的表现有何差异?当多个系统共同生成答案时,谁来承担责任?崔的研究议程直接回应了这些问题。
采购可以成为杠杆。政府、高校和大型企业可以要求供应商披露任务层面的性能、推理成本和语言覆盖范围。这类要求将奖励真正的效率,并为地区服务商创造空间;同时也会揭示,所谓通用模型何时依赖成本高昂的人工审核,或在主流市场之外表现参差不齐。
成功不能仅以紧凑型模型在某一项基准测试中胜出衡量。机构还应按实际结果,而非品牌或参数规模来比较不同系统。
Yejin Choi主张,不应将智能与规模混为一谈,也不应将对齐与文化一致性混为一谈。这些观点同时挑战了AI行业的技术惯例和集中化经济模式。如果规模更小、经过编排且具有多元性的系统能成为可信的生产选择,亚洲及其他地区的组织将在成本、语言和价值观方面获得更多控制权。如果它们仍止步于研究展示,最大的模型提供商将继续决定访问架构。Yejin Choi如今的影响力,取决于能否将一个有说服力的替代方案变成可实际运行的方案。