Tech文章上線

为什么机器人需要一个 ChatGPT 时刻,以及 Nvidia 的 Les Karpas 如何看待前进之路

Claude AI
为什么机器人需要一个 ChatGPT 时刻,以及 Nvidia 的 Les Karpas 如何看待前进之路

目录

你可能想知道

• 到底是什么具体障碍,使得机器人无法达到像 ChatGPT 那样的突破?

• 哪些技术与生态系统变化,能实际加速普及的机器人革命?

主要议题

ChatGPT 在 2022 年 11 月的亮相,标志着人工智能的一个关键时刻:大型语言模型的对话式界面将学术新奇转变为实用的日常工具。那次明显的飞跃提供了突破应有的参照点——快速采纳、广泛的文化影响,以及大量新公司和投资的涌入。尽管机器人在过去数十年有研究、工程进步与稳定的商业部署,但尚未出现类似的拐点。原因是多方面的、务实的,且深植于数字语言理解与具身物理交互之间的差异。

在 2026 年 TechCrunch Disrupt 上,Nvidia Inception 的 Global Head of Physical AI Les Karpas 简洁地指出了核心限制:缺乏一个针对物理交互具有互联网规模的数据集。语言模型受益于丰富的文本数据:书籍、网站、论坛与其他文本来源,共同形成了大型且多样的语料库。相比之下,物理世界呈现出环境、传感器与任务拼凑的局面。没有单一统一的数据库可以捕捉物体形状、表面、人类行为、操作方式以及机器人必须面对的安全关键情境的多样性。这种具身任务的数据稀缺性是主要瓶颈。

要理解为什么这是如此困难的问题,请考虑数据需求的性质。要让家用机器人具有广泛实用性,它必须能在不同光照下识别物体、操作各种材料、适应多样的家庭布局,同时在有人与宠物周围保持安全。要收集足量且多样的真实世界数据——涵盖边缘情况、罕见事件与长尾场景——需要多年在多个部署地点的实地运行,或是一个巨大协调的努力以大规模记录与标注物理交互。像 Waymo 这样的公司通过累积里程来建立驾驶数据集,逐步扩大市场与场景的覆盖。但这种做法既昂贵又缓慢,且通常局限于能由大型车队与监管框架支持系统性数据收集的特定领域(例如驾驶)。

基于这些限制,越来越多的创业公司与研究团队正在寻求替代策略,以近似或替代互联网规模的物理数据集。主要做法包括高保真模拟、合成数据生成,以及在多种机器人形态上训练的基础模型。模拟环境可以产生实际上无限的有标注训练数据,使得跨多种场景与配置的训练成为可能。然而,模拟必须弥合现实差距:模拟物理、传感噪声与真实世界不可预测的丰富性之间的差异。合成数据有帮助,但其效用取决于对变异性与不完美的精心建模;否则模型在部署时可能无法有效迁移。

另一个有前景的策略是多机器人、多任务的基础模型,学习在不同硬件平台与任务族群之间共享表示。通过在多种机器人类型——操作臂、移动底盘、空中平台——上收集的数据进行训练,这些基础模型旨在更好地泛化到新任务与新形态。这个概念类似语言与视觉领域的迁移学习趋势,大型预训练网络提供一个基础,可用更少的标注数据适配下游问题。关键问题在于这类基础模型能否稳健地编码真实世界的物理与语义,达到足以支持安全且可靠行动的程度。

TechCrunch 设立了 Real World AI Stage,正是为了探讨模拟、合成数据与真实世界验证的交叉。在 Disrupt 上,Karpas 与来自 Shield AI、Colossal Biosciences、FieldAI 和 Foxglove 的创始人小组探讨了他们的公司如何应对数据缺口,并努力使模拟训练对物理结果进行验证。这些讨论凸显一个反复出现的主题:进展将来自整合多种策略,而非单一灵丹妙药。产业合作、共享基准数据集与标准化验证协议,能通过减少重复工作并澄清跨应用的表现预期来加速采用。

Karpas 的角色让他处于这个生态系统的中心。作为 Nvidia Inception 的 Physical AI 全球负责人,他与机器人、汽车、制造、移动性与智慧城市等领域的创业公司互动。这个视角带来两个优势:能广泛看到正在尝试的技术方法,以及对哪些产品与商业模式可能扩展具有务实的判断。他的背景——涵盖 Stanley Black & Decker、Intellectual Ventures、Herman Miller、iRobot、Cirque du Soleil 等职务——展示了机器人领域所需的跨学科技能:设计、制造、系统工程与创业领导。当解决方案必须桥接硬件、固件、感知与云端学习系统时,这些能力至关重要。

从投资与创新角度看,含义很清楚。理解数据问题并采取混合解决方案的组织与创业者——结合模拟、众包或车队收集的真实世界轨迹、严格的领域随机化与基础模型方法——将具备优势。同等重要的是能通过严格测试与透明指标来展示安全性与稳健性。对于许多潜在采用者,特别是物流、医疗与公共出行等受监管领域,安全与可靠性的证明将决定商业成功。

最后,像 Disrupt 这类活动的社区建设作用也很重要。将工程师、创始人、投资人与最终用户聚集在一起,能促成知识传递与合作关系的形成。舞台上分享的洞见可以激发新的研究方向、投资论点或产品调整。虽然没有简单配方可以在机器人领域复制 ChatGPT 的文化时刻,但产业、学术界与风投间的协调努力可以缩短时间表。如 Karpas 所强调,进展将是渐进的,既需要技术突破,也需要实际可行的途径以大规模收集并验证数据。

关键洞见表

层面描述
核心瓶颈没有类似文本语料库的针对物理交互的互联网规模数据集。
模拟的角色生成可扩展的有标注训练数据,但需要弥合现实差距。
基础模型在多种机器人类型上训练以促进迁移并减少每项任务所需的数据量。
安全与验证严格的测试与透明的指标对于现实部署与采用至关重要。
生态系统优势创业公司、产业与研究者之间的合作可以加速数据集增长与基准制定。

之后…

展望未来,通往机器人领域等同于 ChatGPT 的时刻,可能是渐进而非瞬间的。进展取决于协调努力以创建共享的数据资源、提高模拟保真度,以及能在不同形体间泛化的成功迁移学习策略。促进安全测试与数据共享的政策框架,结合验证经济价值的商业试点,也将是关键。虽然技术障碍依然重大,但随着投资增加、更强的跨学科合作与更聪明的训练范式,机器人领域出现变革性时刻的可能性正在提高。

对于从业者、投资人与研究人员来说,结论是务实的:关注可衡量的进展——更好的模拟器、更丰富的合成数据、标准化基准与渐进的真实世界验证。那些步骤将缩小模拟能力与部署可靠性之间的差距,使产业更接近 AI 与 ChatGPT 所取得的那种广泛影响。

最後編輯時間:2026/9/16