AI 新闻
NVIDIA 阐述开放世界模型在物理 AI 开发中的作用
NVIDIA 表示,开放世界模型、Cosmos 3 和仿真工具可帮助机器人与自动驾驶团队构建、测试并专门化物理 AI 系统。
NVIDIA 正在主张,开放世界模型将成为物理 AI 的重要基础。所谓物理 AI,是指必须理解并在真实环境中行动,而不只是生成文字或图像的系统。公司在一份新的技术概览中表示,这类模型可以学习物理关系、预测接下来可能发生的事,并帮助团队生成数据、运行仿真和为特定机器人、车辆或视觉应用专门化系统。公告以公司的 Cosmos 3 模型家族和 Omniverse 库为中心,但也表达了一个更广泛的观点:在每个部署几乎都不相同的领域,适应性模型和共享仿真工具十分重要。
物理 AI 团队面临的数据问题不同于许多纯软件应用。机器人或车辆必须应对变化的光线、天气、物体、传感器和人类行为,其中包括难以安全、重复地在现实中采集的罕见事件。NVIDIA 称,世界模型能生成以物理为基础的世界与动作数据,模拟未来状态,并为需要推理这些条件的系统提供起点。公司把这种能力描述为:在系统进入真实场景前,可用于测试策略并创造更丰富的训练环境。它并不能免除真实世界验证的需要,但可能让早期开发不必依赖每种情景自然发生。
公司的 Cosmos 3 家族被定位为若干相关任务的共同基础。NVIDIA 称,它将视觉推理、世界生成和动作预测结合起来,使开发者可使用同一模型家族理解场景、生成合成数据、模拟可能状态并构建专门化的世界动作模型。该产品线包括用于高保真世界建模的 640 亿参数 Cosmos 3 Super、用于更高效推理和后训练的 160 亿参数 Cosmos 3 Nano,以及用于设备端视觉推理和机器人策略部署的 40 亿参数 Cosmos 3 Edge。这些规格描述的是 NVIDIA 的产品家族,并不意味着一个模型无需调整便适合每一种部署。
开放性是公司论述的核心。NVIDIA 表示,Cosmos 世界基础模型采用 Linux Foundation 的 OpenMDW 1.1 许可提供,允许团队在自己的数据和硬件上进行后训练。在物理 AI 中,这种灵活性很重要,因为通用模型并未见过客户可能使用的每一种机器人设计、传感器阵列、仓库、道路或运行条件。NVIDIA 将访问权重、允许适配的许可和后训练工具视为缩小这一差距的实际要求,而不仅仅是关于开放模型的理念偏好。
模型层还配有仿真基础设施。NVIDIA 称,Omniverse 库可帮助开发者构建可用于仿真的世界,而 OpenUSD 为数字孪生、仿真和合成数据工作流中复杂三维数据的组合与交换提供框架。预期收益是在团队改变资产、传感器配置或环境条件时减少反复劳动。实际中,开发者可能需要调整相机位置或天气条件,而不用重建虚拟环境的每一部分。该公告将这些工具定位为构件,而不是保证单靠仿真就能产生安全现实行为。
NVIDIA 还列举了机器人、自动驾驶车辆和视觉 AI 的使用情况,点名了在这些领域使用 Cosmos 的公司,并提到 Cosmos Coalition,旨在围绕模型、研究和评估方法汇集模型开发者、AI 开发者和物理 AI 组织。公司最近已将该联盟扩展到日本,参与组织计划为工厂、物流、农业、建筑、医疗和交通开发开放世界模型。这些例子显示了 NVIDIA 希望这一方法被应用的领域,但并不证明每个行业都已达到相同的部署或成熟度水平。
更广泛的意义在于,物理 AI 正走向一套包含模型、专门化训练数据、仿真环境、评估和领域适配的技术栈。NVIDIA 对开放世界模型的论点,在客户需要控制整条链路而非只调用固定 API 回应时最有说服力。尚待回答的问题关乎成本、质量和向现实的迁移:仿真世界能多准确地代表罕见事件,某个部署需要多少后训练,以及团队如何在自动化系统在人群周围行动前衡量安全性。公司 8 月的更新为这些问题提出了路线图,但真正的证明将取决于建立在其之上的系统所产生的结果。