物理AI还是英伟达全面:开源多款模型、智能提工具,联手宇树帮助机器人学者
物理AI还是英伟达全面:开源多款模型、智能提工具,联手宇树帮助机器人学者
查看摘录全文
智东西(公众号:zhidxcom) 作者 | ZeR0 编辑 | 漠影
智东西6月3日报道,在Computex 2026台北国际电脑展上,英伟达发布物理AI领域的多项进展,包括开源世界基础模型Cosmos 3、面向物理AI的智能体工具和Skills、自动驾驶推理模型Alpamayo 2 Super、闭环强化学习框架AlpaGym、动作条件世界模型OmniDreams等模型及工具,并发布工厂运营蓝图、端到端人形机器人工作流、开放参考人形机器人设计,全方位助力企业及研究机构将AI引入支撑世界运转的物理系统中。
英伟达还分享了许多合作伙伴的实践案例。比如Cadence构建了用于芯片设计验证的超级智能体,台积电将英伟达技术引入晶圆制造多个关键环节,富士康与和硕率先构建工厂经理智能体,多家名校及顶尖研究所将采用基于宇树H2 Plus的开放参考人形机器人设计来开展研究。
英伟达发布了一款面向物理AI的开源世界基础模型 Cosmos 3 。
Cosmos 3是一个完整的全模态(Omni)模型,基于混合Transformer架构,指令、观测数据与动作共同流入自回归Transformer,该模型负责推理、规划,并指导扩散Transformer生成后续内容。
全模态模型是指能够处理视频、传感器输入、文本、声音、动作等多种模态的模型,这些模态均可作为模型的输入和输出,类似于人类和其他生物的认知方式,从多种感官接收输入,并能输出多种类型的结果。
该模型的核心目标是为自主系统构建世界模型,既可生成策略训练数据,也可评估策略,乃至直接作为策略本体。
Cosmos 3在物理AI各项基准测试中全面领先,是视觉推理、图像与世界生成、物理精确性及机器人动作生成等所有类别的第一梯队模型。
作为世界推理器,即视觉语言模型(VLM),Cosmos能够理解视频与文本中的场景并标记关键信息或做出决策。
作为 世界模型 ,Cosmos可生成物理精确的合成训练数据。
作为 仿真器 ,Cosmos在闭环中测试机器人策略,展示动作结果并预测后续状态。
作为 世界动作模型 ,Cosmos可针对不同机器人形态进行后训练,并直接生成动作指令。