微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,引入智能体工作流以加速机器人应用构建与部署。该版本支持 ROS Lyrical 和 Ubuntu 24.04,提供 FoundationPose 推理库使物体位姿估计速度提升 5.5 倍,并包含用于设置和操作的 Isaac 技能。
推荐理由:Isaac ROS 5.0 引入智能体工作流与 FoundationPose 加速,为开发者提供从构建到部署的完整物理 AI 开发路径。
NVIDIA 发布 Halos 全栈安全系统,用于物理 AI 在设计、验证与部署各环节的安全工程。面向自动驾驶,Halos 覆盖 DRIVE AGX Thor。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层大脑,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:官方给出进度分类与时刻定位两项量化指标,可据此判断机器人在长任务中自我纠错与切换步骤的能力边界。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:视觉-语言-动作模型 Gemini Robotics 2 可控制人形机器人全身动作并提升手部与夹爪的灵巧操作。
推荐理由:三款模型分别覆盖全身控制、具身推理与端侧部署,可据此判断机器人智能层的分工方式。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 上运行。
推荐理由:原文给出实时生成式手术仿真的蒸馏与推理优化路径,读者可了解世界模型如何进入闭环交互。
Hugging Face 发布 Grabette,一套开源低成本的手持夹爪数据采集系统,用人类手部演示替代机器人遥操作,采集后自动转换为 LeRobot 数据集并上传至 Hugging Face Hub。
推荐理由:原文给出了一套无需机器人即可采集操作数据的开源硬件与处理流程,读者可据此判断机器人数据采集门槛的变化。
Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。
推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成功率与训练方法,可据此判断具身导航对传感器配置的依赖程度。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新一批 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT)以及统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:原文把世界模型策略、奖励模型 API 与六个仿真基准整合进同一套 CLI,读者可据此判断机器人学习闭环的工程化程度。
伯克利人工智能研究实验室(BAIR)展示其 2026 届博士毕业生的研究成果,涵盖机器人、大语言模型推理、计算机视觉及 AI 安全等领域。毕业生去向包括 OpenAI、Physical Intelligence、Mistral AI 等机构,以及普林斯顿大学、UCLA 等高校教职。
Google DeepMind 推出面向欧洲早期机器人初创的 Accelerator: Robotics 项目,选出 15 家公司,提供 3 个月密集指导与技术支持,并可调用其 AI 技术栈和 Gemini 机器人模型。入选者覆盖物流、制造、医疗、气候与导航等领域,本周在伦敦启动。
GRASP 是一种针对学习动态(世界模型)的基于梯度的规划器,通过提升轨迹至虚拟状态实现时间并行优化,并在状态迭代中引入随机性以增强探索。该方法通过重塑梯度,使动作获得清晰信号,同时避免通过高维视觉模型计算脆弱的“状态输入”梯度,从而解决长时程规划中优化病态及局部极小值问题。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人模型的升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比和仪表读数新能力,可据此判断机器人高层推理的进展。