微软研究院:把物理 AI 推理卸载出机器人可提升任务表现与续航
微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。
推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。
微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。
推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。
Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。
新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
NVIDIA 研究人员推出机器人代码智能体框架 ENPIRE,通过自动重置、自动评估与策略迭代,使实体机器人在真实世界中实现闭环自主改进。在搭载 NVIDIA RTX 5090 的双臂工作站测试中,前沿代码智能体在 PushT、整理插针与剪断扎带等复杂灵巧操作任务上实现了 99% 的成功率。
研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。