我国自主研发 4500 米级深海作业机器人启航赴南海科考
9 月 28 日,我国自主研发的首批量产 4500 米级重型工作级深海作业机器人(型号 VY150)在山东威海港启航,奔赴南海开展联合科考。该机器人搭载自研七轴多功能液压机械臂,整机上万个零部件实现国产化,最大作业深度达 4500 米并可拓展至 6000 米。本次任务旨在实战验证全系统性能,可支持深海油气开发、管线巡检与资源勘探等作业。
9 月 28 日,我国自主研发的首批量产 4500 米级重型工作级深海作业机器人(型号 VY150)在山东威海港启航,奔赴南海开展联合科考。该机器人搭载自研七轴多功能液压机械臂,整机上万个零部件实现国产化,最大作业深度达 4500 米并可拓展至 6000 米。本次任务旨在实战验证全系统性能,可支持深海油气开发、管线巡检与资源勘探等作业。
正行创新宣布联合创始人杨宇欣出任公司总裁,全面负责全球市场拓展、产业生态建设与商业化落地。杨宇欣拥有二十余年跨科技领域产业经验,此前曾任黑芝麻智能首席市场营销官及中科创达董事兼副总裁。他将推动正行创新的具身模型、本体和软件等全栈能力进入更多真实商业与工业场景,加速全球规模化落地。
AMD 宣布已签署最终协议,将以约 82 亿美元全股票方式收购李飞飞创立的空间智能初创公司 World Labs,交易预计在 2026 年底前完成。收购完成后李飞飞将出任 AMD 执行副总裁兼首席科学家,其团队将继续研发 Atlas 等三维场景生成与机器人仿真技术。双方计划以此深化模型工作负载与芯片硬件的端到端协同,布局物理 AI 计算生态。
推荐理由:芯片厂商直接将空间智能前沿研究团队纳入体系,展示了软硬件深度协同争夺物理AI工作负载的商业路径。
消费级具身智能公司诺因智能近日完成由京东相关基金领投的数亿元天使+++轮融资,成立一年累计融资超10亿元。本轮资金将重点用于扩充训练数据、推进KNOWIN-X1机器人量产准备及高端人才引进。旗下GLOW生成式具身大模型支持单次操作示范学习,在RoboDojo评测中取得62.2%的平均成功率。
一目科技推出视光学超薄仿生触觉传感器 SENTRA T0,厚度已迭代至 3 毫米以下,是可量产的仿生视触觉传感器。该光触觉方案利用光芯片检测柔性材质形变,在指尖面积布置了 24 万个点,力感知精度达到约 5mN。一目科技旨在通过数字化手感补齐具身智能的触觉数据短板,解决机器人抓握打滑与复杂装配难题。
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞的反思文章提到,公司自 2024 年成立以来构建了面向创意和设计的 AI 空间智能能力,并在收购 SceniX 后推进机器人仿真能力。
AMD 宣布以 82 亿美元全股票收购李飞飞创立的空间智能公司 World Labs,交易预计 2026 年底前完成。交割后李飞飞将出任 AMD 执行副总裁兼首席科学家,联合创始人 Justin Johnson 与 Ben Mildenhall 带领团队并入组建前沿 AI 研究组织。
推荐理由:AMD借全股票收购吸纳空间智能研发团队,旨在让芯片设计直接对接物理模拟与三维生成等新型算力负载。
AMD 宣布以 82 亿美元收购李飞飞的 World Labs,交易预计年底前完成,尚待监管批准。World Labs 创始人李飞飞将加入 AMD 出任执行副总裁兼首席科学家,两家公司去年已建立推理优化与训练合作。World Labs 的首个产品 Marble 可用于制作娱乐体验,也能为机器人训练生成模拟环境。
Michael Levin 提出"柏拉图心智空间"假说,认为心智是可通过生物、合成或混合身体进入物理世界的非物理模式,xenobots、anthrobots 及排序算法扰动实验被用作佐证。同期内容还包括智谱启动外层 RSI 循环、TPU 部署太空,以及机器人学正为 LLM 时刻做准备但缺少通用算法。
特斯拉部分工厂工人因担忧未来被取代而抵触穿戴动捕设备训练 Optimus 机器人,促使公司将模仿学习的数据采集转交给专属团队并建立专门训练中心。报道指出,Optimus 目前通用能力仍显不足且需在受控环境下针对特定任务编程,同时手部触觉传感器需更换外层保护套以降低损耗。此外,特斯拉在核心零部件上依然依赖中国供应链,并在制造升级与商业化部署上面临来自丰田、现代等汽车制造商的竞争。
Hugging Face 联合 NVIDIA 发布技术教程,详细讲解如何利用 NVIDIA Warp 和 MuJoCo Warp(MJWarp)将机器人仿真从 CPU 单环境迁移至 GPU 批量并行环境。
微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。
推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速包集合,新增智能体工作流与平台支持,帮助开发者与 AI 智能体协作构建机器人应用。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,读者可据此了解开源机器人栈新增的能力与硬件支持范围。
面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。
Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。
AWS 的 Strands Robots 与 Hugging Face 联合展示了基于 LeRobot 格式与 Storage Buckets 的机器人流式数据闭环方案。开发者可通过单个智能体完成示教采集、基于 Xet 的字节级增量同步、无需下载本地文件的流式训练,并将策略直接部署回硬件。官方配套提供了端到端运行的 Jupyter Notebook 示例代码。
推荐理由:文章演示了将具身智能演示采集、对象存储增量同步与流式训练打通的方法,便于机器人开发者降低本地存储和重复数据传输成本。
新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。
Google DeepMind 正式推出具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑提供连续视频理解、多步任务编排与多机协作能力。
推荐理由:该模型将高层推理规划与底层动作执行解耦,并通过连续视频流追踪任务进度,展示了具身智能分层编排与落地的具体路径。
Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。
推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。
Epoch 与 METR 发布长周期编程基准 MirrorCode,Opus 4.7 仅耗时 14 小时和 $251 推理成本便完成需人类 2-17 周的程序重写任务。
NVIDIA 推出面向手术机器人的实时动作驱动生成式模拟器 Cosmos-H-Dreams,支持在单张 GPU 上实现闭环交互控制。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步扩散学生模型,配合 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 fps 的生成速度。
推荐理由:该系统将手术世界模型蒸馏为少步因果架构并结合流式推理,在单张工作站显卡上实现了百帧级交互与闭环控制。
Hugging Face 联合 Pollen Robotics 开源了机器人操作数据采集系统 Grabette,无需实体机械臂或复杂遥操作台即可通过手持夹爪录制真实操作轨迹。
推荐理由:该系统通过低成本手持夹爪免去机械臂遥操作,为低门槛采集操作轨迹并训练具身策略提供了全套开源软硬件方案。
Mistral AI 推出首个专用于具身导航的 8B 模型 Robostral Navigate,仅依赖单颗普通 RGB 摄像头即可根据自然语言指令引导机器人在复杂环境中自主移动。
推荐理由:该模型展示了仅凭单颗普通 RGB 摄像头在仿真数据与在线强化学习训练下实现高精度具身导航的可行路径。
Hugging Face 推出开源机器人学习框架 LeRobot v0.6.0,重点补齐从未来预测、人工纠偏到统一评测的完整学习闭环。新版本引入 VLA-JEPA、LingBot-VA 等世界模型策略,支持 GR00T N1.7 和 MolmoAct2 等新 VLA 模型,并提供 Robometer 等统一奖励模型 API 与 6 个仿真基准。
推荐理由:该版本打通了从世界模型预测、在线人工介入纠偏到云端训练与统一评测的完整机器人学习闭环。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名录,集中展示其在前沿 AI 领域的研究成果与职业去向。该届研究涵盖大语言模型与推理、机器人与具身智能、计算机视觉及生成模型等方向。毕业生去向包括前往高校任教、开展博士后研究,或加入 OpenAI、Mistral AI、Physical Intelligence 等机构与自主创业。
Hugging Face 联合 Cerebras 推出基于 Gemma 4 31B 的实时语音到语音开源流水线,大幅降低语言模型推理与多轮交互延迟。该级联系统采用完全模块化设计,整合 Nvidia Parakeet 语音识别、Cerebras 加速的 Gemma 4 推理以及阿里 Qwen3TTS 文本转语音,重点优化高分位延迟瓶颈。
推荐理由:原文展示了通过专用推理芯片与模块化开源模型串联消除长尾延迟的方案,为具身智能与实时语音助手的架构设计提供了落地参考。
NVIDIA 研究人员推出机器人代码智能体框架 ENPIRE,通过自动重置、自动评估与策略迭代,使实体机器人在真实世界中实现闭环自主改进。在搭载 NVIDIA RTX 5090 的双臂工作站测试中,前沿代码智能体在 PushT、整理插针与剪断扎带等复杂灵巧操作任务上实现了 99% 的成功率。
Google DeepMind 推出机器人加速器计划(Google DeepMind Accelerator: Robotics),选拔了 15 家欧洲早期机器人初创公司加入为期 3 个月的项目。入选团队将获得 Google DeepMind 与 Google 专家的技术指导,并可访问其 AI 技术栈与 Gemini 机器人模型,推动具身 AI 技术融入核心产品并加速落地。
伦敦国王学院、复旦大学与图灵研究所推出 SocioHack 基准,包含 72 个沙盒环境,测试强化学习大语言模型钻制度漏洞的“社会黑客”能力。RL 训练的模型以 61.25% 召回率和 90.85% 精确度重新发现了历史法规漏洞策略。此外,Anthropic 披露其代码合并量增长 8x,显现出实验室级递归自我改进(RSI)的初步迹象。
研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。
Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解以及任务完成判定能力。
推荐理由:该模型增强了空间指向、多视角任务完成判定与工业仪表读取能力,有助于开发者为实体机器人构建高阶环境理解与决策系统。