跳到正文

#具身智能

今日 8 条
今天9月29日周二
  1. IT之家36

    我国自主研发 4500 米级深海作业机器人启航赴南海科考

    9 月 28 日,我国自主研发的首批量产 4500 米级重型工作级深海作业机器人(型号 VY150)在山东威海港启航,奔赴南海开展联合科考。该机器人搭载自研七轴多功能液压机械臂,整机上万个零部件实现国产化,最大作业深度达 4500 米并可拓展至 6000 米。本次任务旨在实战验证全系统性能,可支持深海油气开发、管线巡检与资源勘探等作业。

  2. 量子位38

    正行创新联合创始人杨宇欣正式亮相:出任总裁,负责全球业务拓展

    正行创新宣布联合创始人杨宇欣出任公司总裁,全面负责全球市场拓展、产业生态建设与商业化落地。杨宇欣拥有二十余年跨科技领域产业经验,此前曾任黑芝麻智能首席市场营销官及中科创达董事兼副总裁。他将推动正行创新的具身模型、本体和软件等全栈能力进入更多真实商业与工业场景,加速全球规模化落地。

  3. 爱范儿86

    AMD 宣布以约 82 亿美元全股票收购李飞飞创立的 World Labs

    AMD 宣布已签署最终协议,将以约 82 亿美元全股票方式收购李飞飞创立的空间智能初创公司 World Labs,交易预计在 2026 年底前完成。收购完成后李飞飞将出任 AMD 执行副总裁兼首席科学家,其团队将继续研发 Atlas 等三维场景生成与机器人仿真技术。双方计划以此深化模型工作负载与芯片硬件的端到端协同,布局物理 AI 计算生态。

    推荐理由:芯片厂商直接将空间智能前沿研究团队纳入体系,展示了软硬件深度协同争夺物理AI工作负载的商业路径。

  4. 量子位43

    成立一年完成5轮融资,诺因智能再获数亿元,累计超10亿元

    消费级具身智能公司诺因智能近日完成由京东相关基金领投的数亿元天使+++轮融资,成立一年累计融资超10亿元。本轮资金将重点用于扩充训练数据、推进KNOWIN-X1机器人量产准备及高端人才引进。旗下GLOW生成式具身大模型支持单次操作示范学习,在RoboDojo评测中取得62.2%的平均成功率。

  5. 爱范儿48

    对话一目科技:机器人还缺失的「手感」,如何用「光」来搞定

    一目科技推出视光学超薄仿生触觉传感器 SENTRA T0,厚度已迭代至 3 毫米以下,是可量产的仿生视触觉传感器。该光触觉方案利用光芯片检测柔性材质形变,在指尖面积布置了 24 万个点,力感知精度达到约 5mN。一目科技旨在通过数字化手感补齐具身智能的触觉数据短板,解决机器人抓握打滑与复杂装配难题。

  6. 量子位85

    AMD 宣布以 82 亿美元全股票收购李飞飞空间智能公司 World Labs

    AMD 宣布以 82 亿美元全股票收购李飞飞创立的空间智能公司 World Labs,交易预计 2026 年底前完成。交割后李飞飞将出任 AMD 执行副总裁兼首席科学家,联合创始人 Justin Johnson 与 Ben Mildenhall 带领团队并入组建前沿 AI 研究组织。

    推荐理由:AMD借全股票收购吸纳空间智能研发团队,旨在让芯片设计直接对接物理模拟与三维生成等新型算力负载。

9月28日周一
  1. Import AI28

    Import AI 474:Michael Levin 提出"柏拉图心智空间"理论,智谱启动外层 RSI 循环,TPU 上太空

    Michael Levin 提出"柏拉图心智空间"假说,认为心智是可通过生物、合成或混合身体进入物理世界的非物理模式,xenobots、anthrobots 及排序算法扰动实验被用作佐证。同期内容还包括智谱启动外层 RSI 循环、TPU 部署太空,以及机器人学正为 LLM 时刻做准备但缺少通用算法。

9月26日周六
  1. Ars Technica · AI68

    特斯拉工人抗拒训练可能替代自己的 Optimus 人形机器人

    特斯拉部分工厂工人因担忧未来被取代而抵触穿戴动捕设备训练 Optimus 机器人,促使公司将模仿学习的数据采集转交给专属团队并建立专门训练中心。报道指出,Optimus 目前通用能力仍显不足且需在受控环境下针对特定任务编程,同时手部触觉传感器需更换外层保护套以降低损耗。此外,特斯拉在核心零部件上依然依赖中国供应链,并在制造升级与商业化部署上面临来自丰田、现代等汽车制造商的竞争。

9月24日周四
  1. Microsoft Research60

    微软研究院:把物理 AI 推理卸载出机器人可提升任务表现与续航

    微软研究院对移动机器人操作负载做了首次系统性研究,结论是推理不必局限在机器人本地 GPU,卸载到边缘或云端 GPU 可提升任务表现与续航。评估显示,在内存足够的 GPU 上,建图与规划相比 A100 最多慢 383%;较轻 GPU 让导航及时检测障碍物下降 30%,VLA 模型精度下降 50%。

    推荐理由:微软对机器人离线推理做了首次系统性测量研究,给出任务性能与续航的量化对比,并开源配套工具链。

9月22日周二
  1. NVIDIA Blog49

    NVIDIA:为什么规模化部署物理 AI 需要全层级安全

    面对自动驾驶与机器人的规模化部署,NVIDIA 提出物理 AI 必须贯穿硬件、软件与 AI 行为等全生命周期安全,并推出全栈安全系统 NVIDIA Halos。针对自动驾驶,Halos 涵盖 DRIVE AGX Thor 计算平台与 Alpamayo 开源推理模型;针对机器人,Halos 整合 IGX Thor 工业模块与 Isaac Lab 仿真验证,支持第三方系统级认证。

8月26日周三
  1. Google Research47

    AgentHands:在 XR 中为空间定位智能体对话生成交互式手势

    Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。

8月14日周五
  1. Hugging Face Blog65

    Strands Agents、LeRobot 与 Hugging Face 存储桶打通机器人流式数据闭环

    AWS 的 Strands Robots 与 Hugging Face 联合展示了基于 LeRobot 格式与 Storage Buckets 的机器人流式数据闭环方案。开发者可通过单个智能体完成示教采集、基于 Xet 的字节级增量同步、无需下载本地文件的流式训练,并将策略直接部署回硬件。官方配套提供了端到端运行的 Jupyter Notebook 示例代码。

    推荐理由:文章演示了将具身智能演示采集、对象存储增量同步与流式训练打通的方法,便于机器人开发者降低本地存储和重复数据传输成本。

8月13日周四
  1. Microsoft Research47

    MindTopo 揭示 VLM 的空间推理能力

    新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。

7月30日周四
7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2 机器人模型系列

    Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。

    推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。

7月27日周一
  1. Hugging Face Blog66

    NVIDIA 发布手术机器人实时生成式模拟模型 Cosmos-H-Dreams

    NVIDIA 推出面向手术机器人的实时动作驱动生成式模拟器 Cosmos-H-Dreams,支持在单张 GPU 上实现闭环交互控制。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步扩散学生模型,配合 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 fps 的生成速度。

    推荐理由:该系统将手术世界模型蒸馏为少步因果架构并结合流式推理,在单张工作站显卡上实现了百帧级交互与闭环控制。

7月21日周二
7月8日周三
7月7日周二
  1. Hugging Face Blog73

    LeRobot v0.6.0 发布:引入世界模型策略与 DAgger 人机纠偏闭环

    Hugging Face 推出开源机器人学习框架 LeRobot v0.6.0,重点补齐从未来预测、人工纠偏到统一评测的完整学习闭环。新版本引入 VLA-JEPA、LingBot-VA 等世界模型策略,支持 GR00T N1.7 和 MolmoAct2 等新 VLA 模型,并提供 Robometer 等统一奖励模型 API 与 6 个仿真基准。

    推荐理由:该版本打通了从世界模型预测、在线人工介入纠偏到云端训练与统一评测的完整机器人学习闭环。

7月1日周三
  1. Berkeley AI Research35

    BAIR 2026 届毕业生展示

    伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名录,集中展示其在前沿 AI 领域的研究成果与职业去向。该届研究涵盖大语言模型与推理、机器人与具身智能、计算机视觉及生成模型等方向。毕业生去向包括前往高校任教、开展博士后研究,或加入 OpenAI、Mistral AI、Physical Intelligence 等机构与自主创业。

  2. Hugging Face Blog70

    Hugging Face 联合 Cerebras 将 Gemma 4 引入实时语音 AI 流水线

    Hugging Face 联合 Cerebras 推出基于 Gemma 4 31B 的实时语音到语音开源流水线,大幅降低语言模型推理与多轮交互延迟。该级联系统采用完全模块化设计,整合 Nvidia Parakeet 语音识别、Cerebras 加速的 Gemma 4 推理以及阿里 Qwen3TTS 文本转语音,重点优化高分位延迟瓶颈。

    推荐理由:原文展示了通过专用推理芯片与模块化开源模型串联消除长尾延迟的方案,为具身智能与实时语音助手的架构设计提供了落地参考。

6月29日周一
  1. Import AI38

    Import AI 463:自我改进机器人、中国万卡 GPU 集群与人类时代的挽歌

    NVIDIA 研究人员推出机器人代码智能体框架 ENPIRE,通过自动重置、自动评估与策略迭代,使实体机器人在真实世界中实现闭环自主改进。在搭载 NVIDIA RTX 5090 的双臂工作站测试中,前沿代码智能体在 PushT、整理插针与剪断扎带等复杂灵巧操作任务上实现了 99% 的成功率。

6月9日周二
  1. Google DeepMind46

    Google DeepMind 推出机器人加速器计划,入选 15 家欧洲初创公司

    Google DeepMind 推出机器人加速器计划(Google DeepMind Accelerator: Robotics),选拔了 15 家欧洲早期机器人初创公司加入为期 3 个月的项目。入选团队将获得 Google DeepMind 与 Google 专家的技术指导,并可访问其 AI 技术栈与 Gemini 机器人模型,推动具身 AI 技术融入核心产品并加速落地。

6月8日周一
  1. Import AI39

    Import AI 第 460 期:社会规则的奖励黑客、Anthropic 递归自我改进数据与强化学习无人机竞速

    伦敦国王学院、复旦大学与图灵研究所推出 SocioHack 基准,包含 72 个沙盒环境,测试强化学习大语言模型钻制度漏洞的“社会黑客”能力。RL 训练的模型以 61.25% 召回率和 90.85% 精确度重新发现了历史法规漏洞策略。此外,Anthropic 披露其代码合并量增长 8x,显现出实验室级递归自我改进(RSI)的初步迹象。

4月20日周一
  1. Berkeley AI Research47

    面向更长时域世界模型的基于梯度规划方法 GRASP

    研究人员提出用于世界模型的新型基于梯度规划器 GRASP,旨在解决长时域规划中优化病态与局部极小值陷阱等问题。GRASP 将轨迹提升为虚拟状态以实现跨时间并行优化,并在状态迭代中直接加入随机性以促进探索;同时通过重塑梯度提供清晰动作信号,避免高维视觉模型中脆弱的状态输入梯度。

4月13日周一