跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 21–40 条 · 共 78 条
9月10日周四
  1. OpenAI News60

    OpenAI 在 ChatGPT Work 中推出 Data agent

    OpenAI 宣布在 ChatGPT Work 中推出 Data agent。该智能体支持用户使用自然语言连接企业数据、挖掘业务洞察,并借助 AI 构建交互式仪表盘。

    推荐理由:官方简短介绍了该智能体连接企业数据与构建交互仪表盘的场景,读者可据此了解其工作流支持方向。

  2. OpenAI News69

    OpenAI 推出 Agents API

    OpenAI 推出 Agents API,这是一项用于构建和启动云端智能体的托管服务。该服务由 Codex harness 提供支持,具备任务编排、长时运行会话以及工具调用能力。

    推荐理由:该接口将智能体编排、长时会话和工具调用封装为托管服务,便于开发者降低云端智能体的构建与维护成本。

9月9日周三
9月5日周六
  1. GitHub Blog · AI & ML74

    GitHub Copilot 推出 Project HydraFusion 多模型编排预览

    GitHub Copilot 推出 Project HydraFusion 研究预览版,通过在跨厂商多模型间进行运行时编排来优化编码任务。系统会根据任务能力信号在单模型直出、级联升级和模型间交叉审查三种执行模式中动态选择,以平衡质量、成本与延迟。

    推荐理由:原文给出了单模型、级联和交叉审查三套编排机制及评测对比,为工程团队降低高阶模型调用成本提供了可借鉴范式。

9月3日周四
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月2日周三
8月28日周五
  1. Google Research60

    Google 推出行星预测引擎 PPE:实现地理空间预测模型端到端自动化构建

    Google 推出实验性研究能力行星预测引擎(PPE),可通过自然语言输入端到端自主执行从数据检索、多模态特征工程到模型训练与评估的完整地理空间建模流程。该系统将传统需数周的人工数据工程缩短至数分钟,并在美国公共卫生指标、尼日利亚粮食安全降尺度以及刚果(金)埃博拉疫情预测等基准任务中均超过基线表现。

    推荐理由:原文给出了基于多模态大模型自主编排地理空间建模的完整架构,展现了将数周人工特征工程压缩至分钟级的可行路径。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月20日周四
  1. Mistral AI71

    Mistral 推出 Agentic Search 多步检索功能

    Mistral 推出检索层工具 Agentic Search,通过多步循环让模型在长文档与复杂数据中自主导航、查阅和验证信息。系统提供 search、open、navigate、read 和 grep 五项工具,现已集成至 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。

    推荐理由:原文对比了传统单次检索与带文件导航的多步检索循环,为长文档与复杂报表的架构选型提供了实测参考。

8月19日周三
8月14日周五
  1. Hugging Face Blog81

    Hugging Face 发布 2026 夏季开源模型生态报告

    Hugging Face 发布 2026 年夏季开源模型生态观察报告,指出中国团队在前沿模型参数规模上领跑,但实际工程部署仍以 1B 以下小模型为主。Qwen 已成为社区主流基座,衍生仓库超 15.1 万个,同时 llama.cpp 与 GGUF 加速了万亿参数模型的本地运行。

    推荐理由:原文通过平台下载与点赞数据揭示了模型热度与实际工程落地的脱节,展现了开源开发者生态的真实切片。

  2. Hugging Face Blog65

    Strands Agents、LeRobot 与 Hugging Face 存储桶打通机器人流式数据闭环

    AWS 的 Strands Robots 与 Hugging Face 联合展示了基于 LeRobot 格式与 Storage Buckets 的机器人流式数据闭环方案。开发者可通过单个智能体完成示教采集、基于 Xet 的字节级增量同步、无需下载本地文件的流式训练,并将策略直接部署回硬件。官方配套提供了端到端运行的 Jupyter Notebook 示例代码。

    推荐理由:文章演示了将具身智能演示采集、对象存储增量同步与流式训练打通的方法,便于机器人开发者降低本地存储和重复数据传输成本。

  3. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月13日周四
  1. Hugging Face Blog76

    Hugging Face 总结复现 ICML 2,200 篇论文的经验与发现

    Hugging Face 与 alphaXiv 联合举办 ICML 2026 开放复现挑战赛,1,221 名社区成员利用编码智能体复现了 2,226 篇论文。审计结果显示 51% 的论文至少有一项声明得到独立验证,23% 存在被推翻或具争议的声明,多篇论文的证明缺陷或代码偏差已获原作者确认并提交 arXiv 更正。

    推荐理由:原文展示了社区利用编码智能体大规模复现顶会论文的实测数据,呈现了智能体在学术审计中的潜力与人机协作边界。

8月12日周三
  1. Google Research74

    Google 推出 AMIE (Video) 实时视频临床问诊系统

    Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。

    推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。

8月11日周二
  1. Hugging Face Blog71

    NVIDIA 开源 Magpie 多语言 TTS 模型

    NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。

    推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。

8月10日周一
  1. Hugging Face Blog84

    Meta 发布开源多模态模型 Muse Glimmer

    Meta 发布了 30B 参数的开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议,专为端侧智能体用例与代码任务设计。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持基于 DFlash 的推测解码技术以提升生成速度;Hugging Face、transformers、llama.cpp 和 vLLM 已同步提供全面部署支持。

    推荐理由:该模型结合了轻量视觉编码与推测解码机制,为端侧多模态智能体部署与本地代码辅助提供了兼顾隐私与性能的参考方案。

8月4日周二
  1. Microsoft Research74

    微软研究院开源可扩展智能体框架 Orchard

    微软研究院开源了可扩展智能体框架 Orchard,其核心组件 Orchard Env 基于 Kubernetes 构建,提供可复用的隔离沙箱服务。框架支持直接在 Codex、OpenClaw 等真实部署 harness 中完成端到端强化学习与评估,并同步开源了 Orchard-SWE、Orchard-GUI 和 Orchard-Claw 三项训练方案与数据集。

    推荐理由:原文展示了如何通过可复用沙箱环境和真实 Harness 直接训练小参数模型并在代码及 GUI 任务中取得高成功率。

7月31日周五
  1. Microsoft Research70

    微软发布 Echoverse:面向计算机操作智能体的深度演进环境

    微软研究院提出 Echoverse,为计算机操作智能体构建十二个训练世界,包括十个深度领域环境和两个能力环境,分别针对日期选择器与嵌套筛选等单一控件。在全部十二个世界上训练的 9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4 的 80.7%。

    推荐理由:微软公布 Echoverse 十二个计算机操作智能体训练世界与数据库锚定评分机制,并开源其中四个世界及代码与任务。