跳到正文

#Agent

今日 41 条
5月28日周四
  1. Mistral AI69

    Mistral AI 推出开源搜索框架 Search Toolkit

    Mistral AI 推出开源框架 Search Toolkit 公共预览版,用于为 AI 应用构建涵盖数据摄取、检索与评估的生产级搜索流水线。该框架支持 BM25、稠密向量及混合检索,内置 NDCG 与 MRR 等评估指标,可独立评测检索器性能。它还支持通过 MCP 连接外部系统,为 AI 智能体同时提供索引检索与实时数据拉取能力。

    推荐理由:该框架统一了数据摄取、检索与评估流程并支持 MCP 连接,可减少企业在 RAG 和智能体搜索链路中的集成成本。

5月26日周二
  1. Import AI61

    Anthropic 联合创始人 Jack Clark 论直面 AI 奇点与内部研发变革

    Anthropic 联合创始人 Jack Clark 在牛津大学演讲中指出,面对 AI 技术的持续加速,个人与社会应主动正视并探索奇点带来的深远重塑。他透露 Anthropic 内部在 Opus 4.6 发布后大部分代码已转由 Claude 生成,人类员工正在向监控与验证层迁移,单名研究员已能调遣 9 个合成智能体协同推进研究。

5月23日周六
  1. Mistral AI65

    Mistral AI 宣布收购物理 AI 初创公司 Emmi AI

    Mistral AI 宣布达成确定性协议收购奥地利物理 AI 公司 Emmi AI,以加速工程制造领域的 AI 转型并拓展科学研究路线。Emmi 联合创始人及 30 余名研究员与工程师将加入 Mistral 的科学与应用 AI 团队,双方计划结合物理建模与大模型能力,打造面向航空航天、汽车和半导体等工业场景的工程智能体与实时仿真平台。

    推荐理由:原文披露了基础模型厂商收购物理模拟团队的具体方向,展现了大模型切入工业工程与实时仿真领域的落地路径。

5月22日周五
  1. Mistral AI73

    Mistral AI 在 Studio 中上线 Connectors 功能,支持内置与自定义 MCP

    Mistral AI 宣布在 Studio 中推出 Connectors 公共预览版,支持开发者通过 API 和 SDK 接入内置连接器及基于 MCP 协议的自定义连接器,供所有模型与智能体调用。新功能引入了集中注册管理、免鉴权障碍的直接工具调用机制,以及支持人工在环审批的安全确认流程,避免在业务代码中重复实现集成与 OAuth 认证逻辑。

    推荐理由:原文给出了基于 MCP 封装集成、工具权限排除与人工审批机制的具体代码,可直接用于规范企业级智能体的工具调用体系。

5月18日周一
5月17日周日
  1. Google DeepMind64

    Google DeepMind 推出 Gemini for Science 系列科研实验工具

    Google DeepMind 推出科研工具集 Gemini for Science,在 Google Labs 开放假说生成、计算发现与文献洞察三款实验性原型,并在 Google Antigravity 中提供整合 30 多个生命科学数据库的 Science Skills。

    推荐理由:原文展示了多智能体辩论与并行代码生成如何介入科学假说与验证,读者可以据此了解通用智能体融入科研全流程的具体形态。

5月16日周六
  1. Google DeepMind64

    Google DeepMind 借助 Co-Scientist 发现抗肝纤维化的老药新用候选物

    斯坦福大学医学院与 Google DeepMind 合作,利用 Co-Scientist 智能体从现有药物文献中筛选治疗肝纤维化的老药新用候选物,相关研究发表于《Advanced Science》。

    推荐理由:研究展示了科学智能体在海量文献中挖掘老药新用候选物的实验命中表现,为生物医药研发提供了具体验证案例。

  2. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 系列并上线 3.5 Flash

    Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。

    推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 推出多智能体科研系统 Co-Scientist

    Google DeepMind 在《Nature》发表研究并推出基于 Gemini 的多智能体 AI 系统 Co-Scientist,旨在协助科研人员在生命科学等领域生成、论证与迭代科学假说。

    推荐理由:原文给出了多智能体通过辩论锦标赛演进科学假说的架构细节,对探索 AI 辅助基础科研的工作流设计提供了参考。

5月6日周三
  1. Google DeepMind64

    Google DeepMind 展示 AlphaEvolve 一年成果:从 DNA 测序到 TPU 设计

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果。它帮助 DeepConsensus 将变异检测错误降低 30%,把电网 AC Optimal Power Flow 的可行解比例从 14% 提升到 88%以上,并在量子模拟中给出误差低 10 倍的量子线路。

    推荐理由:一年来 AlphaEvolve 在基因测序、电网、TPU 与量子模拟等场景的落地数据,展示了编码智能体从演示走向基础设施的路径。

5月4日周一
4月30日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI co-clinician 医疗协作研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。

    推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。

4月27日周一
4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank:让智能体从成败经验中提炼推理记忆并自演进

    Google Research 推出智能体记忆框架 ReasoningBank,能够从成功与失败经历中提炼结构化的高阶推理模式,支持测试阶段的持续自演进。该方案通过闭环工作流提取防范性策略,并结合记忆感知测试时扩展(MaTTS)在并行或序列推理中强化策略质量。

    推荐理由:该研究系统性地从失败经验中提炼高层推理模式,为构建具备持续反思与测试时自演进能力的智能体提供了具体记忆架构参考。

4月21日周二
  1. Google DeepMind39

    Google DeepMind 携手行业领袖加速 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 达成合作,加速推动全球企业的智能体转型与前沿 AI 规模化落地。合作伙伴将获得 Gemini 等前沿模型的早期访问权,并与 DeepMind 技术团队合作开发金融、制造等行业解决方案。该合作旨在弥合目前仅 25% 组织实现 AI 规模化投产的应用鸿沟。

4月14日周二
  1. Google Research51

    Google 推出 Vantage 研究实验:利用生成式 AI 模拟协作并评估学生软技能

    Google 与纽约大学合作推出 Vantage 研究实验,利用生成式 AI 构建多方协作模拟环境,用于评估学生的批判性思维与协作等持久技能。系统由主管大模型(Executive LLM)在对话中动态施加冲突与挑战以激发技能展现,再由 AI 评估器对照评分量规生成可视化技能图谱与定性反馈。

4月9日周四
  1. Google Research43

    ConvApparel:衡量与弥合用户模拟器的真实度差距

    Google Research 推出人机对话数据集 ConvApparel,用于量化并弥合 LLM 用户模拟器与真实人类间的真实度差距。数据集涵盖服装购物场景超 4,000 场对话(近 15,000 轮),通过将用户分流至“优质”与故意制造障碍的“劣质”双智能体,记录逐轮的满意度与挫败感。团队还提出了结合统计对齐、拟人度评分和反事实验证的三维框架来评测模拟器。

4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。

    推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。

3月31日周二
  1. Mistral AI65

    Mistral AI 分享 Spaces CLI 设计实践:如何让命令行工具兼顾人类与智能体

    Mistral AI 总结了内部平台工具 Spaces CLI 的开发经验,提出了一套同时适配人类开发者与编码智能体的命令行设计原则。团队提出交互式输入均需提供对应的命令行参数与非交互模式默认值,通过 context.json 和 AGENTS.md 自动导出结构化上下文与执行规则,并消除工作目录等隐式状态依赖,使智能体能自主完成从脚手架创建到部署的全流程。

    推荐理由:文章总结了让命令行工具兼顾人类交互与智能体调用的五条工程规范,为开发者构建面向智能体的开发工具提供了可迁移的落地参考。

3月18日周三
  1. Google Research61

    Google Research 汇总 The Check Up 医疗 AI 进展:涵盖 MedGemma 与临床智能体 AMIE

    Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。

    推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。

  2. Mistral AI51

    Mistral AI 发布企业模型定制系统 Forge

    Mistral AI 发布企业模型构建系统 Forge,支持企业利用内部代码库、文档和运营记录等专有数据定制模型与智能体。该系统覆盖预训练、后训练和强化学习全流程,兼容稠密与 MoE 架构及多模态输入,并具备 Agent-first 设计支持智能体自动调优。目前 ASML、爱立信和欧洲空间局等机构已接入该系统在自身基础设施中构建领域专用模型。

3月17日周二
3月11日周三
  1. Mistral AI63

    Mistral 构建 Rails 自动化测试智能体实践:实现 RSpec 测试自主生成与修正

    Mistral AI 分享了基于开源编程助手 Vibe 构建 Rails 自动化测试智能体的实践,能在 CI/CD 中无需人工干预自主编写、校验与改进 RSpec 测试用例。

    推荐理由:文章详细展示了结合上下文规范与执行工具闭环让智能体自测自改的方法,为大型代码库落地自动化测试提供了可复用范式。

1月28日周三
  1. Mistral AI75

    Mistral AI 发布终端编码智能体 Mistral Vibe 2.0

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选意图澄清、斜杠命令技能以及统一智能体模式。该版本已上线 Le Chat Pro 和 Team 计划并支持自带 API key 或超额按量付费,Devstral 2 同步开放付费 API 访问。

    推荐理由:新版将子智能体编排与交互澄清引入终端开发流,为开发者提供了更具可控性的终端编程自动化实践。

12月9日周二
  1. Mistral AI82

    Mistral AI 发布代码模型家族 Devstral 2 与终端工具 Mistral Vibe CLI

    Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。

    推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。

10月24日周五
  1. Mistral AI56

    Mistral AI 推出企业级生产平台 Mistral AI Studio

    Mistral AI 推出企业级生产平台 Mistral AI Studio,旨在帮助企业打通从提示词开发到稳定生产的全流程闭环,目前已开放 Private Beta 申请。该平台包含可观测性与评测系统、基于 Temporal 构建的高容错 Agent Runtime 以及管理资产与权限的 AI Registry 三大模块,并支持混合云与私有化部署。

9月2日周二
  1. Mistral AI47

    Mistral Le Chat 推出 Memories 测试版:为 AI 助手打造可掌控的记忆系统

    Mistral 旗下 Le Chat 上线 Memories(beta),采用自动保存、智能且可见召回并附来源链接的混合式记忆方案。用户可随时关闭记忆、使用不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入以实现可移植和互操作。同时推出 Memory Insights,基于用户自有数据提供可编辑的提示。

7月30日周三
7月17日周四
  1. Mistral AI81

    Mistral AI 为 Le Chat 推出深度研究、语音模式与项目空间等多项功能

    Mistral AI 宣布为助手 Le Chat 推出一系列重大更新,包括提供结构化研究报告的 Deep Research 预览版,以及由新模型 Voxtral 驱动的低延迟语音模式。新版本还集成了推理模型 Magistral 以支持原生多语言深度思考,并增加用于归类管理对话与文件的 Projects 功能,同时携手 Black Forest Labs 支持直接通过提示词进行图像连续编辑。

    推荐理由:原文集中展示了深度研究、语音和推理模型等多项能力更新,读者可以了解该助手在工作流组织与多模态交互上的最新进展。

7月11日周五
6月4日周三
  1. Mistral AI60

    Mistral AI 推出企业级 AI 编码助手 Mistral Code

    Mistral AI 正式推出面向企业研发团队的 AI 编码助手 Mistral Code,已在 JetBrains 和 VSCode 开放内测。该产品基于开源项目 Continue 构建,由 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四款模型驱动,支持云端或本地隔离环境部署。

    推荐理由:产品采用单一厂商全栈交付模式并支持本地私有化部署,为受合规监管的企业提供了可自主微调的端到端编码方案。

5月27日周二
  1. Mistral AI76

    Mistral AI 推出 Agents API 支持内置连接器与多智能体编排

    Mistral AI 正式发布 Agents API,为企业级 AI 智能体开发提供包含持久记忆与多智能体编排能力的专用框架。该接口内置 Python 代码沙盒执行、FLUX1.1 [pro] Ultra 图像生成、文档库 RAG 和联网搜索连接器,并全面支持模型上下文协议(MCP)集成外部工具。系统还提供支持对话分支的有状态会话管理,以及跨智能体任务交接(handoffs)协作机制。

    推荐理由:原文展示了模型厂商将状态管理、代码沙盒与 MCP 协议封装为 API 的工程方案,读者可据此评估多智能体编排选型。

5月21日周三
  1. Mistral AI83

    Mistral AI 发布开源软件工程智能体模型 Devstral

    Mistral AI 联合 All Hands AI 发布专为软件工程设计的智能体模型 Devstral,采用 Apache 2.0 协议开源。该模型在 SWE-Bench Verified 基准上取得 46.8% 的成绩,可在单张 RTX 4090 或 32GB 内存的 Mac 上本地部署,同时已开放 API 接入,价格为每百万输入 tokens $0.1、输出 tokens $0.3。

    推荐理由:该模型以可单卡本地运行的轻量体积在代码评测中超过部分大参数开源基座,为本地智能体开发提供了开箱即用的开源选项。

5月7日周三
  1. Mistral AI63

    Mistral 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业 AI 助手,包含企业搜索、Agent 构建器、数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

    推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一订阅,可观察欧洲厂商做企业 AI 的路线选择。