跳到正文

#MCP/工具调用

今日 4 条
今天9月29日周二
  1. Hugging Face Blog50

    ProvenanceGuard:面向 MCP 智能体的溯源感知核查

    ProvenanceGuard 是针对 MCP 智能体推出的生成后事实核查层,专门解决事实正确但归因来源错误的“跨来源混淆”问题。该方案在无需重新训练模型的情况下,通过读取包含工具输出与来源 ID 的 MCP 轨迹,逐项核对声明与其归属来源是否匹配。在 361 项专家测试声明中,它成功拦截了 139 项违规声明中的 138 项,来源识别准确率达 86%。

  2. The Decoder80

    Manus 2.0 发布,支持视频剪辑、多人游戏与手机远程运行智能体

    Manus 发布 2.0 版本,把 AI 智能体扩展为平台,用户可编辑视频、托管多人游戏,并通过手机远程运行个人智能体。新的 Cascade 智能体框架在一种测试配置下比上一代系统少用 23.2% 的 token,运行成本降低 32%。

    推荐理由:Manus 2.0 把智能体扩展成平台,附带 Cascade 的 token 与成本对比数据可作效率参照。

  3. TechCrunch · AI71

    Shopify 向浏览器端 AI Agent 开放结账功能

    Shopify 宣布向基于浏览器的 AI Agent 开放结账支持,允许 Agent 在买家授权下直接完成 Shopify 商家网站的购物结算。该更新通过 WebMCP 引入了 get_checkout、update_checkout 和 complete_checkout 三个工具,支持读取结账页面、修改地址与配送选项并提交订单,无需依赖网页截图或爬虫。

9月28日周一
9月25日周五
9月24日周四
9月21日周一
  1. Simon Willison26

    为什么说 MCP 并非一个坏主意?

    MCP 的价值不在于让终端智能体调用 API,而在于提供可控的权限边界。对于不希望智能体像 Claude Code、Codex 那样自由访问互联网的场景,MCP 能精确控制可访问的外部服务、隔离 API key、提供用户连接与授权界面以及审计日志。仅因全能编码智能体不需要 MCP 就判定其过时,忽略了其他想要构建的能力。

9月18日周五
  1. GitHub Blog · AI & ML49

    GitHub:该读代码吗、RAG 是否已死,以及 Skills 取代了 MCP 吗?

    GitHub 播客针对当前 AI 流行论调指出,开发者仍须对生成的代码负责并按风险审查,而 RAG、MCP 与 Skills 实为互补而非互相取代。其中 MCP 提供连接工具与数据的标准接口,Skills 封装流程规范,结合 RAG 检索能共同辅助 AI 智能体;此外,团队评估开发者时更看重其何时使用 AI 及把控质量的判断力。

9月16日周三
  1. Latent Space50

    TypeSafe 推出决策模型 Jev:专注分类与路由,速度比前沿小模型快超 100 倍、成本低超 200 倍

    TypeSafe 推出专用于决策、分类与路由的“系统一模型” Jev,放弃自由文本生成,比前沿小模型快 20–200 倍且成本降低 40–400 倍。该模型基于 RLCD 训练,具备并行采样与无模型幻觉特性,输出 token 免费。其定位为受约束的高效推理引擎,可在生产环境中替代传统 LLM 执行结构化分类、评分与策略路由。

9月11日周五
9月10日周四
  1. Hugging Face Blog74

    用 Gradio Workflow 重构 AUTOMATIC1111

    Hugging Face 演示了基于 Gradio Workflow 搭建的 Workflow1111 项目,通过 73 个节点和 11 条流水线重构了 AUTOMATIC1111 的主要功能。

    推荐理由:原文详细拆解了用节点图组合多模态模型与本地函数的架构,读者可据此参考如何将复杂应用封装为标准接口与智能体工具。

7月9日周四
  1. Mistral AI54

    Mistral Studio 上线提示词与技能集中管理系统

    Mistral AI 宣布在 Mistral Studio 中为提示词和技能上线集中记录系统,将其作为具备不可变版本、明确归属权和审计日志的生产资产统一管理。业务人员与开发者无需等待代码流水线即可直接编辑与即时测试,并能结合标签与 CI/CD 流程规范化发布。智能体运行的技能支持直接作为 MCP 服务器调用,并结合可观测性追踪实现生产输出与资产版本的端到端溯源。

6月25日周四
  1. Google DeepMind70

    Gemini 3.5 Flash 内置 computer use 工具

    Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动端和桌面环境中感知、推理并执行操作的智能体。

    推荐理由:Original text explains the capability and API access methods for integrating computer use into the main Gemini Flash model, allowing readers to assess how to build cross-platform automation agents.

6月24日周三
  1. Mistral AI60

    Mistral AI 推出 Connectors 权限管控与调试功能

    Mistral AI 宣布为 Connectors 推出一系列企业级安全管控功能,支持按工作区与组织细分访问权限、按具体工具单独启闭,并提供带作用域的 API 密钥以防身份冒用。

    推荐理由:原文详细给出了工作区细粒度鉴权、多账号绑定与 MCP 报错排查的具体机制,企业用户可据此评估自动化智能体接入内部数据的治理方案。

5月28日周四
  1. Mistral AI69

    Mistral AI 推出开源搜索框架 Search Toolkit

    Mistral AI 推出开源框架 Search Toolkit 公共预览版,用于为 AI 应用构建涵盖数据摄取、检索与评估的生产级搜索流水线。该框架支持 BM25、稠密向量及混合检索,内置 NDCG 与 MRR 等评估指标,可独立评测检索器性能。它还支持通过 MCP 连接外部系统,为 AI 智能体同时提供索引检索与实时数据拉取能力。

    推荐理由:该框架统一了数据摄取、检索与评估流程并支持 MCP 连接,可减少企业在 RAG 和智能体搜索链路中的集成成本。

5月22日周五
  1. Mistral AI73

    Mistral AI 在 Studio 中上线 Connectors 功能,支持内置与自定义 MCP

    Mistral AI 宣布在 Studio 中推出 Connectors 公共预览版,支持开发者通过 API 和 SDK 接入内置连接器及基于 MCP 协议的自定义连接器,供所有模型与智能体调用。新功能引入了集中注册管理、免鉴权障碍的直接工具调用机制,以及支持人工在环审批的安全确认流程,避免在业务代码中重复实现集成与 OAuth 认证逻辑。

    推荐理由:原文给出了基于 MCP 封装集成、工具权限排除与人工审批机制的具体代码,可直接用于规范企业级智能体的工具调用体系。

3月17日周二
9月2日周二
5月27日周二
  1. Mistral AI76

    Mistral AI 推出 Agents API 支持内置连接器与多智能体编排

    Mistral AI 正式发布 Agents API,为企业级 AI 智能体开发提供包含持久记忆与多智能体编排能力的专用框架。该接口内置 Python 代码沙盒执行、FLUX1.1 [pro] Ultra 图像生成、文档库 RAG 和联网搜索连接器,并全面支持模型上下文协议(MCP)集成外部工具。系统还提供支持对话分支的有状态会话管理,以及跨智能体任务交接(handoffs)协作机制。

    推荐理由:原文展示了模型厂商将状态管理、代码沙盒与 MCP 协议封装为 API 的工程方案,读者可据此评估多智能体编排选型。

5月7日周三
  1. Mistral AI63

    Mistral 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业 AI 助手,包含企业搜索、Agent 构建器、数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

    推荐理由:Mistral 把企业搜索、Agent 构建与混合部署打包进同一订阅,可观察欧洲厂商做企业 AI 的路线选择。

3月4日周二