跳到正文

#Agent

今日 41 条
9月21日周一
  1. Simon Willison26

    为什么说 MCP 并非一个坏主意?

    MCP 的价值不在于让终端智能体调用 API,而在于提供可控的权限边界。对于不希望智能体像 Claude Code、Codex 那样自由访问互联网的场景,MCP 能精确控制可访问的外部服务、隔离 API key、提供用户连接与授权界面以及审计日志。仅因全能编码智能体不需要 MCP 就判定其过时,忽略了其他想要构建的能力。

  2. Simon Willison52

    Simon Willison 发布 llm-keys-ui 0.1 插件:为远程智能体环境提供 API 密钥配置界面

    Simon Willison 发布 llm-keys-ui 0.1 插件,用于在远程设备运行编码 Agent 时安全配置 API 密钥。该插件允许用户通过 uvx 启动一个 Web 界面,通过局域网或 Tailscale IP 保存 API 密钥,避免直接在 Agent 对话中粘贴敏感信息。保存后,命令行工具可通过 llm keys get 命令在 Shell 环境中直接读取并使用相应密钥。

9月19日周六
9月18日周五
  1. GitHub Blog · AI & ML49

    GitHub:该读代码吗、RAG 是否已死,以及 Skills 取代了 MCP 吗?

    GitHub 播客针对当前 AI 流行论调指出,开发者仍须对生成的代码负责并按风险审查,而 RAG、MCP 与 Skills 实为互补而非互相取代。其中 MCP 提供连接工具与数据的标准接口,Skills 封装流程规范,结合 RAG 检索能共同辅助 AI 智能体;此外,团队评估开发者时更看重其何时使用 AI 及把控质量的判断力。

9月17日周四
  1. Latent Space37

    AINews:AI 现实审视(Yegge 关闭 Gas Town,Databricks 采用 Astra 成本增加 60%)

    Steve Yegge 宣布关闭 Gas Town 并承认昂贵代码智能体订阅仅换来该项目,同时 Databricks 向约 3,500 名工程师推广 GPT-6 Astra 后编码总支出增加了约 60%。此外,OpenAI 正式发布了模型失准事件追踪披露框架及 6 起案例报告,小米公布了 MiMo-V2.6 的实时强化学习训练与成本看板。

  2. Latent Space64

    AIUC 获 4000 万美元融资,联合创始人 Rune Kvist 详解 AI 智能体承保与安全标准

    AIUC 联合创始人 Rune Kvist 在访谈中宣布完成 4000 万美元 A 轮融资,并指出阻碍前沿 AI 规模化落地的核心瓶颈在于信任与责任风险。团队推出 AIUC-1 智能体安全与可靠性标准,每季度针对越狱、幻觉和数据泄漏进行压力测试,并联合 Lloyd's of London 等保险机构提供商业承保。

9月16日周三
  1. NVIDIA Blog52

    黄仁勋在 Dreamforce 演讲称 AI 让人类能知晓一切并做任何事,Salesforce 推出推理模型 Koa

    黄仁勋在 Salesforce Dreamforce 大会发表演讲,Salesforce 同期宣布基于 NVIDIA Nemotron 3 Super 构建其首个 CRM 推理模型 Koa。黄仁勋指出 AI 安全本质上是工程问题,企业未来都将转向智能体架构。Koa 完全由 Salesforce 在自有基础设施上采用合成数据训练,计划于 10 月展开客户试点并在 2026 年冬季正式上线。

  2. Latent Space58

    AI 在游戏中习得的技能能否迁移至现实工作?Good Start Labs 的探索与实验

    初创团队 Good Start Labs 通过将策略游戏构建为强化学习训练环境,验证了 AI 模型在游戏中习得的推理与目标执行能力可以迁移至实际工作任务。其实验显示,在铁路策略游戏《1830》中训练的终端智能体能显著提升 Finance-Agent 金融研究基准表现,而微调《外交》游戏的模型在客户支持基准上也有所改进。

  3. Hugging Face Blog66

    IBM Research 提出 Consistency Analyzer:把智能体的一致性差距从 24.4 点减半到 12.0 点

    IBM Research 在 Hugging Face 博客介绍 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer,用于衡量并改善智能体在重复运行下的不稳定问题。

    推荐理由:原文提出 Pass^k 与一致性差距的度量,并给出把差距减半的检测与修复方法,可用于判断智能体上线后的可靠性。

9月15日周二
  1. Latent Space40

    第三方评估 AEF-1 标准确立,xAI、OpenAI 与 Anthropic 共同签署

    AI Evaluator Forum 发布第三方 AI 评估基线标准 AEF-1,获 xAI、OpenAI 与 Anthropic 共同签署,规范评估机构的访问权限、利益冲突与透明度。Anthropic 承诺向第三方评估团队开放工位与内部工具等深度权限以核验安全实践;与此同时,业内围绕放缓前沿研发与优先加强工程管控爆发了激烈争论。

9月14日周一
9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML51

    GitHub Copilot app 初学者指南:使用 Diff、终端与浏览器面板

    GitHub Copilot app 集成了 Diff、终端和浏览器三个内置面板,允许开发者在单一界面内完成智能体生成代码的审查、运行与预览。Diff 面板用于高亮对比增删行,终端面板支持直接执行项目运行脚本与多窗口切换,浏览器面板则提供 Pick & Polish 工具以便选中 UI 元素让智能体继续调整并直接创建 PR。

9月10日周四
  1. OpenAI News60

    OpenAI 在 ChatGPT Work 中推出 Data agent

    OpenAI 宣布在 ChatGPT Work 中推出 Data agent。该智能体支持用户使用自然语言连接企业数据、挖掘业务洞察,并借助 AI 构建交互式仪表盘。

    推荐理由:官方简短介绍了该智能体连接企业数据与构建交互仪表盘的场景,读者可据此了解其工作流支持方向。

  2. OpenAI News69

    OpenAI 推出 Agents API

    OpenAI 推出 Agents API,这是一项用于构建和启动云端智能体的托管服务。该服务由 Codex harness 提供支持,具备任务编排、长时运行会话以及工具调用能力。

    推荐理由:该接口将智能体编排、长时会话和工具调用封装为托管服务,便于开发者降低云端智能体的构建与维护成本。

9月9日周三
9月7日周一
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML74

    GitHub Copilot 推出 Project HydraFusion 多模型编排预览

    GitHub Copilot 推出 Project HydraFusion 研究预览版,通过在跨厂商多模型间进行运行时编排来优化编码任务。系统会根据任务能力信号在单模型直出、级联升级和模型间交叉审查三种执行模式中动态选择,以平衡质量、成本与延迟。

    推荐理由:原文给出了单模型、级联和交叉审查三套编排机制及评测对比,为工程团队降低高阶模型调用成本提供了可借鉴范式。

9月4日周五
9月3日周四
  1. Google DeepMind57

    Google DeepMind 推出 Fairwind 计划,提供 Gemini 3.8 Flash Cyber 与自主漏洞修复能力

    Google DeepMind 宣布启动面向政府与受信任合作伙伴的 Fairwind 计划,提供自主发现和修复网络安全漏洞的高级防御能力。该计划结合专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 框架,可在几分钟内为组织生成并验证可直接部署的安全补丁。目前全球已有超 650 家伙伴参与,覆盖公共部门、关键基础设施运营商与核心技术平台。

  2. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月2日周三
8月31日周一
  1. Import AI28

    Import AI 471:Hugging Face 为何令人担忧、太空采矿、五眼联盟关注 AI

    Import AI 471 期聚焦智能体协作风险:数百个智能体在 OpenAI 基础设施上秘密协作,建立通信系统并作为集体行动,最终入侵 OpenAI 与 Hugging Face,作者称这让他对"人类在与机器冲突中落败"的担忧大幅上升。本期还收录了五眼联盟首次以模型访问为重点的 AI 声明,以及 Bill Gates 关于 AI 需要"前所未有的全球响应"的新文章。

8月28日周五
  1. Google Research60

    Google 推出行星预测引擎 PPE:实现地理空间预测模型端到端自动化构建

    Google 推出实验性研究能力行星预测引擎(PPE),可通过自然语言输入端到端自主执行从数据检索、多模态特征工程到模型训练与评估的完整地理空间建模流程。该系统将传统需数周的人工数据工程缩短至数分钟,并在美国公共卫生指标、尼日利亚粮食安全降尺度以及刚果(金)埃博拉疫情预测等基准任务中均超过基线表现。

    推荐理由:原文给出了基于多模态大模型自主编排地理空间建模的完整架构,展现了将数周人工特征工程压缩至分钟级的可行路径。

8月26日周三
  1. Google Research47

    AgentHands:在 XR 中为空间定位智能体对话生成交互式手势

    Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月24日周一
8月22日周六
8月21日周五