跳到正文

#Agent

今日 6 条
今天9月29日周二
  1. TechCrunch · AI79

    Anthropic 发布 Sonnet 5.5:速度提升 30%,主打高性价比与智能体编码能力

    Anthropic 正式推出中端模型 Sonnet 5.5,运行速度比前代提升 30% 且 token 消耗与调用成本显著降低。基准测试显示其在智能体编码任务上的表现优于 Opus 5.5,同时具备与 Opus 5 相当的网络安全能力并适配相同的安全防护标准。此外,Anthropic 计划在未来数周内发布轻量级模型 Haiku 的新版本。

    推荐理由:该版本在提升30%速度的同时控制了调用成本,在智能体编码基准上优于更高阶版本,为开发者提供了更均衡的模型选型参考。

  2. 爱范儿72

    神秘匿名模型 Space Bunny 实测:草图直接生成 3D 网页,分词特征指向 MiniMax

    爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。

  3. Latent Space75

    AINews:Opus 5.5 擅长生成讲解视频

    AINews 汇总 9/24/2026-9/25/2026 期间消息,指出 Opus 5.5 本周发布后社区反响积极,尤其在生成讲解视频上表现突出。Opus 5.5 以 88.4% 登顶 SimpleBench,被 @skalskip92 评为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%,但弱于 GPT-6 Astra。

  4. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

9月28日周一
9月23日周三
9月22日周二
9月16日周三
  1. NVIDIA Blog52

    黄仁勋在 Dreamforce 演讲称 AI 让人类能知晓一切并做任何事,Salesforce 推出推理模型 Koa

    黄仁勋在 Salesforce Dreamforce 大会发表演讲,Salesforce 同期宣布基于 NVIDIA Nemotron 3 Super 构建其首个 CRM 推理模型 Koa。黄仁勋指出 AI 安全本质上是工程问题,企业未来都将转向智能体架构。Koa 完全由 Salesforce 在自有基础设施上采用合成数据训练,计划于 10 月展开客户试点并在 2026 年冬季正式上线。

9月3日周四
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月11日周二
  1. Hugging Face Blog71

    NVIDIA 开源 Magpie 多语言 TTS 模型

    NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。

    推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。

8月10日周一
  1. Hugging Face Blog84

    Meta 发布开源多模态模型 Muse Glimmer

    Meta 发布了 30B 参数的开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议,专为端侧智能体用例与代码任务设计。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持基于 DFlash 的推测解码技术以提升生成速度;Hugging Face、transformers、llama.cpp 和 vLLM 已同步提供全面部署支持。

    推荐理由:该模型结合了轻量视觉编码与推测解码机制,为端侧多模态智能体部署与本地代码辅助提供了兼顾隐私与性能的参考方案。

7月21日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber 模型,重点提升智能体工作流的 token 效率与执行速度。

    推荐理由:模型通过减少输出 token 消耗和推理步骤降低智能体运行成本,为开发者部署高吞吐工作流提供了兼顾速度与精度的选型参考。

7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布轻量网络安全模型 Gemini 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,将由 CodeMender 通过限定访问试点向政府和可信合作伙伴提供。

    推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比与限政府合作伙伴的试点安排,可了解攻防两侧能力变化。

6月23日周二
  1. Mistral AI71

    Mistral AI 发布 Mistral OCR 4

    Mistral AI 正式推出文档解析模型 Mistral OCR 4,支持输出文本边界框、文本块分类以及行布置信度分数。该模型覆盖 170 种语言,可在单个容器中自托管部署,并直接适配企业级搜索、RAG 和智能体工作流。

    推荐理由:原文给出了边界框和置信度分数的具体输出形态,有助于评估文档解析接入检索与智能体管线的改造成本。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 系列并上线 3.5 Flash

    Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。

    推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。

4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。

    推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。

3月17日周二
12月9日周二
  1. Mistral AI82

    Mistral AI 发布代码模型家族 Devstral 2 与终端工具 Mistral Vibe CLI

    Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。

    推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。

7月11日周五
5月21日周三
  1. Mistral AI83

    Mistral AI 发布开源软件工程智能体模型 Devstral

    Mistral AI 联合 All Hands AI 发布专为软件工程设计的智能体模型 Devstral,采用 Apache 2.0 协议开源。该模型在 SWE-Bench Verified 基准上取得 46.8% 的成绩,可在单张 RTX 4090 或 32GB 内存的 Mac 上本地部署,同时已开放 API 接入,价格为每百万输入 tokens $0.1、输出 tokens $0.3。

    推荐理由:该模型以可单卡本地运行的轻量体积在代码评测中超过部分大参数开源基座,为本地智能体开发提供了开箱即用的开源选项。