跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 1–20 条 · 共 60 条
今天9月29日周二
  1. TechCrunch · AI79

    Anthropic 发布 Sonnet 5.5:速度提升 30%,主打高性价比与智能体编码能力

    Anthropic 正式推出中端模型 Sonnet 5.5,运行速度比前代提升 30% 且 token 消耗与调用成本显著降低。基准测试显示其在智能体编码任务上的表现优于 Opus 5.5,同时具备与 Opus 5 相当的网络安全能力并适配相同的安全防护标准。此外,Anthropic 计划在未来数周内发布轻量级模型 Haiku 的新版本。

    推荐理由:该版本在提升30%速度的同时控制了调用成本,在智能体编码基准上优于更高阶版本,为开发者提供了更均衡的模型选型参考。

  2. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

  3. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

9月28日周一
9月23日周三
9月16日周三
9月10日周四
  1. OpenAI News75

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,并支持自定义声音以及电话协议集成。

    推荐理由:该模型在 API 中支持全双工语音交互与电话集成,为开发者构建实时语音应用提供了新的官方原生接口。

9月9日周三
  1. OpenAI News76

    OpenAI 发布企业级模型 GPT-6 Astra

    OpenAI 推出面向企业场景的模型 GPT-6 Astra,定位于其能力最强的工作智能模型。该模型具备更高级的推理能力与计算机操作功能,同时提升了写作和设计判断表现。

    推荐理由:原文列出面向企业场景的核心能力演进,读者可据此了解其在计算机操作与推理层面的定位。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布全球气象 AI 模型 WeatherNext 3

    Google DeepMind 联合 Google Research 正式发布全球气象 AI 模型 WeatherNext 3,直接利用实时地球同步卫星拼接数据与地面气象站观测,实现每小时刷新并提供最高 5 公里空间分辨率的预报。

    推荐理由:该模型通过引入实时卫星数据实现每小时刷新与5公里空间分辨率,展示了AI气象预报在降水与清洁能源场景下的工程落地路径。

  2. Hugging Face Blog68

    开源原生多模态编码器 NeoMME 发布

    开源原生多模态与多语言编码器 NeoMME 正式发布,提供 260M 和 800M 两个尺寸版本。该模型摒弃了独立的预训练视觉 tower 与因果语言解码器,由单个双向 Transformer 统一处理文本 token 与图像 patch,在下游微调模型 NeoMME-Retriever 中单次前向即可同步输出稠密与后期交互嵌入。

    推荐理由:原生单塔双向架构摆脱了生成式视觉语言模型的冗余计算,配合向量压缩技术为文档级视觉检索提供了低成本部署方案。

  3. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月1日周二
  1. Google Research65

    Google Research 推出 TimesFM-3:支持多元零样本预测的时序基础模型

    Google Research 推出 330M 参数的时序基础模型 TimesFM-3,原生支持零样本多元时序预测。该模型采用因果时间注意力与跨序列注意力交替架构,通过连续 Patch 掩码在单次前向传播中同时预测多个目标,并能结合历史与未来已知协变量输出 9 个分位数预测。目前 TimesFM-3 已在 GitHub 和 Hugging Face 开源上线,后续还将接入 BigQuery。

    推荐理由:该模型通过交替注意力与非自回归单次前向推理扩展至多元预测,为结合未来已知协变量的时序任务提供了开源基础模型参考。

8月28日周五
8月27日周四
8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。