跳到正文
9月29日 · 周二

最新精选

今天9月29日周二
  1. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    最新进展9月29日 02:57Claude Sonnet 5.5 上线 AWS Bedrock

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

9月28日周一
  1. Hugging Face Blog74

    Hcompany 发布 Holo4 系列智能体模型,支持跨界面计算机操作

    Hcompany 正式发布 Holo4 系列计算机使用智能体模型,推出 27B 密集型和 35B-A3B 混合专家两种规格,并同步更新轻量版 Holotron4 Nano。

    推荐理由:该模型统一了图形界面、代码沙箱与 MCP 接口的交互路径,为低成本构建跨软件工作流提供了开源轻量方案。

9月23日周三
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,分别面向深度创意导演与大规模高性价比配音场景。

    推荐理由:原文给出了两款语音模型的具体定位与提示词控制机制,读者可以据此评估长音频生成和双人剧本对话的落地精度与成本。

  2. Latent Space83

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 Luna

    Anthropic 正式发布 Claude 5.5 系列首款模型 Claude Opus 5.5,声称具备 Claude Fable 5.1 水准的性能,且运行成本比 Opus 5 降低 40%。

    推荐理由:原文汇总了新模型的基准表现与实际调用成本拆解,有助于评估日常编码与长任务中的真实开销。

  3. Simon Willison88

    Claude Opus 5.5 与 GPT-6 Sol、Luna 实测体验及价格战分析

    Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。

    推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。

  4. OpenAI News73

    OpenAI 推出 GPT-6 Sol 与 Luna 模型

    OpenAI 推出 GPT-6 Sol 与 Luna 两款新模型,旨在将前沿智能引入日常工作。两款模型在能力和成本之间分别提供了不同的平衡选择。

  5. AWS Machine Learning Blog72

    Claude Opus 5.5 上线 Amazon Bedrock 与 Claude Platform on AWS

    Anthropic 的 Claude 5.5 系列首个模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上可用,定位为面向智能体编码、知识工作和长时任务的最强 Opus 模型。

    推荐理由:AWS 官方给出 Claude Opus 5.5 在 Bedrock 上的能力变化与接入代码,可据此评估迁移与成本。

9月16日周三
9月10日周四
  1. OpenAI News75

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,并支持自定义声音以及电话协议集成。

    推荐理由:该模型在 API 中支持全双工语音交互与电话集成,为开发者构建实时语音应用提供了新的官方原生接口。

9月9日周三
  1. OpenAI News76

    OpenAI 发布企业级模型 GPT-6 Astra

    OpenAI 推出面向企业场景的模型 GPT-6 Astra,定位于其能力最强的工作智能模型。该模型具备更高级的推理能力与计算机操作功能,同时提升了写作和设计判断表现。

    推荐理由:原文列出面向企业场景的核心能力演进,读者可据此了解其在计算机操作与推理层面的定位。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布全球气象 AI 模型 WeatherNext 3

    Google DeepMind 联合 Google Research 正式发布全球气象 AI 模型 WeatherNext 3,直接利用实时地球同步卫星拼接数据与地面气象站观测,实现每小时刷新并提供最高 5 公里空间分辨率的预报。

    推荐理由:该模型通过引入实时卫星数据实现每小时刷新与5公里空间分辨率,展示了AI气象预报在降水与清洁能源场景下的工程落地路径。

  2. Hugging Face Blog68

    开源原生多模态编码器 NeoMME 发布

    开源原生多模态与多语言编码器 NeoMME 正式发布,提供 260M 和 800M 两个尺寸版本。该模型摒弃了独立的预训练视觉 tower 与因果语言解码器,由单个双向 Transformer 统一处理文本 token 与图像 patch,在下游微调模型 NeoMME-Retriever 中单次前向即可同步输出稠密与后期交互嵌入。

    推荐理由:原生单塔双向架构摆脱了生成式视觉语言模型的冗余计算,配合向量压缩技术为文档级视觉检索提供了低成本部署方案。

  3. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月1日周二
  1. Google Research65

    Google Research 推出 TimesFM-3:支持多元零样本预测的时序基础模型

    Google Research 推出 330M 参数的时序基础模型 TimesFM-3,原生支持零样本多元时序预测。该模型采用因果时间注意力与跨序列注意力交替架构,通过连续 Patch 掩码在单次前向传播中同时预测多个目标,并能结合历史与未来已知协变量输出 9 个分位数预测。目前 TimesFM-3 已在 GitHub 和 Hugging Face 开源上线,后续还将接入 BigQuery。

    推荐理由:该模型通过交替注意力与非自回归单次前向推理扩展至多元预测,为结合未来已知协变量的时序任务提供了开源基础模型参考。

8月28日周五
8月27日周四
  1. Google DeepMind75

    Google DeepMind 推出语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出语音转文本模型 Gemini 3.5 Transcribe,支持将原始音频直接转换为格式规范的文本,并能自动处理口语自纠错和过滤语气词。

    推荐理由:该模型强化了口语自纠错与多语种实体识别能力,为构建低延迟实时语音交互应用提供了更精确的转录基底。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月12日周三
  1. Google DeepMind70

    Google DeepMind 推出手语转文本模型 SL2T

    Google DeepMind 推出多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中率先支持美式手语转英语输入。该模型使用覆盖 50 多种手语的超 100,000 小时数据联合训练,借助端侧 MediaPipe Holistic 提取身体姿态关键点坐标直接翻译为文本,在 FLEURS-ASL 基准测试中达到 70 BLEURT 分数。

    推荐理由:该模型将端侧姿态坐标提取与云端序列翻译结合并绕过中间标注,为视觉多模态语言落地提供了具体方案。

8月11日周二
  1. Hugging Face Blog71

    NVIDIA 开源 Magpie 多语言 TTS 模型

    NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。

    推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。