跳到正文

全部动态

今日 9 条
今天9月29日周二
  1. 量子位58

    匿名模型 Space Bunny 登顶调用双榜后的编码能力实测

    匿名模型 Space Bunny 在登顶 OpenRouter 与 OpenCode 调用日榜后,多项实测显示其在编码任务中兼具较快的生成速度与自主补全细节的能力。测试覆盖了 Three.js 交互式天坛构建、Mac 桌面应用编写以及代码审查等场景,模型在首轮交付后通常仅需一轮交互即可修复细节缺陷,多数任务的缓存命中率超过 95%。目前开发者群体整体评价偏向积极,其背后的具体归属厂商仍未公开。

  2. TechCrunch · AI79

    Anthropic 发布 Sonnet 5.5:速度提升 30%,主打高性价比与智能体编码能力

    Anthropic 正式推出中端模型 Sonnet 5.5,运行速度比前代提升 30% 且 token 消耗与调用成本显著降低。基准测试显示其在智能体编码任务上的表现优于 Opus 5.5,同时具备与 Opus 5 相当的网络安全能力并适配相同的安全防护标准。此外,Anthropic 计划在未来数周内发布轻量级模型 Haiku 的新版本。

    推荐理由:该版本在提升30%速度的同时控制了调用成本,在智能体编码基准上优于更高阶版本,为开发者提供了更均衡的模型选型参考。

  3. 爱范儿72

    神秘匿名模型 Space Bunny 实测:草图直接生成 3D 网页,分词特征指向 MiniMax

    爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。

  4. Latent Space75

    AINews:Opus 5.5 擅长生成讲解视频

    AINews 汇总 9/24/2026-9/25/2026 期间消息,指出 Opus 5.5 本周发布后社区反响积极,尤其在生成讲解视频上表现突出。Opus 5.5 以 88.4% 登顶 SimpleBench,被 @skalskip92 评为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%,但弱于 GPT-6 Astra。

  5. Simon Willison84

    Claude Sonnet 5.5 发布并开放至免费层

    Anthropic 发布 Claude Sonnet 5.5 模型,速度提升 30% 以上且多数任务成本降低最多 30%,并已作为 claude.ai 免费层默认模型。该模型在各项基准测试中超越 Sonnet 5,部分编程表现接近 Opus 5.5,但在极高思考力度配置下仍可能出现耗尽 128,000 tokens 的问题;此外官方确认 Haiku 5.5 将在未来几周上线。

    推荐理由:作者通过生成测试指出了高强度思考下的耗尽问题,并结合免费层下放评估了实用价值。

  6. AWS Machine Learning Blog71

    AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。

    推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。

9月28日周一
9月24日周四
9月23日周三
  1. Simon Willison88

    Claude Opus 5.5 与 GPT-6 Sol、Luna 实测体验及价格战分析

    Anthropic 与 OpenAI 分别发布 Claude Opus 5.5 和 GPT-6 Sol、Luna,以大幅降价引发新一轮前沿模型价格战。GPT-6 Luna 将输入价格降至每百万 token 0.10 美元,Opus 5.5 输入降价 20% 且缓存读取价格降低 60%。

    推荐理由:文章梳理了多款新模型的价格落点与降幅,并记录了深度思考模式在生成任务中耗尽上下文的实测表现。

  2. Ars Technica · AI71

    Anthropic Opus 5.5 与 OpenAI GPT-6 Sol、Luna 发布:能力小幅提升、成本大幅下降

    Anthropic 与 OpenAI 相继发布新模型,共同点是能力小幅提升、使用成本大幅下降。Anthropic 称相比 Opus 5,Opus 5.5 在默认设置下处理典型工作负载可节省接近 40% 成本,因为 token 单价下降且完成任务所用 token 更少;该模型在网络安全、生物学等高风险领域能力突出,相关请求可能被自动透明地路由到旧模型。

9月22日周二
9月21日周一
  1. Microsoft Research54

    微软在 Nature 发表小分子逆合成预测模型 RetroChimera 并开源

    微软在《Nature》发表小分子逆合成预测模型 RetroChimera 并开源代码与权重,通过学习重排序策略融合了 Transformer 生成式模型与图神经网络模板模型。在盲测中,化学专家对其单步反应预测的评价超过先前模型与文献记录反应,在 10 个高难度目标分子的多步合成测试中成功规划出 9 个。项目代码已按 MIT 协议托管于 GitHub,并接入 Microsoft Foundry。

9月16日周三
  1. Latent Space50

    TypeSafe 推出决策模型 Jev:专注分类与路由,速度比前沿小模型快超 100 倍、成本低超 200 倍

    TypeSafe 推出专用于决策、分类与路由的“系统一模型” Jev,放弃自由文本生成,比前沿小模型快 20–200 倍且成本降低 40–400 倍。该模型基于 RLCD 训练,具备并行采样与无模型幻觉特性,输出 token 免费。其定位为受约束的高效推理引擎,可在生产环境中替代传统 LLM 执行结构化分类、评分与策略路由。

  2. NVIDIA Blog52

    黄仁勋在 Dreamforce 演讲称 AI 让人类能知晓一切并做任何事,Salesforce 推出推理模型 Koa

    黄仁勋在 Salesforce Dreamforce 大会发表演讲,Salesforce 同期宣布基于 NVIDIA Nemotron 3 Super 构建其首个 CRM 推理模型 Koa。黄仁勋指出 AI 安全本质上是工程问题,企业未来都将转向智能体架构。Koa 完全由 Salesforce 在自有基础设施上采用合成数据训练,计划于 10 月展开客户试点并在 2026 年冬季正式上线。

9月10日周四
  1. OpenAI News75

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,并支持自定义声音以及电话协议集成。

    推荐理由:该模型在 API 中支持全双工语音交互与电话集成,为开发者构建实时语音应用提供了新的官方原生接口。

9月9日周三
  1. OpenAI News76

    OpenAI 发布企业级模型 GPT-6 Astra

    OpenAI 推出面向企业场景的模型 GPT-6 Astra,定位于其能力最强的工作智能模型。该模型具备更高级的推理能力与计算机操作功能,同时提升了写作和设计判断表现。

    推荐理由:原文列出面向企业场景的核心能力演进,读者可据此了解其在计算机操作与推理层面的定位。

9月8日周二
9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布全球气象 AI 模型 WeatherNext 3

    Google DeepMind 联合 Google Research 正式发布全球气象 AI 模型 WeatherNext 3,直接利用实时地球同步卫星拼接数据与地面气象站观测,实现每小时刷新并提供最高 5 公里空间分辨率的预报。

    推荐理由:该模型通过引入实时卫星数据实现每小时刷新与5公里空间分辨率,展示了AI气象预报在降水与清洁能源场景下的工程落地路径。

  2. Hugging Face Blog68

    开源原生多模态编码器 NeoMME 发布

    开源原生多模态与多语言编码器 NeoMME 正式发布,提供 260M 和 800M 两个尺寸版本。该模型摒弃了独立的预训练视觉 tower 与因果语言解码器,由单个双向 Transformer 统一处理文本 token 与图像 patch,在下游微调模型 NeoMME-Retriever 中单次前向即可同步输出稠密与后期交互嵌入。

    推荐理由:原生单塔双向架构摆脱了生成式视觉语言模型的冗余计算,配合向量压缩技术为文档级视觉检索提供了低成本部署方案。

  3. Google DeepMind79

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。

    推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。

9月1日周二
  1. Google Research65

    Google Research 推出 TimesFM-3:支持多元零样本预测的时序基础模型

    Google Research 推出 330M 参数的时序基础模型 TimesFM-3,原生支持零样本多元时序预测。该模型采用因果时间注意力与跨序列注意力交替架构,通过连续 Patch 掩码在单次前向传播中同时预测多个目标,并能结合历史与未来已知协变量输出 9 个分位数预测。目前 TimesFM-3 已在 GitHub 和 Hugging Face 开源上线,后续还将接入 BigQuery。

    推荐理由:该模型通过交替注意力与非自回归单次前向推理扩展至多元预测,为结合未来已知协变量的时序任务提供了开源基础模型参考。

8月28日周五
8月27日周四
  1. Google Research42

    GlucoFM:面向连续血糖监测的基础模型

    Google 提出面向连续血糖监测(CGM)的自监督基础模型 GlucoFM,采用分离慢速血糖趋势与短期波动的双流架构。该模型基于 109,066 小时无标签数据预训练,在 14 项临床预测评估中平均 PR-AUC 达 58.8,较同数据基准提升 4.1 点,并在两小时餐后血糖反应(PPGR)预测中取得最低平均绝对误差。

8月25日周二
  1. Hugging Face Blog73

    IBM Granite 4.2 推理大模型如何构建

    IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。

    推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。

8月21日周五
  1. Microsoft Research44

    微软研究院扩大 Skala 接入生态,加速迈向预测性 DFT

    微软研究院发布深度学习密度泛函 Skala 1.1 并扩大生态集成,目前已上线 CP2K,且正集成至 Psi4、FHI-aims、ORCA 和 VASP。该版本训练数据达前代 2.5 倍,以 meta-GGA 的计算成本在 GMTKN55 基准 55 个类别中斩获 32 项第一,加权平均误差为 2.8 kcal/mol。微软还同步推出了持续追踪计算性能的动态基准。

8月14日周五
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。

    推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。

8月12日周三
  1. Google DeepMind70

    Google DeepMind 推出手语转文本模型 SL2T

    Google DeepMind 推出多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中率先支持美式手语转英语输入。该模型使用覆盖 50 多种手语的超 100,000 小时数据联合训练,借助端侧 MediaPipe Holistic 提取身体姿态关键点坐标直接翻译为文本,在 FLEURS-ASL 基准测试中达到 70 BLEURT 分数。

    推荐理由:该模型将端侧姿态坐标提取与云端序列翻译结合并绕过中间标注,为视觉多模态语言落地提供了具体方案。