AWS 上线 Claude Sonnet 5.5,主打低成本编码与知识工作
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。
推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更快、更高效、多数任务单次成本更低的 Sonnet 模型,适合有明确范围的编码与知识工作。
推荐理由:文章给出了 Sonnet 5.5 在 Bedrock 上的可用入口、成本与适用任务划分,读者可据此判断何时选 Sonnet、何时留给 Opus 5.5。
Hcompany 正式发布 Holo4 系列计算机使用智能体模型,推出 27B 密集型和 35B-A3B 混合专家两种规格,并同步更新轻量版 Holotron4 Nano。
推荐理由:该模型统一了图形界面、代码沙箱与 MCP 接口的交互路径,为低成本构建跨软件工作流提供了开源轻量方案。
Liquid AI 推出投机解码草稿模型 LFM2.5-VL-DSpark,专为 3B 视觉语言模型 LFM2.5-VL-3B 设计,仅增加约 280M 参数(8.9%)。
Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,分别面向深度创意导演与大规模高性价比配音场景。
推荐理由:原文给出了两款语音模型的具体定位与提示词控制机制,读者可以据此评估长音频生成和双人剧本对话的落地精度与成本。
OpenAI 推出 GPT-6 Sol 与 Luna 两款新模型,旨在将前沿智能引入日常工作。两款模型在能力和成本之间分别提供了不同的平衡选择。
Google DeepMind 正式推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 实时对话模型,主打近实时推理与语音智能体任务执行能力。
推荐理由:官方展示了实时多步推理与边思考边交谈的交互机制,为语音智能体的落地架构提供了参考范式。
NVIDIA 在 AI Infra Summit 公布 Vera Rubin 与 DSX 平台的系列进展,覆盖 Vera Rubin NVL72 系统、Dynamo 推理软件、NVLink 6、DSX MaxLPS 与 DSX Flex。
推荐理由:文中给出多组厂商实测数字与软硬件协同路径,可据此判断 AI 工厂按每兆瓦 token 计价的工程方向。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型具备更强的指令遵循能力,并支持自定义声音以及电话协议集成。
推荐理由:该模型在 API 中支持全双工语音交互与电话集成,为开发者构建实时语音应用提供了新的官方原生接口。
OpenAI 推出面向企业场景的模型 GPT-6 Astra,定位于其能力最强的工作智能模型。该模型具备更高级的推理能力与计算机操作功能,同时提升了写作和设计判断表现。
推荐理由:原文列出面向企业场景的核心能力演进,读者可据此了解其在计算机操作与推理层面的定位。
OpenAI 推出 ChatGPT Images 2.5。新版本支持将用户的想法、草图和参考照片转化为更具个性化、更精致且更能体现原意的图像。
Google DeepMind 联合 Google Research 正式发布全球气象 AI 模型 WeatherNext 3,直接利用实时地球同步卫星拼接数据与地面气象站观测,实现每小时刷新并提供最高 5 公里空间分辨率的预报。
推荐理由:该模型通过引入实时卫星数据实现每小时刷新与5公里空间分辨率,展示了AI气象预报在降水与清洁能源场景下的工程落地路径。
开源原生多模态与多语言编码器 NeoMME 正式发布,提供 260M 和 800M 两个尺寸版本。该模型摒弃了独立的预训练视觉 tower 与因果语言解码器,由单个双向 Transformer 统一处理文本 token 与图像 patch,在下游微调模型 NeoMME-Retriever 中单次前向即可同步输出稠密与后期交互嵌入。
推荐理由:原生单塔双向架构摆脱了生成式视觉语言模型的冗余计算,配合向量压缩技术为文档级视觉检索提供了低成本部署方案。
Google DeepMind 正式推出 Gemini 3.8 Flash 及专注于网络安全防御的 Gemini 3.8 Flash Cyber,在保持与 3.7 Flash 相同速度和低成本的同时强化了推理与编码能力。
推荐理由:新模型在保持原有推理成本和低延迟的基础上,显著强化了长程编码智能体能力并推出了防御型安全版本。
Google Research 推出 330M 参数的时序基础模型 TimesFM-3,原生支持零样本多元时序预测。该模型采用因果时间注意力与跨序列注意力交替架构,通过连续 Patch 掩码在单次前向传播中同时预测多个目标,并能结合历史与未来已知协变量输出 9 个分位数预测。目前 TimesFM-3 已在 GitHub 和 Hugging Face 开源上线,后续还将接入 BigQuery。
推荐理由:该模型通过交替注意力与非自回归单次前向推理扩展至多元预测,为结合未来已知协变量的时序任务提供了开源基础模型参考。
微软研究院联合华盛顿大学与 Providence 开源轻量级病理基座模型 GigaPath-Flash 与 GigaTIME-Flash,模型权重已按 Apache 2.0 协议发布至 Hugging Face。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 与 Google AI Studio 为开发者提供更精细的生成式视频控制能力。
推荐理由:新版本引入了基于上下文的场景扩展与首尾帧控制,展示了开发者在长视频叙事与分辨率超分中的具体调用方式。
Google 提出面向连续血糖监测(CGM)的自监督基础模型 GlucoFM,采用分离慢速血糖趋势与短期波动的双流架构。该模型基于 109,066 小时无标签数据预训练,在 14 项临床预测评估中平均 PR-AUC 达 58.8,较同数据基准提升 4.1 点,并在两小时餐后血糖反应(PPGR)预测中取得最低平均绝对误差。
Google DeepMind 推出语音转文本模型 Gemini 3.5 Transcribe,支持将原始音频直接转换为格式规范的文本,并能自动处理口语自纠错和过滤语气词。
推荐理由:该模型强化了口语自纠错与多语种实体识别能力,为构建低延迟实时语音交互应用提供了更精确的转录基底。
IBM Granite 团队开源了首个 Dense 架构推理大模型家族 Granite 4.2,涵盖 3B、8B 和 30B 三种尺寸并采用 Apache 2.0 协议。
推荐理由:文章详细拆解了从五阶段预训练到多阶段异步 GRPO 强化学习的完整流程,为开源智能体与推理模型的端到端训练提供了具体工程参考。
开源发布了面向 LFM2.5 系列(包含 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B)的 DSpark 推测解码草稿模型。
微软研究院发布深度学习密度泛函 Skala 1.1 并扩大生态集成,目前已上线 CP2K,且正集成至 Psi4、FHI-aims、ORCA 和 VASP。该版本训练数据达前代 2.5 倍,以 meta-GGA 的计算成本在 GMTKN55 基准 55 个类别中斩获 32 项第一,加权平均误差为 2.8 kcal/mol。微软还同步推出了持续追踪计算性能的动态基准。
Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。
推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。
Google DeepMind 推出多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中率先支持美式手语转英语输入。该模型使用覆盖 50 多种手语的超 100,000 小时数据联合训练,借助端侧 MediaPipe Holistic 提取身体姿态关键点坐标直接翻译为文本,在 FLEURS-ASL 基准测试中达到 70 BLEURT 分数。
推荐理由:该模型将端侧姿态坐标提取与云端序列翻译结合并绕过中间标注,为视觉多模态语言落地提供了具体方案。
NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。
推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。
Meta 发布了 30B 参数的开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议,专为端侧智能体用例与代码任务设计。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持基于 DFlash 的推测解码技术以提升生成速度;Hugging Face、transformers、llama.cpp 和 vLLM 已同步提供全面部署支持。
推荐理由:该模型结合了轻量视觉编码与推测解码机制,为端侧多模态智能体部署与本地代码辅助提供了兼顾隐私与性能的参考方案。
Google DeepMind 联合多家气象机构在《Nature》发表研究并开源 WeatherNext 系列模型,在热带气旋路径、强度及风场结构预测上平均获得额外 24 小时的精度提前量。
推荐理由:该成果证明大尺度低分辨率输入结合生成网络同样能精准预测极端气旋,为极端气象预警提供了开源且低计算门槛的方案。
Mistral AI 开源发布 3B 参数的多模态安全分类模型 Shieldstral,采用 Apache 2.0 协议。该模型将内容审核重构为自然语言问答任务,支持在推理时动态传入安全策略以统一评估文本与图像,无需针对新分类标准重新训练。模型可在单张 16GB GPU 上运行,单次前向传播即可输出校准的安全置信度分数,性能比肩或超过 7 倍于其体积的基准模型。
推荐理由:它将内容审核抽象为问答任务,支持在推理时直接用自然语言定义策略,为低成本构建自定义多模态防护栏提供了实用方案。
Google DeepMind 正式推出具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑提供连续视频理解、多步任务编排与多机协作能力。
推荐理由:该模型将高层推理规划与底层动作执行解耦,并通过连续视频流追踪任务进度,展示了具身智能分层编排与落地的具体路径。
Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。
推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。
Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。
推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。
NVIDIA 推出面向手术机器人的实时动作驱动生成式模拟器 Cosmos-H-Dreams,支持在单张 GPU 上实现闭环交互控制。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步扩散学生模型,配合 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 fps 的生成速度。
推荐理由:该系统将手术世界模型蒸馏为少步因果架构并结合流式推理,在单张工作站显卡上实现了百帧级交互与闭环控制。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber 模型,重点提升智能体工作流的 token 效率与执行速度。
推荐理由:模型通过减少输出 token 消耗和推理步骤降低智能体运行成本,为开发者部署高吞吐工作流提供了兼顾速度与精度的选型参考。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,将由 CodeMender 通过限定访问试点向政府和可信合作伙伴提供。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比与限政府合作伙伴的试点安排,可了解攻防两侧能力变化。
Thinking Machines Lab 在 Hugging Face 上线开源全模态模型 Inkling 及小尺寸版本 Inkling-Small,原生支持文本、图像和音频输入并具备 1M 上下文窗口。
推荐理由:该模型给出了万亿参数原生全模态与长上下文的开源落地范式,读者可据此参考其混合注意力架构与量化部署成本。
Mistral AI 推出首个专用于具身导航的 8B 模型 Robostral Navigate,仅依赖单颗普通 RGB 摄像头即可根据自然语言指令引导机器人在复杂环境中自主移动。
推荐理由:该模型展示了仅凭单颗普通 RGB 摄像头在仿真数据与在线强化学习训练下实现高精度具身导航的可行路径。
Mistral AI 正式发布开源形式化验证模型 Leanstral 1.5,采用 Apache-2.0 协议,拥有 119B 总参数与 6B 激活参数。模型在 miniF2F 评测中达到 100% 满分, PutnamBench 成功解出 587/672 题且单题成本约 4 美元,同时在 FATE-H 与 FATE-X 上刷新纪录。
推荐理由:模型在极低推理成本下展现出长链形式化验证能力,适合关注自动定理证明与代码严格验证的工程团队参考。
Google DeepMind 推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash,现已上线 Google AI Studio 与 Gemini API。
推荐理由:官方给出了高吞吐图像模型与多模态视频模型的延迟和定价,为构建轻量端到端多媒体流水线提供了参考。
Google Research 推出面向表格数据分类与回归的零样本基础模型 TabFM,无需手动训练、特征工程或超参数调优即可在单次前向传播中完成预测。模型融合行列交替注意力与行压缩机制,完全基于结构因果模型生成的数亿个合成数据集预训练。目前该模型已在 GitHub 与 Hugging Face 开源,并原生接入 Google Cloud BigQuery 支持直接通过 SQL 调用。
推荐理由:该模型将上下文学习范式引入表格数据分析,读者可以了解如何省去传统树模型繁琐的特征工程与调优流程。
Mistral AI 正式推出文档解析模型 Mistral OCR 4,支持输出文本边界框、文本块分类以及行布置信度分数。该模型覆盖 170 种语言,可在单个容器中自托管部署,并直接适配企业级搜索、RAG 和智能体工作流。
推荐理由:原文给出了边界框和置信度分数的具体输出形态,有助于评估文档解析接入检索与智能体管线的改造成本。
Google DeepMind 推出实验性开源模型 DiffusionGemma,采用文本扩散机制替代传统的自回归逐字生成,在专用 GPU 上的文本生成速度最高提升至 4 倍。
推荐理由:该模型通过文本扩散架构将自回归逐字解码转为并行块生成,读者可以据此了解其在本地低延迟交互与代码补全场景下的性能取舍。