Google DeepMind 发布 Gemini 3.7 Flash
Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。
推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。
Google DeepMind 正式推出面向编程与 AI 智能体的工作流模型 Gemini 3.7 Flash,在软件工程、知识处理和 Web 开发上均有提升。
推荐理由:原文给出了编程和复杂工作流的实测基准数据与首发半价方案,读者可以据此评估在生产环境中替换现有轻量模型的性价比。
Google DeepMind 推出多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中率先支持美式手语转英语输入。该模型使用覆盖 50 多种手语的超 100,000 小时数据联合训练,借助端侧 MediaPipe Holistic 提取身体姿态关键点坐标直接翻译为文本,在 FLEURS-ASL 基准测试中达到 70 BLEURT 分数。
推荐理由:该模型将端侧姿态坐标提取与云端序列翻译结合并绕过中间标注,为视觉多模态语言落地提供了具体方案。
NVIDIA 开源 364M 参数的多语言语音合成模型 Magpie TTS,支持英语、中文、韩语、现代标准阿拉伯语等 12 种语言并开放权重。模型采用帧堆叠与局部 Transformer 架构降低解码步数,在 B200 GPU 单流运行下首音频延迟为 32ms,64 并发下吞吐达 320 倍实时。
推荐理由:模型通过开源权重与帧堆叠架构将单流首音频延迟压缩至最低 32 毫秒,为自建低延迟多语言语音智能体提供了完整可控的落地参考栈。
Meta 发布了 30B 参数的开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议,专为端侧智能体用例与代码任务设计。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持基于 DFlash 的推测解码技术以提升生成速度;Hugging Face、transformers、llama.cpp 和 vLLM 已同步提供全面部署支持。
推荐理由:该模型结合了轻量视觉编码与推测解码机制,为端侧多模态智能体部署与本地代码辅助提供了兼顾隐私与性能的参考方案。
Google DeepMind 联合多家气象机构在《Nature》发表研究并开源 WeatherNext 系列模型,在热带气旋路径、强度及风场结构预测上平均获得额外 24 小时的精度提前量。
推荐理由:该成果证明大尺度低分辨率输入结合生成网络同样能精准预测极端气旋,为极端气象预警提供了开源且低计算门槛的方案。
Mistral AI 开源发布 3B 参数的多模态安全分类模型 Shieldstral,采用 Apache 2.0 协议。该模型将内容审核重构为自然语言问答任务,支持在推理时动态传入安全策略以统一评估文本与图像,无需针对新分类标准重新训练。模型可在单张 16GB GPU 上运行,单次前向传播即可输出校准的安全置信度分数,性能比肩或超过 7 倍于其体积的基准模型。
推荐理由:它将内容审核抽象为问答任务,支持在推理时直接用自然语言定义策略,为低成本构建自定义多模态防护栏提供了实用方案。
Google DeepMind 正式推出具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑提供连续视频理解、多步任务编排与多机协作能力。
推荐理由:该模型将高层推理规划与底层动作执行解耦,并通过连续视频流追踪任务进度,展示了具身智能分层编排与落地的具体路径。
Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。
推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。
Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。
推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。
NVIDIA 推出面向手术机器人的实时动作驱动生成式模拟器 Cosmos-H-Dreams,支持在单张 GPU 上实现闭环交互控制。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步扩散学生模型,配合 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 fps 的生成速度。
推荐理由:该系统将手术世界模型蒸馏为少步因果架构并结合流式推理,在单张工作站显卡上实现了百帧级交互与闭环控制。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber 模型,重点提升智能体工作流的 token 效率与执行速度。
推荐理由:模型通过减少输出 token 消耗和推理步骤降低智能体运行成本,为开发者部署高吞吐工作流提供了兼顾速度与精度的选型参考。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,将由 CodeMender 通过限定访问试点向政府和可信合作伙伴提供。
推荐理由:官方给出轻量安全模型在多个漏洞基准上的对比与限政府合作伙伴的试点安排,可了解攻防两侧能力变化。
专攻巴西葡萄牙语的 OCR 模型 DharmaOCR 在葡语基准测试中取得 0.925 分,大幅超越更新的 Mistral OCR4(0.798)与 Unlimited-OCR(0.7587)。该模型先通过监督微调将全部参数专门对齐巴西葡语的词汇与文档结构,再结合 DPO 抑制重复与不连贯输出,从而在复杂文档提取中实现了更高的稳定性和更低的退化率。
Thinking Machines Lab 在 Hugging Face 上线开源全模态模型 Inkling 及小尺寸版本 Inkling-Small,原生支持文本、图像和音频输入并具备 1M 上下文窗口。
推荐理由:该模型给出了万亿参数原生全模态与长上下文的开源落地范式,读者可据此参考其混合注意力架构与量化部署成本。
Mistral AI 推出首个专用于具身导航的 8B 模型 Robostral Navigate,仅依赖单颗普通 RGB 摄像头即可根据自然语言指令引导机器人在复杂环境中自主移动。
推荐理由:该模型展示了仅凭单颗普通 RGB 摄像头在仿真数据与在线强化学习训练下实现高精度具身导航的可行路径。
Mistral AI 正式发布开源形式化验证模型 Leanstral 1.5,采用 Apache-2.0 协议,拥有 119B 总参数与 6B 激活参数。模型在 miniF2F 评测中达到 100% 满分, PutnamBench 成功解出 587/672 题且单题成本约 4 美元,同时在 FATE-H 与 FATE-X 上刷新纪录。
推荐理由:模型在极低推理成本下展现出长链形式化验证能力,适合关注自动定理证明与代码严格验证的工程团队参考。
Google DeepMind 推出图像生成模型 Nano Banana 2 Lite 与视频生成编辑模型 Gemini Omni Flash,现已上线 Google AI Studio 与 Gemini API。
推荐理由:官方给出了高吞吐图像模型与多模态视频模型的延迟和定价,为构建轻量端到端多媒体流水线提供了参考。
Google Research 推出面向表格数据分类与回归的零样本基础模型 TabFM,无需手动训练、特征工程或超参数调优即可在单次前向传播中完成预测。模型融合行列交替注意力与行压缩机制,完全基于结构因果模型生成的数亿个合成数据集预训练。目前该模型已在 GitHub 与 Hugging Face 开源,并原生接入 Google Cloud BigQuery 支持直接通过 SQL 调用。
推荐理由:该模型将上下文学习范式引入表格数据分析,读者可以了解如何省去传统树模型繁琐的特征工程与调优流程。
Mistral AI 正式推出文档解析模型 Mistral OCR 4,支持输出文本边界框、文本块分类以及行布置信度分数。该模型覆盖 170 种语言,可在单个容器中自托管部署,并直接适配企业级搜索、RAG 和智能体工作流。
推荐理由:原文给出了边界框和置信度分数的具体输出形态,有助于评估文档解析接入检索与智能体管线的改造成本。
Google DeepMind 推出实验性开源模型 DiffusionGemma,采用文本扩散机制替代传统的自回归逐字生成,在专用 GPU 上的文本生成速度最高提升至 4 倍。
推荐理由:该模型通过文本扩散架构将自回归逐字解码转为并行块生成,读者可以据此了解其在本地低延迟交互与代码补全场景下的性能取舍。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时流式语音互译,并在生成中保留原发言者的语调、节奏和音高。
推荐理由:材料展示了流式语音互译的技术落地路径,读者可以参考其在跨语种会议与移动端传译中的产品集成方式。
Google DeepMind 推出开源多模态模型 Gemma 4 12B,支持在配备 16GB 显存或统一内存的普通笔记本上本地运行多模态与智能体任务。该模型采用无编码器的统一架构,移除传统的独立视觉与音频编码器,将视觉和原始音频信号直接投影至大语言模型主干网络,性能接近其 26B MoE 模型。
推荐理由:模型采用无编码器的统一架构直接处理视觉与音频输入,使笔记本端在 16GB 内存下也能本地运行多模态推理与智能体工作流。
Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,让各国气象与水文机构能基于与 Google Flood Hub 相同架构和相近训练数据训练 AI 洪水预报模型。
Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。
推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。
Google DeepMind 详细阐述了 AI 气象模型 WeatherNext 如何协助美国国家飓风中心提前 5 天预测飓风梅丽莎增强至 5 级并在牙买加登陆。该模型结合数十年全球气象模式与极端热带气旋专属数据集训练,克服了传统模型难以兼顾路径与强度的限制,可同时推演 50 种集合预测情景以辅助预警决策。
推荐理由:原文给出了 AI 气象模型兼顾路径与强度预测的实战数据,读者可以据此评估 AI 预报极端天气事件的可用性。
Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。
推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。
Google DeepMind 正式推出文本转语音模型 Gemini 3.1 Flash TTS,支持通过自然语言音频标签精确控制语音风格、节奏和表达,并原生支持多说话人对话与 70 多种语言。
推荐理由:该模型通过自然语言行内标签实现对语调和语速的精细调度,为构建多角色对话系统提供了更具成本效益的语音方案。
Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解以及任务完成判定能力。
推荐理由:该模型增强了空间指向、多视角任务完成判定与工业仪表读取能力,有助于开发者为实体机器人构建高阶环境理解与决策系统。
Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。
推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。
Mistral AI 正式发布多语言文本转语音模型 Voxtral TTS,采用基于 Ministral 3B 的流匹配架构,总参数量为 4B,支持英语、法语、阿拉伯语等 9 种语言的情感化语音生成。
推荐理由:原文披露了基于自研编解码器与流匹配的架构细节及延迟数据,读者可据此评估端到端语音智能体的落地成本。
Mistral AI 正式发布开源模型 Mistral Small 4,基于 Apache 2.0 协议将推理、多模态与代码 Agent 能力统一到单一架构中。
推荐理由:该模型将多模态、代码与深度推理整合到单套 MoE 架构中,支持按需调节推理强度以平衡吞吐与精度。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码代理,激活参数 6B,权重以 Apache 2.0 许可开放,同时提供 Mistral Vibe 中的 agent 模式和免费 API 端点。
Mistral AI 正式发布 Voxtral Transcribe 2 语音转写模型家族,包含用于批量转写的 Voxtral Mini Transcribe V2 和开源权重的实时流式模型 Voxtral Realtime。
推荐理由:提供了流式架构和开源权重,开发者能以更低延迟和端侧部署成本搭建实时语音智能体。
Mistral AI 正式推出文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格与手写体识别上相比前代取得 74% 综合胜率。该模型支持将文档解析为 Markdown 并保留富 HTML 表格结构,同时提取内嵌图像。
推荐理由:新版本大幅强化了低质扫描件、手写笔记与多层合并单元格的表格还原能力,为知识库与智能体的数据预处理提供了低成本方案。
Mistral AI 推出新一代代码模型家族 Devstral 2 及配套终端开源智能体工具 Mistral Vibe CLI。该系列包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,均支持 256K 上下文窗口,在 SWE-bench Verified 上分别取得 72.2% 与 68.0% 的成绩。
推荐理由:Mistral 发布了针对代码智能体的开源模型家族并配套终端 CLI,适合关注低成本本地化代码自动化部署的开发者。
Mistral AI 正式推出下一代 Mistral 3 系列模型并全部采用 Apache 2.0 协议开源,涵盖旗舰混合专家模型与小尺寸端侧模型。旗舰 Mistral Large 3 采用 41B 激活与 675B 总参数的 MoE 架构,支持图像理解并提供 NVFP4 量化格式,可通过 vLLM 在单台 8×A100 或 8×H100 节点上运行。
推荐理由:全系模型采用开源协议并提供端侧到超大规模 MoE 的梯度覆盖,配合量化格式显著降低了本地与私有化部署门槛。
Mistral AI 发布开源语音理解模型系列 Voxtral,提供 24B 与 3B 两种尺寸,采用 Apache 2.0 协议在 Hugging Face 开源并同步上线 API。
推荐理由:原文给出了 24B 与 3B 两种尺寸的开源权重与低成本 API,读者可以据此评估本地端侧部署与长语音智能体工作流的可行性。
Mistral AI 联合 All Hands AI 发布编程模型 Devstral Medium 并升级推出 Devstral Small 1.1,专注提升 Agent 编程能力。
推荐理由:开源的 24B 版本采用宽松协议,商用版在基准测试中取得 61.6% 的成绩,为软件开发智能体提供了兼顾本地部署与性价比的新选择。
Mistral AI 正式推出旗下首个推理模型 Magistral,提供开源的 24B 参数 Magistral Small 与企业级 Magistral Medium 两个版本。
推荐理由:原文给出了两款推理模型的评测成绩与开源协议,读者可以据此评估其在多语言复杂推理场景下的部署可行性。
Mistral AI 推出首个代码专用嵌入向量模型 Codestral Embed,主要面向代码检索与代码语义理解场景。该模型在 API 上的代号为 codestral-embed-2505,价格为 $0.15 per M tokens,Batch API 提供 50% 折扣,支持 8192 tokens 上下文窗口。
推荐理由:该模型支持按相关性截断维度与量化压缩,开发者可据此在代码检索与代码智能体场景中平衡存储开销与召回质量。