跳到正文

#多模态

今日 11 条
7月9日周四
  1. Google Research70

    Google 提出 SensorFM:面向可穿戴健康数据的传感器基础模型

    Google Research 联合 Google DeepMind 推出可穿戴健康数据基础模型 SensorFM。该模型基于 500 万参与者超过 1 万亿分钟的未标注多模态传感器信号进行预训练,通过自适应掩码框架直接适应数据缺失,在心血管、代谢、睡眠和心理健康等 35 项任务中均展现出跨领域迁移能力。

    推荐理由:作者利用自监督掩码学习打通了多源可穿戴传感器数据,为稀缺医疗标注场景下的生理特征建模提供了通用方案。

7月8日周三
7月1日周三
6月23日周二
  1. Mistral AI71

    Mistral AI 发布 Mistral OCR 4

    Mistral AI 正式推出文档解析模型 Mistral OCR 4,支持输出文本边界框、文本块分类以及行布置信度分数。该模型覆盖 170 种语言,可在单个容器中自托管部署,并直接适配企业级搜索、RAG 和智能体工作流。

    推荐理由:原文给出了边界框和置信度分数的具体输出形态,有助于评估文档解析接入检索与智能体管线的改造成本。

6月13日周六
  1. Google Research26

    Google 研究:AI 如何帮助用户理解皮肤状况

    Google 分享其在皮肤健康领域的 AI 研究,一项发表于 JAMA Dermatology 的大规模研究显示,2345 名参与者使用 AI 工具时尝试命名皮肤状况的比例超 62%(对照组 41%),命名准确率 23%,接近未使用 AI 对照组(8%)的三倍;"Wizard of Oz"组准确率为 36%。但标准 AI 组在判断下一步就医建议上未显示出统计学显著改善。

6月9日周二
  1. Google DeepMind83

    Google DeepMind 发布统一无编码器多模态模型 Gemma 4 12B

    Google DeepMind 推出开源多模态模型 Gemma 4 12B,支持在配备 16GB 显存或统一内存的普通笔记本上本地运行多模态与智能体任务。该模型采用无编码器的统一架构,移除传统的独立视觉与音频编码器,将视觉和原始音频信号直接投影至大语言模型主干网络,性能接近其 26B MoE 模型。

    推荐理由:模型采用无编码器的统一架构直接处理视觉与音频输入,使笔记本端在 16GB 内存下也能本地运行多模态推理与智能体工作流。

5月27日周三
5月18日周一
  1. Google DeepMind82

    Google DeepMind 发布 Gemini Omni,首款模型 Gemini Omni Flash 上线

    Google DeepMind 发布 Gemini Omni 模型家族,主打从任意输入生成内容,首款模型 Gemini Omni Flash 率先支持视频。Omni 可组合图像、音频、视频和文本输入生成视频,并支持用自然语言多轮对话编辑视频,同时生成画面基于 Gemini 的世界知识,对重力、动能和流体动力学有更好的直观理解。

    推荐理由:Gemini Omni 把视频生成与多轮对话剪辑合到同一模型中,读者可了解其输入方式与首批上线渠道。

5月17日周日
  1. Google DeepMind67

    Google 扩展 SynthID 与 C2PA 验证工具,上线 AI 内容检测 API 并深化跨生态溯源

    Google 宣布在 Search、Gemini、Chrome、Pixel 及 Cloud 中扩展内容透明度与验证工具,深化 SynthID 水印和 C2PA 内容凭据的应用。

    推荐理由:Google 将 SynthID 与 C2PA 凭据贯通至搜索、浏览器及硬件,并向企业开放检测 API,为跨平台构建生成式内容防伪体系提供了系统化方案。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 系列并上线 3.5 Flash

    Google DeepMind 正式推出 Gemini 3.5 模型系列并上线首发版本 Gemini 3.5 Flash,主打长流程编码与复杂智能体任务执行。该模型在 MCP Atlas 达 83.6%、Terminal-Bench 2.1 达 76.2%,输出 token 速率达到其他前沿模型的 4 倍,系列旗舰 3.5 Pro 计划于下月推出。

    推荐理由:模型在兼顾生成速率的同时强化了编码与多步智能体执行能力,可作为评估长流程任务端到端自动化成本的重要参考。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 发布 AI co-clinician 医疗协作研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗。在 98 个真实初级保健问题的盲测中,该系统在其中 97 个案例未出现关键错误,医生对其回答的偏好也高于主流证据合成工具。

    推荐理由:Google DeepMind 披露 AI co-clinician 的评测设计与多模态问诊模拟结果,可了解医疗 AI 从文本走向实时音视频的路径。

4月23日周四
  1. Google Research72

    Google 推出 3D 感知图像重构技术,已在 Google Photos 自动构图中上线

    Google 推出一种结合三维场景理解与生成式 AI 的照片重构技术,并已在 Google Photos 的 Auto frame 功能中正式上线。该方案将图像处理解耦为 3D 场景与相机参数估计、潜在扩散模型修补两个阶段,能够在拍照后自动调整虚拟相机机位与焦距,并修复人像广角畸变。用户在编辑包含人物的照片时,可直接在构图候选项中选择重构视角的一键优化效果。

    推荐理由:该方案将单张照片解耦为三维场景估计与扩散模型修补两阶段,展示了借助空间感知调整成像视角并消除畸变的新思路。

4月13日周一
4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布开源模型 Gemma 4

    Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。

    推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。

3月29日周日
  1. Google DeepMind65

    Google DeepMind 重新构想 AI 时代的鼠标指针交互

    Google DeepMind 推出基于 Gemini 的 AI 鼠标指针原型,让指针能结合屏幕视觉与语义上下文直接理解用户意图。团队提出了保持工作流连贯、减少冗长提示词、支持指代交互以及将像素转化为可操作实体四项原则。目前该功能已在 Google AI Studio 开放实验体验,并逐步整合至 Chrome 浏览器与 Googlebook 笔记本。

    推荐理由:原文提出了结合视觉语义与光标位置的交互原则,为大模型如何摆脱独立对话框并融入日常系统界面提供了具体设计参考。

3月25日周三
  1. Google Research42

    S2Vec 如何学习现代城市的地理语言

    Google Research 推出自监督框架 S2Vec,通过将地理要素光栅化并结合掩码自编码(MAE)学习人造环境的通用嵌入向量。该方法利用 S2 Geometry 多分辨率网格表征建筑与道路等空间分布,无需人工标注即可捕捉区域特征。在全美人口密度与中位数收入等零样本跨区域预测基准中,S2Vec 表现优于 SATCLIP 等对比模型。

3月18日周三
  1. Google Research61

    Google Research 汇总 The Check Up 医疗 AI 进展:涵盖 MedGemma 与临床智能体 AMIE

    Google Research 在 The Check Up 活动上公布了一系列医疗健康 AI 突破,涵盖个人健康助手、临床辅助决策系统及开源开发者工具。团队展示了具备多模态推理能力的多智能体系统 AMIE 在临床问诊中的实测进展,并推广支持 3D 影像的开源医疗模型 MedGemma;同时公布了乳腺癌早筛研究以及用于识别癌症基因突变的研究工具 DeepSomatic。

    推荐理由:文章系统梳理了前沿医疗多模态模型与多智能体系统从实验室算法走向临床筛查、开发者生态和基因组学研究的落地链路。

3月17日周二
  1. Mistral AI73

    Mistral AI 与 NVIDIA 达成战略合作并加入 Nemotron 联盟

    Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron 联盟,双方将联合研发前沿开源 AI 模型。Mistral AI 贡献专有模型架构、多模态能力和微调工具,结合 NVIDIA 的算力与合成数据流水线,共同构建基于 NVIDIA DGX Cloud 训练的开源基础模型,为后续 NVIDIA Nemotron 4 系列提供支撑。

    推荐理由:原文披露了两家机构联合开发前沿开源模型的技术分工与路径,读者可借此评估算力与模型架构结合对开源生态的影响。

12月17日周三
  1. Mistral AI73

    Mistral AI 发布文档解析模型 Mistral OCR 3

    Mistral AI 正式推出文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格与手写体识别上相比前代取得 74% 综合胜率。该模型支持将文档解析为 Markdown 并保留富 HTML 表格结构,同时提取内嵌图像。

    推荐理由:新版本大幅强化了低质扫描件、手写笔记与多层合并单元格的表格还原能力,为知识库与智能体的数据预处理提供了低成本方案。

12月3日周三
  1. Mistral AI85

    Mistral AI 发布 Mistral 3 系列开源模型,涵盖 675B MoE 与端侧版本

    Mistral AI 正式推出下一代 Mistral 3 系列模型并全部采用 Apache 2.0 协议开源,涵盖旗舰混合专家模型与小尺寸端侧模型。旗舰 Mistral Large 3 采用 41B 激活与 675B 总参数的 MoE 架构,支持图像理解并提供 NVFP4 量化格式,可通过 vLLM 在单台 8×A100 或 8×H100 节点上运行。

    推荐理由:全系模型采用开源协议并提供端侧到超大规模 MoE 的梯度覆盖,配合量化格式显著降低了本地与私有化部署门槛。

8月1日周五
  1. Mistral AI47

    通过微调释放 Pixtral-12B 在卫星图像领域的潜力

    Mistral AI 展示了通过微调技术提升视觉语言模型 Pixtral-12B 在卫星图像分类上的表现。在包含 8,000 训练样本和 2,000 测试样本的 Aerial Image Dataset 基准测试中,微调有效解决了基础模型对细分类别的区分难题并减少了标签幻觉。开发者可通过 Mistral 微调 API 或 LaPlateforme UI 快速完成模型适配。

7月15日周二
  1. Mistral AI81

    Mistral AI 发布开源语音理解模型 Voxtral

    Mistral AI 发布开源语音理解模型系列 Voxtral,提供 24B 与 3B 两种尺寸,采用 Apache 2.0 协议在 Hugging Face 开源并同步上线 API。

    推荐理由:原文给出了 24B 与 3B 两种尺寸的开源权重与低成本 API,读者可以据此评估本地端侧部署与长语音智能体工作流的可行性。

5月7日周三
  1. Mistral AI76

    Mistral AI 发布 Mistral Medium 3 模型

    Mistral AI 正式推出企业级模型 Mistral Medium 3,主打前沿性能与高性价比。该模型在综合基准测试中达到 Claude Sonnet 3.7 90% 以上的表现,并在编码与理科任务中超越 Llama 4 Maverick,API 定价为每 1M token 输入 $0.4、输出 $2。

    推荐理由:原文对比了同代前沿模型的定价与基准表现,并给出了本地四卡及云端部署门槛,适合评估企业级替代方案的成本效益。

3月17日周一
3月7日周五
  1. Mistral AI78

    Mistral AI 发布文档理解模型 Mistral OCR 及 API

    Mistral AI 正式推出文档理解模型 Mistral OCR 及 API 服务 mistral-ocr-latest,支持图文穿插提取复杂排版、表格与数学公式。该模型已成为 Le Chat 的默认文档理解工具,单节点每分钟可处理多达 2000 页。API 标准定价为每美元 1000 页,支持提取结构化 JSON 用于构建智能体,并针对敏感数据场景开放私有化部署。

    推荐理由:该模型以图文穿插方式解析复杂版式并支持结构化输出,为构建处理复杂图表与公式的多模态检索工作流提供了高效工具。