微软研究院发布生物学 AI 研究系统 Quine
微软研究院推出面向复杂生物学研究的 AI 系统 Quine,由生物多模态世界模型与交互式实验调度框架组成。在与 Broad 研究所合作的胰腺癌研究中,系统在一个周末内预测并筛选出能诱导肿瘤细胞状态转换的候选化合物,并在湿实验中完成验证。微软同步启动了 Quine Fellows 访问计划,并计划未来通过 Microsoft Discovery 等产品逐步扩大访问权限。
微软研究院推出面向复杂生物学研究的 AI 系统 Quine,由生物多模态世界模型与交互式实验调度框架组成。在与 Broad 研究所合作的胰腺癌研究中,系统在一个周末内预测并筛选出能诱导肿瘤细胞状态转换的候选化合物,并在湿实验中完成验证。微软同步启动了 Quine Fellows 访问计划,并计划未来通过 Microsoft Discovery 等产品逐步扩大访问权限。
前雅虎 CEO Marissa Mayer 展示了个人 AI 助手 Dazzle,该产品曾于去年 12 月完成 800 万美元种子轮融资。不同于依赖邮件和日历的同类工具,Dazzle 完全通过分析手机相册建立上下文,以此推断用户的兴趣爱好与出行偏好。用户可通过 App 或短信交互,用于识别传单提取日程等即时任务,或获取个性化度假与活动建议。
豆包输入法正式补齐 HarmonyOS NEXT 与 Windows 版本,实现 iOS、Android、HarmonyOS NEXT、macOS 与 Windows 五大平台覆盖。
匿名模型 Space Bunny 在登顶 OpenRouter 与 OpenCode 调用日榜后,多项实测显示其在编码任务中兼具较快的生成速度与自主补全细节的能力。测试覆盖了 Three.js 交互式天坛构建、Mac 桌面应用编写以及代码审查等场景,模型在首轮交付后通常仅需一轮交互即可修复细节缺陷,多数任务的缓存命中率超过 95%。目前开发者群体整体评价偏向积极,其背后的具体归属厂商仍未公开。
爱范儿实测了近期在海外走红的神秘匿名模型 Space Bunny Alpha,该模型能够根据简单手绘草图快速生成可交互的 3D 网页与小游戏。测试显示其在多模态理解和 Agent 编程中响应迅速且原型可用度高,但在复杂运动和极端精细度上仍与旗舰模型存在差距,高推理档位下存在耗时较长的问题。此外,分词特征与开源代码线索均显示该模型可能与 MiniMax 存在关联。
AMD 宣布已签署最终协议,将以约 82 亿美元全股票方式收购李飞飞创立的空间智能初创公司 World Labs,交易预计在 2026 年底前完成。收购完成后李飞飞将出任 AMD 执行副总裁兼首席科学家,其团队将继续研发 Atlas 等三维场景生成与机器人仿真技术。双方计划以此深化模型工作负载与芯片硬件的端到端协同,布局物理 AI 计算生态。
推荐理由:芯片厂商直接将空间智能前沿研究团队纳入体系,展示了软硬件深度协同争夺物理AI工作负载的商业路径。
消费级具身智能公司诺因智能近日完成由京东相关基金领投的数亿元天使+++轮融资,成立一年累计融资超10亿元。本轮资金将重点用于扩充训练数据、推进KNOWIN-X1机器人量产准备及高端人才引进。旗下GLOW生成式具身大模型支持单次操作示范学习,在RoboDojo评测中取得62.2%的平均成功率。
一目科技推出视光学超薄仿生触觉传感器 SENTRA T0,厚度已迭代至 3 毫米以下,是可量产的仿生视触觉传感器。该光触觉方案利用光芯片检测柔性材质形变,在指尖面积布置了 24 万个点,力感知精度达到约 5mN。一目科技旨在通过数字化手感补齐具身智能的触觉数据短板,解决机器人抓握打滑与复杂装配难题。
爱范儿对即将上线的新一代视频生成模型 Kling 4.0 进行了首发实测,该版本重点强化了复杂运镜稳定性与叙事可控性。模型原生支持最长 30 秒生成与 21:9 画幅,提供 10-bit HDR 规格输出以适配专业调色流程,并支持 9 种语言的口型与多声道音频同步。
AMD 宣布以 82 亿美元全股票收购李飞飞创立的空间智能公司 World Labs,交易预计 2026 年底前完成。交割后李飞飞将出任 AMD 执行副总裁兼首席科学家,联合创始人 Justin Johnson 与 Ben Mildenhall 带领团队并入组建前沿 AI 研究组织。
推荐理由:AMD借全股票收购吸纳空间智能研发团队,旨在让芯片设计直接对接物理模拟与三维生成等新型算力负载。
AWS 发布教程指导开发者利用 vLLM-Omni v1.5 深度学习容器(DLC),在 Amazon SageMaker AI 上部署 Qwen3-TTS 模型。该方案基于 HTTP/2 全双工 WebSocket 建立持久双向连接,实现输入文本流与 24 kHz PCM 音频块流的实时互传。部署还支持配置 ml.g6.xlarge 等机型的实例池,并提供配套 Gradio 交互示例。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型做多模态 RL 后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
美国国防部在预算申请中提出未来 5 年内投入 3030 万美元开发名为 Polygraph+ 的新型测谎仪。该项目由国防反情报与安全局负责,计划结合人工智能、机器学习评分算法和非接触式生理传感技术,用于新员工审查及内部威胁排查。法律与欺骗行为研究专家指出,谎言缺乏普适生理特征与明确标注真值,引入 AI 很难解决传统测谎仪主观性强和误报率高的问题。
Runway 在 GWM Worlds 2 研究预览中引入 WorldPrompt 控制机制,其核心团队受访详解了将离线视频模型改造为实时交互式运行时的技术架构。
Google Research 提出多智能体视频协导框架及系列研究,通过在 Gemini 与 Veo 之上构建编排层,实现多镜头叙事长视频的自动化与视觉连贯性生成。
推荐理由:研究将长视频生成解耦为多智能体规划、视觉记忆与闭环评测,为多镜头叙事中的角色与场景连贯性提供了可参考的系统化方案。
Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,为原生实时对话模型提供低延迟的流式视频虚拟形象。该功能支持自然表情和精准唇形同步,可在 97 种语言间无缝切换,并支持在保持对话流畅的同时于后台异步调用工具执行复杂任务。输出内容均默认嵌入 SynthID 水印防伪,即日起在 Gemini Enterprise 开放可用。
推荐理由:原文展示了流式视频形象与后台异步工具调用的结合,读者可以据此评估实时数字人在企业端交互场景中的落地可行性。
Liquid AI 推出投机解码草稿模型 LFM2.5-VL-DSpark,专为 3B 视觉语言模型 LFM2.5-VL-3B 设计,仅增加约 280M 参数(8.9%)。
AWS 提出基于智能体架构的对话式视频智能方案,通过 Strands Agents SDK 编排 Amazon Bedrock、Amazon Rekognition 与 Amazon Transcribe,支持用自然语言直接查询视频内容。
Google DeepMind 推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,分别面向深度创意导演与大规模高性价比配音场景。
推荐理由:原文给出了两款语音模型的具体定位与提示词控制机制,读者可以据此评估长音频生成和双人剧本对话的落地精度与成本。
在新加坡 AI 日上,NVIDIA 与合作伙伴展示了东南亚基于 Nemotron 等模型的 AI 落地成果。新加坡 HTX 采用 Nemotron 3 Super 与 Nemotron 3 Nano Omni 推进公共安全研究,泰国 iApp 基于 Nemotron 3 Nano 开源了 OpenThai 2.0 Legal。
小米推出 MiMo-V2.6 系列原生全模态模型,其中总参数量 1.02T、激活参数 42B 的 MiMo-V2.6-Pro 登顶 Artificial Analysis 开源权重评测榜。
开源原生多模态与多语言编码器 NeoMME 正式发布,提供 260M 和 800M 两个尺寸版本。该模型摒弃了独立的预训练视觉 tower 与因果语言解码器,由单个双向 Transformer 统一处理文本 token 与图像 patch,在下游微调模型 NeoMME-Retriever 中单次前向即可同步输出稠密与后期交互嵌入。
推荐理由:原生单塔双向架构摆脱了生成式视觉语言模型的冗余计算,配合向量压缩技术为文档级视觉检索提供了低成本部署方案。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic 视频理解,官方称可将视频分析的 token 消耗最多降低 88%、成本最多降低 66%,准确率最多提升 7%。
推荐理由:Google DeepMind 公布 agentic 视频理解在长视频上的 token 与成本变化,并给出 API 开启方式。
Google 推出实验性研究能力行星预测引擎(PPE),可通过自然语言输入端到端自主执行从数据检索、多模态特征工程到模型训练与评估的完整地理空间建模流程。该系统将传统需数周的人工数据工程缩短至数分钟,并在美国公共卫生指标、尼日利亚粮食安全降尺度以及刚果(金)埃博拉疫情预测等基准任务中均超过基线表现。
推荐理由:原文给出了基于多模态大模型自主编排地理空间建模的完整架构,展现了将数周人工特征工程压缩至分钟级的可行路径。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 与 Google AI Studio 为开发者提供更精细的生成式视频控制能力。
推荐理由:新版本引入了基于上下文的场景扩展与首尾帧控制,展示了开发者在长视频叙事与分辨率超分中的具体调用方式。
Google Research 推出研究原型 AgentHands,通过将大语言模型推理映射为 3D 物理动作,为 XR 环境中的 AI 智能体生成与语音同步的交互手势。系统结合轻量级物体注册、手势事件库与本地解析器,利用词级时间戳让虚拟手在空间中精准执行指示与动作模拟。该方案在兰花养护和 3D 打印机操作等场景中显著提升了空间交互指导的直观性。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,可直接加载 PyLate、Stanford-NLP ColBERT 检查点以及 colpali-engine 的视觉文档检索模型,API 与已有的 dense、sparse、reranker 模型一致。
推荐理由:原文给出多向量检索的完整用法与召回代价对比,读者可据此判断何时该用晚交互模型替代单向量嵌入。
OlmoEarth Studio 推出开源 OlmoEarth 基础模型的嵌入向量导出功能,支持生成 COG 格式的地球观测特征表示。用户可通过 UI 或 API 自定义区域,并选配 Nano(1.4M)、Tiny(6.2M)或 Base(89M 参数)编码器及 10 至 80 米分辨率。生成的 int8 向量可直接用于相似度检索与少样本分割等下游任务,相关源码与模型权重均已公开发布。
新评测基准 MindTopo 评估了多模态模型在连通性、包围、顺序、分离及打结等维度的拓扑推理与规划能力。评测显示,现有开源与闭源模型在静态图像识别上的表现普遍明显优于交互式规划任务,但整体均远低于人类水平。模型在多步规划中往往会丢失结构关系或违反物理动态约束,难以随场景动态变化持续维持拓扑理解。
Google DeepMind 推出多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 与 Live Transcribe 中率先支持美式手语转英语输入。该模型使用覆盖 50 多种手语的超 100,000 小时数据联合训练,借助端侧 MediaPipe Holistic 提取身体姿态关键点坐标直接翻译为文本,在 FLEURS-ASL 基准测试中达到 70 BLEURT 分数。
推荐理由:该模型将端侧姿态坐标提取与云端序列翻译结合并绕过中间标注,为视觉多模态语言落地提供了具体方案。
Google Research 与 Google DeepMind 推出基于 Gemini 与 Project Astra 的临床问诊系统 AMIE (Video),支持在实时视频问诊中感知非语言线索并引导虚拟体检。
推荐理由:研究提出了拆分对话、规划与感知的异步多智能体架构,为高延迟深度推理与低延迟实时音视频交互的共存提供了参考方案。
微软研究院推出胸部 X 光多模态研究模型 CARE-X,将自由文本生成与结构化预测相结合,以覆盖报告生成、病灶定位与管线分类等多项放射学判读任务。该模型采用强化学习 DAPO 优化临床正确性,支持生成式与辅助头双推理模式,并在印度 Narayana Health 的真实临床数据上完成了验证。
Meta 发布了 30B 参数的开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议,专为端侧智能体用例与代码任务设计。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持基于 DFlash 的推测解码技术以提升生成速度;Hugging Face、transformers、llama.cpp 和 vLLM 已同步提供全面部署支持。
推荐理由:该模型结合了轻量视觉编码与推测解码机制,为端侧多模态智能体部署与本地代码辅助提供了兼顾隐私与性能的参考方案。
Mistral AI 开源发布 3B 参数的多模态安全分类模型 Shieldstral,采用 Apache 2.0 协议。该模型将内容审核重构为自然语言问答任务,支持在推理时动态传入安全策略以统一评估文本与图像,无需针对新分类标准重新训练。模型可在单张 16GB GPU 上运行,单次前向传播即可输出校准的安全置信度分数,性能比肩或超过 7 倍于其体积的基准模型。
推荐理由:它将内容审核抽象为问答任务,支持在推理时直接用自然语言定义策略,为低成本构建自定义多模态防护栏提供了实用方案。
Google DeepMind 正式推出具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑提供连续视频理解、多步任务编排与多机协作能力。
推荐理由:该模型将高层推理规划与底层动作执行解耦,并通过连续视频流追踪任务进度,展示了具身智能分层编排与落地的具体路径。
Google DeepMind 宣布在 Google Flow Music 中上线最新音乐生成模型 Lyria 3.5,全面升级音乐性、歌词、人声表现和创作控制。新模型支持更复杂的旋律结构与发音更准、情感更自然的人声,同时增强了歌词生成的提示词遵循度,并允许用户直接调整输出的节奏与时长。
推荐理由:模型在旋律、歌词、人声以及节奏和时长控制上的升级,为创作者在音乐生成工具中微调成品提供了更细致的调节空间。
Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。
推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。
NVIDIA 推出面向手术机器人的实时动作驱动生成式模拟器 Cosmos-H-Dreams,支持在单张 GPU 上实现闭环交互控制。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步扩散学生模型,配合 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 fps 的生成速度。
推荐理由:该系统将手术世界模型蒸馏为少步因果架构并结合流式推理,在单张工作站显卡上实现了百帧级交互与闭环控制。
专攻巴西葡萄牙语的 OCR 模型 DharmaOCR 在葡语基准测试中取得 0.925 分,大幅超越更新的 Mistral OCR4(0.798)与 Unlimited-OCR(0.7587)。该模型先通过监督微调将全部参数专门对齐巴西葡语的词汇与文档结构,再结合 DPO 抑制重复与不连贯输出,从而在复杂文档提取中实现了更高的稳定性和更低的退化率。
Thinking Machines Lab 在 Hugging Face 上线开源全模态模型 Inkling 及小尺寸版本 Inkling-Small,原生支持文本、图像和音频输入并具备 1M 上下文窗口。
推荐理由:该模型给出了万亿参数原生全模态与长上下文的开源落地范式,读者可据此参考其混合注意力架构与量化部署成本。