用 LFM2.5-VL-DSpark 加速视觉语言模型
Liquid AI 推出投机解码草稿模型 LFM2.5-VL-DSpark,专为 3B 视觉语言模型 LFM2.5-VL-3B 设计,仅增加约 280M 参数(8.9%)。
Liquid AI 推出投机解码草稿模型 LFM2.5-VL-DSpark,专为 3B 视觉语言模型 LFM2.5-VL-3B 设计,仅增加约 280M 参数(8.9%)。
oMLX 创建者兼维护者 Jun Kim 正式加入 Hugging Face,全职投入支持 Apple MLX 社区与本地 AI 生态。oMLX 将从个人业余项目升级为获得资金支持的完全维护项目,继续保持 Apache 2.0 开源协议;未来重点之一是简化流程,加速将 transformers 模型定义转换为能在 MLX 上运行的参考实现。
Hugging Face 宣布在 transformers 库中原生支持 llama.cpp 的 GGUF 模型,开发者可直接通过 from_pretrained 加载 Hub 上的量化权重。
推荐理由:该更新让开发者能直接在标准 Transformers 工作流中复用 GGUF 量化权重,便于在 PyTorch 环境下调试模型与评测。
开源发布了面向 LFM2.5 系列(包含 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B)的 DSpark 推测解码草稿模型。
Meta 发布了 30B 参数的开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议,专为端侧智能体用例与代码任务设计。该模型由 2B 视觉编码器和 28B 文本解码器构成,支持基于 DFlash 的推测解码技术以提升生成速度;Hugging Face、transformers、llama.cpp 和 vLLM 已同步提供全面部署支持。
推荐理由:该模型结合了轻量视觉编码与推测解码机制,为端侧多模态智能体部署与本地代码辅助提供了兼顾隐私与性能的参考方案。
Berkeley Sky Lab 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层让已有 CUDA 内核作为知识库,在 Apple Silicon 上自动生成 Metal 内核。
Google DeepMind 发布机器人模型系列 Gemini Robotics 2,首次实现对人形机器人的全身运动控制、高灵巧度末端操作及多机器人协作。该系列包含负责视觉语言动作控制的 VLA 模型、负责长流程规划的具身推理模型 ER 2,以及适配新本体仅需数小时数据的端侧模型 On-Device 2。
推荐理由:该系列将控制范围扩展至人形机器人全身协调与灵巧操作,为具身智能从桌面任务迈向多机长周期协作提供了落地方案。
Google 推出面向端侧模型的冻结多 Token 预测(MTP)架构,已推送至 Pixel 9 和 10 系列,用于加速 Gemini Nano v3 的通知摘要与文本润色等任务。
Google DeepMind 推出开源多模态模型 Gemma 4 12B,支持在配备 16GB 显存或统一内存的普通笔记本上本地运行多模态与智能体任务。该模型采用无编码器的统一架构,移除传统的独立视觉与音频编码器,将视觉和原始音频信号直接投影至大语言模型主干网络,性能接近其 26B MoE 模型。
推荐理由:模型采用无编码器的统一架构直接处理视觉与音频输入,使笔记本端在 16GB 内存下也能本地运行多模态推理与智能体工作流。
Google Research 在《Nature》发表研究系统 PHRM,利用智能手机前置摄像头在用户面部解锁后的数秒内被动估算心率和每日静息心率。该方案在设备端运行轻量化卷积神经网络,心率测量平均绝对百分比误差低于 10%,静息心率相比穿戴设备平均绝对误差低于 5 bpm,并在不同肤色群体中达到统一精度标准。团队同步向通过审核的研究人员开放了数据集与预训练模型 PHRM-mini。
推荐理由:原文展示了仅凭手机前置摄像头在解锁时被动监测心率与静息心率的方案,为无穿戴设备场景下的健康监测提供了具体参考。
Google 提出结合密码学与可信执行环境(TEE)的零信任聚合方案,用于在保护隐私的前提下分析端侧 AI 运行状况。该方案采用单消息(one-shot)协议,消除了设备多轮在线交互需求,并确保原始数据绝不在服务器内存中暴露。结合 TEE 证明机制构成多层防御,仅在完成聚合与匿名化后对外输出统计洞察。
Google DeepMind 正式推出开源模型 Gemma 4 系列,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,专为高级推理与智能体工作流设计。
推荐理由:Gemma 4 转向 Apache 2.0 商业许可并覆盖端侧至 31B 规模,展示了小尺寸开源模型在多模态与智能体工作流上的落地路径。
Mistral AI 正式发布 Voxtral Transcribe 2 语音转写模型家族,包含用于批量转写的 Voxtral Mini Transcribe V2 和开源权重的实时流式模型 Voxtral Realtime。
推荐理由:提供了流式架构和开源权重,开发者能以更低延迟和端侧部署成本搭建实时语音智能体。
Mistral AI 正式发布多模态开源模型 Mistral Small 3.1,采用 Apache 2.0 协议并开源 Base 与 Instruct 检查点。
推荐理由:原文给出了显存配置、推理速度与许可协议,读者可以据此评估在消费级硬件部署多模态小模型的可行性。