Google DeepMind 发布统一无编码器多模态模型 Gemma 4 12B
Google DeepMind 推出开源多模态模型 Gemma 4 12B,支持在配备 16GB 显存或统一内存的普通笔记本上本地运行多模态与智能体任务。该模型采用无编码器的统一架构,移除传统的独立视觉与音频编码器,将视觉和原始音频信号直接投影至大语言模型主干网络,性能接近其 26B MoE 模型。
推荐理由:模型采用无编码器的统一架构直接处理视觉与音频输入,使笔记本端在 16GB 内存下也能本地运行多模态推理与智能体工作流。