跳到正文
原文
Google DeepMind·· 2026-06-09精选AI 评分83

Google DeepMind 推出统一无编码器多模态模型 Gemma 4 12B

Introducing Gemma 4 12B: a unified, encoder-free multimodal model

AI 导读

Google DeepMind 推出统一且无独立编码器的多模态模型 Gemma 4 12B,支持原生音频与视觉输入,采用 Apache 2.0 协议开源。该模型移除了传统的图像和音频编码器,直接将多模态信号投影至 LLM 主干,性能接近 26B MoE 模型而内存占用减少超过一半,仅需 16GB 显存或统一内存即可在笔记本电脑本地运行。

推荐理由

模型移除了传统独立的模态编码器并直接接入语言主干,展示了在消费级硬件上兼顾原生音画输入与推理效率的轻量化方案。

来源:Google DeepMind · deepmind.google