Gemma 4 12B:谷歌发布无编码器多模态开源模型,16GB 笔记本即可本地运行
- 无编码器统一架构:图像与音频原始数据直接送入 LLM 主干,省去独立视觉/音频编码器,降低多模态延迟
- 首个支持原生音频输入的中型 Gemma 模型:可直接处理文本、图像、视频和音频
- 笔记本可跑:仅需 16GB 显存或统一内存,性能接近更大的 26B MoE 模型,但内存占用不到其一半
- 开源开放:Apache 2.0 许可,可从 Hugging Face、Kaggle 下载,支持 Ollama、LM Studio、llama.cpp、vLLM 等
- 低延迟优化:附带多 Token 预测(MTP)草稿模型,并首发 macOS 桌面端本地应用

Introducing Gemma 4 12B: a unified, encoder-free multimodal model
