Google DeepMind·· 2026-06-09
Google DeepMind 发布 Gemma 4 12B:统一架构、无编码器的多模态模型
Introducing Gemma 4 12B: a unified, encoder-free multimodal model
SI 导读
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。
精选SI 评分82
推荐理由
Gemma 4 12B 去掉多模态编码器并把视觉音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。
来源:Google DeepMind · deepmind.google