Clipping 微信公众号

砍掉 96% 的视觉参数,塞进你的 16GB 笔记本:Google 开源 Gemma 4 12B

by AI兴观点 原文 ↗
Created: 2026-06-06

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-06-06 09:45

原文链接:https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12B/

✅点击上方🔺公众号🔺关注我✅

Google DeepMind 把多模态模型的编码器全砍了——然后塞进了一个 12B 参数的小模型里,跑在你的笔记本上就行。

“A unified, encoder-free multimodal model designed to bring high-performance intelligence directly to your laptop, and released under an Apache 2.0 license.” (一款统一的、无编码器的多模态模型,旨在把高性能AI直接带到你的笔记本上,使用Apache 2.0协议开源。)

这跟之前的其他小模型不太一样。它不是把现有架构缩小,而是重新想了下多模态模型还能怎么设计。

它把编码器扔了

传统多模态模型长这样:

图像 → 视觉编码器(几百MB)  \
                                → LLM backbone → 输出
音频 → 音频编码器(几百MB)  /

Gemma 4 12B 长这样:

图像 → 35M参数嵌入模块 → LLM backbone → 输出
音频 → 直接投影到token空间 → LLM backbone → 输出

那个35M参数的”嵌入模块”不是编码器——它就是一个矩阵乘法加位置编码和归一化。而音频更极端,连模块都不要了,直接把原始音频信号投影到文本token的同一维度空间。

结果是:多模态输入直接在LLM骨干网络里处理,没有中间商赚差价。

这意味着一件事:你的笔记本就能跑。

一个数字告诉你为什么这个架构更省

拿 Vision 为例。Gemma 4 其他中等尺寸模型有一个 550M 参数的视觉编码器。Gemma 4 12B 把这个砍成了 35M 嵌入模块,少了 500M+ 参数。

Audio 更夸张——Gemma 4 E2B 和 E4B 需要一个 300M 参数的音频编码器。12B 直接不要了,音频波形切片为 40ms 帧(每帧 640 个 float),线性投影到 LLM 输入空间。

组件传统 Gemma 4Gemma 4 12B节省
视觉编码器550M 参数35M 嵌入模块↓ 94%
音频编码器300M 参数无(直接投影)↓ 100%
总内存需求26B 模型(需要 32GB+)16GB 即可运行↓ 50%+

16GB 就够了

Google 说 Gemma 4 12B 只需要 16GB 的 VRAM 或统一内存。什么概念?一台 M4 MacBook Pro 标配就是 16GB——盖上盖子就能跑。

而且它不是那种”勉强能跑”的水平。官方数据说它在基准测试上的表现接近 Gemma 4 26B(那个大 MoE 模型),但内存占用不到一半。

性能接近 26B,体积减半

Gemma 4 系列之前有 E4B(超小)和 26B MoE(大),中间一直缺一个档位。12B 刚好填上了——它比 E4B 强得多,又比 26B 小得多。

具体来说:

  • 多模态支持:图像、音频、视频、文字四种输入
  • 推理能力:支持多步推理和 Agent 工作流
  • MTP 支持:Multi-Token Prediction drafters 降低延迟
  • Apache 2.0:完全开源,随便用

Omar Sanseviero(Google DeepMind 的产品负责人)在 X 上发了演示视频:

“Super excited to introduce Gemma 4 12B! Multimodal: audio, image, video, and text input. Novel architecture: we removed the multimodal encoders for a unified, streamlined arch.” (超激动地介绍 Gemma 4 12B!多模态:音频、图像、视频和文本输入。全新架构:我们移除了多模态编码器,用统一的精简架构取而代之。)

它有多开放?

你可以在 Hugging Face 和 Kaggle 上下载权重,然后用你最熟悉的工具跑起来:

工具说明
llama.cppCPU 推理,跨平台
MLXApple Silicon 优化
LM Studio图形界面,一键运行
vLLM高吞吐服务
SGLang结构化生成
LiteRT-LMGoogle 边缘推理 CLI
Ollama一行命令跑模型

Google 还专门出了个 macOS 桌面应用(LiteRT 驱动),如果你不想折腾命令行,直接装 App 就能用。跑本地 API 也只要一行:

litert-lm import --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm gemma-4-12B-it.litertlm gemma4-12b
litert-lm serve

150M 下载量的底气

Gemma 4 系列从推出到现在,社区下载量已经突破 1.5 亿。有人拿它做可穿戴机械臂控制,有人拿它做企业级 AI 安全。这次 12B 开源,等于给这帮人多了一个选择——性能够用、成本更低。

Encoder-free 架构这件事,比 Gemma 4 12B 这个模型本身更值得关注。 如果 12B 能砍掉编码器还不掉性能,那下一代更大的模型呢?Google 显然在验证一条路——多模态模型不一定需要独立的视觉/音频编码器,让 LLM 自己消化多模态输入可能才是更高效的方向。

你看好 encoder-free 这条路吗?还是觉得独立编码器才是正道?

如果觉得这篇文章有帮助,欢迎点赞、在看、转发!有问题也可以在评论区留言,我会尽量回复!


内容效果不满意?点此反馈

输入关键词开始搜索