Gemma 4
Gemma 4 是 Google DeepMind 第四代开权重多模态模型系列,2026 年 4 月 2 日以 Apache 2.0 协议发布。四个尺寸覆盖手机到数据中心:E2B、E4B、26B Mixture-of-Experts,以及一个 31B 稠密模型,全部原生支持文本、图像和视频。
4 月 2 日的发布 让 Gemma 4 成为商业授权最开放、能力最强的开源模型系列。31B 模型在 LMArena 开源模型榜排第 3,数学评测 AIME 2026 从 Gemma 3 的 20.8% 跳到了 89.2%,Gemmaverse 社区已累计派生超过 100,000 个模型变体。
相当于 AI 模型界的 Android:随处可部署,从手机到服务器都有对应尺寸的版本。
对出海 builder,最直接的入口是 Gemma 4 vs Qwen 3.6 的中文对比内容。Qwen 是阿里出品,国内开发者本来就熟,做这道选题比纯英文多了一层亲切感。端侧部署 (E2B/E4B 完全离线) 对不想绕美国云 API 的 builder 也有实际价值。
提前 7 天看到萌芽期新词,解锁全部阶段筛选,并每周收到抢先提醒。
为什么现在开始走红?
Google 2026 年 4 月 2 日发布 Gemma 4,四个模型 (E2B 到 31B) 全走 Apache 2.0,前沿多模态推理终于可以完全离线——在 iPhone、MacBook、边缘服务器上都能跑。5 月 5 日跟进了多 token 预测 drafter,推理速度提升 3 倍,模型家族的生命周期由此拉长。
搜索热度
-
萌芽0–7 天
-
初现8–30 天
-
验证中31–90 天
-
上升 ← 当前91–180 天
-
成熟180 天以上
前景
未来 6 个月的热度走势与商业化节奏。
Apache 2.0 协议、四档硬件适配、10 万+ 社区变体,加上 Google 持续投入 MTP drafter,开发者关注度至少还有 6 个月。
风险 · Qwen 3.6 上下文窗口更长、Agentic 编程评测更强,可能会动摇 Gemma 4 的「开发者首选」定位。
类比 · Llama 3 · Mistral · Qwen
-
现在教程 + 部署指南
模型刚出来,搭建、跑分、横向对比的内容搜索需求很高。
-
3-6 个月微调服务上线
Apache 2.0 打开了白标微调 SaaS 的空间;Unsloth Studio 已经在服务这个市场了。
-
6-12 个月边缘 AI 产品层
端侧 E2B/E4B 让不依赖云端 API 的隐私优先 SaaS 成本上跑得起来。
“Gemma 4” 的竞争与机会
判断依据包括已追踪的搜索词、变现方向和相关词。除标注“实测”的 Google KD 外,其余均为参考估算。
“Gemma 4” 能做的点子
这个词可以延伸成文章、网站、产品、帖子、邮件、视频或课程。选一个方向,就能开始行动。
高搜索意图的对比词,有一定搜索量。覆盖跑分、显存需求、本地优先实用场景,附硬件选购联盟链接。
一步步讲解,覆盖 "gemma 4 ollama" 和 "gemma 4 apple silicon" 长尾词,随 MTP drafter 优化可持续更新。
覆盖 "gemma 4 download" 和 "gemma 4 iphone" 搜索词。讲怎么用 Google AI Edge Gallery 和 Off Grid 下载模型、测推理速度。
端侧 4B 模型处理敏感文档(法律、医疗、财务),无需上传到云端。订阅制 SaaS,没有数据出境顾虑。
31B 本地模型配合结构化 schema,为素材生成可搜索的元数据。已验证的需求 (HN 470 分讨论帖),按索引的素材时长计费。
YouTube 横向评测。吸引想降低 API 成本的受众。演示 Ollama、LM Studio、Apple Silicon 本地推理,广告变现潜力强。
2 小时 Unsloth Studio / TRL 实操课。面向想拥有自己模型的 ML 工程师,在 Maven 定价 $99-149。Apache 2.0 意味着学员可以把产出商业化。
Gemma 1 有授权限制,Gemma 2 工具链不齐,Gemma 3 有希望但跑分被质疑是精心挑选的。Gemma 4 发布时拿着 Apache 2.0、所有主流框架 day-0 支持,还有一个在 AIME 2026 上拿了 89.2% 的 31B 模型。
2026 年 4 月,一个 Google 的开源模型开始在 iPhone 13 Pro 上以 12-18 tokens/s 的速度跑,零 API 调用,全程飞行模式也没问题。边缘 AI 这个品类终于不再只停留在概念里了。
50 GB swap,一台 2021 年 M1 Max,零云端上传。这套本地视频档案索引方案在 HN 拿了 470 分,整套跑在本地硬件上,用 Gemma 4 31B Q4,质量和 Sonnet 4.6 比分不出差别。
大家在搜什么
来自 Google Suggest 和 Trends 的长尾词。热度和竞争度是估算,仅供参考,未经核实。内容类型由搜索词的写法推断。
“Gemma 4” 的搜索结果
这里展示当前的自然搜索结果,以及正在投放的广告。广告数量可以反映当下的商业需求。
常见问题
什么是 Gemma 4?
Gemma 4 是 Google DeepMind 第四代开权重多模态模型系列,2026 年 4 月 2 日以 Apache 2.0 协议发布。四个尺寸覆盖手机到数据中心:E2B、E4B、26B Mixture-of-Experts,以及一个 31B 稠密模型,全部原生支持文本、图像和视频。
Gemma 4 为什么现在火?
Google 2026 年 4 月 2 日发布 Gemma 4,四个模型 (E2B 到 31B) 全走 Apache 2.0,前沿多模态推理终于可以完全离线——在 iPhone、MacBook、边缘服务器上都能跑。5 月 5 日跟进了多 token 预测 drafter,推理速度提升 3 倍,模型家族的生命周期由此拉长。
Gemma 4 是什么时候出现的?
约于 2026-04-02 公开出现(截至 2026-08-11 约 131 天前)。EarlyTerms 最早于 2026-04-28 记录到信号。
相关词
同一领域里的其他词:别名、子类、竞品,以及值得继续了解的相近概念。
- 属于 agentic-coding Agentic coding 是让 AI agent 自主完成开发任务的工作方式:agent 自己规划、写代码、跑测试、读报错、修改,一轮轮迭代直到跑通,不需要人在每一步之间点头。这和 autocomplete 式的「AI pair… →
- 包含 MTP MTP (Multi-Token Prediction,多 token 预测) 是一种推理加速技术:用一个轻量级的 drafter 模型同时预测接下来的几个 token,再由更大的目标模型在一次前向传播里集中验证,吞吐量提升 2–3 倍,质量不变。 →
- 包含 mtp MTP (Multi-Token Prediction,多 token 预测) 是一种推理加速技术:用一个轻量级的 drafter 模型同时预测接下来的几个 token,再由更大的目标模型在一次前向传播里集中验证,吞吐量提升 2–3 倍,质量不变。 →
- 竞品 qwen3 Qwen3 是阿里巴巴推出的第三代开权重基础模型系列,2025 年 4 月 28 日正式发布,采用 Apache 2.0… →
- 竞品 qwen3-6 Qwen3.6 是阿里通义千问团队的新一代大模型系列,主打「真实世界的 agent」场景。两个档位:闭源的 Qwen3.6-Plus(2026 年 4 月 2 日发布)和开放权重的 Qwen3.6-35B-A3B,35B 总参数、3B 激活参数的稀疏 MoE,4 月 16… →
- 相关 Gemini 3.1 Pro Gemini 3.1 Pro 是 Google DeepMind 的旗舰推理模型,2026 年 2 月 19 日发布。它引入了 thinking 推理模式,可在三档算力预算(LOW / MEDIUM / HIGH)之间切换,支持最多 100 万 token… →
- 相关 gemini-3-1-pro Gemini 3.1 Pro 是 Google DeepMind 的旗舰推理模型,2026 年 2 月 19 日发布。它引入了 thinking 推理模式,可在三档算力预算(LOW / MEDIUM / HIGH)之间切换,支持最多 100 万 token… →
- 相关 MLX MLX 是 Apple 开源的 Apple Silicon 机器学习框架,API 风格和 NumPy、PyTorch 基本一致,但整个 runtime 跑在 Metal 和统一内存架构上,CPU、GPU、Neural Engine 共享同一块内存,张量不需要在它们之间来回拷贝。 →
- 相关 mlx MLX 是 Apple 开源的 Apple Silicon 机器学习框架,API 风格和 NumPy、PyTorch 基本一致,但整个 runtime 跑在 Metal 和统一内存架构上,CPU、GPU、Neural Engine 共享同一块内存,张量不需要在它们之间来回拷贝。 →
- 相关 LM Studio LM Studio 是一款桌面应用,支持 Windows、macOS、Linux,可以在本机发现、下载并运行开源大模型。它把 llama.cpp、MLX 和一个可视化的 Hugging Face 模型浏览器打包在一起,做到点击就能跑,同时在 1234 端口暴露一个兼容… →
- 相关 lm-studio LM Studio 是一款桌面应用,支持 Windows、macOS、Linux,可以在本机发现、下载并运行开源大模型。它把 llama.cpp、MLX 和一个可视化的 Hugging Face 模型浏览器打包在一起,做到点击就能跑,同时在 1234 端口暴露一个兼容… →
- 包含 DiffusionGemma DiffusionGemma is a 26B open-weights language model from Google DeepMind that generates text through discrete diffusion rather than… →
- 竞品 Granite 4.1 Granite 4.1 is IBM's latest open-source language model family, released April 29, 2026, in dense 3B, 8B, and 30B parameter sizes under… →
- 包含 Gemma 4 12B Gemma 4 12B is Google DeepMind's 12-billion-parameter open-weights multimodal model, distinguished by an encoder-free architecture that… →
- 竞品 Nemotron Ultra Nemotron Ultra is NVIDIA's flagship open-weights large language model — a 550B-parameter hybrid Mixture-of-Experts model with only 55B… →
- 竞品
来源
这份报告引用的一手链接,点开任意一条都能自己核对。
- 01 Google Blog — Gemma 4:逐字节领先,目前能力最强的开源模型(2026 年 4 月 2 日) blog.google ↗
- 02 Google AI for Developers — Gemma 4 模型介绍(架构、规格、上下文窗口) ai.google.dev ↗
- 03 Hugging Face — 欢迎 Gemma 4:端侧前沿多模态推理 huggingface.co ↗
- 04 Google Blog — 加速 Gemma 4:用多 token 预测 drafter 提升推理速度(2026 年 5 月 5 日) blog.google ↗
- 05 HN — Google 发布 Gemma 4 开源模型(1,812 分,2026 年 4 月 2 日) news.ycombinator.com ↗
- 06 HN — 用 2021 款 MacBook 和 Gemma4-31B 本地索引一年视频(470 分,2026 年 5 月 21 日) news.ycombinator.com ↗
- 07 Interconnects.ai — Gemma 4 以及开源模型成功的关键(Nathan Lambert 分析) interconnects.ai ↗