240万 6天前

Gemma 4 系列模型旨在各个尺寸下均提供前沿水平的性能。它们非常适合处理推理、智能体工作流、代码编写和多模态理解任务。

视觉 工具 思考 音频 云端 e2b e4b 26b 31b
ollama run gemma4

应用

Claude Code
Claude Code ollama launch claude --model gemma4
Codex
Codex ollama launch codex --model gemma4
OpenCode
OpenCode ollama launch opencode --model gemma4
OpenClaw
OpenClaw ollama launch openclaw --model gemma4

自述文件

Gemma 4 Ollama logo Gemma 是由 Google DeepMind 构建的开源模型系列。Gemma 4 模型属于多模态模型,可处理文本和图像输入,并生成文本输出。

Gemma 4 引入了关键的 能力和架构改进

  • 推理能力 – 系列中的所有模型均被设计为具备强大推理能力的模型,并支持可配置的思维模式。

  • 扩展的多模态 – 支持处理文本、图像,并支持可变纵横比和分辨率(适用于所有模型)。

  • 多样且高效的架构 – 提供不同尺寸的稠密(Dense)和混合专家(MoE)变体,以实现可扩展的部署。

  • 针对端侧优化 – 小型模型专为笔记本电脑和移动设备上的高效本地运行而设计。

  • 增加的上下文窗口 – 小型模型具有 128K 上下文窗口,而中型模型支持 256K。

  • 增强的代码与智能体能力 – 在编码基准测试中取得了显著进步,并具备原生的函数调用支持,从而驱动高性能的自主智能体。

  • 原生系统提示词支持 – Gemma 4 引入了对 system(系统)角色的原生支持,从而实现结构更清晰、更易于控制的对话。

模型

Ollama 的云端

ollama run gemma4:31b-cloud

边缘侧模型

E2B 和 E4B 中的 “E” 代表 “有效”(effective)参数,专为边缘设备部署而打造。

有效 2B (E2B)

ollama run gemma4:e2b

有效 4B (E4B)

ollama run gemma4:e4b

工作站模型

这些模型专为在本地提供前沿智能而设计。

26B (混合专家模型,具备 4B 活动参数)

ollama run gemma4:26b

31B (稠密模型)

ollama run gemma4:31b

基准测试结果

这些模型已针对大量不同的数据集和指标进行了评估,涵盖了文本生成的不同方面。表中标记的评估结果均为指令微调模型的成绩。

Gemma 4 31B Gemma 4 26B A4B Gemma 4 E4B Gemma 4 E2B Gemma 3 27B (无思维链)
MMLU Pro 85.2% 82.6% 69.4% 60.0% 67.6%
AIME 2026 无工具 89.2% 88.3% 42.5% 37.5% 20.8%
LiveCodeBench v6 80.0% 77.1% 52.0% 44.0% 29.1%
Codeforces ELO 2150 1718 940 633 110
GPQA Diamond 84.3% 82.3% 58.6% 43.4% 42.4%
Tau2 (3项平均) 76.9% 68.2% 42.2% 24.5% 16.2%
HLE 无工具 19.5% 8.7% - - -
HLE 带搜索 26.5% 17.2% - - -
BigBench Extra Hard 74.4% 64.8% 33.1% 21.9% 19.3%
MMMLU 88.4% 86.3% 76.6% 67.4% 70.7%
视觉
MMMU Pro 76.9% 73.8% 52.6% 44.2% 49.7%
OmniDocBench 1.5 (平均编辑距离,越低越好) 0.131 0.149 0.181 0.290 0.365
MATH-Vision 85.6% 82.4% 59.5% 52.4% 46.0%
MedXPertQA MM 61.3% 58.1% 28.7% 23.5% -
音频
CoVoST - - 35.54 33.47 -
FLEURS (越低越好) - - 0.08 0.09 -
长上下文
MRCR v2 8 needle 128k (平均) 66.4% 44.1% 25.4% 19.1% 13.5%

模型信息

属性 E2B E4B 31B 稠密
总参数量 2.3B 有效 (含嵌入层为 5.1B) 4.5B 有效 (含嵌入层为 8B) 30.7B
层数 35 42 60
滑动窗口 512 tokens 512 tokens 1024 tokens
上下文长度 128K tokens 128K tokens 256K tokens
词表大小 262K 262K 262K
支持的多模态 文本, 图像, 音频 文本, 图像, 音频 文本, 图像
视觉编码器参数量 ~150M ~150M ~550M
音频编码器参数量 ~300M ~300M 无音频

混合专家 (MoE) 模型

属性 26B A4B MoE
总参数量 25.2B
活动参数量 3.8B
层数 30
滑动窗口 1024 tokens
上下文长度 256K tokens
词表大小 262K
专家数量 8 个激活 / 128 个总计及 1 个共享
支持的多模态 文本, 图像
视觉编码器参数量 ~550M

最佳实践

为获得最佳性能,请使用以下配置和最佳实践

1. 采样参数

在所有用例中统一使用以下标准化采样配置

  • temperature=1.0
  • top_p=0.95
  • top_k=64

2. 思维模式配置

请注意,Ollama 已为您处理了对话模板的复杂性。

与 Gemma 3 相比,这些模型使用标准的 system(系统)、assistant(助手)和 user(用户)角色。若要正确管理思维过程,请使用以下控制标记:

  • 触发思维链: 通过在系统提示词开头包含 <|think|> 标记来启用思维链。若要禁用思维链,请移除该标记。
  • 标准生成: 启用思维链时,模型将输出其内部推理过程,随后通过以下结构给出最终答案:
    <|channel>thought\n[内部推理]<channel|>
  • 禁用思维链的行为: 对于除 E2B 和 E4B 变体之外的所有模型,如果禁用了思维链,模型仍会生成标签,但内部为空:
    <|channel>thought\n<channel|>[最终答案]

3. 多轮对话

  • 历史记录中不应包含思维内容:在多轮对话中,历史模型输出应仅包含最终响应。在开始下一次用户输入之前,不得添加前几轮模型生成的思维内容。

4. 模态顺序

  • 为了在多模态输入中获得最佳性能,请将图像和/或音频内容放在提示词中的文本之前

5. 可变图像分辨率

除了可变的纵横比外,Gemma 4 还通过可配置的视觉 Token 预算支持可变图像分辨率,这控制了用于表示图像的 Token 数量。较高的 Token 预算可以保留更多的视觉细节,

但代价是计算量增加;而较低的预算则能在不需要精细理解的任务中实现更快的推理。

  • 支持的 Token 预算包括:701402805601120
    • 对于分类、标题生成或视频理解等任务,建议使用较低的预算,因为此时更快的推理和帧处理速度比精细细节更重要。
    • 对于 OCR、文档解析或读取小字体文本等任务,请使用较高的预算