240万 次下载 更新于 6天前
ollama run gemma4
ollama launch claude --model gemma4
ollama launch codex --model gemma4
ollama launch opencode --model gemma4
ollama launch openclaw --model gemma4 Gemma 是由 Google DeepMind 构建的开源模型系列。Gemma 4 模型属于多模态模型,可处理文本和图像输入,并生成文本输出。
Gemma 4 引入了关键的 能力和架构改进
推理能力 – 系列中的所有模型均被设计为具备强大推理能力的模型,并支持可配置的思维模式。
扩展的多模态 – 支持处理文本、图像,并支持可变纵横比和分辨率(适用于所有模型)。
多样且高效的架构 – 提供不同尺寸的稠密(Dense)和混合专家(MoE)变体,以实现可扩展的部署。
针对端侧优化 – 小型模型专为笔记本电脑和移动设备上的高效本地运行而设计。
增加的上下文窗口 – 小型模型具有 128K 上下文窗口,而中型模型支持 256K。
增强的代码与智能体能力 – 在编码基准测试中取得了显著进步,并具备原生的函数调用支持,从而驱动高性能的自主智能体。
原生系统提示词支持 – Gemma 4 引入了对 system(系统)角色的原生支持,从而实现结构更清晰、更易于控制的对话。
Ollama 的云端
ollama run gemma4:31b-cloud
边缘侧模型
E2B 和 E4B 中的 “E” 代表 “有效”(effective)参数,专为边缘设备部署而打造。
有效 2B (E2B)
ollama run gemma4:e2b
有效 4B (E4B)
ollama run gemma4:e4b
工作站模型
这些模型专为在本地提供前沿智能而设计。
26B (混合专家模型,具备 4B 活动参数)
ollama run gemma4:26b
31B (稠密模型)
ollama run gemma4:31b
这些模型已针对大量不同的数据集和指标进行了评估,涵盖了文本生成的不同方面。表中标记的评估结果均为指令微调模型的成绩。
| Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (无思维链) | |
|---|---|---|---|---|---|
| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% |
| AIME 2026 无工具 | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% |
| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% |
| Codeforces ELO | 2150 | 1718 | 940 | 633 | 110 |
| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% |
| Tau2 (3项平均) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% |
| HLE 无工具 | 19.5% | 8.7% | - | - | - |
| HLE 带搜索 | 26.5% | 17.2% | - | - | - |
| BigBench Extra Hard | 74.4% | 64.8% | 33.1% | 21.9% | 19.3% |
| MMMLU | 88.4% | 86.3% | 76.6% | 67.4% | 70.7% |
| 视觉 | |||||
| MMMU Pro | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% |
| OmniDocBench 1.5 (平均编辑距离,越低越好) | 0.131 | 0.149 | 0.181 | 0.290 | 0.365 |
| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% |
| MedXPertQA MM | 61.3% | 58.1% | 28.7% | 23.5% | - |
| 音频 | |||||
| CoVoST | - | - | 35.54 | 33.47 | - |
| FLEURS (越低越好) | - | - | 0.08 | 0.09 | - |
| 长上下文 | |||||
| MRCR v2 8 needle 128k (平均) | 66.4% | 44.1% | 25.4% | 19.1% | 13.5% |
| 属性 | E2B | E4B | 31B 稠密 |
|---|---|---|---|
| 总参数量 | 2.3B 有效 (含嵌入层为 5.1B) | 4.5B 有效 (含嵌入层为 8B) | 30.7B |
| 层数 | 35 | 42 | 60 |
| 滑动窗口 | 512 tokens | 512 tokens | 1024 tokens |
| 上下文长度 | 128K tokens | 128K tokens | 256K tokens |
| 词表大小 | 262K | 262K | 262K |
| 支持的多模态 | 文本, 图像, 音频 | 文本, 图像, 音频 | 文本, 图像 |
| 视觉编码器参数量 | ~150M | ~150M | ~550M |
| 音频编码器参数量 | ~300M | ~300M | 无音频 |
| 属性 | 26B A4B MoE |
|---|---|
| 总参数量 | 25.2B |
| 活动参数量 | 3.8B |
| 层数 | 30 |
| 滑动窗口 | 1024 tokens |
| 上下文长度 | 256K tokens |
| 词表大小 | 262K |
| 专家数量 | 8 个激活 / 128 个总计及 1 个共享 |
| 支持的多模态 | 文本, 图像 |
| 视觉编码器参数量 | ~550M |
为获得最佳性能,请使用以下配置和最佳实践
在所有用例中统一使用以下标准化采样配置
temperature=1.0top_p=0.95top_k=64请注意,Ollama 已为您处理了对话模板的复杂性。
与 Gemma 3 相比,这些模型使用标准的 system(系统)、assistant(助手)和 user(用户)角色。若要正确管理思维过程,请使用以下控制标记:
<|think|> 标记来启用思维链。若要禁用思维链,请移除该标记。<|channel>thought\n[内部推理]<channel|><|channel>thought\n<channel|>[最终答案]除了可变的纵横比外,Gemma 4 还通过可配置的视觉 Token 预算支持可变图像分辨率,这控制了用于表示图像的 Token 数量。较高的 Token 预算可以保留更多的视觉细节,
但代价是计算量增加;而较低的预算则能在不需要精细理解的任务中实现更快的推理。