221.9K 次下载 更新于 1个月前
ollama run nemotron-3-super
ollama launch claude --model nemotron-3-super
ollama launch codex --model nemotron-3-super
ollama launch opencode --model nemotron-3-super
ollama launch openclaw --model nemotron-3-superNVIDIA Nemotron™ 是一系列具有开放权重、训练数据和配方的开放模型,为构建专门的 AI 代理提供领先的效率和准确性。
Nemotron-3-Super 是由 NVIDIA 训练的大型语言模型 (LLM),旨在提供强大的代理(Agent)、推理和对话能力。它针对协作式智能体和高负载工作场景(如 IT 工单自动化)进行了优化。与该系列的其他模型一样,它通过先生成推理链路,最后得出最终响应的方式来回答用户查询和任务。该模型的推理能力可以通过聊天模板中的标志进行配置。
该模型拥有 12B 激活参数 和 120B 总参数。
支持的语言包括:英语、法语、德语、意大利语、日语、西班牙语和中文。
该模型可用于商业用途。
| 基准测试 | Nemotron 3 Super | Qwen3.5-122B-A10B | GPT-OSS-120B |
|---|---|---|---|
| 通用知识 | |||
| MMLU-Pro | 83.73 | 86.70 | 81.00 |
| 推理 | |||
| AIME25(无工具) | 90.21 | 90.36 | 92.50 |
| HMMT 2月25日(无工具) | 93.67 | 91.40 | 90.00 |
| HMMT 2月25日(带工具) | 94.73 | 89.55 | — |
| GPQA(无工具) | 79.23 | 86.60 | 80.10 |
| GPQA(有工具) | 82.70 | — | 80.09 |
| LiveCodeBench (v5 2024-07 至 2024-12) | 81.19 | 78.93 | 88.00 |
| SciCode(子任务) | 42.05 | 42.00 | 39.00 |
| HLE(无工具) | 18.26 | 25.30 | 14.90 |
| HLE(有工具) | 22.82 | — | 19.0 |
| 代理 | |||
| Terminal Bench(硬子集) | 25.78 | 26.80 | 24.00 |
| Terminal Bench Core 2.0 | 31.00 | 37.50 | 18.70 |
| SWE-Bench(OpenHands) | 60.47 | 66.40 | 41.9 |
| SWE-Bench (OpenCode) | 59.20 | 67.40 | — |
| SWE-Bench (Codex) | 53.73 | 61.20 | — |
| SWE-Bench Multilingual (OpenHands) | 45.78 | — | 30.80 |
| TauBench V2 | |||
| 航空业 | 56.25 | 66.0 | 49.2 |
| 零售业 | 62.83 | 62.6 | 67.80 |
| 电信业 | 64.36 | 95.00 | 66.00 |
| 平均值 | 61.15 | 74.53 | 61.0 |
| 带有搜索的 BrowseComp | 31.28 | — | 33.89 |
| BIRD Bench | 41.80 | — | 38.25 |
| 聊天和指令遵循 | |||
| IFBench(提示) | 72.56 | 73.77 | 68.32 |
| Scale AI 多项挑战 | 55.23 | 61.50 | 58.29 |
| Arena-Hard-V2 | 73.88 | 75.15 | 90.26 |
| 长上下文 | |||
| AA-LCR | 58.31 | 66.90 | 51.00 |
| RULER @ 256k | 96.30 | 96.74 | 52.30 |
| RULER @ 512k | 95.67 | 95.95 | 46.70 |
| RULER @ 1M | 91.75 | 91.33 | 22.30 |
| 多语言 | |||
| MMLU-ProX(语言平均值) | 79.36 | 85.06 | 76.59 |
| WMT24++ (英→xx) | 86.67 | 87.84 | 88.89 |