221.9K 1个月前

NVIDIA Nemotron 3 Super 是一款 120B 开源 MoE 模型,仅需激活 12B 参数,即可为复杂的多智能体应用提供极致的计算效率和准确性。

工具 推理 云端 120b
ollama run nemotron-3-super

应用

Claude Code
Claude Code ollama launch claude --model nemotron-3-super
Codex
Codex ollama launch codex --model nemotron-3-super
OpenCode
OpenCode ollama launch opencode --model nemotron-3-super
OpenClaw
OpenClaw ollama launch openclaw --model nemotron-3-super

自述文件

NVIDIA Nemotron™ 是一系列具有开放权重、训练数据和配方的开放模型,为构建专门的 AI 代理提供领先的效率和准确性。

Nemotron-3-Super 是由 NVIDIA 训练的大型语言模型 (LLM),旨在提供强大的代理(Agent)、推理和对话能力。它针对协作式智能体和高负载工作场景(如 IT 工单自动化)进行了优化。与该系列的其他模型一样,它通过先生成推理链路,最后得出最终响应的方式来回答用户查询和任务。该模型的推理能力可以通过聊天模板中的标志进行配置。

该模型拥有 12B 激活参数120B 总参数

支持的语言包括:英语、法语、德语、意大利语、日语、西班牙语和中文。

该模型可用于商业用途。

nemotron 3 super

基准测试

基准测试 Nemotron 3 Super Qwen3.5-122B-A10B GPT-OSS-120B
通用知识
MMLU-Pro 83.73 86.70 81.00
推理
AIME25(无工具) 90.21 90.36 92.50
HMMT 2月25日(无工具) 93.67 91.40 90.00
HMMT 2月25日(带工具) 94.73 89.55
GPQA(无工具) 79.23 86.60 80.10
GPQA(有工具) 82.70 80.09
LiveCodeBench (v5 2024-07 至 2024-12) 81.19 78.93 88.00
SciCode(子任务) 42.05 42.00 39.00
HLE(无工具) 18.26 25.30 14.90
HLE(有工具) 22.82 19.0
代理
Terminal Bench(硬子集) 25.78 26.80 24.00
Terminal Bench Core 2.0 31.00 37.50 18.70
SWE-Bench(OpenHands) 60.47 66.40 41.9
SWE-Bench (OpenCode) 59.20 67.40
SWE-Bench (Codex) 53.73 61.20
SWE-Bench Multilingual (OpenHands) 45.78 30.80
TauBench V2
航空业 56.25 66.0 49.2
零售业 62.83 62.6 67.80
电信业 64.36 95.00 66.00
平均值 61.15 74.53 61.0
带有搜索的 BrowseComp 31.28 33.89
BIRD Bench 41.80 38.25
聊天和指令遵循
IFBench(提示) 72.56 73.77 68.32
Scale AI 多项挑战 55.23 61.50 58.29
Arena-Hard-V2 73.88 75.15 90.26
长上下文
AA-LCR 58.31 66.90 51.00
RULER @ 256k 96.30 96.74 52.30
RULER @ 512k 95.67 95.95 46.70
RULER @ 1M 91.75 91.33 22.30
多语言
MMLU-ProX(语言平均值) 79.36 85.06 76.59
WMT24++ (英→xx) 86.67 87.84 88.89