513.7K 4个月前

Qwen3-Next 系列的第一个版本,在参数效率和推理速度方面都具有强大的性能。

工具 思考 80b
ollama run qwen3-next

应用

Claude Code
Claude 代码 ollama launch claude --model qwen3-next
Codex
Codex ollama launch codex --model qwen3-next
OpenCode
OpenCode ollama launch opencode --model qwen3-next
OpenClaw
OpenClaw ollama launch openclaw --model qwen3-next

自述文件

image.png

Qwen3-Next-80B-A3B 是 Qwen3-Next 系列的第一个版本,具有以下关键增强功能

  • 混合注意力:用门控 DeltaNet 和门控注意力的组合取代标准注意力,从而能够对超长上下文长度进行高效的上下文建模。
  • 高稀疏性混合专家 (MoE):在 MoE 层实现极低的激活率,从而大大降低每个 token 的 FLOPs,同时保持模型容量。
  • 稳定性优化:包括零中心化和权重衰减的 LayerNorm 等技术,以及其他用于稳健预训练和后训练的稳定增强功能。
  • 多 Token 预测 (MTP):提高预训练模型性能并加速推理。