580万 1周前

Qwen 3.5 是一个开源多模态模型系列,提供卓越的实用性和性能。

视觉 工具 思考 云端 0.8b 2b 4b 9b 27b 35b 122b
ollama run qwen3.5

应用

Claude Code
Claude Code ollama launch claude --model qwen3.5
Codex
Codex ollama launch codex --model qwen3.5
OpenCode
OpenCode ollama launch opencode --model qwen3.5
OpenClaw
OpenClaw ollama launch openclaw --model qwen3.5

自述文件

近几个月来,我们加大了对开发基础模型的投入,旨在提供卓越的实用性和性能。Qwen3.5 代表了一个重大飞跃,集成了多模态学习、架构效率、强化学习规模和全球可访问性方面的突破,旨在通过前所未有的能力和效率为开发者及企业赋能。

亮点

Qwen3.5 具有以下增强功能:

  • 统一的视觉语言基础:在多模态 Token 上进行早期融合训练,实现了与 Qwen3 的代际对等,并在推理、编程、智能体和视觉理解基准测试中超越了 Qwen3-VL 模型。

  • 高效的混合架构:门控增量网络(Gated Delta Networks)结合稀疏混合专家模型(MoE),以极低的延迟和成本开销实现高吞吐量推理。

  • 可扩展的强化学习泛化:在百万智能体环境中扩展强化学习,并采用渐进复杂的任务分布,以实现强大的现实世界适应性。

  • 全球语言覆盖:支持扩展至 201 种语言和方言,实现具有细微文化和区域理解的包容性全球部署。

  • 下一代训练基础设施:与纯文本训练相比,多模态训练效率接近 100%,异步强化学习框架支持大规模智能体脚手架和环境编排。

基准测试

benchmark

语言

GPT5.2 Claude 4.5 Opus Gemini-3 Pro Qwen3-Max-Thinking K2.5-1T-A32B Qwen3.5-397B-A17B
知识
MMLU-Pro 87.4 89.5 89.8 85.7 87.1 87.8
MMLU-Redux 95.0 95.6 95.9 92.8 94.5 94.9
SuperGPQA 67.9 70.6 74.0 67.3 69.2 70.4
C-Eval 90.5 92.2 93.4 93.7 94.0 93.0
指令遵循
IFEval 94.8 90.9 93.5 93.4 93.9 92.6
IFBench 75.4 58.0 70.4 70.9 70.2 76.5
MultiChallenge 57.9 54.2 64.2 63.3 62.7 67.6
长上下文
AA-LCR 72.7 74.0 70.7 68.7 70.0 68.7
LongBench v2 54.5 64.4 68.2 60.6 61.0 63.2
STEM
GPQA 92.4 87.0 91.9 87.4 87.6 88.4
HLE 35.5 30.8 37.5 30.2 30.1 28.7
HLE-Verified¹ 43.3 38.8 48 37.6 -- 37.6
推理
LiveCodeBench v6 87.7 84.8 90.7 85.9 85.0 83.6
HMMT Feb 25 99.4 92.9 97.3 98.0 95.4 94.8
HMMT Nov 25 100 93.3 93.3 94.7 91.1 92.7
IMOAnswerBench 86.3 84.0 83.3 83.9 81.8 80.9
AIME26 96.7 93.3 90.6 93.3 93.3 91.3
通用智能体
BFCL-V4 63.1 77.5 72.5 67.7 68.3 72.9
TAU2-Bench 87.1 91.6 85.4 84.6 77.0 86.7
VITA-Bench 38.2 56.3 51.6 40.9 41.9 49.7
DeepPlanning 44.6 33.9 23.3 28.7 14.5 34.3
工具十项全能 43.8 43.5 36.4 18.8 27.8 38.3
MCP-Mark 57.5 42.3 53.9 33.5 29.5 46.1
搜索智能体³
HLE(带工具) 45.5 43.4 45.8 49.8 50.2 48.3
BrowseComp 65.8 67.8 59.2 53.9 --/74.9 69.0/78.6
BrowseComp-zh 76.1 62.4 66.8 60.9 -- 70.3
WideSearch 76.8 76.4 68.0 57.9 72.7 74.0
Seal-0 45.0 47.7 45.5 46.9 57.4 46.9
多语言能力
MMMLU 89.5 90.1 90.6 84.4 86.0 88.5
MMLU-ProX 83.7 85.7 87.7 78.5 82.3 84.7
NOVA-63 54.6 56.7 56.7 54.2 56.0 59.1
INCLUDE 87.5 86.2 90.5 82.3 83.3 85.6
Global PIQA 90.9 91.6 93.2 86.0 89.3 89.8
PolyMATH 62.5 79.0 81.6 64.7 43.1 73.3
WMT24++ 78.8 79.7 80.7 77.6 77.6 78.9
MAXIFE 88.4 79.2 87.5 84.0 72.8 88.2
编程智能体
SWE-bench Verified 80.0 80.9 76.2 75.3 76.8 76.2
SWE-bench Multilingual 72.0 77.5 65.0 66.7 73.0 69.3
SecCodeBench 68.7 68.6 62.4 57.5 61.3 68.3
Terminal Bench 2 54.0 59.3 54.2 22.5 50.8 52.5

* HLE-Verified:人类终极考试 (HLE) 的验证和修订版本,附带透明的组件级验证协议和细粒度的错误分类法。数据集已开源:https://hugging-face.cn/datasets/skylenage/HLE-Verified。
* TAU2-Bench:我们遵循官方设置,但航空公司领域除外,该领域所有模型均应用了 Claude Opus 4.5 系统卡中提出的修复方案进行评估。
* MCPMark:GitHub MCP 服务器使用 api.githubcopilot.com 的 v0.30.3 版本;Playwright 工具响应在 32k token 处截断。
* 搜索智能体:大多数基于我们模型构建的搜索智能体采用简单的上下文折叠策略 (256k):当累计工具响应长度达到预设阈值时,历史记录中较早的工具响应将被修剪,以使上下文保持在限制范围内。
* BrowseComp:我们测试了两种策略,简单上下文折叠策略得分 69.0,而使用与 DeepSeek-V3.2 和 Kimi K2.5 相同的全部丢弃策略则达到了 78.6。
* WideSearch:我们使用 256k 上下文窗口,且没有任何上下文管理。
* MMLU-ProX:我们报告 29 种语言的平均准确率。
* WMT24++:经过难度标记和重新平衡后,WMT24 的一个更难的子集;我们报告使用 XCOMET-XXL 在 55 种语言上的平均得分。
* MAXIFE:我们报告英语 + 多语言原始提示词(总共 23 种设置)的准确率。
* 空单元格 (--) 表示尚未提供或不适用的分数。

视觉语言

GPT5.2 Claude 4.5 Opus Gemini-3 Pro Qwen3-VL-235B-A22B K2.5-1T-A32B Qwen3.5-397B-A17B
STEM 与拼图
MMMU 86.7 80.7 87.2 80.6 84.3 85.0
MMMU-Pro 79.5 70.6 81.0 69.3 78.5 79.0
MathVision 83.0 74.3 86.6 74.6 84.2 88.6
Mathvista(mini) 83.1 80.0 87.9 85.8 90.1 90.3
We-Math 79.0 70.0 86.9 74.8 84.7 87.9
DynaMath 86.8 79.7 85.1 82.8 84.4 86.3
ZEROBench 9 3 10 4 9 12
ZEROBench_sub 33.2 28.4 39.0 28.4 33.5 41.0
BabyVision 34.4 14.2 49.7 22.2 36.5 52.343.3
通用视觉问答 (VQA)
RealWorldQA 83.3 77.0 83.3 81.3 81.0 83.9
MMStar 77.1 73.2 83.1 78.7 80.5 83.8
HallusionBench 65.2 64.1 68.6 66.7 69.8 71.4
MMBenchEN-DEV-v1.1 88.2 89.2 93.7 89.7 94.2 93.7
SimpleVQA 55.8 65.7 73.2 61.3 71.2 67.1
文本识别与文档理解
OmniDocBench1.5 85.7 87.7 88.5 84.5 88.8 90.8
CharXiv(RQ) 82.1 68.5 81.4 66.1 77.5 80.8
MMLongBench-Doc 61.9 60.5 56.2 58.5 61.5
CC-OCR 70.3 76.9 79.0 81.5 79.7 82.0
AI2D_TEST 92.2 87.7 94.1 89.2 90.8 93.9
OCRBench 80.7 85.8 90.4 87.5 92.3 93.1
空间智能
ERQA 59.8 46.8 70.5 52.5 67.5
CountBench 91.9 90.6 97.3 93.7 94.1 97.2
RefCOCO(平均) 84.1 91.1 87.8 92.3
ODInW13 46.3 43.2 47.0
EmbSpatialBench 81.3 75.7 61.2 84.3 77.4 84.5
RefSpatialBench 65.5 69.9 73.6
LingoQA 68.8 78.8 72.8 66.8 68.2 81.6
V* 75.9 67.0 88.0 85.9 77.0 95.891.1
Hypersim 11.0 12.5
SUNRGBD 34.9 38.3
Nuscene 13.9 16.0
视频理解
VideoMME(带字幕) 86 77.6 88.4 83.8 87.4 87.5
VideoMME(无字幕) 85.8 81.4 87.7 79.0 83.2 83.7
VideoMMMU 85.9 84.4 87.6 80.0 86.6 84.7
MLVU (多项平均) 85.6 81.7 83.0 83.8 85.0 86.7
MVBench 78.1 67.2 74.1 75.2 73.5 77.6
LVBench 73.7 57.3 76.2 63.6 75.9 75.5
MMVU 80.8 77.3 77.5 71.1 80.4 75.4
视觉智能体
ScreenSpot Pro 45.7 72.7 62.0 65.6
OSWorld-Verified 38.2 66.3 38.1 63.3 62.2
AndroidWorld 63.7 66.8
医学视觉问答
SLAKE 76.9 76.4 81.3 54.7 81.6 79.9
PMC-VQA 58.9 59.9 62.3 41.2 63.3 64.2
MedXpertQA-MM 73.3 63.6 76.0 47.6 65.3 70.0

* MathVision:我们的模型分数是使用固定提示词进行评估的,例如“请一步步推理,并将最终答案放在 \boxed{} 中。”对于其他模型,我们报告在包含和不包含 \boxed{} 格式运行下的最高分。
* BabyVision:我们的模型分数为开启代码解释器 (CI) 时的结果;关闭 CI 时,结果为 43.3。
* V*:我们的模型分数为开启代码解释器 (CI) 时的结果;关闭 CI 时,结果为 91.1。
* 空单元格 (--) 表示尚未提供或不适用的分数。