580万 次下载 更新于 1周前
ollama run qwen3.5
ollama launch claude --model qwen3.5
ollama launch codex --model qwen3.5
ollama launch opencode --model qwen3.5
ollama launch openclaw --model qwen3.5名称
58 个模型
qwen3.5:latest
6.6GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:0.8b
1.0GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:2b
2.7GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:4b
3.4GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:9b
latest6.6GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:27b
17GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:35b
24GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:122b
81GB · 256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:cloud
256K 上下文窗口 · 文本, 图像 · 1个月前
qwen3.5:397b-cloud
256K 上下文窗口 · 文本, 图像 · 1个月前
近几个月来,我们加大了对开发基础模型的投入,旨在提供卓越的实用性和性能。Qwen3.5 代表了一个重大飞跃,集成了多模态学习、架构效率、强化学习规模和全球可访问性方面的突破,旨在通过前所未有的能力和效率为开发者及企业赋能。
Qwen3.5 具有以下增强功能:
统一的视觉语言基础:在多模态 Token 上进行早期融合训练,实现了与 Qwen3 的代际对等,并在推理、编程、智能体和视觉理解基准测试中超越了 Qwen3-VL 模型。
高效的混合架构:门控增量网络(Gated Delta Networks)结合稀疏混合专家模型(MoE),以极低的延迟和成本开销实现高吞吐量推理。
可扩展的强化学习泛化:在百万智能体环境中扩展强化学习,并采用渐进复杂的任务分布,以实现强大的现实世界适应性。
全球语言覆盖:支持扩展至 201 种语言和方言,实现具有细微文化和区域理解的包容性全球部署。
下一代训练基础设施:与纯文本训练相比,多模态训练效率接近 100%,异步强化学习框架支持大规模智能体脚手架和环境编排。
| GPT5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen3-Max-Thinking | K2.5-1T-A32B | Qwen3.5-397B-A17B | |
|---|---|---|---|---|---|---|
| 知识 | ||||||
| MMLU-Pro | 87.4 | 89.5 | 89.8 | 85.7 | 87.1 | 87.8 |
| MMLU-Redux | 95.0 | 95.6 | 95.9 | 92.8 | 94.5 | 94.9 |
| SuperGPQA | 67.9 | 70.6 | 74.0 | 67.3 | 69.2 | 70.4 |
| C-Eval | 90.5 | 92.2 | 93.4 | 93.7 | 94.0 | 93.0 |
| 指令遵循 | ||||||
| IFEval | 94.8 | 90.9 | 93.5 | 93.4 | 93.9 | 92.6 |
| IFBench | 75.4 | 58.0 | 70.4 | 70.9 | 70.2 | 76.5 |
| MultiChallenge | 57.9 | 54.2 | 64.2 | 63.3 | 62.7 | 67.6 |
| 长上下文 | ||||||
| AA-LCR | 72.7 | 74.0 | 70.7 | 68.7 | 70.0 | 68.7 |
| LongBench v2 | 54.5 | 64.4 | 68.2 | 60.6 | 61.0 | 63.2 |
| STEM | ||||||
| GPQA | 92.4 | 87.0 | 91.9 | 87.4 | 87.6 | 88.4 |
| HLE | 35.5 | 30.8 | 37.5 | 30.2 | 30.1 | 28.7 |
| HLE-Verified¹ | 43.3 | 38.8 | 48 | 37.6 | -- | 37.6 |
| 推理 | ||||||
| LiveCodeBench v6 | 87.7 | 84.8 | 90.7 | 85.9 | 85.0 | 83.6 |
| HMMT Feb 25 | 99.4 | 92.9 | 97.3 | 98.0 | 95.4 | 94.8 |
| HMMT Nov 25 | 100 | 93.3 | 93.3 | 94.7 | 91.1 | 92.7 |
| IMOAnswerBench | 86.3 | 84.0 | 83.3 | 83.9 | 81.8 | 80.9 |
| AIME26 | 96.7 | 93.3 | 90.6 | 93.3 | 93.3 | 91.3 |
| 通用智能体 | ||||||
| BFCL-V4 | 63.1 | 77.5 | 72.5 | 67.7 | 68.3 | 72.9 |
| TAU2-Bench | 87.1 | 91.6 | 85.4 | 84.6 | 77.0 | 86.7 |
| VITA-Bench | 38.2 | 56.3 | 51.6 | 40.9 | 41.9 | 49.7 |
| DeepPlanning | 44.6 | 33.9 | 23.3 | 28.7 | 14.5 | 34.3 |
| 工具十项全能 | 43.8 | 43.5 | 36.4 | 18.8 | 27.8 | 38.3 |
| MCP-Mark | 57.5 | 42.3 | 53.9 | 33.5 | 29.5 | 46.1 |
| 搜索智能体³ | ||||||
| HLE(带工具) | 45.5 | 43.4 | 45.8 | 49.8 | 50.2 | 48.3 |
| BrowseComp | 65.8 | 67.8 | 59.2 | 53.9 | --/74.9 | 69.0/78.6 |
| BrowseComp-zh | 76.1 | 62.4 | 66.8 | 60.9 | -- | 70.3 |
| WideSearch | 76.8 | 76.4 | 68.0 | 57.9 | 72.7 | 74.0 |
| Seal-0 | 45.0 | 47.7 | 45.5 | 46.9 | 57.4 | 46.9 |
| 多语言能力 | ||||||
| MMMLU | 89.5 | 90.1 | 90.6 | 84.4 | 86.0 | 88.5 |
| MMLU-ProX | 83.7 | 85.7 | 87.7 | 78.5 | 82.3 | 84.7 |
| NOVA-63 | 54.6 | 56.7 | 56.7 | 54.2 | 56.0 | 59.1 |
| INCLUDE | 87.5 | 86.2 | 90.5 | 82.3 | 83.3 | 85.6 |
| Global PIQA | 90.9 | 91.6 | 93.2 | 86.0 | 89.3 | 89.8 |
| PolyMATH | 62.5 | 79.0 | 81.6 | 64.7 | 43.1 | 73.3 |
| WMT24++ | 78.8 | 79.7 | 80.7 | 77.6 | 77.6 | 78.9 |
| MAXIFE | 88.4 | 79.2 | 87.5 | 84.0 | 72.8 | 88.2 |
| 编程智能体 | ||||||
| SWE-bench Verified | 80.0 | 80.9 | 76.2 | 75.3 | 76.8 | 76.2 |
| SWE-bench Multilingual | 72.0 | 77.5 | 65.0 | 66.7 | 73.0 | 69.3 |
| SecCodeBench | 68.7 | 68.6 | 62.4 | 57.5 | 61.3 | 68.3 |
| Terminal Bench 2 | 54.0 | 59.3 | 54.2 | 22.5 | 50.8 | 52.5 |
* HLE-Verified:人类终极考试 (HLE) 的验证和修订版本,附带透明的组件级验证协议和细粒度的错误分类法。数据集已开源:https://hugging-face.cn/datasets/skylenage/HLE-Verified。
* TAU2-Bench:我们遵循官方设置,但航空公司领域除外,该领域所有模型均应用了 Claude Opus 4.5 系统卡中提出的修复方案进行评估。
* MCPMark:GitHub MCP 服务器使用 api.githubcopilot.com 的 v0.30.3 版本;Playwright 工具响应在 32k token 处截断。
* 搜索智能体:大多数基于我们模型构建的搜索智能体采用简单的上下文折叠策略 (256k):当累计工具响应长度达到预设阈值时,历史记录中较早的工具响应将被修剪,以使上下文保持在限制范围内。
* BrowseComp:我们测试了两种策略,简单上下文折叠策略得分 69.0,而使用与 DeepSeek-V3.2 和 Kimi K2.5 相同的全部丢弃策略则达到了 78.6。
* WideSearch:我们使用 256k 上下文窗口,且没有任何上下文管理。
* MMLU-ProX:我们报告 29 种语言的平均准确率。
* WMT24++:经过难度标记和重新平衡后,WMT24 的一个更难的子集;我们报告使用 XCOMET-XXL 在 55 种语言上的平均得分。
* MAXIFE:我们报告英语 + 多语言原始提示词(总共 23 种设置)的准确率。
* 空单元格 (--) 表示尚未提供或不适用的分数。
| GPT5.2 | Claude 4.5 Opus | Gemini-3 Pro | Qwen3-VL-235B-A22B | K2.5-1T-A32B | Qwen3.5-397B-A17B | |
|---|---|---|---|---|---|---|
| STEM 与拼图 | ||||||
| MMMU | 86.7 | 80.7 | 87.2 | 80.6 | 84.3 | 85.0 |
| MMMU-Pro | 79.5 | 70.6 | 81.0 | 69.3 | 78.5 | 79.0 |
| MathVision | 83.0 | 74.3 | 86.6 | 74.6 | 84.2 | 88.6 |
| Mathvista(mini) | 83.1 | 80.0 | 87.9 | 85.8 | 90.1 | 90.3 |
| We-Math | 79.0 | 70.0 | 86.9 | 74.8 | 84.7 | 87.9 |
| DynaMath | 86.8 | 79.7 | 85.1 | 82.8 | 84.4 | 86.3 |
| ZEROBench | 9 | 3 | 10 | 4 | 9 | 12 |
| ZEROBench_sub | 33.2 | 28.4 | 39.0 | 28.4 | 33.5 | 41.0 |
| BabyVision | 34.4 | 14.2 | 49.7 | 22.2 | 36.5 | 52.3⁄43.3 |
| 通用视觉问答 (VQA) | ||||||
| RealWorldQA | 83.3 | 77.0 | 83.3 | 81.3 | 81.0 | 83.9 |
| MMStar | 77.1 | 73.2 | 83.1 | 78.7 | 80.5 | 83.8 |
| HallusionBench | 65.2 | 64.1 | 68.6 | 66.7 | 69.8 | 71.4 |
| MMBenchEN-DEV-v1.1 | 88.2 | 89.2 | 93.7 | 89.7 | 94.2 | 93.7 |
| SimpleVQA | 55.8 | 65.7 | 73.2 | 61.3 | 71.2 | 67.1 |
| 文本识别与文档理解 | ||||||
| OmniDocBench1.5 | 85.7 | 87.7 | 88.5 | 84.5 | 88.8 | 90.8 |
| CharXiv(RQ) | 82.1 | 68.5 | 81.4 | 66.1 | 77.5 | 80.8 |
| MMLongBench-Doc | – | 61.9 | 60.5 | 56.2 | 58.5 | 61.5 |
| CC-OCR | 70.3 | 76.9 | 79.0 | 81.5 | 79.7 | 82.0 |
| AI2D_TEST | 92.2 | 87.7 | 94.1 | 89.2 | 90.8 | 93.9 |
| OCRBench | 80.7 | 85.8 | 90.4 | 87.5 | 92.3 | 93.1 |
| 空间智能 | ||||||
| ERQA | 59.8 | 46.8 | 70.5 | 52.5 | – | 67.5 |
| CountBench | 91.9 | 90.6 | 97.3 | 93.7 | 94.1 | 97.2 |
| RefCOCO(平均) | – | – | 84.1 | 91.1 | 87.8 | 92.3 |
| ODInW13 | – | – | 46.3 | 43.2 | – | 47.0 |
| EmbSpatialBench | 81.3 | 75.7 | 61.2 | 84.3 | 77.4 | 84.5 |
| RefSpatialBench | – | – | 65.5 | 69.9 | – | 73.6 |
| LingoQA | 68.8 | 78.8 | 72.8 | 66.8 | 68.2 | 81.6 |
| V* | 75.9 | 67.0 | 88.0 | 85.9 | 77.0 | 95.8⁄91.1 |
| Hypersim | – | – | – | 11.0 | – | 12.5 |
| SUNRGBD | – | – | – | 34.9 | – | 38.3 |
| Nuscene | – | – | – | 13.9 | – | 16.0 |
| 视频理解 | ||||||
| VideoMME(带字幕) | 86 | 77.6 | 88.4 | 83.8 | 87.4 | 87.5 |
| VideoMME(无字幕) | 85.8 | 81.4 | 87.7 | 79.0 | 83.2 | 83.7 |
| VideoMMMU | 85.9 | 84.4 | 87.6 | 80.0 | 86.6 | 84.7 |
| MLVU (多项平均) | 85.6 | 81.7 | 83.0 | 83.8 | 85.0 | 86.7 |
| MVBench | 78.1 | 67.2 | 74.1 | 75.2 | 73.5 | 77.6 |
| LVBench | 73.7 | 57.3 | 76.2 | 63.6 | 75.9 | 75.5 |
| MMVU | 80.8 | 77.3 | 77.5 | 71.1 | 80.4 | 75.4 |
| 视觉智能体 | ||||||
| ScreenSpot Pro | – | 45.7 | 72.7 | 62.0 | – | 65.6 |
| OSWorld-Verified | 38.2 | 66.3 | – | 38.1 | 63.3 | 62.2 |
| AndroidWorld | – | – | – | 63.7 | – | 66.8 |
| 医学视觉问答 | ||||||
| SLAKE | 76.9 | 76.4 | 81.3 | 54.7 | 81.6 | 79.9 |
| PMC-VQA | 58.9 | 59.9 | 62.3 | 41.2 | 63.3 | 64.2 |
| MedXpertQA-MM | 73.3 | 63.6 | 76.0 | 47.6 | 65.3 | 70.0 |
* MathVision:我们的模型分数是使用固定提示词进行评估的,例如“请一步步推理,并将最终答案放在 \boxed{} 中。”对于其他模型,我们报告在包含和不包含 \boxed{} 格式运行下的最高分。
* BabyVision:我们的模型分数为开启代码解释器 (CI) 时的结果;关闭 CI 时,结果为 43.3。
* V*:我们的模型分数为开启代码解释器 (CI) 时的结果;关闭 CI 时,结果为 91.1。
* 空单元格 (--) 表示尚未提供或不适用的分数。