64.9K 下载 已更新 3 weeks ago
ollama run minimax-m2.7:cloud
ollama launch claude --model minimax-m2.7:cloud
ollama launch codex --model minimax-m2.7:cloud
ollama launch opencode --model minimax-m2.7:cloud
ollama launch openclaw --model minimax-m2.7:cloudOllama 的云已正式获得 MiniMax 的商业使用授权
MiniMax M2.7 是 M2 系列中首个深度参与自身进化的模型,能够构建复杂的代理框架,并通过代理团队、复杂技能和动态工具搜索完成高度精细的生产力任务。
专业软件工程。M2.7 在真实工程场景中表现出色,包括端到端项目交付、日志分析与故障排除、代码安全以及机器学习。 在 SWE‑Pro 上得分 56.22%,与 GPT‑5.3‑Codex 相匹配,几乎逼近 Opus 的最佳水平。 在 VIBE‑Pro(55.6%)和 Terminal Bench 2(57.0%)上,展现了对复杂工程系统的深刻理解。
专业工作与复杂环境。在覆盖 45 个模型的 GDPval‑AA 评估中,M2.7 获得了 1495 的 ELO 分数,位居开源模型之首。它能够在 Excel、PPT 和 Word 中进行多轮高保真编辑,并在 40 项复杂技能(每项超过 2000 条 token)中保持 97% 的技能遵循率。 在 Toolathon 上,M2.7 达到 46.3% 的准确率,位居全球顶尖。
角色一致性与娱乐性。M2.7 具备出色的角色一致性和情感智商。MiniMax 开源了 OpenRoom,这是一套网页 GUI 交互系统,能够让对话驱动实时视觉反馈和场景交互,角色会主动参与其环境。
软件工程
M2.7 达到了最先进模型在跨多语言和系统级理解的真实编程任务中的水平。
| 基准测试 | M2.7 | 备注 |
|---|---|---|
| SWE-Pro | 56.22% | 匹配 GPT-5.3-Codex |
| VIBE-Pro | 55.6% | 几乎与 Opus 4.6 持平 |
| Terminal Bench 2 | 57.0% | 深度系统级理解 |
| SWE 多语言 | 76.5 | 多语言工程 |
| 多项目 SWE 基准 | 52.7 | 多仓库任务 |
| NL2Repo | 39.8 | 自然语言到代码仓库 |
专业工作与办公室
| 基准测试 | M2.7 | 备注 |
|---|---|---|
| GDPval-AA(ELO) | 1495 | 在开源模型中最高 |
| Toolathon | 46.3% | 全球顶级 |
| MM Claw | 62.7% | 接近 Sonnet 4.6 |
| 技能遵循(40 项技能) | 97% | 每项技能 >2,000 token |
机器学习(MLE Bench Lite)
在针对 22 项机器学习竞赛的探索性自我进化测试中,M2.7 在三次 24 小时自主运行中实现了 66.6% 的平均获奖率,仅次于 Opus 4.6(75.7%)和 GPT‑5.4(71.2%),并与 Gemini 3.1 持平。