64.9K 3 weeks ago

MiniMax 的 M2 系列模型,适用于编码、智能体工作流和专业生产力场景。

工具 思考
ollama run minimax-m2.7:cloud

应用

Claude Code
Claude 代码 ollama launch claude --model minimax-m2.7:cloud
Codex
Codex ollama launch codex --model minimax-m2.7:cloud
OpenCode
OpenCode ollama launch opencode --model minimax-m2.7:cloud
OpenClaw
OpenClaw ollama launch openclaw --model minimax-m2.7:cloud

1 个模型

minimax-m2.7:cloud

200K 上下文窗口 · 文本 · 3 周前

自述文件

Ollama 的云已正式获得 MiniMax 的商业使用授权

logo

MiniMax M2.7 是 M2 系列中首个深度参与自身进化的模型,能够构建复杂的代理框架,并通过代理团队、复杂技能和动态工具搜索完成高度精细的生产力任务。

亮点

  • 专业软件工程。M2.7 在真实工程场景中表现出色,包括端到端项目交付、日志分析与故障排除、代码安全以及机器学习。 在 SWE‑Pro 上得分 56.22%,与 GPT‑5.3‑Codex 相匹配,几乎逼近 Opus 的最佳水平。 在 VIBE‑Pro(55.6%)和 Terminal Bench 2(57.0%)上,展现了对复杂工程系统的深刻理解。

  • 专业工作与复杂环境。在覆盖 45 个模型的 GDPval‑AA 评估中,M2.7 获得了 1495 的 ELO 分数,位居开源模型之首。它能够在 Excel、PPT 和 Word 中进行多轮高保真编辑,并在 40 项复杂技能(每项超过 2000 条 token)中保持 97% 的技能遵循率。 在 Toolathon 上,M2.7 达到 46.3% 的准确率,位居全球顶尖。

  • 角色一致性与娱乐性。M2.7 具备出色的角色一致性和情感智商。MiniMax 开源了 OpenRoom,这是一套网页 GUI 交互系统,能够让对话驱动实时视觉反馈和场景交互,角色会主动参与其环境。

benchmark overview

基准测试

软件工程

M2.7 达到了最先进模型在跨多语言和系统级理解的真实编程任务中的水平。

基准测试 M2.7 备注
SWE-Pro 56.22% 匹配 GPT-5.3-Codex
VIBE-Pro 55.6% 几乎与 Opus 4.6 持平
Terminal Bench 2 57.0% 深度系统级理解
SWE 多语言 76.5 多语言工程
多项目 SWE 基准 52.7 多仓库任务
NL2Repo 39.8 自然语言到代码仓库

专业工作与办公室

基准测试 M2.7 备注
GDPval-AA(ELO) 1495 在开源模型中最高
Toolathon 46.3% 全球顶级
MM Claw 62.7% 接近 Sonnet 4.6
技能遵循(40 项技能) 97% 每项技能 >2,000 token

机器学习(MLE Bench Lite)

在针对 22 项机器学习竞赛的探索性自我进化测试中,M2.7 在三次 24 小时自主运行中实现了 66.6% 的平均获奖率,仅次于 Opus 4.6(75.7%)和 GPT‑5.4(71.2%),并与 Gemini 3.1 持平。

参考