440.5K 4个月前

Rnj-1 是 Essential AI 训练的一个 8B 参数开放权重密集模型系列,针对代码和 STEM 进行了优化,其能力与 SOTA 开放权重模型相当。

工具 8b
ollama run rnj-1

应用

Claude Code
Claude Code ollama launch claude --model rnj-1
Codex
Codex ollama launch codex --model rnj-1
OpenCode
OpenCode ollama launch opencode --model rnj-1
OpenClaw
OpenClaw ollama launch openclaw --model rnj-1

自述文件

此模型需要 Ollama 0.13.3 或更高版本。

Rnj-1 是 Essential AI 从头开始训练的 8B 参数开源权重、密集模型系列,针对代码和 STEM 进行了优化,其能力与最先进的开源权重模型相当。这些模型在各种编程语言中表现良好,并拥有强大的代理能力(例如,在 mini-SWE-agent 等代理框架中),同时在数学和科学方面也表现出色。在此,rnj-1 指的是基础模型,而 rnj-1-instruct 指的是经过后训练的指令微调模型。

image.png

能力亮点

  • 代码生成: rnj-1-instructrnj-1 在 HumanEval+、MBPP+、BigCodeBench 和 LiveCodeBench v6 等任务中衡量的代码生成能力都很强。两种模型都与最强的开源权重模型竞争,有时甚至优于更大的模型,例如 GPT OSS 20B。我们使用预测给定输出的输入和反之的任务 Crux-IO 来衡量代码理解能力。我们发现我们的模型优于可比的基线。对于跨编程语言的多语言代码生成能力,我们测量 MultiPL-E 在 6 种语言(C++、TypeScript、Java、JavaScript、Shell、PHP)上的表现,并发现性能接近最强的模型。
  • 代理和工具使用: rnj-1-instruct 在代理编码方面占据领先地位,这是我们的目标能力之一。SWE-bench 性能表明该模型能够处理日常软件工程任务。该模型在 SWE-bench 上比同等大小的模型强一个数量级,并接近更大模型中的能力。它在 bash-only 模式下的 SWE-bench Verified 分数为 20.8%,高于 Gemini 2.0 flash 和 Qwen2.5-Coder 32B Instruct 在相同代理框架下的分数(排行榜)。

    人们对开发模型编写高性能代码的能力越来越感兴趣。rnj-1-instruct 能够使用分析器迭代地改进其编写的代码的性能。例如,在 Enamel 上,该模型测量了编写高效算法解决方案的能力,该模型优于相同设置下的所有其他模型。

    此外,rnj-1-instruct 在 Berkeley Functional Calling Leaderboard (BFCL) 测量的工具使用性能方面超越了可比的模型。
  • 代码补全:由于专门接受了 FIM 预训练数据的训练,rnj-1 表现出强大的补全能力,并在后训练期间得到了进一步增强。基础模型 rnj-1 在 HE-FIM-Python (avg) 上获得了 82.49% 的分数,而 rnj-1-instruct 获得了 86.21% 的分数。
  • 数学问题解决: rnj-1-instruct 在各种难度级别的数学方面都表现出很强的能力,从基础数学 (GSM8k) 到高中和本科数学 (Minerva-MATH) 以及竞赛数学 (AIME ‘24 和 ‘25)。在更难的科目上,它胜过或与该领域中最强的模型不相上下。
  • 科学推理: rnj-1-instruct 表现出解决 GPQA-Diamond 和 SuperGPQA 中难题科学和技术问题所需的长期上下文推理能力。

参考

rnj-1 博客文章