Local Model Bench
  • Home
  • Cases
  • Methodology
  • About
Sign in Subscribe

devin-cli

A collection of 1 post
Score card: paperwork-v3 board via Devin CLI — Kimi K3 Max 94.4%, SWE-2 Max 88.9%, Luna High + Opus 77.8%, Grok 4.7 + Astra Max 72.2%, Luna Max 61.1%
paperwork-v3

Kimi K3 Max tops paperwork-v3 via Devin CLI: SWE-2 beats GPT-6 and Opus

Seven frontier model configs ran all nine paperwork-v3 cases through Devin CLI's agent loop. Kimi K3 Max takes first place on the board (94.4%), SWE-2 Max second (88.9%), ahead of GPT-6 Astra Max, Claude Opus 5.5 Max and Grok 4.7 XHigh.
27 Sep 2026 6 min read
Page 1 of 1
Local Model Bench © 2026
  • Sign up
Powered by Ghost