Local Model Bench
  • Home
  • Cases
  • Methodology
  • About
Sign in Subscribe

reasoning

A collection of 1 post
A hand-held magnifying glass over a printed leaderboard under a desk lamp, revealing glowing hidden text inside one row
paperwork-v3

The no-think leaderboard that wasn't: 7 rows reasoned anyway, re-measured Gemma-4 falls 61.1% to 11.1%

Seven paperwork-v3 leaderboard rows sent every no-think flag and produced reasoning tokens anyway, up to 28,821 per model. Re-measured under verified suppression, Gemma-4 26B A4B drops from 61.1% to 11.1% practical.
25 Sep 2026 5 min read
Page 1 of 1
Local Model Bench © 2026
  • Sign up
Powered by Ghost