More Effort, No Miracle: On DeepSWE, Extra Reasoning Leaves Mostly Noise-Like Variation
A four-run, multi-model research note: above High on DeepSWE v1.1, measured resource use keeps rising, while 11 of 12 score changes remain indistinguishable from finite-repeat variation.