大力出不了奇迹:在 DeepSWE 上,更多推理只留下了噪声般的扰动
一则多模型、四次重复的研究笔记:在 DeepSWE v1.1 的 High 以上区间,实测资源投入继续增长,但 12 组分差中有 11 组无法与有限重复产生的随机波动可靠区分。
AI Evals · Benchmark · Agent Experiments
记录 AI 评测、Benchmark 构建、Agent 实验与论文阅读,也保留工作和生活中值得反复思考的观察。
一则多模型、四次重复的研究笔记:在 DeepSWE v1.1 的 High 以上区间,实测资源投入继续增长,但 12 组分差中有 11 组无法与有限重复产生的随机波动可靠区分。