AI Evals · Benchmark · Agent Experiments

观察 AI 系统如何失败,以及我们如何更好地评测它。

记录 AI 评测、Benchmark 构建、Agent 实验与论文阅读,也保留工作和生活中值得反复思考的观察。

最近文章

查看全部文章 →