SlopCodeBench
SlopCodeBench 不考一次性的对错,考的是 AI 编程 agent 在反复给自己的代码打补丁、跟着一路演进的需求往下写的过程中,代码质量会烂到什么程度。
Gabriel Orlanski 团队 (威斯康星大学麦迪逊分校,背后有 DARPA、NSF、Snorkel AI 支持) 在 2026 年 3 月 25 日 发布了这个基准,结果是 20 道题没有一个 agent 能端到端全对。这篇论文安静了四个月,直到 2026 年 7 月 27 日 HumanLayer 发的 Opus 5 跑分帖子在 Hacker News 冲到 400 分才被重新捞起来。
像一个体测项目:每加一英里就重新给你称一次体重,而不是只看一次冲刺的成绩。
英文圈现在还没有一篇正经的对比或教程内容 (页面自己说 SERP 竞争是零),这个空档现在能填。而且排行榜对比里直接点了 Kimi K2.6 的名字,国产模型跟 Opus 5、GPT-5.5 放在同一张榜上比,这本身就是给中文读者的天然切入点:不用编故事,写「Kimi 在这个新基准上跑到多少分」就是一篇现成的选题。
提前 7 天看到萌芽期新词,解锁全部阶段筛选,并每周收到抢先提醒。
为什么现在开始走红?
威斯康星大学麦迪逊分校 2026 年 3 月发的一个基准,专测编程 agent 在反复迭代任务时代码质量怎么衰退,7 月 27 日 HumanLayer 拿它跑了 Claude Opus 5 并发到 Hacker News 后突然火了。
搜索热度
-
萌芽0–7 天
-
初现8–30 天
-
验证中31–90 天
-
上升 ← 当前91–180 天
-
成熟180 天以上
前景
未来 6 个月的热度走势与商业化节奏。
排行榜远没跑满 (最高分才 28%),加上 DARPA/NSF 背书,每出一个新旗舰模型大概率都会被拿去跑一遍,这个基准有留下来的底气。
风险 · AgentWorldBench、ProgramBench 这类同类型的长程基准也在抢注意力,可能在 SlopCodeBench 站稳「默认引用」的位置之前就把关注度分掉。
类比 · SWE-bench · HumanEval · Terminal-Bench
-
现在解释性内容还是一片空地
HN 都冲到 400 分了,市面上却还没有一篇像样的对比或教程内容。
-
3-6 个月3-6 个月:模型厂商开始公开引用分数
各家 lab 会在发布文里贴 checkpoint 解题率,对比类内容的需求会跟着起来。
-
6-12 个月6-12 个月:衰减指标被搬进 CI 工具链
啰嗦度/衰减度这套打分逻辑会被商业化的代码审查、agent QA 产品借鉴过去。
“SlopCodeBench” 的竞争与机会
判断依据包括已追踪的搜索词、变现方向和相关词。除标注“实测”的 Google KD 外,其余均为参考估算。
“SlopCodeBench” 能做的点子
这个词可以延伸成文章、网站、产品、帖子、邮件、视频或课程。选一个方向,就能开始行动。
这个对比词目前 SERP 竞争为零,HN 那波讨论之后开发者正在争这个话题,能占先。
定义型科普,趁主流科技媒体还没跟进之前,先接住 7 月这波 HN 帖子带起来的搜索量。
挂着实时排行榜做的模型对比内容,新 checkpoint 一上榜就能自然更新一版。
官方排行榜没有通知功能,做一个 Discord/Slack 机器人补上这个明显的空白,AI 研究者会需要。
基准里那套确定性的代码质量指标 (复杂度集中度、代码克隆率、依赖熵) 是开源的,拿到基准之外的场景复用完全说得通。
HumanLayer 的文章已经有现成的图 (缺陷轨迹、成本曲线),做一版有人讲解的视频回顾能覆盖比原文更广的受众。
Opus 5 写的函数量是上一代的 5 倍,只为换 4 个百分点的准确率提升,结果还是没有一道题端到端做对。
SlopCodeBench 目前最高分 28%,这就是它的全部卖点:一个 frontier lab 短期内刷不到 90% 的基准。
大家在搜什么
来自 Google Suggest 和 Trends 的长尾词。热度和竞争度是估算,仅供参考,未经核实。内容类型由搜索词的写法推断。
“SlopCodeBench” 的搜索结果
这里展示当前的自然搜索结果,以及正在投放的广告。广告数量可以反映当下的商业需求。
常见问题
什么是 SlopCodeBench?
SlopCodeBench 不考一次性的对错,考的是 AI 编程 agent 在反复给自己的代码打补丁、跟着一路演进的需求往下写的过程中,代码质量会烂到什么程度。
SlopCodeBench 为什么现在火?
威斯康星大学麦迪逊分校 2026 年 3 月发的一个基准,专测编程 agent 在反复迭代任务时代码质量怎么衰退,7 月 27 日 HumanLayer 拿它跑了 Claude Opus 5 并发到 Hacker News 后突然火了。
SlopCodeBench 是什么时候出现的?
约于 2026-03-25 公开出现(截至 2026-08-11 约 139 天前)。EarlyTerms 最早于 2026-07-28 记录到信号。
相关词
同一领域里的其他词:别名、子类、竞品,以及值得继续了解的相近概念。
- 属于 coding-agents Coding Agents 是一类 AI 编程工具的品类名。这类工具能自主完成代码工作:读仓库、想改法、改文件、跑测试、开 PR,而不是像 2021 年那批 copilot 只在光标处补几行。 →
- 属于 agentic-coding Agentic coding 是让 AI agent 自主完成开发任务的工作方式:agent 自己规划、写代码、跑测试、读报错、修改,一轮轮迭代直到跑通,不需要人在每一步之间点头。这和 autocomplete 式的「AI pair… →
- 竞品 programbench ProgramBench 是一个软件工程评测基准,专测 AI agent 能否在只拿到编译好的二进制文件和配套文档的前提下,从零重建一个完整、可运行的代码库。任务期间不给源码,不允许反编译,不能联网。 →
- 竞品 agentworldbench AgentWorldBench 只看一件事:大模型能不能准确预测 agent 环境接下来会发生什么,下一条终端输出、下一个文件 diff、下一屏画面会变成什么样。至于 agent 有没有把任务真正做完,这套评测根本不关心。 →
- 相关 ai-slop AI slop 是一个贬义词,专指 AI 生成的各类内容(文章、图片、视频、pull request):技术上流畅,内容上空洞,批量生产只为刷点击或走流程,压根不是为了沟通。研究者总结了三个特征:表面能力、不对称的产出成本、可大规模复制。 →
- 相关 context-rot Context Rot 指大模型输出质量随输入长度增加而出现的可测量衰退,即便提示词还远没触及广告宣传的 context window 上限。模型处理第 10,000 个 token 的可靠程度,远不如处理第 100… →
- 相关 agent-harness Agent harness 是大模型和真实世界之间的那层中间件,负责跑 agent 循环、调工具、管记忆、守护栏、从错误里恢复。圈子里现在流行一个公式:「Agent = 模型 + Harness。你不是模型,你就是 harness。」 →
- 相关 claude-opus-5 Claude Opus 5 是 Anthropic 主打性价比的前沿大模型,定价 $5/$25 每百万 token,只有旗舰款 Claude Fable 5 的一半,主打代码、企业工作流和 Claude Code、Claude Pro、API 里的 agentic 任务。 →
- 相关 long-running-agents Long-running agents 是能跨多个上下文窗口持续干活的 AI agent,靠把状态写进结构化产物(进度文件、git commit、功能规格文档),让每次新会话从上一次停下的地方接着跑。这个模式针对的是一个硬约束:每次上下文窗口结束,模型就失忆了。 →
- 相关
来源
这份报告引用的一手链接,点开任意一条都能自己核对。
- 01 SlopCodeBench 论文 (arXiv) arxiv.org ↗
- 02 SlopCodeBench 全文 (HTML) arxiv.org ↗
- 03 SprocketLab/slop-code-bench — 官方 GitHub 仓库 github.com ↗
- 04 实时排行榜 — scbench.ai scbench.ai ↗
- 05 Snorkel AI — 衡量 agent 迭代过程中的代码腐化 snorkel.ai ↗
- 06 Snorkel AI — SlopCode Bench 排行榜页面 snorkel.ai ↗
- 07 HumanLayer — 在 SlopCodeBench 上给 Opus 5 跑分 github.com ↗
- 08 Hacker News 讨论帖 — 在 SlopCodeBench 上给 Opus 5 跑分 news.ycombinator.com ↗