EarlyTerms

SlopCodeBench

上升 · 出现于 · 139 天前 · 最近核对
月搜索量
~365 /月
关键词难度(KD)
阶段
上升
数据更新于 2026-08-10 来源 · 8

SlopCodeBench 不考一次性的对错,考的是 AI 编程 agent 在反复给自己的代码打补丁、跟着一路演进的需求往下写的过程中,代码质量会烂到什么程度。

Gabriel Orlanski 团队 (威斯康星大学麦迪逊分校,背后有 DARPA、NSF、Snorkel AI 支持) 在 2026 年 3 月 25 日 发布了这个基准,结果是 20 道题没有一个 agent 能端到端全对。这篇论文安静了四个月,直到 2026 年 7 月 27 日 HumanLayer 发的 Opus 5 跑分帖子在 Hacker News 冲到 400 分才被重新捞起来。

像一个体测项目:每加一英里就重新给你称一次体重,而不是只看一次冲刺的成绩。

中文视角 · 出海机会

英文圈现在还没有一篇正经的对比或教程内容 (页面自己说 SERP 竞争是零),这个空档现在能填。而且排行榜对比里直接点了 Kimi K2.6 的名字,国产模型跟 Opus 5、GPT-5.5 放在同一张榜上比,这本身就是给中文读者的天然切入点:不用编故事,写「Kimi 在这个新基准上跑到多少分」就是一篇现成的选题。

EarlyTerms Pro

提前 7 天看到萌芽期新词,解锁全部阶段筛选,并每周收到抢先提醒。

为什么现在开始走红?

TL;DR

威斯康星大学麦迪逊分校 2026 年 3 月发的一个基准,专测编程 agent 在反复迭代任务时代码质量怎么衰退,7 月 27 日 HumanLayer 拿它跑了 Claude Opus 5 并发到 Hacker News 后突然火了。

5 个因素在推动它走红,右滑 →

搜索热度

峰值 ~365/月
更新于 2026-08-10
~365/月 ~182/月 0
2026-07-12 2026-07-27 2026-08-10
词的生命周期
  1. 萌芽
    0–7 天
  2. 初现
    8–30 天
  3. 验证中
    31–90 天
  4. 上升 ← 当前
    91–180 天
  5. 成熟
    180 天以上

前景

未来 6 个月的热度走势与商业化节奏。

信号 中等
营收 适中

排行榜远没跑满 (最高分才 28%),加上 DARPA/NSF 背书,每出一个新旗舰模型大概率都会被拿去跑一遍,这个基准有留下来的底气。

风险 · AgentWorldBench、ProgramBench 这类同类型的长程基准也在抢注意力,可能在 SlopCodeBench 站稳「默认引用」的位置之前就把关注度分掉。

类比 · SWE-bench · HumanEval · Terminal-Bench

变现时间线
  1. 现在
    解释性内容还是一片空地

    HN 都冲到 400 分了,市面上却还没有一篇像样的对比或教程内容。

  2. 3-6 个月
    3-6 个月:模型厂商开始公开引用分数

    各家 lab 会在发布文里贴 checkpoint 解题率,对比类内容的需求会跟着起来。

  3. 6-12 个月
    6-12 个月:衰减指标被搬进 CI 工具链

    啰嗦度/衰减度这套打分逻辑会被商业化的代码审查、agent QA 产品借鉴过去。

“SlopCodeBench” 的竞争与机会

判断依据包括已追踪的搜索词、变现方向和相关词。除标注“实测”的 Google KD 外,其余均为参考估算。

内容缺口
1 条搜索词已追踪
主要是 通用 (1)
1 条长尾词仅见于 Suggest,存在内容机会
变现潜力
0% 的搜索词带有购买意图
2 条变现方向
以了解信息为主,商业意图尚弱
实现难度
(参考估算)
阶段: 上升 — 入场稍晚,先确认是否还有机会
0 / 12 个常见域名后缀已被注册
9 个相关词已发布
参考信号:已追踪的搜索词、变现方向和相关词

“SlopCodeBench” 能做的点子

这个词可以延伸成文章、网站、产品、帖子、邮件、视频或课程。选一个方向,就能开始行动。

文章
SlopCodeBench vs SWE-bench:"解出一道题" 和 "没把代码越改越烂" 根本是两码事

这个对比词目前 SERP 竞争为零,HN 那波讨论之后开发者正在争这个话题,能占先。

文章
什么是 SlopCodeBench?专门测 AI 代码腐化的基准

定义型科普,趁主流科技媒体还没跟进之前,先接住 7 月这波 HN 帖子带起来的搜索量。

文章
SlopCodeBench 排行榜解读:Opus 5、GPT-5.5、Kimi K2.6 谁更能扛

挂着实时排行榜做的模型对比内容,新 checkpoint 一上榜就能自然更新一版。

产品
一个盯着 SlopCodeBench 分数变化的提醒机器人,新模型一上榜就推送

官方排行榜没有通知功能,做一个 Discord/Slack 机器人补上这个明显的空白,AI 研究者会需要。

产品
把 SlopCodeBench 的 41 项质量指标搬到私有仓库上用的衰减/啰嗦度检查工具

基准里那套确定性的代码质量指标 (复杂度集中度、代码克隆率、依赖熵) 是开源的,拿到基准之外的场景复用完全说得通。

视频
视频:我看着 Opus 5 在 SlopCodeBench 上把自己写进死胡同,6 小时直播回顾

HumanLayer 的文章已经有现成的图 (缺陷轨迹、成本曲线),做一版有人讲解的视频回顾能覆盖比原文更广的受众。

帖子 HN / r/MachineLearning
这才是第一个真正测出 "vibe coding" 代价的基准

Opus 5 写的函数量是上一代的 5 倍,只为换 4 个百分点的准确率提升,结果还是没有一道题端到端做对。

帖子 Newsletter / LinkedIn
为什么一个没跑满的基准比跑满的基准更值钱

SlopCodeBench 目前最高分 28%,这就是它的全部卖点:一个 frontier lab 短期内刷不到 90% 的基准。

大家在搜什么

来自 Google Suggest 和 Trends 的长尾词。热度和竞争度是估算,仅供参考,未经核实。内容类型由搜索词的写法推断。

关键词
竞争度
内容类型
slopcodebench
极低
通用
更新于 2026-08-10 · 来源:Google Trends、Google Suggest · 竞争度为参考估算

“SlopCodeBench” 的搜索结果

这里展示当前的自然搜索结果,以及正在投放的广告。广告数量可以反映当下的商业需求。

常见问题

什么是 SlopCodeBench?

SlopCodeBench 不考一次性的对错,考的是 AI 编程 agent 在反复给自己的代码打补丁、跟着一路演进的需求往下写的过程中,代码质量会烂到什么程度。

SlopCodeBench 为什么现在火?

威斯康星大学麦迪逊分校 2026 年 3 月发的一个基准,专测编程 agent 在反复迭代任务时代码质量怎么衰退,7 月 27 日 HumanLayer 拿它跑了 Claude Opus 5 并发到 Hacker News 后突然火了。

SlopCodeBench 是什么时候出现的?

约于 2026-03-25 公开出现(截至 2026-08-11 约 139 天前)。EarlyTerms 最早于 2026-07-28 记录到信号。

相关词

同一领域里的其他词:别名、子类、竞品,以及值得继续了解的相近概念。

继续探索
还提到
  • 相关 SWE-bench

来源

这份报告引用的一手链接,点开任意一条都能自己核对。

  1. 01 SlopCodeBench 论文 (arXiv) arxiv.org
  2. 02 SlopCodeBench 全文 (HTML) arxiv.org
  3. 03 SprocketLab/slop-code-bench — 官方 GitHub 仓库 github.com
  4. 04 实时排行榜 — scbench.ai scbench.ai
  5. 05 Snorkel AI — 衡量 agent 迭代过程中的代码腐化 snorkel.ai
  6. 06 Snorkel AI — SlopCode Bench 排行榜页面 snorkel.ai
  7. 07 HumanLayer — 在 SlopCodeBench 上给 Opus 5 跑分 github.com
  8. 08 Hacker News 讨论帖 — 在 SlopCodeBench 上给 Opus 5 跑分 news.ycombinator.com
机会雷达
还有更多搜索量正在飙升的新词
查看 →