AutoResearch
AutoResearch 是一个 agent 循环:LLM 自主修改单个训练文件,跑一个固定 5 分钟的实验,检查选定指标有没有变好,然后保留或回滚这次改动,如此循环整晚。这是一套极简的「改 → 验 → 留/丢 → 再改」跑法,不是什么重型框架。
这个词真正立住,是在 Andrej Karpathy 于 2026 年 3 月 7 日开源 karpathy/autoresearch 之后——他把 agent 指向了自己的 nanochat GPT-2 代码库。两天、约 700 次实验、约 20 项真实改进,端到端加速了 11%,repo 随后积累了 74k+ stars,autoresearch 也成了「自主实验循环」这一品类的通用叫法。
Karpathy 的参考实现用三个文件严格划分职责:`prepare.py` 不可改动,负责数据处理和 `val_bpb` 评估;`train.py` 是 agent 的实验沙箱;`program.md` 是人写的研究方向说明。agent 提出一个改动(比如 QK-norm 缩放器、banded-attention 调整、AdamW 的 beta 参数),训练恰好 5 分钟,验证损失没有下降就 git revert。
就像让一个初级研究员拿着秒表独自熬一晚,他会不停尝试,只有真正有效果的才会留下来。
提前 7 天看到萌芽期新词,解锁全部阶段筛选,并每周收到抢先提醒。
为什么现在开始走红?
2026 年 3 月 7 日,Karpathy 开源了 AutoResearch,630 行 Python,让 AI agent 能在单张 GPU 上一晚跑约 100 次训练实验。两天自动跑下来,他那条已经调优的 nanochat GPT-2 流水线又提速 11%。Fortune 十天后跟进,把这称为「loopy era」。
搜索热度
-
萌芽0–7 天
-
初现8–30 天
-
验证中31–90 天
-
上升 ← 当前91–180 天
-
成熟180 天以上
前景
未来 6 个月的热度走势与商业化节奏。
Karpathy 的影响力加上极简规范,各方垂直化复刻(GPU kernel、SAT、RL)还会持续涌现,这个词热度至少还能撑 6 个月以上。
风险 · 有声音认为这不过是「花哨的超参搜索」,如果这个质疑坐实,autoresearch 可能碎片化成各家自己命名的 "agent lab" 品牌,词本身就很难统一了。
类比 · nanoGPT · AutoML · agent loop
-
现在开源热度,SaaS 还是空白
Karpathy 的仓库加上各种复刻已经有了热度,但没有任何付费产品真正拿下这个品类。
-
3-6 个月托管循环开始落地
预计 SkyPilot、Modal、Together、RunPod 上的托管 AutoResearch 服务会陆续出现。
-
6-12 个月垂直化把词撕碎
AutoKernel、auto-SAT、auto-RL 各自截流,搜索词最终导向各自细分领域的品牌。
“AutoResearch” 的竞争与机会
判断依据包括已追踪的搜索词、变现方向和相关词。除标注“实测”的 Google KD 外,其余均为参考估算。
“AutoResearch” 能做的点子
这个词可以延伸成文章、网站、产品、帖子、邮件、视频或课程。选一个方向,就能开始行动。
HN 上的最大质疑是「这不就是超参搜索」。一篇从代码层讲清三点区别(任意代码改动、跨轮次记忆、全自动化)的文章,能捡到质疑者的搜索词。
消费级 GPU 跑 nanochat 的教程很稀缺,"autoresearch karpathy" 已经是 Google autocomplete 的活词了。第一篇清楚的教程稳拿教程搜索词。
AutoKernel 和 agent-SAT 已经有人在做了。一篇系统梳理非 ML 移植版、给这个模式命名的综述,能拿到跨领域的反链。
yibie/awesome-autoresearch 是个 GitHub 列表,没有可检索的界面。一个按「autoresearch <领域>」关键词索引的目录站,SEO 空间很清晰。
上传 `train.py` + `program.md`,定预算,早上拿报告。SkyPilot 已经发了扩展部署的博文,一个带成本限额的产品化封装,一个周末能做出来。
一晚 100 次实验,日志量爆炸。一个能展示保留 diff、回滚 diff 和指标曲线的 Web UI,是 CLI 循环天然的配套工具。
带真实 diff 和回归数据的第一人称实验帖,在 HN 和 X 上传播快。Karpathy 的 nanochat 以外,这类内容现在还很少。
延时展示 agent 修改 `train.py`、看 val_bpb 下降、解说每次命中。Karpathy 发布时只有文字推文,视觉化演示还没有人做。
630 行 Python,Karpathy 打响了自主 ML 研究的发令枪,前沿实验室已经在照着这套思路复刻了。
发布帖下面最高赞的评论不是「牛」,而是「这不就是加了步骤的贝叶斯优化?」
GPU Triton 有 AutoKernel,Solver 有 agent-SAT,树莓派有 pi-autoresearch。这个模式正在吃掉每一个有数值验证器的优化问题。
大家在搜什么
来自 Google Suggest 和 Trends 的长尾词。热度和竞争度是估算,仅供参考,未经核实。内容类型由搜索词的写法推断。
“AutoResearch” 的搜索结果
这里展示当前的自然搜索结果,以及正在投放的广告。广告数量可以反映当下的商业需求。
常见问题
什么是 AutoResearch?
AutoResearch 是一个 agent 循环:LLM 自主修改单个训练文件,跑一个固定 5 分钟的实验,检查选定指标有没有变好,然后保留或回滚这次改动,如此循环整晚。这是一套极简的「改 → 验 → 留/丢 → 再改」跑法,不是什么重型框架。
AutoResearch 为什么现在火?
2026 年 3 月 7 日,Karpathy 开源了 AutoResearch,630 行 Python,让 AI agent 能在单张 GPU 上一晚跑约 100 次训练实验。两天自动跑下来,他那条已经调优的 nanochat GPT-2 流水线又提速 11%。Fortune 十天后跟进,把这称为「loopy era」。
AutoResearch 是什么时候出现的?
约于 2026-03-07 公开出现(截至 2026-08-11 约 157 天前)。EarlyTerms 最早于 2026-04-20 记录到信号。
相关词
同一领域里的其他词:别名、子类、竞品,以及值得继续了解的相近概念。
- 属于 agent loop Agent loop 是每个自主 LLM agent 的控制流核心:模型读一遍上下文,决定下一步怎么做,调工具,拿结果,再循环——直到输出纯文本不再调工具,或被预算规则切断。规范实现大概九行 Python。 →
- 相关 agent harness Agent harness 是大模型和真实世界之间的那层中间件,负责跑 agent 循环、调工具、管记忆、守护栏、从错误里恢复。圈子里现在流行一个公式:「Agent = 模型 + Harness。你不是模型,你就是 harness。」 →
- 相关 parallel agents Parallel Agents 是同时跑多个 AI 编程会话的工作方式。每个会话对着代码库的一个独立副本干活,开发者的角色从写代码转为调度、审查和合并。 →
- 相关 coding agents Coding Agents 是一类 AI 编程工具的品类名。这类工具能自主完成代码工作:读仓库、想改法、改文件、跑测试、开 PR,而不是像 2021 年那批 copilot 只在光标处补几行。 →
- 相关 Claude Agent SDK Claude Agent SDK 是 Anthropic 用代码构建 Claude agent 的官方工具包。它把驱动 Claude Code 的那套底层能力开放出来:工具调用循环、上下文管理、子 agent 编排、hooks、权限控制、MCP 集成,封装成 Python… →
- 相关 managed agents Managed Agents 是云平台托管并运行 AI agent 的基础设施模式。开发者以前要自己搭 agent 循环,记忆管理、工具路由、状态控制、沙箱隔离、错误恢复,全部自己处理;现在这些都由平台打包成 runtime 服务。 →
- 相关 agentic coding Agentic coding 是让 AI agent 自主完成开发任务的工作方式:agent 自己规划、写代码、跑测试、读报错、修改,一轮轮迭代直到跑通,不需要人在每一步之间点头。这和 autocomplete 式的「AI pair… →
- 相关 Leiden Declaration The Leiden Declaration on Artificial Intelligence and Mathematics is a community-initiated statement that defines the core values… →
- 相关 ML Intern ML Intern is an open-source autonomous AI agent that runs the full machine-learning research loop without human supervision. →
- 相关 Sakana Fugu Sakana Fugu is a multi-agent orchestration model that dynamically routes complex tasks across a swappable pool of frontier LLMs — Opus… →
- 相关 Browser Harness Browser Harness is a 592-line Python project from browser-use that gives an LLM direct, unmediated control of Chrome via the DevTools… →
- 相关 AI Workspace An AI workspace is a persistent, project-scoped container where chats, files, tools, and memory live together — replacing the stateless… →
- 相关 Deep Research Deep Research is an agentic AI capability that autonomously browses the web, synthesizes hundreds of sources, and produces a cited… →
- 包含
- 竞品
- 相关
来源
这份报告引用的一手链接,点开任意一条都能自己核对。
- 01 karpathy/autoresearch — 正式仓库 github.com ↗
- 02 VentureBeat — Karpathy 的开源 autoresearch venturebeat.com ↗
- 03 Fortune — 为什么大家都在谈 Karpathy 的自主 AI 研究 agent fortune.com ↗
- 04 DataCamp — AutoResearch 入门指南 datacamp.com ↗
- 05 Hacker News — 发布讨论帖 (208 分,3 月 7 日) news.ycombinator.com ↗
- 06 Hacker News — 「用 autoresearch 回炉老研究思路」 (428 分,3 月 23 日) news.ycombinator.com ↗
- 07 SkyPilot 博客 — 把 Karpathy 的 Autoresearch 扩展到 GPU 集群 blog.skypilot.co ↗
- 08 awesome-autoresearch — 生态汇总列表 github.com ↗