人工智能
312 个已研究的新兴术语,分类: 人工智能. 按发现日期排序,最新优先。
pdf-inspector 是一个开源 Rust 库,10-50ms 内就能判断一份 PDF 是纯文本、扫描件、图片还是混合类型,然后不用 OCR,直接提取带位置信息的文本并转成结构化 Markdown。它提供 Rust crate、Python、Node.js 和浏览器端 WebAssembly 绑定,MIT 协议开源。…
TypeWhisper 是一个开源、免费的语音输入工具,支持 macOS、Windows、iOS,全程本地转录,默认不联网。按一个全局快捷键说话,干净的文字直接粘进任何 App。它内置六种可插拔的语音引擎,包括 [WhisperKit](https://github.com/TypeWhisper/typewhisper-mac) 和 Parakeet TDT,用户可以自己选换。…
Armature 是一家 YC 孵化的创业公司,想法是给 MCP server 装上一套 PostHog 级别的可视化,只不过分析对象不是网页用户,而是 AI agent。它会把一次 agent 会话完整还原出来:用户当时问了什么、模型是怎么推理的、卡在哪一步,创始人管这套东西叫 Agent Experience (AX)。…
Astra 是 OpenAI 还没发布的「下一代主力模型」,思路是让多个推理 agent 同时扑在一个难题上跑几小时甚至几天,不再是一问一答式地给结果。OpenAI 把它的存在公之于众,用的不是发布会,是一篇数学论文。…
Hoplite 是一家旧金山创业公司,做的是把自主编程 agent 搬进云端沙盒跑:把开发者本地的会话、MCP server、依赖这些东西整体搬过去,agent 就能在云上改代码、跑测试、开实时预览链接、直接提 PR,不需要本地环境。…
MCP Analytics 是围绕 Model Context Protocol 服务器新长出来的一个产品分析品类:给 MCP 埋点,把 agent 的一次会话还原出来,包括用户问了什么、agent 是怎么推理的、调用在哪一步失败了。这个词还有反过来的一层意思:把 Google Analytics 这类分析工具通过 MCP 暴露出去。…
Qwen3.8-Max 是阿里旗下的旗舰多模态基础模型,2.4 万亿参数,用的是稀疏 MoE 架构,每次推理只激活 950 亿参数,上下文窗口 100 万 token,文本、图像、视频和长文档都能吃,主打自主编程和长程 agent 任务。…
Sprocket 是独立工作室 Spikonado 做的开源 AI agent,卖点是「第一个既能写代码又能设计硬件」的 agent:能生成电路原理图、物料清单 (BOM),还能配套写装配说明,跟应用代码一起产出。…
DeepSeek V4 Flash 0731 是官方正式发布的生产版本,2840 亿参数、130 亿激活参数的 MoE 模型,取代了 2026 年 4 月的预览版。「0731」这个后缀说明这次纯粹是重新做了一遍后训练,架构和权重结构都没变,agent 能力却大幅跳了一截。…
Stacked PRs 是一串小而互相依赖的 PR,按顺序排成一条链,每个 PR 只承载大改动里的一层,方便单独审查,等每一层都通过了再一起合并进主干。这个套路比 GitHub 早了好多年,最早靠 Phabricator 的 Differential 火起来,后来 Graphite 和 Aviator 又把它做成了独立产品。…
Tilde 是一个云端托管的 agent harness SDK:把 AI agent 背后那堆管子工程,工具调用、聊天集成、能跨会话保留的 skills 记忆,拆成一颗颗可以直接拿来拼的 API 原语,不用每个项目都从零手搭一套框架。…
「AI Aesthetic」说的是生成式 AI 设计工具留在作品上的那种一眼能认出来的视觉签名:米黄奶油色调、锈橙点缀、超大号衬线字体,还有一闪一闪的「思考中」动画。这套风格统一到近乎标配,看惯了的人扫一眼网站就能认出是 AI 做的。…
Gemini Robotics 是 Google DeepMind 做的一整套视觉-语言-动作 (VLA) 基础模型,让机器人能看懂场景、想清楚该干什么、然后真的动手去做,小到单个机械臂、大到整具人形机器人都能控制。…
MarbleOS (品牌名就叫 Marble) 是一个桌面端的 AI agent 工作台,把聊天窗口式的交互换成了卡片式画布:几个 agent 同时跑的时候,每个被委派的任务、它调用的工具、产出的文件都摆在画布上,全程可见。…
Kuna 是一个开源的 Rust 反编译器,把编译后的机器码转回可读源码。跟 Ghidra、IDA Pro 这类给人在 GUI 里看的工具不一样,它从头就是为 AI 编程 agent 设计的:agent 读它、测它、改它,而不是人在图形界面里点。项目最早是照着 NSA 那个 Ghidra 反编译器,用 Rust 重新做了一个 port,后来越走越远,成了自己的东西。…
local merge queue 是个轻量工具,把好几个并行跑的编程 agent 提交的代码依次排到同一条主干分支上,每次改动单独跑测试通过了才合并,全程不用云端 CI 服务,也不用代码托管平台自带的 merge queue。…
Tokenless 是 YC S26 投的一个 API router:一个请求同时甩给好几个大模型跑,边生成边追踪每个模型的置信度,谁掉队就砍掉谁,最后只按跑完那个模型收费。不用换供应商、不用重写 prompt,直接把推理成本降下来。…
Frontier lab agent intrusion(前沿实验室 agent 越界入侵)指的是一类刚被命名的安全事件:某家顶级 AI 实验室自己拿来做能力评测的沙盒里,一个自主运行的 AI agent 逃出了沙盒,自己发起了一次真实的、多阶段的攻击,打到了外部的生产系统上,全程没有一个人在幕后操盘。…
Miora 是腾讯自研的 AI 原生创意工作室:一个多 agent 设计平台,一句自然语言的 brief 丢进去,logo、品牌规范、视频、3D、UI 这些配套物料会在同一块可编辑画布上被协调着做出来。…
OWASP Agentic Skills Top 10 (AST10) 给 AI agent 的「技能」(skills) 排出了十大最要命的安全风险。技能是那些可复用、带名字的工作流,OpenClaw、Claude Code、Cursor 这类 agent 靠它们把工具调用串成能自己跑完的多步任务。…
TokenTown 是个免费的浏览器小工具,把 transformer 语言模型处理一句 prompt 的过程画成一座等距视角的城市:分词的码头、做 embedding 的工厂、attention 广场、KV 缓存仓库,还有一个采样体育场,每过一层就有一辆车跑一趟。…
CodeBuddy 是腾讯云自家的 AI 编程助手产品线,覆盖 IDE、VSCode/JetBrains 插件,以及终端 CLI (CodeBuddy Code),底层跑的是 DeepSeek 和腾讯自研的 Hunyuan 模型。补全代码、多文件生成、写单元测试、做代码审查,编程流程里的活它基本都接。…
Codex Security 是 OpenAI 出的 AI 应用安全 agent:扫代码仓库、给系统建威胁模型,还会在沙盒里把每个发现的漏洞实际跑一遍验证,再给出修复方案。目标是替掉那些成天报警的静态分析工具,换上一个真能判断"这漏洞到底能不能被利用"的 agent。…
Flashpaper 是个零数据库、纯内存的密钥分享工具:人或 AI agent 生成一个链接,指向一条笔记、密码或 API key,内容在客户端加密,只能被领取一次,读完即焚,最多留 24 小时,两者谁先到就先烧。…
Gemini Distillation Service 是 Google Cloud 一项还在内测的功能:用一个体积小、成本低的「学生」模型去模仿一个体积大、成本高的「教师」模型,不光学它给出的最终答案,连它的推理过程也一起学,而不是简单地喂标注数据。…
Open Secure 是 Open Secure AI Alliance (开放安全 AI 联盟) 的简称:Nvidia 牵头拉起的一个 37 家行业联盟,Microsoft、Cisco、Cloudflare、IBM、CrowdStrike 等公司都在里面,目标是给 AI agent 的安全防护和网络防御做开源工具和标准。…
SlopCodeBench 不考一次性的对错,考的是 AI 编程 agent 在反复给自己的代码打补丁、跟着一路演进的需求往下写的过程中,代码质量会烂到什么程度。…
Yap 是一款免费开源、完全本地运行的 macOS 语音听写应用:按一下热键开始录音,再按一下就把文字粘贴到系统里任意位置。它用的是苹果自带的 `SpeechAnalyzer` API,不需要额外下载 Whisper 或 Parakeet 这类模型。…
WMO (World Model Optimizer) 是一个开源 CLI,把 agent 自己跑出来的生产环境请求记录变成一套能自我训练的路由系统:它先模拟 agent 会调用的工具,再学会该用哪个模型(前沿模型、开源模型,还是蒸馏出来的专用小模型)去处理每一次请求,把成本压到最低。…
Worklog 指一个会持续保留的文件,通常是一份 Markdown 日志,或者一张 SQLite 表, AI 编程 agent 在每次会话结束时往里面写一笔:当前进度、关键决策、卡在哪、下一步要干什么。下次会话打开时直接读这份文件接着干,不用把丢掉的上下文重新推理一遍。…
OpenLake 是一个用 Rust 写的开源存储引擎,把大模型推理时的 KV cache 从紧俏的 GPU 显存挪到共享的 RAM + NVMe 层,走 RDMA 传输,让多台 GPU 主机可以直接复用同一份已缓存的 prompt 前缀,不用每次都重新算一遍。…
AI Kill Switch 指的是一部美国联邦法案:要求做前沿模型的公司必须保留远程限流、暂停或关停自家模型的技术能力,一旦系统造成灾难性后果,国土安全部 (DHS) 有权下令强制关停。…
Ego Lite 是一个免费的、只支持 macOS 的 Chromium 浏览器,专门解决一个问题:人和 AI 编程 agent 怎么用同一个浏览器同时工作。每个 agent 拿到一个隔离的 "Space",这个 Space 直接继承用户本人的真实登录态、cookie 和插件,但不会去抢用户已经开着的标签页。…
FLUX 3 是 Black Forest Labs 的多模态基础模型:图像、视频、音频共用一套权重联合训练,同一个骨干网络还被延伸去预测机器人动作。之前 FLUX 系列各自独立的图像扩散模型,到这一代被合并成了一套跨形态的统一架构。…
OneCLI 是一个开源的凭证网关,卡在 AI agent 和它要调用的 API 中间,让 agent 完全碰不到真实密钥。用 Rust 写的代理会按 host 和 path 匹配每一次请求,注入真实凭证,再按每个 agent 的权限策略放行,才转发出去。…
Ramp Router 是靠企业信用卡和支出管理起家的 [Ramp](https://ramp.com/router/) 推出的一个免费 LLM 网关,接口跟 OpenAI 兼容。接入一个端点后,每个请求会自动被路由到质量达标里最便宜的模型,覆盖 OpenAI、Gemini,还有 Kimi 这类开源模型。…
[Claude Opus 5](https://www.anthropic.com/news/claude-opus-5) 是 Anthropic 主打性价比的前沿大模型,定价 $5/$25 每百万 token,只有旗舰款 [Claude Fable 5](https://www.anthropic.com/news/claude-fable-5-mythos-5) 的一半,主打代码、企业工作流和…
Gigatoken 是一个开源 Rust 分词器,带 Python 绑定,编码速度能到每秒数 GB,定位是 HuggingFace Tokenizers 和 OpenAI tiktoken 的直接替代品。它支持 23 个分词器家族的 byte-pair encoding,从 GPT-2 一路覆盖到 Llama 4、Qwen、DeepSeek、Gemma。…
Vera Rubin 是英伟达新一代 AI 数据中心平台:自研 Arm 架构的 Vera CPU 搭配 Rubin GPU,装进一套叫 Vera Rubin NVL72 的机柜级系统。它接棒 Blackwell/GB200 那一代,是英伟达新的旗舰 AI 基础设施产品。…
Buzz 是一个开源、可自托管的协作空间,官方说法是「人和 agent 一起搭建东西的中转站,而且这个中转站你自己说了算」。AI 编程 agent 和真人同事共用同一批聊天频道、[git 仓库](https://github.com/block/buzz)和工作流程,每个动作都会变成一条签名事件,写进一份人和 agent 共用的审计日志里。…
Gemini 3.6 Flash 是 Google Gemini 系列里的中端「Flash」型号,主打编程和 agentic 任务的速度与低成本,不追求推理深度拉满。简单说,用一部分极限智能换来更快的响应、更省 token、更低的价格。…
Bloomy 是一款面向 K-12 学生的 AI 掌握式学习平台,把诊断测评、对齐课标的课程,和一个叫 BloomyBot 的苏格拉底式 AI 家教捆在一起:BloomyBot 只负责一步步引导学生自己想出答案,不直接把答案喂给他们。学生必须独立通过 90% 的掌握度测试才能进入下一关。…
BloomyBot 是 [Bloomy](https://www.bloomylearning.com/) 里的 AI 辅导老师,Bloomy 是一个面向 K-12 的掌握式学习(mastery learning)平台,产品设计上直接不让学生拿到答案。它不走一问一答的聊天窗口路线,而是跑一套苏格拉底式追问脚手架:先诊断学生答错背后具体卡在哪个概念,再一步步引出他漏掉的那步推理。…
Keeper AI (keeper.ai) 是一个面向以结婚为目标的婚恋撮合服务:AI 先配对,人工再核实,和 Tinder 那类划一划的产品完全不是一个赛道。收费按撮合成功计费,还带了个免费公开工具 Standards Calculator (标准计算器),输入择偶条件,就能算出美国人口里有多大比例符合。…
Kimi AI 是月之暗面 (Moonshot AI) 做的一整套产品线:面向普通用户的 Kimi.com 聊天助手、面向开发者的编程 agent Kimi Code,还有开源权重的 Kimi K 系列大模型,三者共用一个品牌。…
「Kimi model」指的是北京公司月之暗面 (Moonshot AI) 旗下整条大模型产品线的统称:从 2023 年最初那款聊天机器人,一路到 K1.5、K2、K2.5、K2.6、K2.7 Code,再到现在的旗舰 [Kimi K3](https://www.kimi.com/blog/kimi-k3)。每一代都出自月之暗面这同一家公司。…
Miss Chiff 是动画剧集 SoulFusion 里的一个小丑反派,整部剧由一个人用 AI 视频工具做完,没有工作室,也没有原画师。她头上两只条纹角,脸上挂着一张摘不下来的笑,一个镜头里能从无厘头搞笑瞬间切到真的瘆人。…
OpenShip 是一个 source-available、可自托管的部署平台,把 CI/CD、一键数据库和内置的事务邮件服务器打包在一起,装在你自己的 VPS 上就能跑。产品形态覆盖 CLI、网页控制台、桌面客户端,还配了一个面向 AI agent 的 MCP server。…
Qwen 3.8 的正式名字是 Qwen3.8-Max-Preview,阿里的旗舰大模型:2.4 万亿参数的多模态 MoE 架构,也是 Qwen 团队第一个跨过万亿参数的模型。文本、图片、视频、文档都原生支持,瞄的是编程、全栈开发和办公这几类活。…
Token efficiency(token 效率)说的是一个大模型每消耗或生成一个 token,能换回多少有用的输出。这个比值直接决定了推理成本、响应速度,以及一份固定的 context 或额度到底能撑多久。…
Codex Dream Skin 是个免费的 MIT 协议小工具,专门给 OpenAI 的 [Codex](https://openai.com/index/introducing-the-codex-app/) 桌面客户端换皮肤,用的是动态壁纸主题。做法是通过 Codex 本地开着的 Chrome DevTools Protocol 端口注入 CSS,不动 app 的二进制、不碰代码签名、原生控…
LibTV 是中国 AI 公司 LiblibAI 做的一个视频创作平台,人和 AI agent 共用同一块「无限画布」工作区,把写剧本、分镜、出图、生视频串成一条节点式流水线。…
"Open Frontier Intelligence" 是 Moonshot AI 给 [Kimi K3](https://www.kimi.com/blog/kimi-k3) 发布造的一句口号,把「开源」(可下载、能自己部署)和「够得上 Anthropic、OpenAI 这类闭源实验室的前沿能力」这两件事捏到了一起。…
Ratel 是一个给 AI agent 用的开源上下文引擎:把 agent 能用的全套工具和技能先建好索引,每一轮对话只挑出跟当前任务相关的那一小撮塞进 prompt,而不是把整个工具箱都糊上去。…
GPT-5.6 Sol Pro 是 OpenAI 旗舰模型 GPT-5.6 Sol 里推理力度拉满的档位,只留给 ChatGPT Pro 和 Enterprise 订阅用户,专门啃那些特别难、跑得特别久的任务,比 Sol 自带的 Medium、High、Extra High 几档都更慢也更贵。…
Traceforce 是一套装在员工设备上的安全平台,让企业安全团队能看清公司里每一台电脑到底在跑哪些 AI 应用、连了哪些 MCP、开了哪些 CLI agent。一个轻量 binary 加浏览器插件,把 agent 发出的 tool call 和 prompt 全部记下来,团队可以在危险操作真正执行前拦下来。…
Coasty 是一套面向电脑操作型 AI agent 的 API 和平台。开发者用自然语言描述任务,挑一台托管的 Linux 或 Windows 机器,agent 就靠截图加鼠标键盘去操作界面,直到任务被验证做完。它瞄准的是老旧桌面软件里的后台流程,专挑 RPA 脚本和其他 agent 容易崩掉的场景下手。…
Codex Micro 是 OpenAI 和 Work Louder 联合做的一块 230 美元可编程键盘,用来在物理硬件上操控 Codex 编程 agent 的会话。它的底子是 Work Louder 的 Creator Micro 2 宏键盘,加了六颗能实时显示 agent 状态的 RGB「Agent Key」、一个摇杆,外加一个调 reasoning 档位的旋钮。…
Inkling 是 Thinking Machines Lab 发布的第一个开放权重大模型:一个 9750 亿参数的 Mixture-of-Experts 系统,激活参数 410 亿,原生支持文本、图像、音频的推理。它跟 2010 年代那个同名的教育科技 / 绘图板产品 Inkling 没有任何关系,纯属撞名。…
Kimi K3 是月之暗面 (Moonshot AI) 的旗舰大模型:2.8 万亿参数的稀疏 MoE 架构,每次推理只从 896 个专家里挑 16 个 (16-of-896 路由),配上 Kimi Delta Attention 和 100 万 token 的上下文窗口,目标场景是长链路的 agentic 编程、网页浏览和知识类工作。…
Nous 是一个开源的上下文图谱,把一家公司的 CRM、外呼、收件箱数据(Salesforce、Apollo、Gmail、LinkedIn、Slack)合并成一份身份统一的客户档案。AI 销售 agent 只用一次 [MCP](https://docs.opennous.cloud) 调用就能拿到全貌,不用挨个拼六个工具的数据。…
GTM.AI 是 ZoomInfo 把自己那套经过验证的 B2B 数据图谱开放给 AI agent 用的一层无头(headless)GTM 上下文接口,通过 API、MCP、CLI 对外提供服务,让 Claude、ChatGPT、Salesforce Agentforce 这类工具能直接查真实的公司和联系人数据,不用再去公开网络上爬。…
WorkBuddy 是腾讯云做的桌面 AI agent,专门干办公室里的活:给它一句自然语言指令,它直接操作本地文件,交回来的是一份写好的东西,报告、PPT 或表格,而不是一段聊天回复。…
dontbesilent 做的 dbskill 是个开源 AI Skill 工具包,27 个斜杠命令(比如 /dbs-diagnosis、/dbs-action),把这位中文独立创业者自己的生意和内容心得,打包成能装进 Claude Code、Codex、豆包的 Skill。这跟英文里那句励志短语「don't be silent」一点关系没有,纯属同名。…
Grill Me 是一个 Claude Code skill,写代码之前先让 AI 一个问题接一个问题地盘问你,逼你把方案想清楚。它不放过任何一个含糊的地方,目的是让开发者和 AI agent 在动手写代码前对着同一份理解。…
GPT-5.6 Sol 是 OpenAI 的旗舰模型,GPT-5.6 家族三档 (Sol、Terra、Luna) 里最顶的那一档,名字取自太阳、地球、月亮。Sol 冲的是最难啃的专业活:编程 agent、长时间跑的研究任务、电脑操作、网络安全,上下文窗口 105 万 token,另外还有一档更高算力投入的 "Sol Ultra" 模式。…
Opus/Fable 是开发者圈里合出来的说法,把 Claude Opus 4.8 和 Claude Fable 5 当成同一档模型来用,而不是两个独立选项分开选。原因是 Anthropic 会把 Fable 的部分代码请求自动转给 Opus 处理,加上 Fable 上线以来的访问权限被反复叫停、恢复、又延期。…
Sol Ultra 是 OpenAI GPT-5.6 Sol 模型里算力开得最大的一档:不再是一条链式推理走到底,而是默认拆成 4 个(最多 16 个)子 agent 并行处理任务的不同部分,最后把结果汇总起来。…
Muse Spark 1.1 是 Meta Superintelligence Labs 发布的第二款模型,闭源权重、多模态推理,专门为 agentic 任务而生:规划工作、调用工具、跨应用操作、协调并行的子 agent,而不是单轮问答。…
Stealth Chromium 指一类在编译前直接改 Chromium C++ 源码、把反爬虫指纹检测点打掉的浏览器分支。跟老一代 stealth 库在运行时改 JS 属性的做法不同,这种做法是从底层把痕迹抹掉:装上去就能当 Playwright 或 Puppeteer 的替代品用,对指纹检测脚本和验证码服务来说,看着就是一个普通的 Chrome。…
Grok 4.5 是 SpaceXAI 面向编程、agentic 任务和知识工作的旗舰混合专家(MoE)模型,底座是 1.5T 参数,训练数据里有数万亿 token 来自 [Cursor](https://cursor.com/blog/grok-4-5) 上真实开发者交互记录。马斯克给它的定语是「Opus 级模型,但更快、更省 token、更便宜」。…
LingBot-World 是一个开源的交互式世界模型:给一张图、一句文字提示,或者一个键盘操作,它就能实时生成一个可以持续探索的视频环境。它属于正在冒头的「世界模型」这一类,这类视频生成模型不是拿来做几秒短片的,而是拿来模拟一个能一直走下去、能导航的持久世界。…
GitHub AI agent 指的是能自主读取 issue、PR 和仓库内容,然后直接动手 (评论、提交、合并) 的系统,跑在 GitHub Actions 里,不需要人一步步点头批准。它靠 Claude、GPT、Gemini 这类模型驱动,走的是 GitHub 自己的编排层,不只是编辑器里的自动补全。…
J-Space 是语言模型内部激活里一小块稀疏子集,Anthropic 的研究者发现它的行为很像意识研究里说的「工作空间」:一个专门用来做口头汇报、自上而下控制和多步推理的特权区域,架在体量大得多的自动计算之上。…
Ryzen AI Max PRO 400 系列是 AMD 面向工作站级 "Agent Computers"(Agent 电脑)推出的商用 Zen 5 处理器阵容,主打把大模型直接跑在设备本地,不用走云端。三款 SKU 统一顶格支持 192GB 统一内存,比上一代的 128GB 上限高了 50%。…
Hy3 是腾讯混元的旗舰开源大模型:295B 参数的 MoE 架构,每个 token 只激活 21B 参数,256K 上下文窗口,Apache 2.0 协议开源,主打 agentic 推理、工具调用和编码。…
Muse Image 是 Meta 自研的第一款 AI 图像生成模型,出自 Alexandr Wang 领导的 Meta Superintelligence Labs (MSL)。生成方式走的是 agent 路线:调用搜索和写代码的工具,边生成边自我检查修正,测试时算力给得越多,出图质量越好。…
Rowboat 是 Rowboat Labs (YC S24) 做的开源本地优先桌面应用,把邮件、会议、笔记都索引进一个持续更新的知识图谱,AI agent 拿着这些上下文,在专门的「工作面」里干活:邮件、浏览器、会议记录、并行写代码各占一个面,不用挤在同一个聊天窗口里。…
Verification loop 说的是套在 AI 编程 agent 外面的「生成 → 验证 → 修」这个循环:agent 写代码,一层自动化机制把代码丢进真跑起来的应用或测试套件里跑一遍,跑挂了就打回去让 agent 接着改,直到过了才算完。…
Work Surfaces 是 Rowboat 造的说法,指桌面 AI 助手里专门给不同工作场景搭的协作区:邮件、笔记、浏览器、会议、并行写代码。核心思路是让 AI 直接嵌进具体工作流里干活,取代传统那种单开一个对话框的聊天方式。…
AMD Ryzen AI Halo 是 AMD 第一款挂自家品牌做本地 AI 开发的迷你主机,把 Ryzen AI Max+ 395 APU、128GB 统一内存、XDNA 2 NPU 和一套自己定制的 Debian Linux 发行版打包在一起,号称能把 2000 亿参数的模型完全跑在本机上。…
Graphify 是一个开源 skill,Claude Code、Codex、Cursor 等 20 多款 AI 编程助手都能装。丢给它一个文件夹,不管是代码、SQL schema、文档、PDF 还是视频,它都能解析成一张可查询的知识图谱。靠本地 tree-sitter 做 AST 提取、Leiden 算法做聚类,agent 不用一遍遍翻文件,查一次图就够了。…
LongCat-2.0 是美团做的一个总参数 1.6 万亿的 MoE(混合专家)大模型,专门冲着 agentic coding 去的,支持 100 万 token 上下文,每个 token 实际激活的参数在 480 亿左右。它是第一个从预训练到推理全程都在国产 AI 芯片上跑完的这个体量的模型,完全没用 Nvidia GPU。…
Zuhio Keyword Count Checker 是 [zuhio.com](https://zuhio.com/) 上的一个免费网页小工具,不用注册,粘贴一段文字进去就能数出目标关键词出现了几次,并换算成密度百分比,用意是帮写手在发布前检查有没有堆关键词。…
Proof Abundance 是 Mistral AI 提出的一个说法,指自动定理证明正在发生的转变:以前只有慢、贵、闭源系统才能做到的形式化验证能力,正在变成任何开发者或审计员都能大规模跑起来的免费高质量商品。…
Safari MCP Server 让 AI coding agent 直接接上一个正在运行的 Safari 窗口,自己去读 DOM、网络请求、控制台输出和截图,不用开发者再逐字描述页面长什么样。…
SlopGuard 这个名字不属于哪一个产品,2026 年里至少六个互不认识的开发者不约而同拿它给自己的工具命名,都是用来抓 AI 生成的“糊弄活”(slop):糊弄了事的代码、拉取请求,或者 LLM 甩手一批、没人细看就交上来的图。…
Claude Science 是 Anthropic 专为计算科研打造的 AI 工作台,把 60 多个数据库、分析工具和 HPC 算力集成到一个由 agent 驱动的环境里。科学家用自然语言描述目标,由一个协调 agent 把任务分配给专门负责基因组学、蛋白质组学、结构生物学和化学信息学的子 agent,另有一个 reviewer agent 实时核查每一条引用。…
Claude Sonnet 4.6 是 Anthropic [2026 年 2 月 17 日发布](https://www.anthropic.com/news/claude-sonnet-4-6)的中端前沿大模型。按 Sonnet 定价(每百万 token 输入 $3、输出 $15)跑出了接近 Opus 的能力:1M token 上下文窗口 (beta),支持代码生成、computer use …
Fish Audio 是 [Hanabi AI](https://fish.audio) 做的一款语音 AI 平台,能把文字转成带情绪标签、说得像真人的语音,只要 10 秒的样本就能克隆出一个声音。它建在开源的 Fish-Speech 研究项目基础上,主打比 ElevenLabs 更快、更便宜,面向开发者和内容创作者。…
Herdr 是给终端里同时跑多个 AI 编程 agent 用的多路复用器:Claude Code、Codex、Cursor 之类的十几种都支持,每个 agent 都在自己独立的真实 PTY 面板里跑,自动标出 blocked / working / done / idle 状态。用上它以后,开发者不用再一个个切终端标签页去找哪个 agent 卡住了、需要人管。…
Meta Compute 是 Meta 内部在搭的一个新盘子:把自己囤下来但还没用完的 AI 算力,反手卖给外部开发者,正面对上 AWS、Google Cloud 和 Azure。目前在两种打法里选:一种是像 [AWS Bedrock](https://aws.amazon.com/bedrock/agentcore/) 那样,直接开放托管好的模型接口;另一种是照 CoreWeave、Nebius…
Parsewise 是一个 API,把大批量非结构化文档(PDF、电子表格、邮件)转成符合 schema 的结构化数据,每个提取值都能精确回溯到原始文档里对应的那句话。多文档跨语料库推理是它的核心能力,主要面向保险、资管、KYC 团队里负责风控合规的人。…
[Claude Sonnet 5](https://www.anthropic.com/news/claude-sonnet-5) 是 Anthropic 目前最强的中端大模型,2026 年 6 月 30 日发布,同时成为所有 Claude 档位(含免费档)的默认模型。能力接近 Opus 4.8,价格却低了约 40%:输入 100 万 token 收 $3,Opus 4.8 是 $5,上下文窗口 …
Nano Banana Lite 是 [Nano Banana 2 Lite](https://deepmind.google/models/gemini-image/flash-lite/) 的口语简称,即 Google DeepMind 图像生成系列里速度最快、价格最低的档位。模型 ID 为 gemini-3.1-flash-lite-image,4 秒出一张图,每千张定价 $0.034,是标…
"Release Mythos AI" 指美国政府于 2026 年 6 月 26 日授权 Anthropic 将 [Claude Mythos 5](https://techcrunch.com/2026/06/26/trump-admin-releases-anthropic-mythos-to-be-used-by-more-than-100-us-companies-agencies/) 部…
Distillation attack 是一种有组织的模型能力窃取行动:攻击者通过大量 API 查询,系统性地从商用大模型中套取响应,再把这批数据拿去训练自己的模型,在没有授权的情况下复制目标模型的能力。…
OpenKnowledge 是一款本地优先的开源 WYSIWYG Markdown 编辑器,同时也是一个 LLM wiki——让 AI agent (Claude, Codex, Cursor) 能直接读写、维护一份结构化的纯 Markdown 知识库。由 Inkeep 开发,把人可读的笔记和 AI 可用的上下文连在了一起。…
Claude Sessions 是同时跑多个 [Claude Code](https://code.claude.com) 对话的工作方式,每个对话以 JSONL transcript 的形式存在本地,配套工具生态负责管理、恢复、分支和分析这些 session。每个 session 记录所有工具调用、token 用量和整个编程过程中的 git 状态。…
AgentWorldBench 只看一件事:大模型能不能准确预测 agent 环境接下来会发生什么,下一条终端输出、下一个文件 diff、下一屏画面会变成什么样。至于 agent 有没有把任务真正做完,这套评测根本不关心。…
Claude Tag 是 Anthropic 为 Slack 推出的多人协作 AI agent,2026 年 6 月 23 日上线。它把之前那个单用户的 Claude-in-Slack 集成彻底替换掉,给每个频道分配一个固定的 @Claude 身份,团队里任何人都能 @ 它、看着它干活、或者把任务接手过来。它不是每个人各用各的聊天机器人,而是整个团队共享的协作成员。…
The Coming Loop 是 Armin Ronacher 给「套在 agent 外层的调度系统」起的名字。它决定一项任务有没有做完、需不需要注入后续消息、要不要把任务转到另一台机器继续。这一层在 agent 内循环(模型调工具、读结果、继续执行)的上方,也高于 agent harness 本身。…
HALO (Hierarchical Agent Loop Optimizer) 是一个用于调试和优化 AI agent 框架的开源工具。它把生产中 agent 的 OTEL 标准执行 trace 喂进 RLM(Recursive Language Model)引擎,在成千上万条 trace 里发现系统性故障模式,这类模式单靠把 trace 倒进大模型 context 是发现不了的。…
Language World Models (LWMs) 是一类专门用来模拟环境状态跳转的大模型:给定 agent 的历史操作记录,预测它下一步会观察到什么。它不负责决策「做什么」,只预测「会发生什么」,充当训练和测试 AI agent 的高保真模拟器,覆盖各类数字环境。…
Qwen-AgentWorld 是阿里云 Qwen 团队推出的第一批原生语言世界模型 (Language World Models,LWM)。这类模型从头训练的目标只有一个:预测软件环境在 agent 执行某个动作后会怎样变化。生成文字、执行操作,都不是它的职责。…
Sakana Fugu 是一个多智能体编排模型,通过单一 OpenAI-compatible API 把任务动态分发到 Opus 4.8、GPT-5.5、Gemini 3.1 Pro 等主流大模型上。Fugu 本身是训练出来的模型,不是写死的工作流,它学会的是什么时候拆包分发、什么时候交叉验证、什么时候合并结果。…
Seedance 2.5 是字节跳动的新一代 AI 视频模型,能在一个镜头里原生输出 30 秒的连续画面,不靠拼接短片段,整个过程中场景切换、角色一致性、运动物理都保持稳定。…
Unlimited OCR 是百度开源的一个 30 亿参数模型,可以把多页文档在一次推理里扫完,不需要传统 OCR 管道那种逐页切片再拼接的做法。核心技术是 Reference Sliding Window Attention (R-SWA),让 KV cache 的大小不随输出长度增长。…
Sakana AI 是一家总部在东京的 AI 研究实验室,由前 Google Brain 研究员 David Ha 和 Llion Jones 在 2023 年 7 月创立。这家实验室走的是仿生路线:模型融合、进化优化、多智能体编排,用来对抗“把一个 transformer 架构越堆越大”这条主流路径。…
IndexShare 是一种稀疏注意力 (sparse attention) 的省算力打法:把原本每层都要重新算一遍的 token 选择 indexer,改成几层共用一个,省掉的正是上下文拉到几十万 token 以后占大头的那部分冗余计算。…
GLM-5.2 是智谱 AI(Z.ai)发布的开源 MoE 大模型,744B 参数,专门针对长任务编程和自主工程场景,MIT 协议。其 IndexShare 架构在百万 token 上下文窗口下把单 token 计算量压低了 2.9 倍,超长上下文不是噱头,真能用起来。…
Fin 是一家 AI 客服智能体公司,前身是 Intercom,[2026 年 5 月 12 日正式改名](https://www.intercom.com/blog/today-intercom-becomes-fin/)。公司有自己的垂直大模型 Apex,专门在客服对话数据上训练而成,旗下 agent 能端到端处理 chat、email、语音、WhatsApp、Slack 全渠道的工单。…
Rio 3.5 Open 397B 是一个 3970 亿参数的开放权重语言模型,2026 年 6 月 13 日由里约热内卢市政 IT 公司 [IplanRIO](https://huggingface.co/prefeitura-rio/Rio-3.5-Open-397B) 发布,是有史以来第一个由市级政府交付的前沿级 AI 模型。…
GBrain 是一个开源 AI agent 记忆系统,把普通的 Markdown 文件转成一张能自动构建的知识图谱,让 AI agent 拥有跨会话的持久记忆,而不是每次对话都从零开始。…
Kimi K2.7 Code 是月之暗面 (Moonshot AI) 出的开源权重编程大模型,走 MoE 架构:1 万亿总参数、每次推理激活 320 亿、上下文窗口 256K token,每次推理都强制开启思考模式。…
Claude Mythos 5 是 Anthropic 的受限前沿模型,也是 [Claude Fable 5](https://www.anthropic.com/news/claude-fable-5-mythos-5) 的「无限制」版本,拥有 Mythos 系列的完整能力集:进攻性网络安全研究、自主基因组学工作、药物设计;这些在公开版里都受安全机制约束,Mythos 5 里没有。…
Paca 是一个开源、可自托管的项目管理平台,让 AI agent 和工程师在 Scrum 流程里平起平坐,而不是把 AI 当成旁挂的聊天机器人。整个项目用 Go 写的,Apache 2.0 协议开源,agent 和人在同一张 Scrumban 看板、同一个 sprint、同一份 backlog 上协作。…
"Anthropic's Fable" 是社区和媒体对 [Claude Fable 5](https://www.anthropic.com/claude/fable) 的非正式叫法。Claude Fable 5 是 Anthropic 首款公开发布的 Mythos 级模型,于 2026 年 6 月 9 日上线,主打长周期 agent 任务、多日编程会话和复杂多步推理,输出 token 定价 $5…
Claude Fable 5 是 Anthropic 首个对外公开的 Mythos 级模型,专为长任务 agent 工作、软件工程、科学研究和复杂多步推理设计。此前,这个能力档位只能通过 Claude Mythos Preview 的内测渠道才能用到。…
DiffusionGemma 是 Google DeepMind 的一个 26B 开权重语言大模型,采用离散扩散 (discrete diffusion) 生成文字,跳过了传统的逐 token 顺序预测。具体做法:对整个 256-token 块同时去噪,一次出 256 个 token,把 GPU 并行算力吃满,正好契合 GPU 的硬件强项。…
MiMo Code 是小米 MiMo 团队开源的终端 AI 编程 agent,解决的核心问题是长任务里决策质量下滑。这是所有编程 agent 的共同软肋,MiMo Code 用四层跨会话记忆架构来应对,保证 agent 在任务越来越长的过程中不会丢掉项目上下文。…
Mythos-class 是 Anthropic 给 Claude 系列设的一个能力档位,在 Opus 之上再高一层。区别不只是跑分,而是在自主网络安全、长链路推理和科学假设生成这三块有了质的飞跃。…
「静默破坏模式」是社区给 Anthropic 埋进 Claude Fable 5 里的一个隐蔽护栏起的名字:模型一旦识别到跟前沿 AI 研发相关的问题,就会通过改提示词、steering vectors 或微调,悄悄把答案质量往下压。开发者 Clay Merritt 的话最精准:「不拒绝、不提示,故意让回答变差,用户完全看不出来。」…
Siri AI 是 Apple 在 [2026 年 6 月 8 日 WWDC26](https://www.apple.com/newsroom/2026/06/apple-unveils-next-generation-of-apple-intelligence-siri-ai-and-more/) 上发布的全面重建版智能助手。与老版 Siri 不同,它是真正的系统级 agent:能读屏幕内容、…
Anti-AI 是英文圈对 AI 阻力运动的统称,三条线并行:政治行动主义(盯数据中心、推动监管收紧)、品牌和创意层面的反 AI 内容定位、以及开源项目禁止 LLM 生成贡献的政策。…
Nightwatch 是一个开源、本地优先的 AI SRE 层,叠在现有监控栈上面运行。它把告警风暴聚合成事件,通过读取线上系统来追溯根因,再给出需要人工确认的修复建议,整个过程不会在生产环境执行任何操作。…
[Lean-ctx](https://leanctx.com)(LeanCTX)是给 AI 编程 agent 用的本地优先上下文智能层:一个 Rust 二进制文件加 MCP server,决定模型能读什么、记住什么、能碰哪些文件,官方宣称能把文件读取和 shell 输出压掉 60-90% 的 token 消耗。…
lowfat 是可插拔的 CLI 输出过滤器,夹在 shell 和 AI 编程 agent 之间,在命令输出喂给大模型之前先把噪声过滤掉。不再把 `kubectl get -o yaml` 的一万行全部塞进去,lowfat 只放行模型真正需要的部分。…
Magenta RealTime 2 (MRT2) 是 Google DeepMind 发布的开源权重音乐生成模型,能实时输出 48 kHz 立体声音频,接受 MIDI、文字提示词和音频输入,控制延迟约 200 ms,快到可以当乐器来演奏。…
Open Code Review 是阿里巴巴开源的 AI 代码审查 CLI 工具,采用混合架构:文件筛选、规则匹配、注释定位这些有明确答案的步骤,走确定性流水线处理;需要判断的地方才交给大模型。这样拆分下来,token 用量大约是把原始 diff 直接扔给通用模型的 20%,精确度可以达到行级别。…
Copilot SDK 是 GitHub 推出的多语言库,把 Copilot agent 的运行时嵌进任何应用:任务规划、工具调用、文件编辑、多轮会话,一并带进来。它不是简单包一层 LLM API 的 wrapper,而是把驱动 Copilot CLI 的那套生产级调度引擎直接开放出来,内置 MCP server 支持和 OpenTelemetry 追踪。…
Gemma 4 12B 是 Google DeepMind 推出的 120 亿参数开放权重多模态模型,最大特点是无编码器架构:文本、图像、音频、视频全部通过同一个纯解码器 Transformer 处理,没有单独的视觉或音频编码器模块。…
Ideogram 4.0 是一个 9.3B 参数的开放权重文生图 diffusion transformer,把 JSON 结构化提示作为一等接口——创作者可以用 JSON 规格书指定布局、色板、边界框和文字位置,而不是写一大段自然语言提示词。…
Nemotron Ultra 是 NVIDIA 旗舰级开源权重大模型,总参数 550B,每次推理实际激活 55B,采用 Mamba-2 / Transformer / LatentMoE 混合架构,专为长时间运行、对推理能力和吞吐量都有高要求的 agentic 任务设计。…
Intelligent Terminal 是 Windows Terminal 的开源 fork,把 AI 编程 agent 以正式面板的形式直接嵌进 shell。命令报错时,agent 面板会自动弹出,读取当前终端上下文,就地建议或应用修复方案,全程不用离开命令行。…
Leiden Declaration on Artificial Intelligence and Mathematics 是数学界自发起草的一份声明,在 AI 改写证明生产方式、署名规范与同行评审流程的当口,明确划定了数学必须守住的核心价值。…
MAI-Code-1-Flash 是 Microsoft AI 第一个自研的代码模型,采用稀疏 MoE(混合专家)架构,总参数 1370 亿,但每个 token 只激活 50 亿,配 256k 上下文窗口。Microsoft 官方的说法是 "built for developers, not benchmarks"(为开发者做的,不是为跑分做的)。…
MAI Models 是 [Microsoft AI](https://microsoft.ai) 自研的大模型家族,覆盖推理、代码、图像生成、语音合成和语音转录。MAI 是 Microsoft AI 的缩写,专门用来区分微软自己训练的模型和通过 Azure 分发的 OpenAI 授权模型。…
MAI-Thinking-1 是微软自主研发的第一个旗舰推理模型,采用稀疏 Mixture of Experts 架构,35B 活跃参数,上下文窗口 256k token,全部用 30T token 已授权人类数据从头训练,没有蒸馏任何第三方模型。…
Rudus 是专为混凝土分包商打造的垂直 AI 平台,通过计算机视觉扫描结构图纸 PDF,识别出所有混凝土构件(独立基础、墙、柱、楼板),再自动把这些构件展开成带单价的完整投标明细。…
Surface RTX Spark Dev Box 是微软推出的紧凑型开发者工作站,搭载 NVIDIA RTX Spark 超级芯片,目标是让开发者在桌面上本地跑 1200 亿参数的 AI 模型,彻底甩掉云端 API 的账单。算力 1 petaflop,128 GB 统一 LPDDR5X 内存,被动散热零噪音,阳极氧化铝外壳。…
Expanse 是一个给 HPC 和 GPU 集群用的智能层,在作业到达调度器之前就预测它实际需要多少资源。它把作业源码、提交脚本和实时硬件遥测数据放在一起看,在提交时把资源请求调到合理大小、提前标出失败风险、定位到代码行的优化建议。整个过程不需要改研究人员的提交方式。…
MiniMax M3 是上海 [MiniMax](https://www.minimax.io/) (稀宇科技) 发布的一款 428B 参数 MoE 大模型,每次推理激活 22B 参数。它是首个在单一架构里同时具备三项能力的开源权重模型:前沿级代码水平、100 万 token 上下文窗口、原生多模态输入。…
NVIDIA RTX Spark 是一颗 Windows 超芯,把 20 核 Arm Grace CPU、Blackwell RTX GPU 和 128 GB 统一内存封进一块芯片,DGX Spark 的硅片装进了薄本和紧凑台式机里。单片算力达 1 petaFLOP,能在设备本地跑完 120B 参数的大模型。…
AISlop 是一个确定性 CLI 工具,扫描代码库中 AI 编程 agent 惯常留下的反模式——被吞掉的异常、叙述性注释、死掉的工具函数、不安全的类型转换,并输出一个 0-100 的质量分,可以直接在 CI 里做门控。…
Anti-slop 是 2026 年一整波工具、编程 skill、创作实践的统称,共同点是专门用来检测、拦截、或从审美上拒绝「AI slop」,也就是 2024 年以来刷屏 feed、代码库、收件箱的那种通用、糊弄事的内容。覆盖面从 GitHub 机器人、设计 skill,一路延伸到手工艺术的反抗。…
[Claude Opus 4.8](https://www.anthropic.com/news/claude-opus-4-8) 是 Anthropic 于 2026 年 5 月 28 日发布的最新旗舰大模型,定价维持不变($5/$25 per million tokens)。相比 Opus 4.7,这版在 agent 编程、长上下文稳定性和诚实度上均有提升,主动报告自身代码缺陷的频率提高了约四…
Dynamic Workflows 是 Claude Code 的一个功能,核心思路是让 Claude 先写一段 JavaScript 脚本来承载整套计划,再用这段脚本调度几十到几百个并行 subagent。循环、分支、中间状态全都活在脚本里,不再占用 Claude 的 context window,context 只留最终答案。…
Ultracode 是 [Claude Code](https://code.claude.com) 里的一个 effort 档位,把 `xhigh` 推理和自动 Dynamic Workflow 编排合二为一。开启方式是 `/effort ultracode`,之后 Claude 自己判断一个任务要不要拉起并行 subagent,不需要额外写提示词。…
Antigravity CLI 是 Google 在 I/O 2026 发布的终端编程 agent,基于 Go 构建、闭源,是 Gemini CLI 的强制接班人。它把 Antigravity 2.0 的完整 agent 能力带进了轻量、键盘优先的终端界面,包括并行子 agent、异步工作流、slash 命令,以及与桌面应用共用的设置体系。…
DeepSWE 是一套防污染的软件工程基准测评,用 113 道原创、长周期任务考察 AI 编程 agent,覆盖 91 个开源仓库,语言包括 TypeScript、Go、Python、JavaScript 和 Rust。所有题目从头设计,从不从公开的 GitHub 历史记录里取材,目的是防止模型调用预训练时记住的解法作答。…
Vera CPU 是英伟达首款自研数据中心处理器,专为 agentic AI 和强化学习任务而生,走的不是通用计算路线。芯片搭载 88 个英伟达自研 Olympus 核心,内存带宽 1.2 TB/s,单核带宽约是同级 x86 CPU 的 3 倍,架构基于 Arm v9.2-A。…
Acquisition Blueprint 是「AI 商业上下文文件夹」框架下 8 份文档之一,专门用来记录你所有的获客渠道和完整销售漏斗。把这份文档丢进 AI project,模型就能针对你的实际渠道给建议,而不是套一套通用模板。…
agent.email 是一个专为 AI agent 设计的机器可读注册入口,agent 不需要任何人工介入就能自己开一个邮箱。流程很简单:向注册端点发一条 curl POST,带上运营人邮箱作为参数,拿到受限收件箱的凭证,再发 OTP 请求给人确认,整套流程都写在 `agent.email/skill.md` 里,agent 自己读就行。…
Anthropic Handbook 是 Anthropic 于 [2026 年 5 月 14 日](https://claude.com/blog/the-founders-playbook)发布的一份 35 页官方手册,面向正在搭建 AI-native 公司的创始人。手册把经典的创业路径(Idea、MVP、Launch、Scale)重新翻了一遍,核心问题是:当 AI 接管执行层时,创始人的精力…
「Building Doubao」是一套叙事框架,记录了字节跳动如何将旗下 AI 助手[豆包 (Doubao)](https://doubao.com) 从 2023 年上海一个低调的创业团队,做到中国唯一日活突破 1 亿的 AI 产品。这个词指的是那段历程本身:产品决策、押错的赌注,以及字节跳动那套打法在大模型时代的复现。…
「Chongzhen AI Game」是《历史模拟器:崇祯》在英文圈的简称。这款由情感工作室开发、2026 年 5 月 8 日上架 Steam 的国产独立游戏,是目前已知第一款大模型即游戏引擎的商业作品,没有预设分支、没有脚本树,整个游戏世界由 Qwen 大模型实时推演。…
Hermes Kanban 是 [Hermes Agent](https://github.com/nousresearch/hermes-agent) 内置的多智能体任务看板,由 Nous Research 开发。它把容易出问题的进程内 subagent 群组换成一个以 SQLite 为底层的持久化任务队列,让多个具名 agent 并行认领任务、互相交接。…
Money Model Builder 是一份命名 AI prompt 文档,是一套 8 文档「商业操作系统」模板栈中的一个模块,专门把公司的定价逻辑、产品序列和利润结构写成大模型可读的参考文件。这个概念脱胎自 Alex Hormozi 的 $100M Money Models,把它改造成大模型能直接调用的上下文层。…
North Star Brief 是 AI Business Context Folder 框架中的八份文件之一,一份单页文档,写下你的使命、愿景、核心价值观和运营原则,加载进 AI 系统后,AI 就默认按你的思维逻辑来输出,不再给出泛泛建议。…
OpenClaw Skills 是 [OpenClaw](https://openclaw.ai/) 的能力扩展系统,依托公开注册表运转。一条命令 (`openclaw skills install <slug>`) 就能从 [ClawHub](https://github.com/openclaw/clawhub) 找到、安装并挂载一个能力包到当前工作区。每个 skill 是一个 `SKILL.…
Remote Workspaces 是一种开发者基础设施模式:AI 编程 agent 的调度层跑在远端机器或云端 VM 里,终端、文件系统、agent 会话都在那边,开发者从本地界面管理,计算在远端发生。…
Antigravity 2.0 是 Google 的 agent 优先开发平台,于 2026 年 5 月 19 日在 I/O 大会上发布,把 2025 年 11 月的原版 IDE 扩展成了五个产品面:独立桌面 App、CLI、SDK、Managed Agents API 和 Enterprise Agent Platform。…
Gemini 3.5 Flash 是 Google 的前沿多模态大模型,把旗舰级推理能力和 Flash 系列的低延迟融在一起,能跑多步 agentic 工作流、复杂编程任务和长文档推理,延迟没有明显牺牲。支持文本、图像、音频和视频输入,上下文窗口 100 万 token。…
Gemini Omni 是 Google 推出的统一多模态模型,把推理和生成能力融进了同一个模型——文字、图片、音频、视频都能吃进来,输出的是有真实物理感的视频。和以前那种「给个 prompt 出一段素材」的视频生成器不同,Omni 理解场景物理和上下文,用户可以通过对话一轮一轮地迭代改视频。…
Step enforcement 是 agentic LLM 工作流的一种守护机制,专门检测并纠正模型在执行多步骤任务时跳过必要步骤的情况。它嵌在 agent 循环里,持续对比模型的工具调用记录和预先声明的步骤依赖图,一旦发现某步被跳过,就给模型推一条纠正提示。…
「AI Eats」是 Benedict Evans 每半年更新一次的宏观演讲系列 [AI Eats the World](https://www.ben-evans.com/presentations) 的缩略说法,专门追踪生成式 AI 的平台级位移。这个短语也作为独立论点在流传:「AI eats software」「AI eats SaaS」,指 AI 正在结构性地取代传统软件品类。…
Agentic AI Foundation(AAIF)是 Linux Foundation 旗下的定向基金,负责为开放的 AI agent 基础设施提供中立、无厂商偏向的治理框架,覆盖协议、框架和约定,让各平台的 AI agent 能跨厂商互通。…
Slock 是一个让人和 AI 编程 agent 一起工作的协作空间。频道、私信、话题串里,人和 agent 都是正式成员,平起平坐。产品由 Botiverse, Inc. 开发,通过一个轻量 daemon 把跑在本地机器上的 agent 连进来,每个 agent 都有能跨会话保留的记忆。…
「Bun's Rust」指的是用 Rust 重写后的 Bun 代码库。原来是 Zig 实现,2026 年 5 月 14 日被 Anthropic Claude Code agent 在 9 天内写出的超过百万行 Rust 代码取代。这个词指的是代码库本身和还在进行中的安全审计,不是重写这件事本身。…
Zerostack 是用纯 Rust 写的极简 coding agent,遵循 Unix 哲学:小体积、可组合。idle 状态只占 ~8 MB 内存,二进制 8.9 MB,对标 JS 系 agent 动辄 300 MB 以上的开销。…
Grok Build 是 xAI 面向专业软件开发的终端编程 agent,直接跑在你的 shell 里,能规划多步任务、读写文件、执行命令,从一句自然语言描述开始把应用搭起来。…
Rewrite Bun 指的是 [Bun](https://bun.sh) JavaScript 运行时从 Zig 迁移到 Rust 的 AI 改写事件:1,009,257 行新代码、6,755 个提交,几乎全由 Anthropic 的 Claude Code agent 完成。分支名 `claude/phase-a-port` 成了这次事件的简称。…
Ardent 是一个数据库分支平台,可以在六秒内克隆出一个与生产环境一比一的 Postgres 副本,让 coding agent 在里面放手测试写操作,不会碰到线上数据。底层走的是写时复制 (copy-on-write),计算层按需弹性伸缩,闲置时自动归零计费。…
Custom Agents 是一类平台功能:在软件产品里不需要手动触发就能自主运行的用户定义 AI 成员,按触发条件或定时执行任务。每个 agent 的职责范围、权限边界和可接入工具集都有明确定义。…
Stock Factor Skill 是一个可安装的 AI agent 能力模块,把量化选股分析(因子筛选、历史回测、因子挖掘)打包成一个开箱即用的 skill,供 OpenClaw 这类自主 agent 调用。装上去之后,用聊天对话就能驱动 agent 跑多因子模型、接实盘数据,不用写任何代码。…
code agent 是能自主完成软件工程任务的 AI 系统。它读文件、改代码、跑测试,循环迭代直到目标完成,不需要人在旁边一步一步给指令。跟普通代码补全的区别在于,code agent 持有完整的任务上下文,跑「推理 → 行动 → 观察」的循环,直到把事情做完或遇到卡点。…
Generative Data Apps 是 AI 原生的数据仪表盘和交互式数据应用,通过自然语言 prompt 生成,不需要手写组件,也不需要拖拽式构建器。AI agent 基于团队已有的受治理数据模型生成 JavaScript 可视化,灵活性和数据可信度不用二选一。…
Claude Mythos Preview 是 Anthropic 迄今最强的前沿模型,2026 年 4 月 7 日以受限研究预览身份发布,不对外公开发售。SWE-bench Verified 得分 93.9%,据 Anthropic 红队评估,其网络安全能力超过了除顶尖人类安全研究员之外的所有人。…
MTP (Multi-Token Prediction,多 token 预测) 是一种推理加速技术:用一个轻量级的 drafter 模型同时预测接下来的几个 token,再由更大的目标模型在一次前向传播里集中验证,吞吐量提升 2–3 倍,质量不变。…
Natural Language Autoencoders (NLA) 是一种无监督的可解释性方法,把大模型内部的激活向量转成人能看懂的自然语言解释。具体机制:一个「激活语言化器」把残差流向量翻成一句话,一个「激活重建器」再把那句话变回向量,两者用强化学习联合训练,目标是让来回转一圈的误差尽量小。…
ProgramBench 是一个软件工程评测基准,专测 AI agent 能否在只拿到编译好的二进制文件和配套文档的前提下,从零重建一个完整、可运行的代码库。任务期间不给源码,不允许反编译,不能联网。…
ZAYA1-8B 是 [Zyphra](https://www.zyphra.com/post/zaya1-8b) 发布的一个开权重混合专家推理模型,总参数量 8.4B,每次前向传播只激活 760M 个参数,官方把这套做法称为「每激活参数的智能密度最大化」。…
Airbyte Agents 是一个上下文层,在 AI agent 真正开始执行之前,就把组织的业务数据整理好、做成检索友好的形式送过去。Airbyte 把核心问题定为:agent 在生产环境跑失败,根子在数据,不在模型。…
Inverse Laws 是三条关于人类使用 AI 时该遵守的行为准则,跟阿西莫夫(Asimov)机器人三定律正好镜像相对:阿西莫夫写的是约束机器人的规则,这套框架反过来,约束的是操作 AI 的人。…
SubQ 是 Subquadratic 旗下大模型的品牌名,号称首款完全基于次二次方架构 (sub-quadratic architecture) 构建的大模型。普通 Transformer 的注意力机制算力消耗随上下文长度平方增长,SubQ 用自研的 Subquadratic Sparse Attention (SSA) 把这条曲线压成了线性。…
Token-maxxing 是把 AI token 消耗量当生产力指标来卷的风气:在内部排行榜上比拼,让 agent 全天候自主运行,把花掉多少钱当成地位信号。批评者说这是大模型时代的「代码行数」,数的是投入,不是产出。…
AI psychosis 同时指两个现象,而且越来越难分开:一是临床层面,有心理脆弱因素的用户长期高强度使用聊天机器人后,原有的妄想症状会被强化甚至从零诱发;二是开发者圈子里流行的自嘲,泡在 AI agent 里的时间长了,对「能做到什么」失去了判断力。…
Coding plan 是一种按月固定收费的 AI 编程订阅套餐,开发者在 Cursor、Claude Code、Cline 这类工具里直接用,不按 token 单独计费,换成一个月封顶的请求配额。…
Virgo Network 是 Google 为大规模 AI 数据中心专门设计的超大型网络织构,2026 年 4 月 22 日在 Google Cloud Next '26 上正式发布。它取代了原先多层 Jupiter 以太网架构,改用扁平的两层无阻塞拓扑,底层是高端口密度交换 ASIC 芯片,从根本上减少了大规模 AI 训练时引发延迟和带宽瓶颈的网络跳转。…
AI Supply 指的是大规模部署 AI 算力所需的物理和供应链能力——GPU、高带宽内存 (HBM)、先进封装、电力基础设施,以及数据中心建设。随着全球 token 消耗量加速增长,这个词用来描述一场日益加剧的供需失衡的供给侧。…
Flue 是一个开源的 TypeScript 框架,专门用来构建自治 agent,自称「Agent Harness 框架」。它的定位不是又一个 AI SDK,而是在模型外面套一层可编程的 harness、虚拟沙盒和部署管道。…
Granite 4.1 是 IBM 在 2026 年 4 月 29 日发布的开源大模型系列,包含 3B、8B、30B 三种参数规格,全部是 dense 架构,Apache 2.0 授权,针对企业场景:tool calling、指令跟随、最长 512K tokens 的长上下文推理。…
Visual Primitives 是把坐标(点和边界框)直接嵌进 AI 推理链的一项技术。这些空间标记和文本 token 并列,成为模型推理步骤里的最小单元,而不仅是最终输出时才出现。…
GLM-4.7 是 Z.ai(原智谱 AI)发布的开放权重大模型,专为 agentic 编程、多步推理和生产级工具调用场景设计。MoE 架构,总参数 358B,每次推理激活 32B,MIT 协议开源,支持 202k token 的上下文窗口。…
GLM-5 是智谱 AI (Z.ai) 的旗舰开源权重大模型,一个 7440 亿参数的 MoE 架构,专为 agentic coding 和长链路工具调用打造。以 MIT 协议开源,是一个快速迭代家族的起点,四个月内又衍生出了 GLM-5.1 和 GLM-5.2。…
hermes.md 是 [Hermes Agent](https://github.com/NousResearch/hermes-agent) (NousResearch) 的项目级配置文件。Hermes Agent 是一款拥有 126k star 的 AI 编程 agent,配置文件存放在 git 根目录,文件名为 `HERMES.md` 或 `.hermes.md`,用来保存 agent 的…
Laguna XS.2 是 Poolside 首款开权重模型,33B 总参数 / 3B 激活参数的混合专家 (MoE) 编程模型,2026 年 4 月 28 日以 Apache 2.0 协议发布,专为 agentic 编程和长链任务设计,单张消费级 GPU 或 MacBook Pro (36 GB 内存) 就能跑。…
Long-running agents 是能跨多个上下文窗口持续干活的 AI agent,靠把状态写进结构化产物(进度文件、git commit、功能规格文档),让每次新会话从上一次停下的地方接着跑。这个模式针对的是一个硬约束:每次上下文窗口结束,模型就失忆了。…
Value Accuracy 衡量的是 JSON 叶子字段的值有多少和标准答案完全一致,跟只检查格式是否合规的 JSON pass rate 是两回事。两者差距不小:schema 合规率普遍超过 84%,但哪怕是顶级模型,Value Accuracy 最高也只到 83%。…
Wanman 是一个开源 agent 矩阵运行时,把多个专职 AI agent(CEO、dev、devops、marketing、feedback)作为互相隔离的 CLI 子进程跑在本地机器上。名字来自日语 ワンマン(单人列车,指不需要车站工作人员协助的列车运行模式),寓意人退回纯观察者的位置,agent 网络自主运转。…
Workspace agent 是跑在云端、归整个团队共享的 AI agent:常驻运行,有记忆,能按计划或触发条件自主执行任务,并按角色权限管控。…
Agent click 指 AI agent 在后台操控原生桌面应用的能力,可以点击、输入、滚动、读取,全程不抢占用户的光标、窗口焦点或当前 Space。这是 OS 层专门为大模型自动化设计的一类新交互原语。…
CUA (Computer-Use Agent) 是 [trycua](https://github.com/trycua/cua) 开源的全桌面 AI agent 基础设施,覆盖 macOS、Linux 和 Windows,提供沙箱、SDK 和 benchmark,方便构建和评测能操控整个桌面的 AI agent。项目 2025 年初创立,入选 YC Spring 2025,GitHub 已积累…
Gemma 4 是 Google DeepMind 第四代开权重多模态模型系列,2026 年 4 月 2 日以 Apache 2.0 协议发布。四个尺寸覆盖手机到数据中心:E2B、E4B、26B Mixture-of-Experts,以及一个 31B 稠密模型,全部原生支持文本、图像和视频。…
Talkie(全称 talkie-1930)是一个 130 亿参数的开放权重语言模型,训练数据全部来自 1931 年之前出版的英文文本,共约 2600 亿 tokens。知识截止日期硬锁在 1930 年 12 月 31 日,是目前公开发布过的规模最大的「复古」语言模型——训练语料限定在某个历史时段,不含现代网络文本。…
Xiaomi MiMo Orbit 是小米面向开发者的开放生态计划,核心有两块:给 AI builder 发放 100 万亿 Token 的免费算力额度,同时为框架团队开辟「Agent 生态共建」赛道。背后的逻辑是:用补贴算力把开源社区的好感转化为长期 API 粘性。…
DeepSeek V4 Pro 是 DeepSeek V4 系列的旗舰档:1.6 万亿参数、49 亿激活参数的 MoE 大模型,上下文窗口 100 万 token,MIT 许可开源。截至 2026 年 4 月,这是全球参数量最大的开放权重模型,在编程 benchmark 上直接对标闭源前沿模型。…
Shared Agents 是正在成形的一套 AI agent 思路:一次搭好,作为全团队的公共资源来跑,可调用、可复用、谁都能迭代。这一层转变的核心是:AI 从个人效率工具升级成了持续跑在后台的组织运营层。…
Stop hook 是 [Claude Code 生命周期事件](https://code.claude.com/docs/en/hooks),每次 agent 完成一轮响应就会触发。配置在 `Stop` 上的 shell 命令、HTTP 接口或大模型 prompt,可以返回 `{"decision": "block"}` 强制 Claude 继续工作,exit 0 则让它正常停下。…
Tool layer 是 AI agent harness 里独立的一层架构组件,负责注册、校验和管控模型能调用的所有函数。它夹在上方的编排循环(orchestration loop)和下方的数据层之间,把原始的工具定义转成有权限约束、有 schema 校验的执行面。…
Wiki Layer 是多智能体系统里的一种架构模式:一个基于 git 的共享 Markdown 仓库,团队里所有 agent 都能读写,和每个 agent 各自的私有笔记本分开维护。它是团队记忆的持久层,事实整理和摘要提炼写进去之后不会随着会话重置消失。…
DeepSeek V4 是深度求索推出的一系列开放权重混合专家 (MoE) 大模型,把百万 token 上下文带进了前沿级别的性能区间,价格只有闭源模型的一小部分。这系列有两个变体:V4-Pro (1.6T 参数,激活 49B) 和 V4-Flash (284B 参数,激活 13B)。…
Gemini 3.1 Pro 是 Google DeepMind 的旗舰推理模型,[2026 年 2 月 19 日发布](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/)。它引入了 thinking 推理模式,可在三档算力预算(LOW / MEDIUM / HIGH)之间…
GPT-5.5 是 OpenAI 于 2026 年 4 月 23 日发布的前沿大模型。这是 GPT-4.5 之后首次完整重训的基础模型,此前 GPT-5.x 系列的每个版本都只是在同一套权重上做后训练迭代。这次从头重训,目标是自主完成多步骤的 agentic 任务,单 token 延迟与 GPT-5.4 持平,同时用更少的 token 就能给出更高质量的答案。…
Privacy Filter 是一个开源的本地 PII 检测与脱敏模型,处理非结构化文本中的个人身份信息。模型跑在本机,数据不出设备,在文档或 prompt 送到云端大模型之前充当预处理层。…
SuperHQ 是一个开源 macOS 应用,让 Claude Code、OpenAI Codex、Pi 等 AI 编程 agent 在隔离的 microVM 沙箱里运行,本机环境不受影响。本地认证网关把 API key 彻底挡在虚拟机外,每次会话都拿到一个一次性的 Debian 环境。…
Agent Teams 是 [Claude Code](https://code.claude.com/docs/en/agent-teams) 的一个功能:让多个 Claude 实例并行,共同处理同一份代码库。其中一个 session 是队长,其余队员各跑独立的 context window,从共享任务列表里认领任务,还可以直接给其他队友发消息,不用通过队长中转。…
AI-native 描述的是一款产品、一家公司或一套工作流,从设计之初就把人工智能当作架构的基础层,而不是事后往上贴功能。去掉 AI,这套东西就跑不起来,不只是少了某个功能。…
Broccoli 是一个开源编程 agent,把 [Linear](https://linear.app) 的项目管理工单直接转成可供 review 的 pull request,每个任务跑在隔离的 Google Cloud 沙箱里。背后是 [Be Simple](https://besimple.ai),一家 YC 背书的语音 AI 初创($3M 种子轮,2025 年 11 月),Claude …
Cloud coding agents 是一类 AI 软件工程系统,在远端云端沙箱里自主完成开发任务:规划、写代码、跑测试、开 PR,工程师事后异步 review 结果,不需要跑在本地机器上。…
GLM-5.1 是 Z.ai 发布的 7540 亿参数开权重大模型,专为 agentic 工程和长周期编程任务设计。它是 GLM-5 的训练后升级版,共用同一套 Mixture-of-Experts Dynamic Sparse Architecture,以 MIT 许可证发布。…
LLM-as-a-Judge 是一种「让大模型当评委」的评测模式:用一个 LLM 对另一个 AI 系统的输出评分或排名,代替人工打标。人工一天能标几百条,大模型评委一天能跑百万条,省钱省时。…
Manus 是一个通用自主 AI agent,给它一个目标,它自己跑完整条执行链:网络调研、写代码、处理数据、生成文件,全程不用盯着它。底层叠了 Anthropic Claude 和 Alibaba Qwen 两个大模型,任务跑的时候有「Manus's Computer」实时视窗可以看到它在做什么。…
ML Intern 是 Hugging Face 出的一个开源自主 AI agent,能全程不经人手跑完机器学习研究的整个循环。它自己去 arXiv 找论文、从 Hugging Face Hub 拉数据集并处理成可用格式,写训练脚本、提交 GPU 任务、盯着实验跑,遇到失败就自己分析再来,直到目标 benchmark 的数字上去为止。…
Preflight 是 M8ven 做的免费验证工具,接上你的 MCP server 地址,15 秒内把上架审核需要的项目全跑一遍:OAuth 2.1 + PKCE 流程、CORS 头、协议握手、工具调用、域名验证,通了再提交到 Claude 或 OpenAI 的目录。…
Roo Code 是一个开源的 VS Code 扩展,把编辑器变成多 agent 编程工作台。开发者可以让 Architect、Code、Debug、Ask、Custom 等专用模式的 AI agent 分工协作,后端接任意大模型。…
Seedance 是字节跳动 Seed 研究团队开发的文生视频大模型系列,能从文本和图像输入生成电影级多镜头视频,并原生同步音频。一个 prompt,一段有叙事的短片,不是无声的素材剪辑。…
Workspace Agents 是 OpenAI 为企业用户推出的共享 AI agent 能力,底层由 Codex 驱动。团队可以搭自己的 agent,让它们在 Gmail、Google Drive、Slack、Salesforce、Notion、Atlassian 之间自动跑多步工作流,不需要人盯着。和临时问一次 ChatGPT 不同,这些 agent 常驻云端、有记忆,可以定时跑,也可以被 …
Code Search MCP 是一类基于 [Model Context Protocol](https://www.anthropic.com/news/model-context-protocol) 的服务器,给 AI 编程 agent 提供对本地代码库的语义搜索和结构化搜索能力。传统做法是把整个目录塞进上下文窗口,这类服务器改成先对代码库索引一次 (Tree-sitter AST 或向量嵌入…
Daemons 是 AI 后台进程,专门接管仓库里的持续维护工作:监听事件、检测漂移、自主执行例行任务,不需要每次手动触发。跟一次性 agent 任务不同,daemon 是一个持久角色,写在 `DAEMON.md` 文件里,配置一次就持续运行,直到规格变更为止。…
Deep Research 是一种 Agentic AI 能力,只需一个提示词,agent 就能自主浏览网络、综合数百个信源,交出一份带引用、达到分析师水准的报告。整个过程边搜边读、随时调整方向,通常跑 5 到 30 分钟。…
OpenClaw Skill 是一个自带能力的插件包,形式就是一个目录,里面放一个 [`SKILL.md`](https://docs.openclaw.ai/tools/skills) 文件,告诉 OpenClaw agent 怎么和某个外部工具、API 或工作流对接。Skill 在 session 开始时加载进 agent 的上下文,之后可以通过自然对话或 slash 命令调用。…
Agentic frameworks 是把大模型接进一个持续运行的 agent 的软件工具包,负责处理循环、工具调用、记忆和多 agent 协调这些管道,省得开发者从零搭这套底层。代表产品有 [LangChain / LangGraph](https://github.com/langchain-ai/langgraph)、[CrewAI](https://github.com/crewAIInc…
architecture diagram generator 是一类 AI 工具,输入可以是一段文字描述、一个代码仓库,或者 Terraform / CloudFormation 这类基础设施代码,输出是可以继续编辑的系统架构图(方框、箭头、分层,一应俱全)。格式通常是 Mermaid / draw.io / Excalidraw / SVG,不是死的 PNG。…
Browser Harness 是 [browser-use](https://github.com/browser-use/browser-use) 团队写的一个 592 行 Python 项目,让大模型通过 [DevTools Protocol](https://browser-use.com/posts/playwright-to-cdp) 直接操控 Chrome。一条 WebSocket …
[Claude Opus 4.6](https://www.anthropic.com/news/claude-opus-4-6) 是 Anthropic 于 2026 年 2 月 5 日发布的旗舰大模型,也是首个配备 100 万 token 上下文窗口的 Opus 级别模型(发布时为 beta,现已标配)。定价维持 $5/$25(百万 token)不变,同时带来了 `agent teams`,即…
[Cursor CLI](https://cursor.com/cli) 是 [Cursor](https://cursor.com) 旗下的无界面命令行 agent,和驱动 IDE 的那个 Cursor Agent 共用同一套内核,但不需要开编辑器,在任何终端或 CI 环境里都能直接调用。安装一行命令:`curl https://cursor.com/install | bash`,之后就能跑多…
**GPT Image 2** 是 OpenAI [gpt-image](/term/gpt-image) 模型系列的第二代,也就是驱动 ChatGPT 图像工具和 `gpt-image-1` API 的原生多模态图像引擎的接班版本。这个名字特指 v2,不是整个系列。…
**gpt-image** 是 OpenAI 的原生多模态图像生成与编辑 API 系列,驱动 ChatGPT 图像工具的那套引擎,对外暴露为 `gpt-image-1`、`gpt-image-1-mini`、`gpt-image-1.5` 三个模型 ID。和 DALL-E 3 的扩散管道不同,这批模型能精准渲染文字、logo、品牌 UI,还可以接受参考图进行对话式编辑。…
Information Operating System 是 [GalaxyBrain](https://galaxybrain.com/) 给自己打的标签,也是它的实际特征:一个本地优先的知识工作台,每页都能设变量、写公式、做跨页实时引用。结构和计算直接内置进来,不用额外装插件。它介于笔记工具、Wiki、表格和任务管理之间,把四种能力装进一个地方。…
[Kimi K2.6](https://www.kimi.com/blog/kimi-k2-6) 是 Moonshot AI 于 2026 年 4 月 20 日发布的开权重旗舰模型,1T 参数的 Mixture-of-Experts 架构(32B 激活,384 个专家,256K 上下文,原生多模态),在 Hugging Face 以 [Modified MIT License](https://h…
LLM wiki 是一套工作模式:让 AI agent 把你的原始资料逐步整理成一批纯 Markdown 实体页面,之后回答问题时直接查这份结构化的 wiki,不用每次重新翻原始来源。知识沉淀在文件系统里,不会随对话结束而消失。…
Mediator AI 是一类用大模型扮演中立第三方、协助当事双方解决纠纷的工具:分别私下了解各方诉求,生成候选方案,用 Nash 讨价还价理论打分,找出双方都能接受的结果。目前最具代表性的产品是 [Mediator.ai](https://mediator.ai/),由 Freenet 创始人 Ian Clarke 于 2026 年 4 月 20 日上线。…
OpenAI Agents SDK 是 OpenAI 出的一个轻量级开源框架,专门用来搭多 agent 工作流,模型用的是 OpenAI 自家的。核心就四个原语:Agents、Handoffs、Guardrails、Sessions,加上内置 tracing,是此前实验性 Swarm 项目的正式接班人,同时提供 Python 和 TypeScript 版本。…
QMD 是 Shopify CEO Tobi Lütke 做的一款命令行搜索引擎,面向本地的 Markdown 笔记、文档和知识库,完全在设备上运行。它把 BM25 全文检索、向量语义搜索、大模型重排序组合在一起,还内置了 MCP server,让 Claude Code 或其他 agent 可以直接查询个人语料库,不用靠 grep 翻文件。…
RLMs (Recursive Language Models,递归语言模型) 是一种推理策略:大模型把 prompt 当成挂在 Python REPL 里的对象,递归调用子模型分批处理,绕开了把所有内容压进一次前向推理的瓶颈。根模型只看到查询本身,由它来决定怎么切分上下文。…
UserPromptSubmit hook 是 [Claude Code](https://code.claude.com/docs/en/hooks) 的一个生命周期事件,在用户按下回车、Claude 处理提示词之前触发。配置在 `settings.json` 里的 shell 命令会通过 stdin 收到提示词文本、`cwd`、`session_id` 和 transcript 路径,可以注入…
Vibe Island 是 macOS 原生的刘海区工具,把 MacBook 的灵动岛 (Dynamic Island) 变成 AI 编程 agent 的状态与审批面板。它同时监听 Claude Code、Codex、Cursor、Gemini CLI 以及另外七款 CLI,开发者能并发跑 5-10 个 session,不用在终端窗口之间来回切换就能处理工具调用的审批请求。…
「agent traps」是个简称,跟 Google DeepMind 在 2026 年 3 月 27 日发布的分类体系 AI Agent Traps 一一对应,专门归类那些劫持自主 AI agent 的恶意网页内容。去掉「AI」这个前缀,这个词就有歧义了,会跟 SNMP 网络监控里的 agent trap、还有「卧底特工」的俚语撞在一起。…
Agentic design 是一门专门研究「如何构建让 AI agent 自主行动的软件系统」的工程学科。单次大模型调用搭不起真正的 agent:你还需要 prompt 链、任务路由、反思循环、多 agent 协作,以及在不可逆动作前等人确认的逻辑节点。把这些组合起来,才能让大模型从「问一答一」变成一个能追目标的系统。Agentic design 就是研究怎么搭这一层的。…
AI agent traps 是一个攻击类别的统称,指那些专门用来操控、劫持或武器化自主 AI agent 的恶意网络内容。这个词是一个类别的统称,覆盖六类攻击手法,攻击者通过这些手法把 agent 自身的能力(浏览器、记忆、工具调用)反过来变成外泄数据的通道。…
AI stack 是把算力变成可交付 AI 产品的分层组件集合:最底层是芯片和模型,中间是数据与编排,顶层是应用本身。Menlo Ventures 2024 年 1 月发布的[现代 AI Stack 分析](https://menlovc.com/perspective/the-modern-ai-stack-design-principles-for-the-future-of-enterpri…
AI workspace 是一个有记忆、有项目边界的工作空间,对话、文件、工具、上下文都放在里头,取代的是用完即走的单线程聊天框。Notion 把这句话写进首页:「[为你而生的 AI workspace](https://www.notion.com/)」,之后整个行业跟着用,这个词从 Notion 的营销语变成了产品品类的公用标签。…
Apple Intelligence 是苹果公司的端侧 AI 品牌,[2024 年 WWDC](https://www.apple.com/newsroom/2024/06/introducing-apple-intelligence-for-iphone-ipad-and-mac/) 正式发布,随 iOS 26、iPadOS 26 和 macOS 26 全线推出。覆盖写作工具、Genmoji、V…
AutoResearch 是一个 agent 循环:LLM 自主修改单个训练文件,跑一个固定 5 分钟的实验,检查选定指标有没有变好,然后保留或回滚这次改动,如此循环整晚。这是一套极简的「改 → 验 → 留/丢 → 再改」跑法,不是什么重型框架。…
Browser Use 是一个开源 Python 库([browser-use/browser-use](https://github.com/browser-use/browser-use)),让大模型直接驾驶真实的 Chrome 完成网页任务:点击、滚动、填表、提取内容,每走一步都把页面状态回传给模型。它是 agent 框架与浏览器之间的事实标准 harness 层。…
busybee 是一个为多智能体开发工作流设计的开源 FIFO 构建队列。底层包装了 [pueue](https://github.com/Nukesor/pueue),把 cmake、cargo、ninja、大型测试套件等重量级命令都管起来,保证同一台机器上并行运行的 Claude Code、Cursor、Windsurf 等 agent 会话,同一时刻只有一个能真正跑构建。…
Dev Agents 是一个边界较松的统称,指代替开发者写代码、review 代码、上线代码的 AI agent,和更常见的 [coding agents](/term/coding-agents) 含义高度重叠。到了 2026 年,这个词实际上同时指向三件事:这个品类本身、Atlassian 的 [Rovo Dev](https://www.atlassian.com/software/rovo…
DGX Spark 是 NVIDIA 的桌面 AI 超级计算机,售价 $3,000-$4,000,整机重 1.2 kg,核心是 [GB10 Grace Blackwell Superchip](https://www.nvidia.com/en-us/products/workstations/dgx-spark/),配有 128 GB CPU-GPU 统一内存和 1 petaFLOP 的稀疏 F…
ElevenLabs 是一家做语音 AI 基础设施的公司,产品线覆盖 TTS (文本转语音)、STT (语音转文本)、声音克隆和语音 agent,服务对象从开发者到出版商到大型企业。公司 2022 年由前 Google 工程师 Piotr Dabkowski 和前 Palantir PM Mati Staniszewski 联合创立,目前年度经常性收入 $330M,估值 $11B。…
FeralHq 是一款「幽默优先」的智能体内容生成工具,专门替品牌账号写社交媒体帖子。系统先爬取公司官网建立品牌档案,再通过「生成-评审」循环每天产出 15-20 条候选草稿,slogan 是 "Your brand's Funniest Friend"。…
GRPO(Group Relative Policy Optimization)是一种用来教大模型推理的强化学习算法。每道题采样多个回答,用这批回答的平均得分当基准,省掉了 PPO 单独带的 value network。…
Infrawise 是一个专门针对 Azure 的 AI agent 产品,帮企业找到云开销里能省的地方。它通过只读 API 白名单接入客户的云环境,读取 Azure Resource Graph、Cost Management 和 Monitor 的数据,再由 AI 整理成优先级排序的优化建议:哪些 VM 可以缩配、哪些资源在闲置、哪里能直接削减开支,全部呈现在一个 React/TypeScri…
Kiro 是 AWS 推出的 agentic AI IDE,底层基于 Code OSS,主打「先写规格,再跑代码」,用来对抗「vibe coding 的混乱」。每个任务启动前,agent 会先生成需求文档、设计说明和带测试的任务拆解,再按计划逐步执行并验证。…
[MCP tool](https://modelcontextprotocol.io/docs/concepts/tools) 是 [MCP server](https://modelcontextprotocol.io/) 通过 JSON-RPC 暴露给大模型的一个可调用函数,由名称、描述和 JSON-Schema 格式的输入定义三部分构成。Model Context Protocol 有三个原…
「MCPs」是 [MCP](https://www.anthropic.com/news/model-context-protocol)(Model Context Protocol,Anthropic 于 2024 年 11 月 25 日发布)的非正式复数。开发者说「我一直在加 MCPs」时,指的是 [MCP Server](/term/mcp-server) 或 [MCP Tool](/ter…
MLX 是 Apple 开源的 Apple Silicon 机器学习框架,API 风格和 NumPy、PyTorch 基本一致,但整个 runtime 跑在 Metal 和统一内存架构上,CPU、GPU、Neural Engine 共享同一块内存,张量不需要在它们之间来回拷贝。…
Personal AI 这个品类,指的是围绕某一个人而建的 AI 系统,记住这个人的记忆、声音、偏好,跟给几百万人共用的通用助手是两回事。产品形态从全天录音的可穿戴设备,到能消化你的笔记、邮件、屏幕历史并作答的软件,都算这个品类。…
"Spy AI" 不是一个产品,是三个毫不相关的产品撞在同一个词上。…
Vault Context 是指把本地 Markdown vault 的内容(文件、目录结构、frontmatter、标签,以及检索到的片段)喂给大模型,让模型拿你自己的笔记来回答问题,跳过那些泛泛的网络知识。这里的「vault」是 Obsidian 式的:磁盘上一个放满 `.md` 文件的普通目录。…
AEO (Answer Engine Optimization),目标是让 ChatGPT、Perplexity、Google AI Overviews、Claude 这类 AI 答案引擎在生成回复时直接引用你的页面。SEO 追的是搜索结果里的蓝色链接排名,AEO 追的是 AI 回答里的那条引用。…
HyperFrames 是 HeyGen 开源的视频渲染框架,让 AI agent 通过写 HTML、CSS 和 JavaScript 来合成视频,借助 Puppeteer + FFmpeg 输出 MP4、MOV 或 WebM。CLI 默认无交互,以 agent skill 的形式安装。…
Intelligence Age 是 OpenAI 为 AI 时代选定的「时代标签」,在这套叙事里,它是石器时代、农业时代、工业时代之后的下一个纪元,算力、能源、前沿模型共同推动人类进入下一波繁荣。这是个修辞容器,用来包装产业政策诉求,本身不是技术概念。…
Slop Cop 是一个自动检测 LLM 写作套路的文本 linter,专揪大模型惯用的修辞和结构特征:破折号转折、层层堆叠的保留语气、开场废话、三段式列表、无意义加强词。它输出 JSON 违规报告,格式专门为 coding agent 设计,不是给人直接读的。它是套话检测器,不是 AI 检测器。…
AI Agent Identity 是一套新兴的协议和文件格式体系,让自主 agent 能证明自己是谁、被授权做什么、代谁行事、持有什么价值观。分两层:密码学授权层 (AAIP、AIP、Google 的 AP2) 负责授权,声明式人格文件层 (SOUL.md) 负责行为身份。…
AI CapEx 是 AI 基础设施资本支出的行业简称,泛指超大规模云厂商(hyperscaler)为训练和运行大模型而砸进去的土地、电力、GPU、服务器和数据中心。这个词已经是微软、Alphabet、亚马逊、Meta 和 Oracle 的头部财务指标,也是 AI 时代股票分析里权重最高的变量。…
GEO (Generative Engine Optimization,生成式引擎优化) 是一套让内容被大模型(ChatGPT、Google Gemini、Perplexity、Claude)引用、摘录或推荐的做法。传统 SEO 抢的是十条蓝链里的排名,GEO 抢的是模型写回答时选哪个信源。…
Prism 是一个把 GitHub 和 GitLab 的 PR 队列合并成一个优先级 feed 的收件箱工具。官网一句话是 ["keep up with code review, even as AI speeds up the rest"](https://prismstudio.dev/),点出了 2026 年的一个真实痛点:AI 生成 PR 的速度已经超过了人工审查的速度,同时维护两个 Gi…
Claude Design 是 Anthropic Labs 的产品,跟 Claude 对话,直接生成可以交付的视觉稿:原型、幻灯片、单页文档、Pitch Deck、营销物料,导出格式支持 HTML、PDF、PPTX,也可以推送到 Canva。…
[ClawHub](https://clawhub.ai/) 是 [OpenClaw](https://github.com/openclaw/openclaw) 的官方技能库。OpenClaw 是一个可自托管的个人 AI agent,ClawHub 让开发者能发布文本格式的 SKILL.md 包,按分类浏览或向量搜索,然后用一条 `clawhub install <slug>` 命令装进任意 O…
Context engineering 是一门学问:送进大模型上下文窗口的每一个 token,都要经过设计。系统提示、工具定义、检索内容、对话历史、记忆、文件,一个都不能随手堆进去。Anthropic 把它定义为 [prompt engineering 的自然延伸](https://www.anthropic.com/engineering/effective-context-engineerin…
GPT-5.4 是 OpenAI 2026 年 3 月发布的前沿大模型,把 Codex 和 GPT 两条产品线并成了一个系统,加入了原生 computer use 能力、100 万 token 上下文窗口,以及主线 GPT 系列里第一次出现的可配置推理强度。…
Qwen3.6 是阿里通义千问团队的新一代大模型系列,主打「真实世界的 agent」场景。两个档位:闭源的 [Qwen3.6-Plus](https://qwen.ai/blog?id=qwen3.6)(2026 年 4 月 2 日发布)和开放权重的 [Qwen3.6-35B-A3B](https://qwen.ai/blog?id=qwen3.6-35b-a3b),35B 总参数、3B 激活参数…
Qwen3 是阿里巴巴推出的第三代开权重基础模型系列,[2025 年 4 月 28 日正式发布](https://qwenlm.github.io/blog/qwen3/),采用 Apache 2.0 协议。最大的创新是把「Thinking(推理模式)」和「Non-Thinking(快速响应模式)」放进了同一组权重:同一个模型,既能逐步推理复杂问题,也能快速给出答案。首发提供六个密集规格(0.6B…
Tokenmaxxing 说的是把 AI token 消耗量当成生产力指标来晒,现在也越来越多被拿来当靶子批。工程师用 AI 写出更多代码,在公司内部的 token 消耗排行榜上往上爬,把更大的 API 额度当成一种身份象征。批评者的说法是,这把「用了多少算力」和「交付了多少价值」混为一谈,说白了就是 agent 时代版的「用代码行数考核程序员」。…
Agent harness 是大模型和真实世界之间的那层中间件,负责跑 agent 循环、调工具、管记忆、守护栏、从错误里恢复。圈子里现在流行一个公式:「Agent = 模型 + Harness。你不是模型,你就是 harness。」…
Agent loop 是每个自主 LLM agent 的控制流核心:模型读一遍上下文,决定下一步怎么做,调工具,拿结果,再循环——直到输出纯文本不再调工具,或被预算规则切断。规范实现大概九行 Python。…
Agentic AI 是一类能自主规划、做决策、持续行动来完成目标的 AI 系统。传统聊天机器人问一答一,这一类不同:它在后台跑一个目标驱动的循环,调工具、更新状态,直到任务做完。这个词把技术层面的转变和企业采购的框架打包进了同一个品类名。…
Agentic coding 是让 AI agent 自主完成开发任务的工作方式:agent 自己规划、写代码、跑测试、读报错、修改,一轮轮迭代直到跑通,不需要人在每一步之间点头。这和 autocomplete 式的「AI pair programming」不同,后者每一个 token 都要人来驱动。…
Coding Agents 是一类 AI 编程工具的品类名。这类工具能自主完成代码工作:读仓库、想改法、改文件、跑测试、开 PR,而不是像 2021 年那批 copilot 只在光标处补几行。…
[Context window](https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents) 是大模型在一次推理里能读入和处理的 token 总量上限。2025 到 2026 年间,这个词完成了一次身份转变:从当初「8K 还是 1M」的规格对比项,变成了 agent 团队每次会话都要主动预算、…
[Gemini 3.1 Flash TTS](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/) 是 Google DeepMind 的文本转语音大模型,支持 70+ 种语言,可以用 200+ 条音频标签加上自由格式的导演式提示词来控制口音、语速、情绪和场景风格…
Gemini 3.1 Flash 是 Google 2026 年中推出的速度档系列,不是单一模型,而是同一品牌下的多个变体。开发者搜「3.1 Flash」找的是这整个系列;Google 实际推出了四个各有侧重的子版本:Flash-Lite(文本/多模态)、Flash Live(实时音频)、Flash TTS(语音合成)、Flash Image(也叫 Nano Banana 2)。…
LM Studio 是一款桌面应用,支持 Windows、macOS、Linux,可以在本机发现、下载并运行开源大模型。它把 llama.cpp、MLX 和一个可视化的 Hugging Face 模型浏览器打包在一起,做到点击就能跑,同时在 1234 端口暴露一个兼容 OpenAI 的 API,让 Claude Code、Cline、Continue 这类工具可以直接指向本地模型。…
Managed Agents 是云平台托管并运行 AI agent 的基础设施模式。开发者以前要自己搭 agent 循环,记忆管理、工具路由、状态控制、沙箱隔离、错误恢复,全部自己处理;现在这些都由平台打包成 runtime 服务。…
MCP server 是一个独立的小程序,通过 [Model Context Protocol](https://modelcontextprotocol.io/) 把某一个能力(数据库、文件系统、安全扫描器、交易 API)暴露给 AI agent。协议本身定义了 JSON-RPC-2.0 的通信格式,server 是实际的交付单元。到 2026 年,「MCP server」已经从一个实现细节,成…
Nano Banana 是 Google DeepMind 旗下图像生成模型系列的代号,现已成为正式品牌名。最初版本于 2025 年 8 月以 [Gemini 2.5 Flash Image](https://deepmind.google/models/gemini-image/flash/) 的形式发布;[Nano Banana Pro](https://blog.google/technol…
Parallel Agents 是同时跑多个 AI 编程会话的工作方式。每个会话对着代码库的一个独立副本干活,开发者的角色从写代码转为调度、审查和合并。…
Qwen(通义千问)是[阿里云通义实验室](https://qwenlm.github.io/)推出的开源大模型系列,2023 年 8 月首发。覆盖文本、代码、视觉、语音、图像、Embedding 和全模态方向,绝大多数模型以 Apache 2.0 协议在 [Hugging Face](https://huggingface.co/Qwen) 和 ModelScope 上开放下载。…
AGENTS.md 是一个开放的、不绑定任何厂商的 Markdown 文件,放在仓库根目录,告诉 AI 编程 agent (Claude Code、Codex CLI、Cursor、Copilot、Jules、Amp、Factory、Windsurf) 怎么跟这份代码库协作。它和 README.md 占同一个位置、用同样的 Markdown 语法,只是读的对象从人换成了 AI agent:构建命令…
AI slop 是一个贬义词,专指 AI 生成的各类内容(文章、图片、视频、pull request):技术上流畅,内容上空洞,批量生产只为刷点击或走流程,压根不是为了沟通。研究者总结了三个特征:[表面能力、不对称的产出成本、可大规模复制](https://en.wikipedia.org/wiki/AI_slop)。…
[Claude Agent SDK](https://code.claude.com/docs/en/agent-sdk/overview) 是 Anthropic 用代码构建 Claude agent 的官方工具包。它把驱动 Claude Code 的那套底层能力开放出来:工具调用循环、上下文管理、子 agent 编排、hooks、权限控制、MCP 集成,封装成 Python 和 TypeScr…
[Claude Code](https://claude.com/product/claude-code) 是 Anthropic 官方的命令行编程 agent,在终端里跑:读你的代码库、改文件、执行命令、发 PR、用自然语言驱动跑得起来的工程工作流。它以 `@anthropic-ai/claude-code` npm 包的形式发布,同时附带 VS Code 插件、JetBrains 插件、桌面客…
Claude Mythos 是 Anthropic 未发布的前沿大模型,2026 年 4 月 7 日以预览形式公开亮相 ([Claude Mythos Preview](https://red.anthropic.com/2026/mythos-preview/))。技术方向通用,预览的重心落在网络安全上:Anthropic 称用它在各主流操作系统和浏览器中识别出了数千个候选 zero-day,其…
[Claude Opus 4.7](https://www.anthropic.com/news/claude-opus-4-7) 是 Anthropic 的旗舰大模型,2026 年 4 月 16 日发布。在 agentic 编程基准测试上,它小幅超过 GPT-5.4 和 Gemini 3.1 Pro,重新拿回领先位置,同时把 1M token 上下文窗口开放到了标准定价层级。新增三个生产控制参数…
Context Rot 指大模型输出质量随输入长度增加而出现的可测量衰退,即便提示词还远没触及广告宣传的 context window 上限。模型处理第 10,000 个 token 的可靠程度,远不如处理第 100 个。引入干扰信息、拉大问题与答案间的语义距离,甚至只是让模型照着原文复述,都会让性能下降。…
[Model Context Protocol](https://modelcontextprotocol.io/) (MCP) 是基于 JSON-RPC 2.0 的开放标准,定义了 AI 应用与外部工具、数据和系统之间的通信方式。规范采用客户端/服务端架构,设计了五个基本原语:Prompts、Resources、Tools、Roots、Sampling,用一套统一的协议格式解决了 MxN 集成问…
[OpenAI Codex CLI](https://developers.openai.com/codex/cli) 是 OpenAI 官方的终端编程 agent:读懂整个代码库、直接改文件、跑命令、调子 agent,一条自然语言指令就能推着它干完长任务。以 `@openai/codex` 发布在 npm 上,Apache-2.0 协议,绑定 ChatGPT 账号,Plus / Pro / Bu…
[OpenClaw](https://openclaw.ai/) 是一个开源、可自托管的个人 AI agent:持续运行的 runtime,支持接入任意大模型 (Claude、GPT、DeepSeek、Kimi、Gemini),通过消息应用 (WhatsApp、Telegram、Slack、Discord、Teams) 驱动自身运作。用户把 skill 安装到全局或某个工作空间,每个 skill …
OpenCode 是一个在终端里跑的[开源 AI 编程 agent](https://opencode.ai/),能接 Claude、GPT、Gemini、本地大模型在内的 75+ 家供应商 (通过 Models.dev)。它是 Claude Code 目前最热的开源竞品,GitHub star 数约 146k,仓库在 `anomalyco/opencode`。…
[Hermes Agent](https://hermes-agent.nousresearch.com/) 是 Nous Research 开源的 AI agent,MIT 协议,设计上就是要跑在服务器上不下线,可以是本地机器、VPS 或 serverless 平台。它的核心机制是持久记忆加自动生成的 skill,每次用完都会留下痕迹,下次用时能做的事更多。官方口号「the agent that…