Appearance
“LLM 什么时候会进入瓶颈期?”这个问题需要先拆开,瓶颈可以指基础模型的能力增速放缓,也可以指推理成本无法继续下降,还可以指 Agent 无法稳定承担长任务;把这些层面混在一起,讨论很快会滑向口号,要么是“很快 AGI”,要么是“马上撞墙”
我的判断更保守一些:基础模型的原始能力增长会先放缓,尤其是单个模型在聊天框里的惊喜感;但 AI 作为系统的能力,包括工具使用、任务执行、权限管理、审计、协作和企业流程改造,还会继续增长
这个判断对应两条技术路线,一条继续扩大预训练规模,一条把模型嵌入可验证、可授权、可恢复的行动系统;前者最容易被发布会和评测榜单展示,后者更接近 AI 进入真实工作的方式
瓶颈的定义
这里说的瓶颈,指单位投入带来的能力提升变小;更具体地说,同样数量级的训练成本、数据成本或推理成本,换来的用户可感知提升下降
基础模型的瓶颈通常表现为三件事:新模型仍然更强,但代际差异变小;benchmark 继续上涨,但真实任务改善有限;产品叙事从“更聪明”转向“更便宜、更快、更长上下文、更好集成”
系统能力的瓶颈则不同,一个 Agent 失败,常见原因是它在长任务里丢状态、误用工具、没有验证关键假设、无法回滚错误,或者在应该请求授权的地方继续执行;这里的约束来自工程系统、软件接口和组织制度
这两个瓶颈会在不同时间出现,基础模型可能先进入边际收益递减,Agent 系统却仍处在早期建设阶段
预训练收益会先变薄
过去几年,LLM 的主要增长来自规模化预训练,scaling law 通常译作规模定律,指模型性能会随着参数量、训练数据和计算量扩大而呈现相对可预测的改善;Kaplan 等人在 2020 年的论文里系统描述了这种关系,DeepMind 的 Chinchilla 论文进一步指出,在给定计算预算下,参数量和训练数据需要匹配,单纯扩大模型参数并不划算
这条路线的优点很清楚:可规划、可投入、可复现,只要有足够数据、算力和工程能力,模型能力大概率继续提升;限制也同样清楚,早期从“不能用”到“能用”,用户感知很强,后来从“能用”到“好用”,仍有明显差异,继续往后,从 90 分到 92 分可能需要更高训练成本,但普通用户只感到“更稳一点”,这类提升有价值,却不再改变预期
基础模型的瓶颈很可能表现为惊喜递减,模型不会突然停止进步,发布节奏也不会立刻消失;更可能出现的情况是,新模型每次都能列出一批改进,但很难让大多数用户重新理解 AI 能做什么
这也是技术成熟的常见过程,数据库、搜索引擎、云计算在成熟后都不再频繁制造公共惊讶,但它们对生产系统的影响反而更深;LLM 也可能从“让人惊讶的产品”转为“默认存在的基础设施”
数据问题会转向反馈问题
“数据耗尽”这个说法不够精确,互联网不会没有文本,真正紧张的是高质量、低噪声、可授权、可验证的数据
Epoch AI 相关研究估计,如果训练趋势延续,模型对公开人类文本的需求可能在 2026 到 2032 年之间接近可用存量;这个区间不必当成确定预测,但它提示了一个方向:公开文本的低成本红利会下降
另一个风险来自 AI 生成内容回流训练集,Nature 上关于 model collapse 的研究讨论过这一点,model collapse 可译作模型坍塌,指模型反复学习合成数据后,逐渐丢失原始数据分布里的长尾细节;结果更接近分布收缩,输出更趋同、更平滑,也更远离真实世界里的不规则信息
后续训练的关键变量会从“更多文本”转向“更强反馈”,代码任务有测试结果,数学题有可验证答案,工具调用轨迹记录了任务如何失败和修正,真实工作流能提供状态变化和责任边界;强化学习重新重要起来,也与这个转向有关,模型需要从结果中学习,不能停留在模仿已有文本
如果可验证反馈能大规模扩展,预训练瓶颈会被推迟;如果合成数据和强化学习只能在少数任务上有效,基础模型能力增长会更快进入高成本区间
推理时计算改变成本结构
o1、R1 这类推理模型说明,能力增长不只来自训练阶段;test-time compute 或 inference-time compute 可以译作推理时计算,指模型在回答时额外花费计算资源进行搜索、反思、验证和多步推理
这条路线把“更强模型”拆成了两个问题:底座模型有多强,以及系统愿意在单次任务上花多少推理预算;OpenAI 对 o1 的介绍中提到,模型表现会随着强化学习训练增加而提升,也会随着测试时思考时间增加而提升,后续关于 test-time compute 的研究也显示,在某些任务上,合理分配推理预算比单纯扩大模型参数更有效
推理时计算的限制在于成本和验证,模型可以生成更长的推理链,也可以尝试更多候选路径,但开放任务往往没有清晰答案;一个错误事实、错误检索结果或错误目标,会让更长推理变成更昂贵的错误
推理模型不会自动解决瓶颈,它把瓶颈转移到验证系统上:代码需要测试,事实需要来源,数学需要校验,计划需要预演,高风险动作需要授权;模型想得更久有价值,前提是系统能判断哪些推理结果可以被信任
Agent 的核心约束是可靠性
聊天模型输出一次答案,Agent 接手一个过程,这个差异决定了可靠性要求
在聊天场景里,一个错误回答通常会被用户及时发现;在 Agent 场景里,第三步的错误可能污染后续十几步,Agent 需要维护目标、管理状态、调用工具、识别不确定性、处理失败、保留日志,并在关键节点请求人类授权
工具调用只能说明 Agent 具备动作入口,任务跨度更接近成熟度指标;一个系统能否连续推进半小时、一小时、一天,是否能在上下文压缩后保持目标,是否能发现自己偏离任务,是否能在失败后恢复到可控状态,这些指标更接近实际工作
METR 的长任务研究使用了 50% task-completion time horizon 这个指标,可译作 50% 任务完成时间跨度,指 AI 以 50% 成功率完成某类任务时,该任务通常需要人类专家花多长时间;这个指标比单轮考试更有价值,因为它衡量的是系统能承担多长、多复杂的连续工作
SWE-bench 也提供了类似视角,它要求模型修复真实 GitHub issue,而非写一段孤立代码;模型需要理解代码库、定位问题、修改文件、运行测试、处理失败,它揭示的核心问题是:会写代码不等于能完成软件工程闭环
未来高价值 Agent 的竞争点,不会只在平均成功率,失败管理同样重要;成熟 Agent 需要知道何时继续、何时验证、何时回滚、何时请求授权,成熟系统允许错误存在,但错误必须有边界、可发现、可恢复
外部系统会成为关键约束
今天很多 Agent 仍在模拟人类操作软件:看网页、找按钮、复制粘贴、填写表单;这种方式成本高、脆弱,也难以审计,根本原因是现有软件主要为人类视觉和手动操作设计
如果 Agent 成为重要用户,软件接口会发生变化,企业系统需要提供结构化接口、细粒度权限和完整审计;授权会拆成多个层级:可读取但不可修改,可草拟但不可发送,可提交但需审批,可支出但不能超过预算,可修改测试环境但不能影响生产环境,这也是我们现在能明显感受到的变化
MCP 是一个早期信号,MCP 全称 Model Context Protocol,可译作模型上下文协议,它用统一方式连接 AI 应用和外部数据、工具、工作流;它属于接口层和上下文层的标准化尝试,并不直接改进模型算法
这类基础设施会决定 Agent 能否进入真实流程,模型智力只是一部分,身份、权限、日志、预算、沙箱、回滚和责任升级同样重要;很多“模型能力不足”的问题,最后可能会落到软件系统没有为机器行动者准备好
经济回报会限制投入强度
技术路线能走多远,还取决于投入是否能被回报覆盖;前沿模型训练需要巨额资本开支,如果新增能力无法带来足够收入或成本节约,投入强度会下降,理论上的 scaling 空间不等于现实中的持续加码
太空计划提供了一个有用类比,登月不是失败,卫星也深刻改变了现代社会;但 1960 年代那种推进速度没有长期持续,因为它依赖特殊历史条件下的巨额投入,技术没有消失,增长斜率变了
LLM 也可能进入类似阶段,只要下一代模型能打开巨大市场,资本会继续投入;如果新增能力主要表现为聊天更顺、代码补全更稳、PPT 更好看,投入逻辑会变弱
Agent 是另一种可能,如果它能进入真实企业流程,缩短软件开发周期,替代重复运营,在科研、工程、数据分析和客服中创造可量化回报,投资理由会从“更接近 AGI”转为“降低单位任务成本”;这会让 AI 继续增长,即使基础模型的代际惊喜已经下降
观察信号
判断 LLM 是否进入瓶颈,需要看增长机制是否还有效,发布会和榜单只能提供一部分信号
模型层面的放缓信号包括:前沿训练成本继续上升,但真实任务提升变小;新模型主要卖点转向价格、速度、上下文长度和集成能力;多个实验室的前沿模型能力开始收敛;企业客户只愿意为明确工作流结果付费,不再为“更强模型”本身付费;合成数据、强化学习和推理时计算无法稳定扩展到开放任务
瓶颈被推迟的信号包括:模型能稳定利用自身输出改进下一代训练数据;推理时计算在开放任务中持续带来可验证收益;Agent 的任务完成时间跨度继续增长;软件生态开始系统性支持 Agent 身份、授权、审计和回滚;企业把核心流程改成 AI-first,而非仅把 AI 当作辅助插件
判断
基础模型会先遇到边际收益递减,这个过程不会像撞墙,更像斜率下降:训练更贵,提升更细,惊喜更少
AI 的系统能力还没有到同一阶段,模型会继续进入工具、流程、权限、协作和组织结构;下一阶段的核心问题会从模型聪明程度,转向系统能否把聪明转化为可托付的行动
一个成熟 Agent 不需要在演示里显得神奇,它需要在任务里稳定、可审计、可恢复;真正的信任来自一句更平静的话:
这件事交给它,我可以不再盯着了
到那时,即使 LLM 的原始能力增速已经放缓,AI 对工作和组织的改变也可能才刚刚开始