Skip to content

Harness之后,Agent 领域下一个受关注的技术会是什么

网上有个很有意思的说法,说大概率是分布式运行环境+分布式记忆系统

Harness真正的意义,不是工具调用本身,而是它出现之后,人们早晚要问:既然LLM可以通过一套胶水层框架运行在本地或者云端,那么有没有一种可能,让一个Agent同时运行在本地和云端来协同完成一项耗时很长的任务?

或者更进一步,我们能不能让很多个共享上下文的Agent并行运行在无数隔离环境里,来完成原本需要数个月或者数年才能完成的任务

这就指向了第一个实际问题——Agent需要一个稳定的、可隔离的、可弹性伸缩的运行环境,而支撑这一切的技术,诸如云计算、容器等,在22年GenAI大爆发之前就已经存在了

image.png

运行框架正在成为制约Agent能力的瓶颈,而非底层模型本身

https://hyper.ai/cn/papers/agent-harness-engineering

基于ETCLOVG七层分类法,E层(执行环境与沙箱)已经有20+个主项目,算是基础设施层最成熟的部分,但是C层(上下文与记忆管理)在开源社区里几乎是最薄弱的存在,更多的被嵌在框架里当附属功能 image-1.pngimage-2.png

一个最成熟的层和一个最薄弱的层,恰恰是同一件事的两面

  • 执行环境解决的是Agent在哪里跑的问题
  • 记忆系统解决的是Agent记得什么的问题 我们给Agent一台云电脑,它能写代码、联网,能操作文件系统,但是每次任务结束,这台电脑就被销毁了,下次启动,它从零开始,这样的代价就是它能干活,但是他无法积累经验

E2B的数据已经印证了这个趋势,从2024到2025,每个沙箱的平均运行时长增长了超过10倍,这说明Agent正在从跑几分钟就结束的短任务,走向跑几个小时的长期任务

image-3.png

当前的各种Claw的云端实例,本质上是在一台虚拟计算机里模拟一个完整的人类工作流,沙箱从临时工具变成了长期工作空间,但是记忆系统没有跟上这个变化,比如我使用了某款claw在一个云端沙箱里工作了几小时,产出了大量的中间信息、判断依据、错误修正记录,然后我把这个任务的产物拉到本地继续做,本地的Agent获得的刺激信号只有我新输入的提示词

哪怕是我安装了记忆相关的skill,这些记忆数据只留存在那个云端环境,无法被我本地的Agent获取,这也导致龙虾和hermes这种以多信息通道+单一运行环境的模式成为了目前上下文交换摩擦力最低的选项 所以才有说法提到,下一个受关注的技术可能是分布式运行环境和分布式记忆系统的组合


单独看分布式运行环境,它已经在爆发了 E2B从几个用户增长到服务约50%的财富500强公司,每周生成百万个沙箱,Browserbase成立不到两年估值就到了3亿美元,腾讯云今年也开源了CubeSandbox,基于RustVMM和KVM构建

但是沙箱本身解决的是隔离和弹性的问题,不解决连续性问题,连续性问题需要记忆系统,而记忆系统的难点其实比大部分人想的要深

很多人以为Agent的记忆就是把对话历史存到向量数据库或者存到本地markdown,下一个session再召回,这是最浅的一层,真正的分布式记忆系统要解决多个层次的问题,每一层都比上一层难一个数量级

  • 第一层是持久化,一个Agent在沙箱A里工作了两小时,下次启动沙箱B时,它要能无缝访问上一次的工作状态,这不仅仅是保存文件,还得保存整个工作上下文——哪些路径已经探索过了,哪些决策已经做出了,哪些错误已经修正了

MemGPT(现在叫Letta)最早尝试解决这个问题,它的核心思路是给Agent一个自己管理的记忆层级,像操作系统的内存一样,让Agent自己决定什么放在主记忆里,什么放到外部存储,但是MemGPT解决的还是单Agent在单一环境里的记忆问题,这边不展开介绍,后面再专门写篇文档来介绍letta

  • 第二层是共享,当多个Agent协作的时候,他们需要一种机制来共享和同步各自的记忆,一个负责调研的Agent发现了关键信息,一个负责编码的Agent需要实时获得这些信息,一个负责测试的Agent需要知道编码Agent的设计决策,这就像分布式系统里的状态同步问题,但是比传统分布式系统更复杂,因为Agent的记忆不仅仅是结构化的键值对,还有大量半结构化的自然语言推理链、决策树、经验片段等,我们没法用Raft协议来同步这些东西

  • 第三层是演化,Agent的记忆不是静态的快照,而是需要随着时间不断精炼和压缩的活系统,一个Agent运行了一千次任务,它不应该保留一千份原始记录,而应该从中提炼出 模式、规律、偏好,Claude code的做梦机制(本质上,它接近于Agent 在执行过程中暂停一下,对当前上下文进行总结、压缩、规划,然后再继续干活)算是开了个头,因为Agent的记忆系统需要这种自我精炼的能力,不然记忆会无限膨胀,最终拖垮整个系统,但是目前没有哪个类似的机制可以做到跨环境从而获得系统层级的记忆认知

运行环境是Agent的身体,记忆系统就是Agent的灵魂image-4.png 分类体系详细视图。每个分支对应一层ETCLOVG;叶子节点列出用于梳理综述的子类别,并标注介绍各类别的对应章节指引。 从Agent Frameworks到Agent Platforms的转变,本质上就是给Agent一个本地抽象到给Agent一个持久化的生存空间

  • Framework提供的是Agent、Tools、Memory等抽象概念
  • Platform提供的是持久化的工作空间、身份、可观测性、评估治理以及跨多次运行、跨多用户的人工交界

这个转变的核心驱动力,就是Agent需要从一次性任务执行者变成长期存在的数字工作者


分布式运行环境天然是多实例的,一个Agent可能在不同时间启动不同的沙箱,不同的Agent可能同时运行在不同沙箱里,这意味着记忆必须脱离任何单一运行实例,成为独立并且可被任意实例访问的服务,反过来,记忆系统也需要运行环境来承载它的写入和读取操作, 记忆不是凭空存在的,它总是在某个具体的执行上下文中被产生和消费

两者形成了一个闭环:运行环境产生记忆、记忆指导运行环境中的行为,行为又产生新的记忆 只有这样,Agent才能具备成长的能力,而不是一个每次从零开始的推理引擎,Agent才能够像生物一样,通过反复与环境交互来积累不可替代的经验

今天的Agent生态就像早起的云计算,大家都在讨论虚拟机的规格和定价,大家很少讨论持久化存储,后来AWS推出EBS,虚拟机终于可以挂载一个不会随实例终止而消失的磁盘,云计算才真正从临时计算变成了可依赖的生产基础设施,E2B正在扮演早期EC2的角色,但是Agent领域的EBS还没有出现

最后更新于: