菜单
积墨AI

积墨AI

从单次调用到完整运行时:大模型Agent系统的演进逻辑

今天的Agent系统看起来越来越像一套小型操作系统:它们管理子Agent进程,维护长期记忆文件,通过工具驱动接触外部世界,还要处理权限、隔离、恢复和观测。可它们的起点并不宏大——最初,开发者手里只有一个把输入映射为输出的语言模型。从一次模型调用到完整的Agent运行时,这个演进过程并非一次设计的结果,而是每逢模型试图越过边界时,系统就不得不在模型外面增加新部件。本文将拆解Agent系统演进的关键阶段,从Q&A Bot、ReAct架构、Tool Calling到Harness层的完整抽象,揭示Agent究竟如何一步步长出这些能力边界。

从朴素调用到上下文装配

LLM最朴素的大语言模型接口可以被看成一个函数:输入一段token,输出另一段token。它可以在参数中编码世界知识,却不会天然记住某个用户上一轮说过什么,也不知道自己刚刚输出的命令是否被执行。2020年GPT-3展示了大规模语言模型仅通过文本提示完成多种任务的能力;2022年底GPT-3.5成为ChatGPT背后的模型;2023年Meta发布LLaMA,推动开放权重模型进入主流研究与本地部署。GPT、LLaMA、Claude、Gemini、Qwen等模型虽然能力不同,但在应用看来仍然共享同一个基本形态:接收上下文,predict next token。初始系统只有一次前向调用,模型参数里的知识来自训练;一次对话中的名字、偏好和任务状态,则必须由应用在每次调用时重新提交。

ReAct架构与工具调用协议

Q&A Bot的第一项工程进步,不是换了一个更聪明的模型,而是在模型前面增加一个上下文装配层。它把系统指令、用户当前输入和对话历史拼成一次请求。2022年提出的ReAct执行架构把推理轨迹与动作交错起来:模型形成下一步意图,执行外部动作,接收Observation,再把观察送回下一轮推理。这把Chain-of-Thought与外部行动连接成Thought→Action→Observation循环。Agent真正的分水岭不是「会思考」,而是建立了模型→动作→环境→观察→模型的闭环。2023年6月OpenAI发布Function Calling,工具名和参数开始成为模型API的结构化输出;2024年11月Anthropic发布MCP,进一步标准化Agent与外部数据源、工具服务之间的连接。结构化Tool Calling让工具通过schema注册,模型输出带有工具名、调用ID和参数的结构化对象,运行时验证参数、选择实现、执行调用,再把结果以Tool Result Message的身份放回上下文。

Agent的成败,不在模型的参数里、不在提示词的技巧里,而在Harness为它搭建的每一次上下文、每一个工具边界和每一段可追溯的记忆里。

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

Harness层:Agent外面的运行时边界

只要系统开始承担真实工作,一批新的工程问题就会同时出现:会话能否恢复、副作用是否安全、上下文如何压缩、客户端如何连接、扩展如何装配、任务如何并行。2023年的许多Agent原型仍把Prompt、Loop和Tools写在一个应用里;2024年MCP开始统一外部连接协议;到2025年,Claude Code和开源的Codex CLI把终端Agent推向真实软件工程场景。随着任务变长、副作用变强、客户端变多,Agent Loop外围的会话、权限、沙箱、事件和扩展机制逐渐凝结成独立的Harness层。Agent Loop不再直接面对所有东西,它被包进一个更大的运行时,由这个运行时负责装配资源、管理会话、约束工具、持久化事件、暴露API,并在多个Agent之间调度任务。Agent决定下一步做什么;Harness决定这一步在什么上下文、权限、生命周期与持久化规则下发生。这套Harness设计空间催生了四种典型路线:Pi代表极简主义、OpenCode代表事件驱动、Codex代表安全工程化、Hel则探索自进化路径。

四大框架的设计哲学与实践验证

同一个模型,只是换了一套Harness,结果能差多少?测评机构Composio把DeepSeek V4 Flash分别放进Pi Agent、Prime Agent等框架跑同一批30个Agentic Tasks,Pi的通过率是66.7%,中位任务成本只有0.012美元,在这组测试里完成得最多也花得最少。Databricks内部基准显示,Opus 4.8搭配Pi的xhigh设置接近90%通过率,部分同模型换到Pi后,单任务成本相差两倍以上。Pi的核心策略是尽量不让模型反复阅读无关内容,默认只暴露read、write、edit、bash四个工具,Resource Loader显式装配当前会话启用的指令和Skills,Session Manager用活动分支和Compaction把完整会话投影成更紧的Working Memory。OpenCode则把一轮回答拆成Reasoning、Text、Tool、Step Start、Step Finish、Patch和Compaction等独立Part,保存Agent运行过的全过程,让Session可恢复、行为可审计、子Agent可隔离。Codex在用户点下允许之外叠加Sandbox Policy,真正执行前要连续穿过Approval和Sandbox两层边界,确保Coding Agent的错误不会变成被覆盖的文件或错误执行的命令。

回到开头,今天的Agent看起来像一套小型操作系统,并不是因为有人一开始就想造一套小型操作系统。每一层都是模型撞上边界以后,工程系统不得不补上的回答。模型越能行动,外面的运行时越不能含糊。未来的分水岭,未必只是谁的模型更聪明,也是谁能为同一个模型搭出更好的上下文、更稳的循环、更清晰的边界,以及一套不会在长期使用中越学越乱的记忆。

#Tool Calling#ReAct#MCP#Agent Framework#Context Management#Multi-agent
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信