什么是 Agent Context(智能体上下文)?
大模型本质上是一个“没有长期记忆的失忆症患者”,每一次对话都是全新开始;而 Agent Context(上下文工程) 就是AI 探员手里的“便签夹与随身工作台” —— 把系统人设、工具描述、短期对话历史和 RAG 检索知识整齐码好,让 AI 拥有持续思考与解决复杂任务的灵魂!
转头就忘,无法执行连续任务
纯大模型是无状态(Stateless)的函数:你问第 2 句话时,它早就把第 1 句话忘得一干二净;不知道你是谁、手头有哪些工具、上一步改了哪个文件!
- ❌ 无连续状态:无法胜任多步骤自主编程或多轮复杂调研
- ❌ 缺乏纪律约束:没有严格的 System Prompt 约束行为边界
全景视野,运筹帷幄步步为营
每次调用大模型前,上下文引擎像组装三明治一样把“系统铁律 + 工具说明 + 历史记忆 + 检索文档 + 当前提问”拼装为一整段 Prompt,瞬间激活 AI 的连贯智能!
- ✨ 状态持久自愈:随时回顾上一步执行结果与环境报错
- ✨ 按需检索(RAG):在有限的窗口内精准注入最相关的事实知识
拆解 Agent Context 的 4 大核心维度
从系统人设到长期外挂记忆,读懂智能体记忆流转机制
1. System Prompt (系统底座)
设定 AI 的最高行为准则、安全铁律、可用工具(Tool Definition)与结构化输出格式(JSON Schema)。
2. 短期工作台 (In-Context)
滑动窗口内的多轮问答、思考链(CoT)、工具调用参数与终端执行返回结果(Tool Outputs)。
3. 长期外挂记忆 (RAG / DB)
当历史信息超出 128k/1M 窗口限制时,将长期记忆存入向量数据库,按语义相似度按需动态检索注入。
4. 上下文压缩与总结 (Summarize)
自动监控 Token 消耗。在窗口用尽前触发“阶段性摘要压缩(Checkpoint)”,将数万字历史凝练为数百字精要。
🕹️ Agent 上下文三明治动态剖析演练台
点击切换 Context 中的各个切片组件,观察每一层为 AI 注入了哪些关键认知:
迷失在中间 (Lost in the Middle)
研究表明:当上下文长达数十万 Token 时,大模型对“开头”和“结尾”的信息注意力极高,却极易忽略“夹在正中间”的关键线索。
优秀的上下文工程必须把最关键的系统规则和用户问题分别放在最前和最后!
Prompt Caching 降本 90%
Anthropic 与 OpenAI 推出的 Prompt Caching 技术:
由于 System Prompt 与代码库前缀在多轮调用中保持完全不变,大模型只计算一次 KV Cache 并在内存缓存,API 成本与响应延迟骤降 80%~90%!
从 128k 到无限上下文 (Infini-Context)
从最早 GPT-3 的 4k 窗口,到 Gemini 1.5 Pro 的 200 万超长窗口。
结合滑动窗口注意力(Sliding Window)与状态空间模型(Mamba),未来的 Agent 将能把全公司十年所有文档作为无缝常驻上下文随身携带!