码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • Codex Context Compaction 真相:Agent 为什么压缩后还能接着干活?


    从 Codex Remote Compact 看长程 Agent 如何保存现场、重建规则并继续执行。
    合集 - 老六的AI笔记本(116)
    1.告别“失忆”的组织:构建企业级 AI 记忆基质的工程思考05-142.脚本的下一站:让自然语言直接成为可执行入口05-133.告别“轮流发言”:为什么说“交互模型”才是 AI 对话的未来?05-134.当用户觉得 Agent 变笨时,真正退化的往往不是模型05-135.AI 不是天然站在进步主义的对立面05-136.做 Agent,先把 Prompt Cache 当成系统架构来设计!05-137.逃离地球!AI数据中心的太空狂想曲05-148.疯狂五月:AI 化身最强“神探”,重塑网络安全攻防战05-149.深度拆解 Agent 引擎:从 Prompt 到 Harness Engineering,揭秘 AI 操作系统的工程本质05-1510.AI 编程提效反思:构建健壮软件,为什么更需要“消化”的时间?05-1511.软件工程师的终结?当 AI 代理让开发门槛降为零,硬核开发者的底牌是什么05-1512.TencentDB Agent Memory 架构拆解:告别 Agent 失忆,构建四层可追溯记忆与上下文治理系统05-1813.狼来了?如果我们正处于AI泡沫中会怎样?05-1814.Hermes Agent /goal 长任务运行时架构拆解:状态持久化、Judge 闭环与自主续航05-1915.DeepSeek-V4-Flash 让 LLM Steering 重回主舞台:本地大模型时代的模型操控工程实战05-1916.Agent Runtime 九个关键设计:状态外化、上下文压缩与多智能体协同05-2017.2026 年我作为资深工程师如何使用 LLM Agent:从副驾到主驾的真实工作流转变05-2018.OpenClaw Dreaming 记忆流水线底层架构:状态分层、证据留痕与检索回流05-2119.AI 基建账单:8000 亿 capex 砸下去,云厂商到底回了多少本05-2120.Agent Harness Runtime 架构深度解析:工具循环、状态外置与长程任务调度05-2221.当AI 算力进入锁仓时代,AI 就不再只是软件生意!05-2222.为什么 AI Coding 难进生产环境?深入了解 Everything-Claude-Code !05-2523.AI 正在抬高手机价格:HBM 抢产能,消费电子为什么越来越贵?05-2524.平台智能化到了分水岭:为什么配置代码化才是 AI Coding 的下一代接口05-2625.技术沟通为什么总在返工?你写的是文档,产品听到的却不是同一种语言05-2626.Claude Code 如何压缩上下文:Microcompact、Prompt Cache 与 cache_edits 工程拆解05-2727.前端别再乱接管浏览器了! 自定义滚动、密码框、日期控件,这些为什么总把体验做坏?05-2728.Agent Harness 架构真相:Prompt Cache 如何决定 Skill、MCP 与 SubAgent 设计05-2829.AI 智能体正在放大低质量代码:为什么大组织会先被反噬?05-2830.RAG 负责召回,LLM Wiki 负责沉淀:团队知识系统为什么不能只做检索05-2931.AI 已经进流程了,但人不能从责任链上消失:招聘、授信与公共服务里的治理底线05-2932.Dynamic Workflows 深度解析:Claude Code 为什么把多 Agent 编排写进可执行代码06-01
    33.Codex Context Compaction 真相:Agent 为什么压缩后还能接着干活?06-02
    34.AI 代理安全架构:沙箱、虚拟机和出口控制,才是 Agent 时代真正的保险丝06-0235.业务 Agent 搭建指南:别急着重造 Agent,用知识、工具与评测跑通闭环06-0336.Claude Opus 4.8 Agent 交付力拆解:为什么它更像工程负责人?06-0337.CodeGraph 代码图谱实战:AI Agent 为什么不该再从 grep 开始?06-0438.AI 搜索正在改写 Web 入口:为什么搜索框不再把人送到网页06-0439.Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文06-0540.AI 没有 ROI?企业真正暴露的,是 Token 成本失控!06-0541.AI Coding 如何影响交付链路重构:写代码更快了,为什么人反而觉得更累了?06-0842.AI 编程争论变味了:为什么反 AI 情绪开始走向怀旧化06-0843.Agent 工具链工程化: Skill 负责编排判断,CLI 稳定交付的执行边界06-0944.LLM 编程提速之后,为什么你反而更难想清楚问题?06-0945.Harness Engineering:Agent 真正能交付,靠的不是更强模型,而是上下文、执行协议和验收闸门06-1046.AI Skill 市场的安全账:为什么说 Skill Registry 本质上是新的供应链入口06-1047.AI Native 竞争力:真正稀缺的不是会用 AI,而是把事往前推的人06-1148.AI 生成 PR 正在刷爆开源项目:GitHub 贡献信号为什么失灵了?06-1149.Google AX 控制面拆解:分布式 Agent 如何把断点恢复、审计策略和执行调度收进同一条链路06-1250.LLM 写代码的新风险:不是写错,而是差一点就好06-1251.Agent Workflow Runtime 架构拆解:把 Agent Loop 从提示词搬进代码,长任务才真正稳了06-1552.LLM 写代码为什么不能盲信:AI 编程进入生产前,必须过人类的门06-1553.GEPA 架构拆解:让 Prompt 和 Skill 优化不靠玄学06-1654.UI Output Protocol 架构拆解:Markdown、HTML 和 UI DSL 如何分工06-1755.Hermes Agent Skill Runtime 架构拆解:让 AI Agent 不再从零开始06-1856.Loop Runtime 架构拆解:别再手动催 Agent,先把工程闭环跑起来06-2157.AI 支付大战开打:微信支付宝争夺下一代交易入口06-2158.AI Native 架构:有限上下文、确定性边界与质量闸门06-2259.Claude 网络安全实测:AI 攻防能力正在从聊天走向执行06-2260.Agent Coding Governance:上下文地图、运行时护栏与自进化 Loop 如何重塑 AI 编程交付06-2361.OpenAI 护城河收窄:大模型竞争正在从能力领先转向入口、成本与工作流06-2362.LLM 记忆系统:从 Markdown 知识库到 Self-Governing Repo06-2463.AI 短剧“买脸”上热搜:500 元肖像授权背后的生成式内容生意06-2464.AI 生产力陷阱:你变快了,但团队为什么更慢了?06-2565.Agent Skill 状态机工程:Mode-Step 网格如何拆开工作流边界06-2666.Yog's Law:创作者别为曝光倒贴钱06-2667.Multi-Agent 执行闭环:AI Coding 真正进生产,要靠模型分工和工程护栏06-2968.Claude 蒸馏争议升级:Anthropic 指控阿里,模型输出边界被撕开06-2969.SkillOpt 架构拆解:把 Skill 文本当参数,用执行轨迹训练 Agent06-3070.AI 数据中心的真成本:GPU 之外,电网、水和噪音才是硬账06-3071.Agent Loop 架构拆解:让 AI Agent 自己跑完验收闭环07-0172.AI 账号实名化来了:提示词、代码和日志都会绑定真实身份07-0173.AI Coding 不只靠 Prompt:Agent 工程闭环如何接入 DevOps07-0274.Seedance 2.5:AI 视频生成进入全像素时代07-0275.AI 研发共生架构:别再问 AI 会不会替代程序员啦!07-0376.AI 简历正在制造匿名感:别让求职材料抹掉你这个人07-0377.Agent 工程化新底座:用 CLI 契约层打通 HTTP 接口与业务能力07-0678.豆包、千问下线智能体:平台 Agent 正在告别开放广场07-0679.团队落地 Agent 工程化 Loop 的一些必看小技巧!07-0780.Meta 外售 AI 算力:泡沫争论终于进入硬件账本07-0781.Agent 评测系统架构:从指标分层到 GT/Judge 闭环的工程化落地07-0882.AI 手机进入 Agent 时代:Siri、Gemini、豆包都在争夺下一代移动入口07-0883.Agent Runtime 架构拆解:Prompt 如何变成可校验的执行链路07-0984.Claude Code 被禁争议背后:Coding Agent 正在进入企业安全审计时代07-0985.Hermes Skill Runtime 架构拆解:三层加载如何压住 Agent 上下文成本07-1086.开源大模型风险升级:DeepSeek 之后,模型供应链会被监管吗?07-1087.Agent Tool Interface 架构拆解:为什么好工具比强模型更决定成败07-1388.AI 编程正在变天:从“写代码”走向“管系统”07-1389.Hermes 上下文压缩架构:长任务 Agent 不失忆的几个关键设计07-1490.AI 搜索摘要正在吃掉开放网页:Google 答案层背后的内容生态危机07-1491.Agent Memory 架构拆解:别再把向量库当唯一记忆系统07-1592.Meta AI 管理实验翻车:指标化正在伤害工程组织07-1593.Agent 从上手到精通:打造有记忆的个人智能体07-1694.Figma AI 设计工作流变了:画布正在吃进代码、动效和团队协作07-1695.企业 Agent 为什么难落地:组织、数据和流程才是真卡点07-1796.Agent 长程任务架构设计指南:上下文管理、错误纠偏、目标约束与框架选型07-2097.GPT-5.6 更聪明之外:模型竞争开始算成本账07-2098.SAG 知识库检索机制:Event-Entity 索引、SQL 动态超边与多跳 RAG 召回链路07-2199.Big Tech 反垄断换战场:州政府和海外监管正在接力07-21100.代码不是 AI 编程的最终资产,AI Coding 真正该存的是 Checkpoint07-22101.AI 陪伴智能体降温:豆包、千问之后,角色 Agent 正在进入合规深水区07-22102.Agent 评测别把「调优 Loop」 跑成「刷题 Loop」07-23103.GLM-5.2 低价冲击:企业开始认真给 Token 算账07-23104.Claude Tool Search 深度拆解:延迟加载、工具引用和与 Codex 对比07-24105.Vibe Coding 不是终点:AI 编程教育真正该补的是打开黑盒的能力07-24106.Agent 可消费知识库建设:从文档资产、业务路由到可信上下文基础设施07-28107.Coding Agent 的组织风险:局部正确,团队失语07-28108.AI Agent、架构决策记录与工程上下文治理:团队如何把隐性约束留在仓库里。07-29109.为什么 Google Agent Teams 会重写软件交付07-29110.Agentic Engineering 组织级研发闭环的工程化拆解07-30111.AI 转型为什么失败:李开复把问题指向管理层07-30112.Agent OS 视角:别再把 Graph、Loop 和 Harness 当成并列概念08-03113.Skill 评测体系:从格式检查到真实任务验证的五层证据链08-04114.Agent 自进化为什么难:约束系统比自我反思更重要08-05115.Brainstorming 与 grill-me 在 AI 产品设计和工程决策中的分工边界08-06116.Agent Runtime 如何用 Session、Memory、User Profile 和 Skill 实现外部学习08-07
    收起

    从 Codex Remote Compact 看长程 Agent 如何保存现场、重建规则并继续执行。
    原文链接:AI小老六

    如果你长时间用过代码 Agent,大概率遇到过这种场景:前面半小时还在很认真地查仓库、跑测试、解冲突,下一轮突然像换了个人,只记得“正在处理一个项目”,但忘了分支名、PR 编号、刚才失败的是哪个测试。

    这类崩坏通常不发生在第一轮。它发生在上下文被压缩之后。

    所以过去很多人的习惯很保守:上下文快满之前,先让 Agent 写一份交接文档;重要任务做到一半,尽量不要自动 compact;能新开会话就新开会话。听起来麻烦,但至少可控。

    最近 Codex 的风向不太一样。越来越多用户开始把上下文窗口这件事交给系统自己处理。它自动压缩,继续跑,再压缩,再继续跑。最让人意外的不是它“还能回答”,而是它在复杂任务里还能记住不少低层事实:分支、stash、merge commit、构建结果、用户最后一句确认。

    这背后不是某个提示词突然写得更聪明了。更准确地说,Codex 把 compact 从“一段摘要”做成了一次状态迁移。
    inline-01.png

    图:长程 Agent 真正需要保住的是现场碎片,而不只是文章主线。

    窗口不见了,不代表窗口不重要

    Codex App 曾经把 context window 的使用比例放在主界面上。后来这个指示器被挪到了二级入口,只能通过 /status 或 /compact 之类的命令查看。这个改动让不少重度用户很不爽。

    原因很好理解。对短问答来说,上下文窗口只是一个技术参数;对长程 coding 来说,它更像油表。你不一定每秒盯着它,但你需要知道车还能跑多远。

    Codex 团队当时给出的方向是 “​vibe contexting​”:用户不再需要主动管理上下文。

    这句话如果放在一年前,很像产品经理的漂亮话。因为压缩一直是 Agent 链路里最脆弱的地方。它不是把文本缩短那么简单,而是在决定哪些事实还能活到下一轮,哪些事实永远丢掉。

    Codex 敢把窗口感知降级,真正依赖的是下面几层机制:入口截流、远程压缩、系统脚手架重建,以及服务端和模型的配合。

    真正进入 compact 之前,很多内容已经被处理掉了

    很多人以为上下文管理就是“满了以后压一下”。Codex 不是这么干的。

    在 full compact 之前,它已经先把一批容易撑爆窗口的内容压住了:

    位置 Codex 怎么处理 这意味着什么
    工具输出 工具结果进入历史时就做 middle truncation,保留头尾 中间细节可能直接消失
    终端输出 PTY 原始输出只留头尾,总量有限 大日志不会完整进上下文
    Hook 结果 太大的 hook 输出写到临时文件,只给预览和路径 模型需要时可以再读,但不会默认吃满窗口
    历史消息 清理不成对的 tool call/output、孤儿输出和不支持的图片 保证请求结构干净
    系统上下文 只追加变化部分,不每轮重复塞满配置 降低固定上下文的增长速度

    这里有个细节挺重要:很多截断发生在内容进入历史的那一刻。也就是说,它们发生在 prompt cache 形成之前。

    这不是洁癖,是成本问题。模型服务端的前缀缓存依赖逐 token 一致。如果一条旧工具结果已经进入历史,后面再回头改它,改动点之后的缓存可能全废。对十几万 token 的长程会话来说,一次 cache miss 可能就是一轮账单和延迟的数量级变化。

    Codex 的选择比较硬:先在入口控制住体积。代价也很明确,被截掉的内容未必能回来。

    ​Local Compact​:一份交接文档能救简单任务,救不了复杂现场

    Codex compact 的第一条路叫 ​Local Compact​。它的做法并不神秘:让当前模型给后续模型写一份 handoff summary。

    流程大概是这样:
    mermaid-01.png

    图:Local Compact 以明文摘要替换旧历史

    这套方案非常像人类工程师写交接文档。写得好,后面的人能接上;写漏了,后面的人只能猜。

    Local Compact 最大的问题就在这里:压缩后的 replacement history 里,很多原始材料不会再出现。assistant 的中间判断、tool call 的原始结果、reasoning、web 结果,大多只能靠 summary 间接留下来。

    简单任务还能扛住。比如开一个 GitHub issue、补一条评论、确认几个 label,summary 抓住主线就行。

    复杂任务不一样。长程 coding 里真正致命的常常是小事实:

    • 当前在哪个分支;
    • 哪个 stash 是临时绕过签名用的;
    • 哪个测试 315/315 通过;
    • 哪个构建失败是 x86_64 slice 缺失;
    • 用户最后是否已经验收。

    这些东西如果没被 summary 写进去,下一轮模型不会“自然想起来”。它只能重新查,或者老老实实说不知道。

    ​Remote Compact​:客户端看不懂,但效果明显不一样

    第二条路是 ​Remote Compact​。这里开始变得有意思。

    Codex 会根据 provider 判断能不能走远程压缩。OpenAI 原生 provider 和 Azure Responses provider 支持;常见第三方 provider、中转站、本地模型入口默认不支持。分流逻辑大致是:
    mermaid-02.png

    图:不同 provider 下的远程压缩路径

    Remote V1 走专用 /v1/responses/compact endpoint。Remote V2 则把压缩触发器塞进普通 Responses stream:输入末尾多一个 CompactionTrigger,服务端返回一条特殊的 compaction item。

    两条远程路径最后都会产生类似的东西:encrypted_content。

    客户端不会拿到一段可读摘要。它拿到的是一块 opaque state,一段加密内容。后续请求继续带上它,由服务端解密并组装给模型。
    mermaid-03.png

    图:encrypted_content 在服务端完成状态迁移

    这也是 Remote Compact 和 Local Compact 的本质区别:Local 留给客户端一份“文本交接”;Remote 留给服务端一份“状态块”。
    inline-02.png

    图:Remote Compact 的关键变化,是把压缩从文本摘要推进到服务端状态承载。

    实验最刺眼的地方:差距不是 5 分,而是一个等级

    如果只看机制,很容易陷入猜测。真正有说服力的是同一批长程任务分别走 Local、Remote V1、Remote V2 后的恢复效果。

    一类简单任务里,Remote 比 Local 稳定一些,但差距还不算夸张:

    测试内容 Local Remote
    主线和决策链恢复 89.7 96.6
    反事实判断 88 100
    低层事实定位 84.0 92.3
    禁用工具后的续跑 86 92
    允许工具后的最小验证 88 95
    平均 87.1 95.2

    真正拉开差距的是复杂 coding 任务。比如持续处理一个 Multi-Mac PR:merge upstream、解冲突、stash 管理、构建验证、真机测试、用户验收,全都混在同一条会话里。

    压缩路径 客观评分 关键事实命中
    Local Compact 约 28/100 5/24
    Remote V1 约 94/100 23/24
    Remote V2 约 92/100 23/24

    Local 的失败很克制,但也很致命。它没有大规模编造,而是大量 unknown。它知道自己不知道。可对执行任务来说,这几乎等价于失忆。

    Remote V1/V2 则能恢复仓库、分支、merge commit、PR #137、stash 内容、测试通过数量、真机型号和用户确认。这里面不少事实都不是“文章主旨”,而是现场碎片。长程任务能不能接上,往往就靠这些碎片。

    所以 Remote Compact 的优势不像是 prompt 稍微好一点。它更像保留了 Local summary 留不住的状态。

    服务端黑盒:提示词之外还有多少操作空间

    有人用 prompt injection 研究过 Remote Compact 的服务端流程。能看到的大致是这样:服务端有一个 compactor LLM,它读入系统提示和会话历史,写出一份明文 summary;随后服务端把这份 summary 加密成 blob。下一轮请求时,服务端再解密 blob,拼上 handoff prompt,交给模型继续执行。

    麻烦也在这里。泄露出来的 compaction prompt,和 Local Compact 开源出来的那段提示词非常接近。既然提示词差不多,为什么复杂任务里一个接近失忆,一个还能恢复大部分现场?

    我更倾向于把 prompt injection 看到的东西理解成“表层文本”,不是完整机制。服务端真正能动手脚的地方,比那几行 prompt 多得多。
    mermaid-04.png

    图:Remote Compact 可能包含隐藏信号和上下文重组

    第一种可能,是服务端给 compactor 的输入里夹了额外信号。比如 tool call 的结构化摘要、关键实体列表、conversation 的元数据标注。它们不一定会以自然语言形式出现在 prompt 里,所以即使用注入方式套出了提示词,也看不到这些中间信号。

    第二种可能,是加密 blob 里不只有一段普通 summary。表面实验看到的是 handoff 文本,但服务端在加密前完全可能追加后处理结果:工具输出摘要、关键决策节点、甚至某种更适合恢复任务状态的结构化表示。客户端只拿到 encrypted_content,没法判断里面到底装了什么。

    第三种可能,是 Remote 的压缩器本来就不是用户当前正在用的模型。Local Compact 只能调用当前配置模型来写交接文档;Remote Compact 的 compactor 由服务端选择,它可能针对压缩任务做过优化,更擅长从一堆工具调用和对话碎片里抓住任务状态。这个猜测没法从客户端证实,但能解释为什么同一套提示词会拉开这么大差距。

    第四种可能,发生在解密之后。能看到 summary 被放在 handoff prompt 后面,但服务端组装最终上下文时是否还有检索、重排、裁剪或额外注入,外部很难观察。换句话说,压缩不是一次“模型写摘要”就结束了,后面还有 context assembly 这一步。

    所以 Remote Compact 的强点未必是“提示词更好”。更可能是服务端掌握了从压缩、加密、保存、解密到重新组装上下文的整条链路。客户端只能看到 encrypted blob 进来、模型状态恢复出去,中间发生了什么基本不可见。

    这也是它最让人不踏实的地方:效果确实强,但不可审计。你不知道它保住了哪些事实,也不知道哪些事实已经在黑盒里丢了。

    只靠压缩还不够,系统规则必须重新搭起来

    长程 Agent 压缩后容易出问题,还有一个原因:它不只会忘任务,也会忘规则。

    比如项目里的 AGENTS.md 怎么要求,当前 sandbox 策略是什么,哪些工具可用,哪些 skill 已安装,工作目录和 git 状态是什么。这些东西如果也靠 summary 传递,压几次以后迟早变形。

    Codex 的做法是:系统约束不交给 summary。

    compact 完成后,Codex 会清掉一个 baseline 标记。下一轮开始时,它发现 baseline 不存在,就重新构造 initial context。这个脚手架会把开发规则、权限策略、可用工具、MCP、插件、环境信息、协作模式等重新注入。
    mermaid-05.png

    图:任务状态与系统脚手架在下一轮重新合流

    这点很关键。summary 只需要记住“任务发生了什么”。至于“当前系统要求模型怎么工作”,下一轮重新搭。

    换句话说,Codex 的恢复不是一条腿走路:

    • compact 负责迁移任务状态;
    • prompt scaffold 负责恢复执行环境和规则。

    很多人只盯着 summary,就会低估第二层机制的作用。

    Claude Code 的思路不同:它更像在维护一张视图

    拿 Claude Code 对比,会更容易看出 Codex 的设计取舍。

    Codex 像 checkpoint/rebase:压缩后生成一段 replacement history,把旧历史换成新基线。

    Claude Code 更像数据库 view:原始记录尽量 append-only,模型看到的是预算、外置、折叠、缓存编辑之后的投影视图。

    维度 Codex Claude Code
    大工具输出 入口截断,简单直接 外置到 sidecar 文件,保留读取路径
    full compact 前的减压 主要靠入口控制和历史清洗 tool budget、snip、micro compact、context collapse 多层处理
    compact prompt 极简 handoff 100+ 行审计清单式 prompt
    服务端协作方式 返回 opaque encrypted state cache_edits、context_management 等声明式能力
    客户端透明度 低,服务端空间大 高一些,但客户端逻辑复杂

    两边没有绝对优劣。Codex 把更多事情委托给服务端,效果可以很强,但黑盒感重。Claude Code 把更多控制留在客户端,工程复杂,调试空间也更大。

    我更愿意把它们看成两种架构性选择,而不是两种摘要写法。

    Prompt Cache 是这套设计里最现实的约束

    为什么 Codex 不在历史中间做细粒度修改?为什么 Claude Code 那么在意外置决策“冻结”?绕不开 prompt cache。

    长程会话里,单次请求十几万 token 并不稀奇。上一轮已经出现过的前缀,如果这一轮逐 token 一致,就可以命中缓存。命中的 token 便宜得多,也快得多。

    但缓存很脆。你改了历史中间某个旧工具结果,从那里往后的 token 都可能失去命中。

    所以两个系统都在避免“中间切一刀”:

    设计动作 背后的 cache 考虑
    Codex 在内容入史前截断 还没形成缓存,不破坏旧 prefix
    Codex full compact 时替换整段 history 不做局部手术,直接建立新基线
    Claude Code 冻结外置决策 保证后续 wire format 不变
    Claude Code 用 cache_edits 让服务端动缓存层,不改客户端消息内容

    这也是上下文压缩最容易被忽略的地方。不是“文本越短越好”。信息保留、窗口大小、缓存命中率三者之间一直在互相拉扯。

    更大的变化:模型和 Harness 正在绑在一起

    Remote Compact 不是一个孤立功能。它其实暴露了 Agent 竞争的下一层:模型和 Harness 正在变成一套东西。

    过去大家更关心“哪个模型更强”。现在越来越多体验差异来自模型外面的那层系统:工具协议、​上下文压缩​、缓存策略、权限模型、IDE 集成、历史状态恢复。

    OpenAI 有 Codex 的 encrypted_content 和 CompactionTrigger。Anthropic 有 Claude Code 的 cache_edits 和 context_management。这些能力并不是裸模型 API 的简单包装,而是服务端、客户端、训练数据一起配合出来的。

    第三方 Agent 当然还能做得很好,但它要追的东西变多了:协议细节、服务端 beta 能力、模型后训练习惯、真实用户长程数据。任何一个环节慢半拍,体验都可能差一点。

    这也是为什么 “​Model + Harness = Agent​” 会越来越像行业共识。只提供模型,不做 Harness,就等于把最终用户体验交给别人,也失去了最有价值的交互数据。

    结语:上下文压缩已经不是摘要问题

    Codex 多次 compact 后还能继续跑,原因大概可以拆成三层:

    1. 入口层先控制工具输出和历史膨胀,避免窗口太快被噪声吃掉。
    2. Remote Compact 把任务状态交给服务端处理,用 opaque state 承载比明文 summary 更强的恢复能力。
    3. Prompt scaffold 在压缩后重建系统规则,让 summary 不必背负所有环境约束。

    这套机制当然还有黑盒问题。encrypted_content 里到底有什么?服务端 compactor 是什么模型?解密后怎样重组上下文?外部只能猜个轮廓。

    但实验结果已经足够说明一点:长程 Agent 的能力,很多时候不只取决于模型会不会推理,还取决于它怎么保存现场、怎么遗忘、怎么在遗忘后重新接上。

    所谓 “​vibe contexting​”,表面上是用户不用管上下文了。底下其实是一堆很不 vibe 的工程。

    推荐阅读

    Dynamic Workflows 深度解析:Claude Code 为什么把多 Agent 编排写进可执行代码

    Claude Opus 4.8 Agent 交付力拆解:为什么它更像工程负责人?

    为什么 AI Coding 难进生产环境?深入了解 Everything-Claude-Code!

    平台智能化到了分水岭:为什么配置代码化才是 AI Coding 的下一代接口

    Agent Runtime 九个关键设计:状态外化、上下文压缩与多智能体协同

  • 相关阅读:
    WireShark 常用协议分析
    Qt多线程http下载器之二:仿迅雷新建下载任务
    手把手教学一文安装Keil5(MDK)固件支持包
    在地图上画出多个点
    基本图形学概念
    手部关键点检测2:YOLOv5实现手部检测(含训练代码和数据集)
    2022最新android设备uuid、udid使用教程​
    美妆行业如何通过自媒体提升品牌曝光
    WPF之浅谈数据模板(DataTemplate)
    内网学习笔记(4)
  • 原文地址:https://www.cnblogs.com/ai-old-six/p/20261005
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号