上下文塞满后,AI 变傻又烧钱:5 个省 Token 的做法
AI 越聊越傻、账单越滚越大,问题常常不在提示词,而在没人收拾的上下文。这篇讲清上下文腐烂的由来,梳理 2026 年已经成熟的三类省 Token 技术,并给出普通用户今天就能动手的 5 个做法,含具体参数与实测数据。
先看一组实测数字。同一个"查 100 轮资料"的任务,不做处理时上下文峰值冲到 33.5 万 Token;把自动压缩的触发点设在 18 万之后,峰值降到 16.9 万,任务收尾时只剩 5829 个 Token,活照样干完了。这组轨迹来自 Anthropic 公开的实验记录,不是挑出来的漂亮值。换句话说,你账单上的大头,未必花在"AI 想得更多",而是花在"AI 反复重读同一堆历史"。
这篇分三层:先说清 AI 为什么越聊越傻,再讲 2026 年已经成熟的省 Token 技术,给出普通用户今天就能动手的 5 件事。先补一个常识:Token 是 AI 记录内容和计费的单位,一个汉字大约算一到两个 Token,下面出现的数字都按这个口径理解。
一、AI 不是撑满窗口才变傻
很多人以为上下文窗口像水杯,装满之前一切正常。实际情况更像一张办公桌:桌面堆到三分之一,你找一份合同就要翻半天。Chroma 关于"上下文腐烂"的研究发现,性能退化会在超过约 3 万 Token 后开始加速,哪怕窗口里还有大量空位。3 万 Token 是什么量级?让 AI 读完 30 页文档,再聊十来轮,基本就到了。
什么是上下文腐烂(context rot)?它不是指模型读不懂长文,而是信息变多之后,模型抓重点的能力反而下降。Anthropic 在 2025 年 9 月发布的上下文工程指南里给了另一层解释:工具输出的原始数据,是上下文增长的主要来源。浏览器截图、命令日志、整份 JSON、整篇网页正文,一进上下文就赖着不走,每一步推理还要重新发一遍。
这也是 Agent 和普通聊天机器人的根本差别。聊天是一次问答,Agent 是几十轮的"读文件、调工具、看结果、再决定",累计输入的 Token 可以是普通问答的 10 到 100 倍。所以真正的信号不是"窗口快满了",而是"质量开始下滑"。实践中的压缩触发点通常设在有效窗口的 60% 到 75%,换成 200K 窗口的模型,大约是 14 万 Token 那一条线。
很多人问:AI 助手越聊越笨怎么办?答案往往不在提示词写得漂不漂亮,而在上下文有没有被主动收拾。等窗口占用到 95% 才动手,模型其实已经在退化区里跑了很久。
二、成熟做法收敛成一条流水线
Agent 上下文压缩怎么做才有效?2026 年的答案不是某个技巧,而是一条按成本递增排列的流水线。学界把它抽象成四步:选出要压的部分、执行压缩、存到窗口之外、需要时恢复。业界反复实践出来的一句话是:保护开头、压缩中间、保留近几轮。
做法 | 干的事 | 公开效果 | 要不要懂技术 |
|---|---|---|---|
清理旧工具结果 | 把用过的工具输出从历史里删掉,留个占位符 | 100 轮搜索任务 Token 少 84%,完成情况反而更好 | 不用,多数平台已内置 |
滚动压缩 | 把前面的对话摘要成一段,用摘要重开窗口 | 峰值从 33.5 万降到 16.9 万 Token | 不用,改个开关 |
增量合并摘要 | 不重写整份摘要,只把新挤出去的那段合并进去 | 在 36000 条真实工程会话上,准确性与连续性优于从头重写 | 不用 |
上下文折叠 | 把子任务的中间步骤折叠掉,只留结论 | 活跃上下文能小 10 倍,100 轮交互后只剩约 7000 Token | 暂时不用,属前沿 |
提示词压缩 | 用小模型逐个 Token 判断哪段信息量低,直接删 | 能到 20 倍压缩,准确率只掉 1.5 个百分点 | 不用 |
KV 缓存压缩 | 在推理层压缩模型的显存缓存 | 有的方案能把缓存压到 2 bit | 自建推理才用得上 |
这张表里值得注意的是顺序:从便宜、可逆的操作开始,再到有损的摘要,末了才是模型和推理层的改动。清理旧工具结果排在前头,因为它不花额外的模型调用,结果也确定,需要时还能重新取回来。摘要压缩则要另外调一次模型,保得住大意,逐字细节会丢。

把这条流水线记成一句话:先做不要钱的,再做要点钱的,末了才动模型本身。顺序颠倒,钱花了,效果还差。
三、大厂已经把它做成了服务端开关
一个实际的变化是,这些事现在不用你自己写代码。Anthropic 在 2025 年 9 月底随 Claude Sonnet 4.5 上线了上下文编辑(Context Editing)。它默认在输入到 10 万 Token 时启动,从更早的工具调用开始清理,保留近三组,并留下占位符告诉模型"这里原本有个结果"。在 100 轮网页搜索的评测里,它把 Token 消耗降了 84%;单独使用带来 29% 的性能提升,配合记忆工具能到 39%。
2026 年初,同一个思路升级成服务端的一级特性:压缩接口(compact_20260112)。它按 Token 阈值自动触发,触发点可以设到 5 万、默认 15 万,还能传入自定义的摘要指令,等于把"摘要怎么写"从默认设置变成一份可打磨的工程文档。OpenAI 在 Responses API 里提供了对应的 context_management 加 compact_threshold。另一个独立端点更省事,直接返回压缩好的上下文窗口。
Claude Code 则把整件事拆成一条按成本递增的流水线。先调低工具输出的截断预算,再截短老的工具输出只留一行摘要;接着做局部内联压缩,然后对更久远的历史做细粒度折叠,末了才用大模型生成结构化摘要。它有一处很讲究:优先压缩靠后的内容,保住缓存前缀,因为缓存的 Token 价格通常只有标准输入的一成左右。
这里有个容易被忽略的取舍。压缩在语义上是一次硬切换,会让此前缓存好的提示前缀失效,而缓存本身又便宜得多。有团队在真实的 AI 教学产品上做过对比,给出一个反直觉结论:在开了提示缓存的场景里,把内容都留着,有时比做摘要更便宜、更快、记得也更牢。他们的建议是,压缩应当是针对某个明确约束的主动选择,不该成为默认动作。
仙踪问道在给用户做本地部署和配置调优时,看到的是另一面:多数人的问题不是"没开压缩",而是触发点定得不对,太早太晚都费钱。所以这项技术真正的门槛不在算法,而在几个参数的取舍上,下一节我们讲怎么定。
四、普通用户今天就能做的 5 件事
普通用户怎么省 AI 的 Token 费用,其实不需要读论文。下面 5 件事按"先做哪个"排,前两件不花钱、不担风险,可以先动手。
一是在任务边界上手动压缩,别等自动触发。做完一个完整的活,报告写完、功能改完、调试收尾,就主动压一次。等自动压缩,等于等模型已经在退化区里干了一阵活,而写摘要的模型这时输入也很臃肿,摘要质量会打折。Anthropic 推荐的配套动作是把进度写进文件、用 git 提交当检查点,压缩之后还能顺着记录把状态接回来。
二是把长期规则写进文件,而不是留在对话里。项目规范、写作要求、内部红线,写进 AGENTS.md 或 CLAUDE.md 这类配置文件,或者写进 AI 工具的记忆功能。压缩只动对话历史,不动磁盘上的文件,规则就能跟着会话活下来。反过来看,你在聊天框里口头交代的约束,压缩一次就可能消失。
三是一个任务一个会话。很多人的账单是"隔夜会话"堆出来的:昨天的活做完不关,今天接着聊,几十万 Token 的陈旧历史每一步都要重发一遍。切换任务时开个新会话,是成本很低的省钱动作。
四是关掉用不上的工具和技能。工具定义本身也占上下文,而且每一轮都要发一次。自己盘一盘:有多少工具你这半年一次都没调用过?有多少技能装了却从来不用?把工具定义改成按需加载,公开的实测是能省下约 85% 的相关 Token。
五是给压缩触发点钉一个固定的上限,而不是只看百分比。假设窗口是 100 万 Token,压缩比例按默认的一半算,就得累积到 50 万才触发,等于根本不触发,缓存的 Token 反复重发,账单一路走高。窗口越大越需要钉一个固定数,把触发点定在 12 万到 20 万之间,按任务难度取一个值。
仙踪问道在 Hermes 管理页里把这做成了三档节约档位(保守 200K、推荐 150K、激进 120K)。按实测数据,触发点从默认值钉到 150K 之后,单周缓存读取量从 5.76 亿降到 3.99 亿,省了约三成。
把这 5 件事连起来,逻辑其实很简单:别让 AI 反反复复重读它已经读过的东西。省下来的不是一分两分钱,而是整个任务的分母。
顺着这个话题说一句,如果你用的是 macOS、也不想自己翻配置文件,可以看看仙踪问道·爱马仕助手。它把 Hermes Agent 的安装、国内网络加速、模型接入都做进了图形界面。上面提到的节约档位和用量看板也在同一个界面里,打开就能看到近 7 天的 Token 用量、缓存读取和压缩次数。它也支持把模型跑在本地(目前仅苹果芯片),数据不出本机,长期看也是压成本的一条路。
五、三个容易踩的坑
坑一是压得太狠。压缩的失败其实有三类:压之前判断错,把后面还要用的关键信息删了;压的过程中受长度限制被截断,把已经验证过的结论丢了;压完之后虽说从外部记忆里把东西找回来了,却没有正确用上。它们的共同点是,省下来的 Token 很显眼,丢掉的正确性不显眼。
坑二是只盯"每次请求花多少",不看"每个任务花多少"。这两种口径给出的结论经常相反。有商业压缩服务公开过一组经验:让 Agent 每个会话少消耗 3 到 4 倍的 Token,压缩被触发的频率也跟着低 3 到 4 倍。换句话说,减少压缩的需求,往往比把压缩本身做得更漂亮更划算。
坑三是以为压缩免费。摘要要另外调一次模型,是实打实的支出。有的 Agent 内置了防抖动机制:某次压缩只省下不到 10% 的 Token,就记一次无效压缩,避免每轮都空转烧钱。如果你的工具支持这个指标,值得定期看一眼。
三个坑归到一句话:省钱的目标不是让上下文尽量短,而是让每个任务的总花费尽量低。
结尾:省 Token 是习惯,不是开关
这两年的变化很有意思。早些时候,上下文压缩被当成一个"成本优化技巧",可有可无;到 2026 年,它已经变成 Agent 架构里的一等公民。对普通用户来说,这意味着门槛在下降:你不必读论文,只要把触发点、会话边界和长期规则这三件事调对。
归根结底,AI 的上下文不是垃圾桶,是一张需要你主动收拾的办公桌。你替它收拾得越勤,它把活干得越利索,账单也越好看。
关注这个账号,后面我会继续把 AI 工具里那些说不清的"钱到底怎么花掉的"拆成能对照的表和清单。你平时用 AI 干哪种活比较费 Token?评论区说说你的情况,留言里出现比较多的场景,下一篇就写它。

