注意这个问题立省 50% token

第 1 轮 · 我问了什么
「代码注释里还有 96 处遗留备注,全清掉」
→
模型干了什么
展开了 101 次工具调用
142 次文件编辑 · 179 次命令
↓
上下文 = 101 次调用的「入参 + 输出」原文
27 万 token(占最终 59 万的 45%)
这 27 万里面装的是什么
工具输出(命令回显 / 文件内容 / 搜索结果)75% 工具入参 19% 我的提问(含系统注入)4.5% AI 回复 1.3%
从此永久留在历史里 —— 之后每一轮、每一次请求,都要把它整份重发一遍
第 1 轮101 次调用
27 万
第 2 轮26 次调用
36 万
第 3 轮24 次调用
39 万
第 4 轮10 次调用
41 万
AI 只回 620 字
从前面继承的(每轮全量重发) 本轮新增
共 29 轮 → 末尾 59 万 | 累计输入 1.93 亿 | 其中工具痕迹 93%
但最贵的不是第 1 轮(它只占 5.6%)—— 是水位已经很高、还跑了 50+ 次请求的那两轮,合计 40%
主 要 问 题
一句话,被展开成上百次工具调用;
而这些调用背后的每一次模型请求,都要把全部历史原文重发一遍。
⇒ 成本 = 请求次数 × 当时的上下文体积,越往后越贵。
解 决 方 案
让 AI 写脚本处理
101 次工具调用 ➜ 1 个脚本,一次跑完
96 处同类改动合成一个脚本 —— 少一次调用,就少背一遍全部历史。