← 返回作品集行途 · 作品集
H3_五层Token首篇_CSDN_20260806_发布版 · 行途专属排版
公众号文章预览
作者:行途(Justin Li)· 资深技术经理 / AI 工程化实践者
首发:CSDN | 转载请注明出处

很多人觉得「AI 编程贵」是因为模型贵。

错了。大部分 Token 是被浪费掉的——重复读文件、啰嗦回复、无意义的工具调用。模型在认真干活的部分,其实只占一半。

我带着团队做了一轮实测,结论很直接:日常编码里,50%–85% 的 Token 是可以砍掉的,而且不靠换更便宜的模型,靠「分层优化」。

这篇文章只讲模型和实测量级,不讲具体配置(配置太干,留到后面再说)。


一、AI 编程的 Token,烧在 5 个独立层

我们把一次 AI 编程会话的 Token 消耗拆成 5 层,每一层都能独立优化

名称在烧什么优化方向
1检索层AI 人肉 grep 几十个服务再读文件,重复调用爆表代码图谱一次查准
2协议层一条命令返回几千行日志,全是 Token命令输出压缩
3散文层AI 回复又长又啰嗦,文风吃掉大量输出文风极简压缩
4生成层代码写得太多,YAGNI 失效最少代码纪律
5调度层确定性任务也丢给大模型跑,浪费判断额度脚本做脏活,只留判断角色

关键点:这 5 层是乘法关系,不是加法

单层省 20%,五层叠起来不是省 100%,而是指数级的——前提是每层真的独立有效。


二、我的实测量级(不剧透精确数据)

下面是我自己 harness 跑出来的聚合量级,仅供参考方向:

  • 检索层:用代码图谱替代人肉检索后,工具调用次数砍了 约 70%。这一层贡献最大,因为它直接减少了"AI 反复读文件"的次数。
  • 协议层:给命令输出加压缩后,命令返回体积压了 九成以上。原来一条命令动辄几千行日志,现在只回关键几行。
  • 散文层:把 AI 文风训成"极简模式"后,纯文字输出大幅压缩,啰嗦话基本消失。
  • 生成层:强制"最少代码"纪律(不需要就不写),代码和配套文档量压了 约 53%
  • 调度层:能写成 bash 脚本跑的确定性任务,全部从 Agent 手里收回;最后只留了 4 个"判断型"角色,其余流程调度、跑门禁、提 MR 全是脚本。

注意:这些数字不能简单相乘算总账。诚实地说,端到端的精确节省率需要严格 A/B 实验才能定。但保守估计,日常编码省 50%–85% 是稳的——标题说的「80%」是个偏乐观的体感值,不是精确结论。


三、最反直觉的一点

省 Token 不是「让 AI 变笨」,是「让 AI 别干重复活」

举个例子,Sub-Agent 分工:

  • 能写成 bash 脚本跑的确定性任务(跑测试、提 MR、清缓存),就别让 Agent 跑;
  • 只有需要判断的(架构决策、代码评审、异常定位),才交给大模型。

我们最后只留了 4 个判断型角色,其余全部脚本化。这一招省下的不止是 Token,还有"Agent 跑偏"的调试时间。


四、底层逻辑一句话

AI 编程的 Token,一半花在「理解你不熟悉的代码、设计架构」上——这部分省不了,那是它真在干活。

另一半花在「重复检索、啰嗦表达、过度生成、确定性任务滥用大模型」上——这部分,分层优化能砍掉大半。

所以记住这句话:AI 编程贵,八成是浪费,不是模型贵。


五、下一篇聊什么

下篇我会讲具体怎么搭这五层:检索层用哪个工具、协议层怎么压、散文层怎么训、生成层用什么纪律卡住 YAGNI。

那部分太干,我会整理成可直接抄的配置清单 + 实测数据表,方便你照着落地。


我是 行途(Justin Li),一个既带团队又天天写代码的资深技术经理。只分享能直接上手的 AI 工程化实战,不整虚的。

👉 想要这份「五层 Token 优化配置清单」模板?关注同名公众号 行途技术手记,后台回复「Token」直接领,后续更新也会第一时间同步。


AIGC 声明:本文由作者基于一线 AI 工程化实践撰写,部分内容借助 AI 辅助整理与校订,核心方法论与实测数据均来自本人团队真实项目。