为了研究如何省代币,我烧光了所有代币
Hacker News 摘要原标题:I burned all my tokens researching how to save tokens
在 Quesma,研究人员近期深入探讨了 AI 智能体(Agent)的经济学,分析了 Agent 编写代码的真实成本以及优化方法。作者 Bartosz Kotrys 分享了他在研究代币经济学(Tokenomics)过程中,如何从 30 分钟烧光所有 Token 额度到建立起一套高效、省钱且可信的研究工作流的经历。
初始挫折与问题
作者最初尝试使用常规的 deep-research 工具来研究 AI 支出治理和优化工具。他在 30 分钟内启动了 111 个 Agent,排队了 123 项待验证声明,但最终只有 25 项得到验证,且由于触及了 Claude Max 5x 方案的限制,最终的综合报告根本没有生成。这意味着他在没有得到任何结果的情况下,就耗尽了所有的 Token。
整合现有订阅资源
为了解决成本问题,作者决定利用手中已有的三个订阅服务:Claude、Codex 和 Antigravity。通过扩展 claude-mem 插件,他实现了本地共享内存,让不同供应商的工具可以共享学习到的知识。
他采用了一种模型编排模式,将任务按需分配给不同层级的模型,而不是所有工作都使用昂贵的顶级模型:
• Claude Sonnet 5:负责寻找信息。它在 Agent 基准测试中表现出色,且价格足够便宜。
• Claude Opus 4.8:负责验证信息。它是最准确的工作模型,适合检查链接、引用和数据的准确性。
• Claude Fable 5:负责判断与规划。由于价格最高,它仅用于规划任务分解和解决争议。
• Claude Haiku 4.5:负责琐碎任务。用于简单的提取和格式化工作。
• Codex (GPT-5.5):负责运行工具。在终端基准测试中表现极强,用于克隆仓库、安装和运行工具。
• Antigravity (Gemini 3.1 Pro):负责第二意见。作为不同家族的模型,它可以避免与 Claude 产生相同的盲点。
通过一个简单的 Bash 脚本,作者将 Codex 和 Antigravity 作为 Claude 的无头子 Agent 调用。当这些外部订阅达到限制时,系统会自动回退到 Claude 模型。这种方法在不增加额外费用的情况下,将研究持续时间延长了约 10 倍。
减少幻觉与建立信任
除了成本,信任是第二个难题。为了防止模型产生看似合理实则错误的发现,作者在框架中实施了严格的验证规则:
• 角色分离:发现声明的 Agent 严禁参与验证,必须由另一个模型检查链接和原始引用。
• 强制引用:所有进入知识库的信息必须包含 URL 和原始来源的直接引文。
• 严禁虚构数字:如果源页面不包含某个数字,该数字绝不允许出现在结果中。
优化的工作流
在新的流程中,deep-research 工具不再是第一步,而是最后一步。它仅在处理经过验证的声明时运行,用于填补空白和消除杂乱。相比最初烧光额度的尝试,这种方式仅需 22 分钟和 61 个 Agent 即可完成高质量报告。
最终所有验证过的笔记都会存入基于 Obsidian 的 LLM Wiki。作者强调,虽然 Agent 可以承担繁重的研究工作,但人类的监督和规则制定仍然至关重要。
关于 Token 经济学的关键发现
通过这套系统,作者总结了一些关于 AI 成本的意外发现:
• 框架(Harness)的重要性:在相同的模型下,不同的框架设置可能导致 Token 使用量产生 66 倍的差距。
• 上下文压缩的陷阱:虽然压缩听起来能省钱,但模型总结历史记录的过程也会消耗 Token。如果处理不当,会导致模型反复读取被剔除的文件,反而使账单翻倍。
• 缓存失效风险:在会话中间更改或重新排序工具模式(Tool Schema)会使整个缓存失效,导致所有内容按全价重新计费。
• 预估与实际账单的差距:由于上下文累积、重试放大和框架开销,实际账单可能是简单 Token 估算的 7 到 11 倍。
作者最后建议,如果你也在进行深度研究并面临额度焦虑,应尝试反转顺序:让便宜的模型去寻找,准确的模型去验证,最后再由深度研究工具进行总结。