为了研究如何省代币,我烧光了所有代币

为了研究如何省代币,我烧光了所有代币

Hacker News 摘要

原标题:I burned all my tokens researching how to save tokens

在 Quesma,研究人员近期深入探讨了 AI 智能体(Agent)的经济学,分析了 Agent 编写代码的真实成本以及优化方法。作者 Bartosz Kotrys 分享了他在研究代币经济学(Tokenomics)过程中,如何从 30 分钟烧光所有 Token 额度到建立起一套高效、省钱且可信的研究工作流的经历。

初始挫折与问题

作者最初尝试使用常规的 deep-research 工具来研究 AI 支出治理和优化工具。他在 30 分钟内启动了 111 个 Agent,排队了 123 项待验证声明,但最终只有 25 项得到验证,且由于触及了 Claude Max 5x 方案的限制,最终的综合报告根本没有生成。这意味着他在没有得到任何结果的情况下,就耗尽了所有的 Token。

整合现有订阅资源

为了解决成本问题,作者决定利用手中已有的三个订阅服务:Claude、Codex 和 Antigravity。通过扩展 claude-mem 插件,他实现了本地共享内存,让不同供应商的工具可以共享学习到的知识。

他采用了一种模型编排模式,将任务按需分配给不同层级的模型,而不是所有工作都使用昂贵的顶级模型:

• Claude Sonnet 5:负责寻找信息。它在 Agent 基准测试中表现出色,且价格足够便宜。

• Claude Opus 4.8:负责验证信息。它是最准确的工作模型,适合检查链接、引用和数据的准确性。

• Claude Fable 5:负责判断与规划。由于价格最高,它仅用于规划任务分解和解决争议。

• Claude Haiku 4.5:负责琐碎任务。用于简单的提取和格式化工作。

• Codex (GPT-5.5):负责运行工具。在终端基准测试中表现极强,用于克隆仓库、安装和运行工具。

• Antigravity (Gemini 3.1 Pro):负责第二意见。作为不同家族的模型,它可以避免与 Claude 产生相同的盲点。

通过一个简单的 Bash 脚本,作者将 Codex 和 Antigravity 作为 Claude 的无头子 Agent 调用。当这些外部订阅达到限制时,系统会自动回退到 Claude 模型。这种方法在不增加额外费用的情况下,将研究持续时间延长了约 10 倍。

减少幻觉与建立信任

除了成本,信任是第二个难题。为了防止模型产生看似合理实则错误的发现,作者在框架中实施了严格的验证规则:

• 角色分离:发现声明的 Agent 严禁参与验证,必须由另一个模型检查链接和原始引用。

• 强制引用:所有进入知识库的信息必须包含 URL 和原始来源的直接引文。

• 严禁虚构数字:如果源页面不包含某个数字,该数字绝不允许出现在结果中。

优化的工作流

在新的流程中,deep-research 工具不再是第一步,而是最后一步。它仅在处理经过验证的声明时运行,用于填补空白和消除杂乱。相比最初烧光额度的尝试,这种方式仅需 22 分钟和 61 个 Agent 即可完成高质量报告。

最终所有验证过的笔记都会存入基于 Obsidian 的 LLM Wiki。作者强调,虽然 Agent 可以承担繁重的研究工作,但人类的监督和规则制定仍然至关重要。

关于 Token 经济学的关键发现

通过这套系统,作者总结了一些关于 AI 成本的意外发现:

• 框架(Harness)的重要性:在相同的模型下,不同的框架设置可能导致 Token 使用量产生 66 倍的差距。

• 上下文压缩的陷阱:虽然压缩听起来能省钱,但模型总结历史记录的过程也会消耗 Token。如果处理不当,会导致模型反复读取被剔除的文件,反而使账单翻倍。

• 缓存失效风险:在会话中间更改或重新排序工具模式(Tool Schema)会使整个缓存失效,导致所有内容按全价重新计费。

• 预估与实际账单的差距:由于上下文累积、重试放大和框架开销,实际账单可能是简单 Token 估算的 7 到 11 倍。

作者最后建议,如果你也在进行深度研究并面临额度焦虑,应尝试反转顺序:让便宜的模型去寻找,准确的模型去验证,最后再由深度研究工具进行总结。


原文:https://quesma.com/blog/custom-deep-research-pipeline/

评论:https://news.ycombinator.com/item?id=48967355

Report Page