日均 40 亿 Token 的那一周:我怎么把羊毛变成长期生产资料
原文只给出 Token 消耗量与按 API 价格折算的等效估值(近 30 天约 27000 美元),作者明确说明这不是真实账单,实际支出是两个 200 美元订阅;来源没有统一的收益口径,不应把等效估值或消耗量当作利润或收入。
这篇文章讲了什么
作者在 Token 订阅低价期,不把额度用于一次性对话,而是沉淀成代码、服务和工作流等长期资产。核心做法有三:把高频、流程固定的场景从 Skill 转为程序化服务(下载、爬虫网关、ASR、OCR),用 DeepSeek 等廉价模型单次调用替代 Agent,单项目日成本不到 10 元;按角色分层调用模型,顶级模型规划、Codex 做 review、Grok 执行;搭建会自我修复的 Agent 流水线,检查全通过才在飞书露出审批按钮,人只回“去查”和点“合并”。
值得读的实操细节
高频场景程序化,把 Agent 注意力留给不确定性
判断标准是“频率够高、流程够固定”才值得做成程序。作者把同一套信息处理过滤流程写成程序化服务,仍调用 LLM 但走传统单次调用、可换 DeepSeek 这类便宜模型,单个项目一天七八百万甚至上千万 Token,成本不到 10 元;同样活儿用 Agent 做可能烧一两亿 Token。已建成的局域网服务包括解决 IP 风控与地区切换的 YouTube 下载、给 URL 就能取公众号/小红书/Twitter 内容的零 Token 爬虫网关、批量 ASR、图片 OCR 与理解,每个服务下游有两到五个消费方。
按角色分层调用模型
Fable 5 只用于顶级项目规划,价值在于从业务视角判断该不该投入、怎么选型,用得省;Codex 是严谨工程师和性价比之王,但要提前说清目标、防止过度设计,做 review 体验最好;Grok 4.5 速度快,适合主力负载高时甩活;Kimi K3 前端审美能打但命令行工具待成熟。国产与平价模型各有分工:GLM 5.2 跑 code review、MiniMax M3 做文档整理、DeepSeek 给程序化服务当便宜劳力。
会自我修复的 Agent 流水线三条规矩
一、所有自动化检查不过不能上线,测试要过、改动量不能超上限、核心基础设施文件 Agent 不能碰;二、写代码和审代码必须是不同 Agent,有界面的项目还会自动模拟真实用户操作并录屏;三、只有万事俱备时才在飞书卡片上露出按钮,中间过程不打扰人。作者在一次线上故障中从头到尾走完整套流程,全程只做两个动作:回一句“去查”,点一下“合并”。
选 Skill 看它会不会长期迭代
作者常年高频在用的 Skill 只有一个——YC CEO Garry Tan 开源的 gstack 里的多视角 review,其余多为项目级安装而不装全局,或干脆研究其原理后吸收进自己的工程化项目。他的判断依据是:一个 Skill 会不会长期迭代。大部分自媒体分享的 Skill 若不是持续更新的,多半为传播效果而写,没在生产环境真正跑过。
你能从原帖了解哪些问题
- 01
你手上哪些重复工作频率够高、流程够固定,值得一次性做成程序,而不是每次都让 Agent 现场处理?
- 02
你现在处在 Copilot、照看 Agent 还是 Agent 自主运行阶段?真正卡住你的是哪个环节?
- 03
如果高智力 Token 恢复按 API 真实价格计费,你现在的哪些玩法会跑不动,哪些沉淀下来的东西仍然能用?
- 04
你在行业里积累的哪些 know-how 是训练数据里没有的,可以喂给 Agent 放大?
原作者的一句话
把 Token 变成代码,我认为是目前杠杆最高的一种转换——前提是这段代码要真正跑在生产环境里、被持续调用。
—— 张立行
第一,所有自动化检查没通过,别想上线。 测试要过、改动量不能超上限、核心基础设施的文件 Agent 不能碰——只要有一条不满足,直接打回,没有情面可讲。
—— 张立行
领取三天生财有术体验卡
扫码领取,在生财有术里阅读更多圈友的实践与复盘。
卡券网整理于 2026-09-11。项目结果为作者自述;本页为精选解读。