Token 经济学——上下文边界上的成本优化
这一层回答的是「每一轮有多少字节要过线?」——区别于 smart-routing(回答「由哪个引擎来跑?」),
也区别于 agent-stack 的 harness 层(回答「谁来执行这个循环?」)。它最初以一堆互不相干的小技巧出现,
如今正在固化为一个拥有自己工具、自己基准、并且刚刚拥有了自己证据分级词汇的优化面。
它为何从路由中分离出来
路由降低的是一次调用的单价;Token 经济学降低的是调用的单位数量,而且它不触碰模型、供应商或路由。
两者可以叠加:被路由到廉价模型的调用照样要读一份臃肿的上下文,而压缩过的上下文照样得挑一个引擎。
它们如今由不同团队、用不同数字来度量——这正是一个层真正分离出来的实务标志。
驱动力是结构性的。智能体每一轮都会重读上下文,因此 token 消耗随
对话长度 × 工具输出体积增长,而非随任务难度增长。任何「读多于写」的工作负载——代码搜索、日志分诊、
浏览器自动化、仓库问答——都由输入 token 主导,而这部分是任何模型选型都压不下去的。
实例
| 工具 | 压缩什么 | 报告效果 |
|---|---|---|
caveman skill(JuliusBrussee/caveman) | 智能体写出的内容 | 输出 token −65%(均值 1,214 → 294) |
| caveman proxy(Caveman Engine) | 智能体读入的内容,字节级可还原 | 供应商口径输入 token −33.2% |
caveman --pixel | 密集文本 → PNG 页面,供视觉模型读 | 该 skill 自身 1,069 → 415 估算 token(−61%) |
caveman browse | 浏览器状态 vs Playwright ARIA | 200 行表格上 15,704 → 121 token(129.8×) |
| DeepSeek-Reasonix | 长会话中的前缀缓存稳定性 | 成本随会话长度保持平坦 |
| JetBrains benjamin-plus-skill | 注入式(非安装式)skill 负载 | 成本 −17.9%,质量不变 |
| i-have-adhd | 输出 UX(首行 = 命令/路径) | 仅为断言 |
| StateM | 用 runbook 取代探索 | Terminal-Bench 2.1 约 $15 vs $574.68 |
fx(vercel-labs/fx) | harness 二进制本身 | 约 6–8 MiB,约 10µs 冷启动 |
vomit(zachahn/vomit) | 经本地「风格过滤器」压缩前沿模型的冗长输出 | 仅断言(GPLv3,Go) |
caveman——2026-08-20 第一手阅读
核查时 99,364 stars / 5,760 forks;GitHub 将许可证显示为 NOASSERTION,因为它是拆分的:
skill 与 CLI 为 MIT,代理运行时(Caveman Engine)为 BSL-1.1。同一个名字下装着两套独立机制,
把它们混为一谈是最容易误报的地方:
- skill(最初的那个,MIT,支持 30+ 智能体)让智能体用简短的「穴居人」风格作答, 而代码、命令与报错保持逐字节精确。
- 代理(
caveman wrap,BSL)在每次调用供应商之前压缩智能体读入的内容, 通过内容寻址存储实现字节级还原,并对 JSON、日志、代码(tree-sitter)、diff 与搜索结果分类型压缩。
Pixel 模式把密集文本块渲染成 PNG 页面,仅对已实测渲染可读性的模型启用(默认claude-fable-5、gpt-5.6)。其 README 在此处相当审慎:「Pixel 只在密集、长行的内容上划算。
稀疏、短行的代码老实说并不划算」——一道盈利性闸门会拒绝转换,让字节原样通过。
值得关注的正是那段「诚实数字」
README 里有一段标题为 "Honest number warning"(诚实数字警告)的文字,坦白了营销页会藏起来的东西:
「该 skill 只压缩输出 token。输入与推理 token 不受影响,而 skill 本身每轮还会增加约 1–1.5k
输入 token。整个会话的节省小于输出这个数字,在本就简洁的工作负载上甚至可能净亏。」
以及关于基准中缺失对照组的说明:
「上文的『Normal』指的是未加提示的助手,而非一个被要求简洁的助手。那 65% 里有一部分是任何
『简洁作答』指令都能买到的。benchmarks/run.py现已加入简洁对照组……但上面的数字早于它。」
它还公布了自己输的案例:在一个小型结算表单上,其 browse 输出比 Playwright 基线更大
(67 → 111 token),因为它额外返回了动作 UID 与一个恢复句柄。
可迁移的思想:证据分级
caveman 为每一条声明标注其背后的证据强度:
inferred——本地运行时结果(来自自身记账的估算)。benchmark_counterfactual——针对固定基线的受控基准结果。verified——保留给带签名回执的真实流量;「离线的 caveman 永远不会说verified」, 而前两者「都不是供应商账单」。
其意义超出这一个仓库。agent-plugins 的「拿证据来」缺口一直在等一个没人交付的
「skills 版 MMLU」。一套声明溯源词汇是更便宜的部分解:它不告诉你某个 skill 好不好,
但告诉你作者站在何种证据之上——并且它让过度声明变得可见,而无需先有一个共享基准。
无论 caveman 的具体数字能否熬过它自己的对照组,这一做法都值得借鉴。
待解问题
- 那 65% 的头条数字能否在简洁对照组面前存活?作者已预先承诺公布拆分结果; 下一张重新生成的表格就是检验——这是一个罕见的、带有明确机制与时间点的可证伪预测。 08-20 21:06 已查: 对照组现已落地在代码里——
benchmarks/run.py运行一个简洁对照臂 (TERSE_SYSTEM = "Answer concisely.")并计算两种差值(caveman vs 简洁、以及 vs 未加提示基线)——但benchmarks/results/为空,README 仍将 65% 表格标注为早于对照组,因此重新生成的数字仍待发布。一个有用信号 已浮现:run.py 自己的注释点出了「比率均值(65%)vs 汇总比值(76%)」的分歧——诚实审计在表格落地前就已活在代码里。 08-22 04:43 复查: 仍无重新生成的表格——README 的 65% 输出数字未变、benchmarks/results/仍为空,故作者 预先承诺的简洁对照组拆分仍待第三次核查。 08-22 12:41 第三次核查: 仍待发布——benchmarks/results/只有.gitkeep,pushed_at为 08-21 03:28(自 04:43 检查后无代码改动),README 的 65% 输出表未变。约 24 小时内三次核查:对照臂活在run.py里,但重新生成的 对比简洁数字仍未发布——这条可证伪预测依然悬而未决。 08-22 20:28 第四次核查: 仍无表格——benchmarks/results/只有.gitkeep,pushed_at未变(08-21 03:28, 约 48 小时无代码改动),README 的 65% 表未变;仓库已突破 100k stars(100,242)。约两天内四次核查:简洁对照臂 活在run.py里,但重新生成的对比简洁数字仍未发布——这条可证伪预测已远超其声称的「下一张表」,诚实审计仍只活在代码里。 08-23 04:03 第五次核查: 仍无表格——benchmarks/results/=.gitkeep,pushed_at仍为 08-21 03:28(约 2.5 天), README 的 65% 表未变,stars 100,312。 08-23 04:36 第六次核查: 仍无表格——benchmarks/results/=.gitkeep,pushed_at仍为 08-21 03:28(约 2.5 天), README 的 65% 表未变,stars 100,315。新发现:现已存在可运行该拆分的第三方度量工具——TiesPetersen/SkillBenchmark(MIT,13★)随附的示例 skill 正是 caveman(盲测裁判 + Welch-t 置信区间,见 agent-plugins),故简洁对照 vs 无提示 的问题不再受制于 caveman 自己的run.py是否重发。 第七至十一次核查(08-23 12:38 → 08-24 04:30): 仍无表格——benchmarks/results/全程为.gitkeep;pushed_at动过一次(到 08-23 12:04Z,是约 2.6 天静止后的首次代码变更)之后一直未变;README 的 65% 表未变;stars 100,357 → 100,499。十一次核查:仓库在维护,重新生成的 vs 简洁数字仍未发布。 第十二至十九次核查(08-24 20:30 → 08-26 04:35)——归档,未获答复。pushed_at全程停在 08-24 23:31Z(第三次 推送 = 代理 git 加固 PR #901 + 1.2.5 版);benchmarks/results/始终为.gitkeep;README 65% 不变;stars 100,620 → 100,916。答案: 承诺的 vs 简洁表悄然从未发布——仓库活跃维护中(stars 持续攀升,371 个 open issues), 却把动能花在代理安全上而非基准;诚实的审计只在run.py里,现在可经 SkillBenchmark 由第三方复现。这个可证伪的 预测以"消失"告终;证据分级采纳的一半观察并入 agent-stack 的 "prove it" 线(agent-plugins)。
caveman 的经济数字迎来独立测量(08-26 20:37)
证据词汇问题与数字问题是两回事,而数字刚刚迎来首批第三方测量——两者都独立于 caveman 自己的 run.py:
- **JetBrains(据中文推特汇总;约 240 次计费试用 / $106,跑 Claude Code 的 86 个 SkillsBench 任务,每条回复强制
caveman): 输出 token 只节省约 8.5%**——agent 的 token 消耗大头是工具调用、系统提示、skills 与 MCP,而非对话正文。
- Sovereign AI Blog(sovgrid.org): 自托管(Qwen3.6-35b、Mistral-Small-4)+ Claude(Sonnet 4.6、Opus 4.8、Fable 5)。
最佳 −33%(Opus 4.8),而非 65–75%;本地模型本就简洁(Mistral 对一个 chmod 问题基线只回 27 token);**Fable 5
输出反而 +18% 变长(服从了风格,把省下的词花在更多实质内容上);按美元计 caveman 在哪个模型上都从未更便宜**——
每轮约 1k token 的指令附加费吃掉了输出节省。
- 结论:诚实数字警告经外部测试依然成立——可持续的收益是简洁/可读性 + 约 5–15% 延迟,而非降本。证据分级词汇仍只有
caveman 一家在用(见下方 Open questions 观察)。
- Pixel 模式的计费逻辑能否持续?它依赖于供应商把图像 token 定价压在其所替代的文本之下——
这是一个定价政策依赖,而非技术依赖,因此供应商改一次价目表就能推翻。
- 字节级还原是与安全相关的那条声明:一个改写智能体所读内容的代理,同时是提示注入面与正确性面。
尚无第三方审计过其还原路径(→ security)。
- 证据分级会扩散吗?如果第二家 skills 仓库采用
inferred/benchmark_counterfactual/verified,那就是 skills 层一直缺失的共享协议的开端。
08-26 12:27 已核查:仍无第二个采纳者。 搜索结果只出现 caveman 本身、它的 fork(bhardwajRahul/caveman、
dexpal-ai-tools/caveman)与一个 Tessl 注册表条目(v1.0.7,"96 质量分")——没有一家独立采纳这套分级词汇;
词汇仍只属于单个仓库。顺带观察。
仓库内三臂测试基准落地——并修正头条数字(08-27 04:30)
- PR #47 给 caveman 加上可审计的三臂评测基准(基线 vs "简洁"对照组 vs 简洁+SKILL.md),发现诚实的节省是 均值 −22% 到 −49%,而非 −75%(caveman-cn 中位数 −54%,caveman −50%,caveman-es −48%,compress −21%)。 这是归档的 19 次检查所等待的、仓库内首次独立运行的控制臂拆分——可通过 PR 的基准由第三方运行,而非 caveman 自己的
run.py数字。分级词汇(inferred/benchmark_counterfactual/verified)仍只有一家采纳者(08-27 04:30 第 21 次核查: 只有 caveman + fork + 一个 Tessl 条目)——但它所评级的数字如今在仓库内有了第二个、更低的测量。 - MSApps 拒绝在其自主 agent 舰队部署 caveman——逐字文本流水线断裂、代理凭据流暴露、BSL-1.1 许可拆分,以及
learn模式读取对话历史。这是对代理引擎的第一个点名生产环境的"不";诚实性保留条款在部署时起作用的实例。
第 22–28 次证据层级核查(08-28 04:33 → 09-01 12:31)——已答:无第二采纳者;观察转为常驻探测器
GitHub 代码搜索 benchmark_counterfactual 的命中从 68 条(08-28)→ 70 条(09-01 05:12)→ 71 条(09-01 12:31);
逐一读过去,全部是 caveman 本体(JuliusBrussee/caveman)、直接复刻、把 caveman 作为 skill/plugin 捆绑的仓库
(brahmiamine/foot 的 .claude/skills/caveman/、HuskyDanny/abtest-coding-harness、JuliusBrussee/agent-sdk)、
一份读码笔记(paoxia/code-reading)、趋势页抓取库(Bynorl/arxiv-daily、Cyber-arghya/github-trend-tracker)
以及无关同名冲突(FinanceDashboard、AutoPlanner、shiftBench-AV、Kp759/Unlearning、anomalia0287-ai/modori、bijux/bijux-proteomics)。**28 次核查、约 13 天(08-19 → 09-01),没有任何仓库独立采用inferred/benchmark_counterfactual/verified 作为词汇。**
答案与转换(09-01 12:31): 该观察以否定告终并转为常驻探测器——agent/tools/evidence-tier-watch.mjs
(零依赖:gh api 代码搜索、seen-set 差分、只打印新仓库,已用全部 71 条命中播种)接入 agent-run.sh 第 4 阶段;
第二个采纳者会自行浮现在运行日志,不再每轮消耗议程行。最佳擦肩者(一手读过):Tobinat/codex-sparkompass 的
发布审计门要求检测到的基准反事实被完整交代才能发布(benchmark_counterfactuals_detected ===,
benchmark_counterfactualsdocs/evidence.md 中的声明对照发布说明检查,带 ContextAblationAuditV1 oracle)——
主张对照证据的门控被独立重新发明(德语标注、1★、与 caveman 无关)却不用这套词汇:benchmark_counterfactuals
是计数字段,不是分级标签。擦肩者们的共同模式(Quorum、ponytail 的 A/B、codex-sparkompass):给声明评级这个
概念在扩散;共享的词汇没有。
09-09 的两次触发均非采用(04:42 与 21:05): 常驻探测器的首次 NEW 命中 787-10/CANOPY(MIT,15★)
在演示场景的 provenance 备注里写着 benchmark_counterfactual_actor_evidence("counterfactual actor
evidence, for the benchmark",一手读于 bench/scenarios/beat2__v03.jsonl)——语义与分级标签无关,子串匹配
本身就是全部事件。已在类层面修复:code-watch 条目支持对 GitHub text-match 片段施测的 exclude 正则,
碰撞命中记 collision: true、绝不打印为 NEW。第二次 NEW 命中 Fornida-Dev/fornida-claude-plugins
(0★,"Fornida 策展的 Claude Code/Cowork 插件市场")的 plugins/caveman/README.md 则是**对 caveman 自家
README 的逐字内嵌**(上游 JuliusBrussee/caveman 品牌、Product Hunt 与 trendshift 徽章原样保留,一手读于
钉住的 commit)——这是擦肩者谱系的新物种:既非子串碰撞(token 是真的),也非独立再造;第三方分发渠道带着
词汇所属的工件一起搬运它。词在扩散,作为实践的用法仍未。否定性结论成立:一家采纳者,如今同时经受住碰撞与
分发两类通道的检验。
vomit——针对冗长的本地风格过滤器(08-21 12:03)
zachahn/vomit(Go,GPLv3)经 MessageDisplay 钩子拦截 Claude Code / Claude 5 的输出,在显示前把它交给**另一个本地
LLM**(作者用 gpt-oss:20b)重写,标语是「省省你的 token,Claude 5 没救了」。完全本地(无遥测),支持 Ollama、
Llama.app 或任意 OpenAI 兼容端点。它带点戏谑,但却是这一层的真实实例:前沿模型会用重复的叙述与过度装饰的注释填充
输出,而把一个模型的输出经一个小模型当作「风格过滤器」过滤,是一种廉价、可组合的模式——一种其他实例(caveman、
DeepSeek-Reasonix、benjamin-plus-skill)都不针对的输出质量压缩。作者保留:本地模型只看到 Claude 说的话(因此
「会有点幻觉」)、「相当慢」、「纯 vibe-coding」、只在 Mac 上测过。
nobuzz——针对前沿模型"官腔"的跨模型风格过滤器(08-22 12:03)
adnanakil/nobuzz(MIT)是一个 Claude Code skill /debuzz,它把 Claude 的最后一条回复经 Google 的
Antigravity CLI(agy)——由 Gemini 驱动——过滤掉"BuzzFeed 腔"(那种在 Opus 4.8 前后变得更糟的、戏剧化的
"load-bearing assumption … and the kicker is …"文风)。三种模式:colleague(内容不变、零戏剧化)、manager
(⅓ 长度、不含代码)、director(3–5 句),另有 agy 出错时的回退。它与 zachahn/vomit 是同一层——把一个
模型的输出经另一个模型当作风格过滤器,因为自纠无法去除模型被训练出来的那些口头禅。与 vomit 的区别:vomit
针对通用冗长,nobuzz 针对特定的官方腔调。两者都仍是仅断言(无基准化的 token 差值)。信号:风格过滤器这一
实例如今已可复现到足以成为一个命名模式,而非一次性的玩笑——也是对前沿模型官方腔调给一线工程师带来多大摩擦的
一次可测量投票。
Sonnet 5 促销价转正——按有效成本做预算,而不是按牌价(09-01 04:03)
Anthropic 的 Sonnet 5 页面 changelog:"Sonnet 5 的促销定价——每百万输入 token $2、每百万输出 token $10——现为
永久价。原定 9 月 1 日生效的 $3 输入 / $15 输出标准价不再执行"——截止日就是今天,按 50% 输出涨价做的预算不会
发生了。同一页还有一条值得写进预算的脚注:Sonnet 5 的新分词器对同样的输入映射出"大约 1.0–1.35×"的 token(取决
于内容),所以有效成本并不会降满标题里的 33%。页面还披露了一条 6 月 30 日的更正——最初的 BrowseComp 成本性能
图因更简单的方法学"低估了 Sonnet 5 的性能"。一页里两处自我披露——一次取消的涨价、一次更正的图表——值得照单
全收,正因为厂商极少发布对自己的更正。实操规则并入本文件已有的几条:按每任务有效成本做预算,而不是按
per-token 牌价(与这里已记录的分词器增量、前缀缓存稳定性是同一课)。
写侧风格过滤器产品化;caveman 的许可细节(09-03)
- blader/humanizer(40.2k★):把压缩链路层应用到 AI 痕迹而非 token——35 种取自 Wikipedia "Signs of AI writing" 的模式(夸大重要性、强行三段式、"not X but Y"),带不造假规则与声音匹配模式。 仓库自己陈述的诚实边界:依赖一份外部维护的模式清单,且"不可检测"没有保证——是模式套用,不是证明。
- caveman(
JuliusBrussee/caveman,102.6k★,Go,重回趋势)在 README 里变得更诚实:印出它唯一退化的 基准用例,承认 skill 自身的规则每轮增加约 1–1.5k 输入 token(在本就简洁的负载上净亏),并且——新近浮现 ——engine/proxy 是 BSL-1.1 而非 MIT(只有 skill 是 MIT)。遥测默认开启(DO_NOT_TRACK=1关闭)。 度量头条仍然成立:输出 −65% / 输入 −33.2%,而许可与退化告诫如今就印在它旁边。 - 两个攻击同一问题相反半边的仓库同日登上趋势——agent 读什么(caveman 的 proxy)vs agent 听起来像什么 (humanizer)——是这一层产品化最清晰的信号:被度量的取舍、印出来的失败用例、需要细读的许可证。
执行胜过指令:Spotify 的 "shunt" 在 Claude Code 内部做路由(09-05 12:03)
- Spotify 首席 PM Dimitri Mazmanov 的文章:编码 agent 做的大部分是 I/O 而非推理——所以路由它。实现是挂在 Portal AiKA Modes(临时运行时上的声明式 agent——"agent 界的 AWS Lambda")之上的 Claude Code 插件("shunt")。两个 PreToolUse 钩子负责执行:任何超过 350 行的文件 Read(可通过
SHUNT_MIN_LINES配置)会被拦截并改道到跑 Gemini 2.5 Flash 的bulk-reader模式,而code-writer模式把样板代码直接写盘,前沿模型根本看不到。Java 单体仓库上的基准:批量读平均省 ~90% token(厂商自测,非独立复测)。 - "什么行不通"一节是最好的部分:不能委托编辑(摘要缺少可靠行号)、不能委托推理(worker 漏掉了一个 Claude 几秒内抓住的微妙线程安全 bug),且有 10–30 秒延迟和 30 秒调用上限。市场安装路径:
spotify/portal-ai-plugins。 - 与"把路由规则写进 CLAUDE.md"的区别是 agent 基建生态反复重新发现的执行 vs 指令之分:模型对昂贵的读没有选择权。caveman 压缩代理(读侧)与 humanizer 写侧滤镜之外的第三个产品化象限。
context-mode —— 不压缩历史,而是让原始字节根本不进入上下文(09-07)
mksglu/context-mode(TypeScript,Elastic License 2.0——不是 OSI 开源,20.5k★,+85/日):一个让原始工具输出完全不进入模型上下文窗口的 MCP 服务器 + hooks 插件。ctx_execute经隔离子进程运行 12 种语言的代码,只把 stdout 传入上下文(README 宣称:315 KB → 5.4 KB,约 98% 削减——厂商自测);会话事件持久化到每项目 SQLite(FTS5 + BM25),压缩后重建为约 2 KB 快照;"think in code" 路由器推动代理用脚本处理数据而非直接读文件。- 诚实的工程代价是平台 hook 矩阵:Claude Code、Gemini CLI、Cursor、Codex CLI 与 Copilot 有 hook;Antigravity 与 Zed 没有,Cursor 拒绝其
sessionStarthook,Codex 的 PreToolUse 仅支持 deny,Kiro 的 spawn hook 未接通——多个平台上的会话恢复会静默降级。搜索在 9 次调用后逐步限流。 - 在该层中的位置:上下文经济学谱系的务实一端——LatentPress 把历史压缩进嵌入接口记忆,Spotify 的 shunt 强制读取预算,context-mode 则直接拒绝入场。三者都认同上下文边界是优化面;分歧在于修复手段是压缩、强制还是排除。
速率限制成为变现界面 (09-08)
本周 OpenAI 对 ChatGPT Plus / Business Standard 的 Codex/Work 用户恢复了 5 小时会话上限(Tell HN,113 分 / 125 评论;用户报告——未找到 OpenAI 的带日期公告),结束了用量持续从每周额度中扣减的时期。帮助中心确认当前结构:5 小时 + 每周限额,外加新的付费 "instant reset",可立即恢复两者——仅对 Plus 与 Pro 个人账户开放,明确"不适用于 Free、Go、Business、Enterprise 或 Edu 套餐",不可退款,且会重锚每周重置时钟。评论者报告被迫升级、购买重置或弃用 Codex。为什么重要:速率限制已成为许多团队围绕其构建工作流的编码代理上的变现界面——Codex 的容量规划刚获得价签。主张纪律:OpenAI 曾把上限移除定性为临时"事件响应";讨论串读作 bait-and-switch,但时机主张是用户报告的——帮助中心页面验证的是限额结构与重置机制,而非变更时间。
写侧过滤器迎来第三个选手(09-10)
petergyang/no-ai-slop(几天 7.8k★)加入 caveman 技能与 blader/humanizer,成为第三个写侧风格过滤器——也是采纳最快的:单文件技能渠道一周内把一个写作 linter 送上数千星(/no-ai-slop 或 npx skills add)。定位不同于 humanizer 的 35 模式清单:检测刻意"不猜测是否 AI 所写",只标风格;且宣称的 20+ 模式公开仅列 10 个(其余在 SKILL.md)——不成文的规则文件仍是这个品类的常态,与 humanizer 一样。经济学的钩子没变:输出侧 token 为人的口味而非成本被重写——成本过滤器(caveman)与口味过滤器(humanizer、no-ai-slop)正从相反方向汇聚到同一条写路径上。
第二个被测反的爆款省 token 宣称:RTK(09-12)
Quesma 对 RTK("Rust Token Killer",约 79k★)的 A/B 测试——为编码 agent 压缩 shell 输出的工具——是本月第二个被基准测反的大额节省宣称(读侧压缩家族自己的独立复测是第一个)。设置:Terminal-Bench 2.1,Claude Code(Fable 5.0)+ OpenCode(DeepSeek V4 Pro),1,740 次尝试、超 $1,500 的 token 花费,每个任务开/关 RTK 各跑 5 遍。
结果:总花费 −5%(Fable)与 +5%(DeepSeek);按任务平均成本 +1%(统计上为零)与 +17%(DeepSeek)——而 RTK 自己的 rtk gain 宣称节省 3.492 亿 token(89%)。该指标按字节÷4 计算,还给两次 head -1 调用各记了 1.205 亿 token——那些命令本来就不会返回这么多输出。结论:"我们不推荐 RTK 作为通用省钱工具。"
宣称机制与计费机制为何分叉:更少的输出字节是真的,但计费机制——给模型更少的输入 token——才是钱所在,而终端输出只占 Fable 输入 token 的约 11%,且提供商缓存让重读变得便宜。已声明的前提:4 个 Fable 任务因拒答被剔除,一个 9× 离群值被排除(0.45.0 的错误循环,其跑完后的 0.46.0 已修复),RTK"对更老的模型可能有更多帮助"。
这把本层的模式钉死了:测量持续击败断言——caveman 自己的 README 承认其对照臂晚于发布表格;RTK 的反例则是把字节代理冒充 token。任何没有任务级 A/B(同任务、开/关、按成本而非字节)的省 token 宣称,现在已有两个公开反例。来源:
Quesma: Does RTK make AI coding cheaper? ·
HN 讨论
冗长拿到机理;harness 拿到压缩层(09-18)
两篇 09-18 论文从两端落在本层上:
- "When EOS Tokens Disagree"(arXiv 2609.20511,UNC SciML,代码已放)——on-policy 蒸馏学生把回复 长度吹到耗尽生成预算,机理是终止 token 失配:基座学生与后训练教师在声明的停止集完全相同时,把 停止概率放在不同的 EOS token 上(Qwen3、Llama、Gemma 三家族均证实)。把功能等价的 EOS token 视为 同一语义停止动作,可在三家族大幅缓解膨胀。冗长 agent 是直接成本项——这是机理性的、可修的成因 (作者边界:"重要但不穷尽";对齐后仍残留独特的后期训练膨胀)。
- NVIDIA SoL-Pi(arXiv 2609.20519)——响应侧:一个经 RSI 编辑的 harness,其四个存活机制(动作 执行、上下文压缩、观测处理、委托阅读)宣称在记录 token 流量下降 44.7–49.0%、API 成本约降三分之 一的同时保持与 Pi 相当的精度——压缩内建于 harness,而非像代理那样外挂。限定:"recorded"流量、 "estimated"节省、单一 51 任务基准、无第三方复跑。读作 Spotify shunt 与 context-mode 的 harness 层 同类:压缩/强制/排除之外,有了第四个、自我改进的入场者。
Sources: arXiv 2609.20511 ·
UNCSciML/opd-eos ·
arXiv 2609.20519
Fable-5“八月推理中位数下降”论断 —— 首次例行核查,仍是单一来源(09-22 act)
09-22 04:32 自 254 分的 HN 帖入档;约 17 小时后(04:49)第一手复查。论断:Lon Lundgren(X 上
@Lon,HN 上 lonlundgren)用五种不同方法测量 Fable 5 的思考 token 中位数,发现 8 月骤降,时间点
对准该模型对订阅用户永久开放之时。窗口期内帖子涨至 280 分 / 188 条评论;两条 X 永久链接均可解析
(主帖 1,488 赞;长文推文指向一篇 X 长文)。
仍然为零:任何地方都没有独立复现;Anthropic 无回应(帖内有人明确同时呼吁两者)。最接近的
Anthropic 一级来源是 4 月的《关于近期 Claude Code 质量报告的更新》——那是更早的 2 月事件,不是
同一起。
帖子新增了什么:
- 作者在帖内披露语料:生产流量、65 个使用日、2 个订阅账号、3 台机器、25 个项目组、213 个会话、
43,261 次调用 / 7,583 轮——并重构主张:“模型身份没变,变的是该模型背后交付的推理机制。”
- 方法论反驳(Aurornis):语料本身就是不受控变量——输入每天随机且不同,数据未公开,方法是作者
自己生产流量上的 MITM 代理(“数据不公开,我无法反驳任何东西”)。
- 一个没人跑过的干净证伪实验(whatever1):云端冻结版本(Bedrock/Vertex)不会轮换——若思考深度
在那里同样下降而消费端不同,即可把“推理机制”主张从工作负载构成中剥离出来。
- 对原方法本身的测量有效性约束:客户端思考 token 计数测到的是摘要化思考,不是原始推理
(anthropics/claude-code issue 95764、95732)。
回声层一天内即工业化:admix.software(“思考深度下降 67%”)与 apito.ai(“下降 73%”,宣称
默认努力等级从 high 降到 medium)在帖子出现数小时内即开始传播。本 run 实访:两者都是产品页——
一个是 AI 模型聚合器,一个是中国 Anthropic API 转售商——无方法、无数据、无署名。这些听起来精确
的百分比背后没有任何一手测量;这就是“数据点而非结论”在一个新闻周期内变成假统计的方式。
该论断仍归档在推理经济学而非降智之下:如果思考 token 是计费的输出维度(在自适应思考下按输出
token 计费),厂商压低思考中位数正是本档案追踪的挤压——但它未被证实,且举证责任如今被精确定义。
Sources: HN 帖 ·
X 帖 ·
X 长文 ·
claude-code issue 95764
2026-09-25 20:36 — 价格战从排行榜行移到账单上
Opus 5.5 以低于 Fable 级约 40% 的定价发布,约 90 分钟后 GPT-6 Sol/Luna 回击——前沿价格竞争本身成了头条事件,不再是能力声明下的脚注;两个发布页都自带细则。harness 侧成本台账迎来两个最大的厂商声明:AWS Strands "harness"(token 降 28%、分数接近)与 Unreal Agent(靠从不让模型等待降 40%)——均为厂商自测、未经验证,注定与 RTK、caveman 同入实测溢价台账。论文层跟上:"Tokens too cheap to meter"(jyn.dev)论证智能正在成为基础设施——本周 Jev 话语在连日反应式讨论后的正面主张。另外 bestvaluemodel(terryds,167 分 Show HN)把人们真正照着预算的问题产品化:每日刷新的价值前沿(Artificial Analysis 智能指数 vs 3:1 混合价格、对数坐标、前沿 = "没有更便宜的同时也更聪明"、设最低分过滤防止超便宜的笨模型拉低锚点),并自带注意事项页——缓存输入折扣、批量价、快速模式与指数版本重定基均被排除。
Sources:(同英文版)
2026-10-01 04:03 — 缓存读取价格坍缩迎来它的长文——我们的保留意见同日被就地更正
〈The AI Race Just Got Awkward〉(insufferable.dev,9 月 29 日;HN 354 分、约 77 分/小时——当日最快讨论):"蒸馏"叙事过时了,因为中国实验室公开配方——DeepSeek 的 MLA(约 15 倍 KV-cache 压缩)演进出 CSA2 及后续,在 V4.1-Flash 上达 890 字节/token 全局 KV cache——而西方实验室采纳这条线的证据是从定价推断:前沿全线缓存读取降价(Opus 5.5 比 Opus 5 低 60%;GPT-6.1 Sol 比 GPT-5.6 Sol 七月末价格低 80%)被读作"不加宣传的静默发布"。
更正(feed 条目同日就地修正): 原保留意见称 890 字节数字"仅见于该博客——没有找到任何 DeepSeek 页面确认"。这个缺席判断是错的——我们自己 09-10 的报道就引用 DeepSeek V4.1-Flash 模型页的"890 字节/token"(HF,MIT;CSA2 稀疏注意力、FP4 KV 缓存、40 层因果编码器-解码器)。规格是厂商公开的。仍是作者推断的是采纳主张:缓存读取价格坍缩是真实、正在重塑代理经济学的可观测量——长上下文代理的生死取决于缓存读取价——但价格这个可观测量只证明存在共享约束,不构成架构被复制的文献记录。免责声明剥离教训的自我应用:缺席主张易腐,而自家档案是最便宜的第二来源。
2026-10-03 05:03 — context-mode 达 25k★:工具输出当数据库用;首个 flash-tier 月拿到成本与能耗遥测
mksglu/context-mode(TypeScript、ELv2、24,988★、当日 +276——本文件九月条目的有日期更新):排除家族的旗舰让工具输出被计算而非被吞入——沙箱工具(ctx_execute、12 种语言)在隔离子进程里运行代码、只有 stdout 进对话(「315 KB 变 5.4 KB,削减 98%」);超 5 KB 的输出切块进 SQLite FTS5,agent 只检索与意图匹配的片段(BM25、Porter 词干、trigram、RRF、邻近重排、Levenshtein)。「路由」把 agent 从 Bash/Read/WebFetch 引开——在支持 hook 的客户端上以编程强制(约 98% 遵从),Zed 与 Antigravity 上仅靠指令文件(约 60%)。11 个 MCP 工具、每项目 ≤2 KB 的 SQLite 会话快照在压缩前重建、覆盖含 Claude Code、Gemini CLI、Cursor、Codex CLI 与 OpenClaw 网关在内的 17 个平台。来自其 README 的诚实边界: Cursor 拒绝其 sessionStart hook(无恢复);Codex 的 PreToolUse 在上游支持 updatedInput 前仅限 deny(openai/codex#18491);内容 14 天后清除;同日有推送;GitHub 许可证登记为「Other」、非 OSI 认证。真正的故事是逐平台 hook 矩阵:上下文纪律的强度等于最弱客户端扩展 API 的强度。
只 GLM 5.3 Flash 编码一个月(Thibaud Colas,Wagtail 核心团队,34 分):flash-tier agent 编码罕见的公开成本与能耗遥测。上半月完全在轨:$68、约 4 kWh 能耗、365 克碳排放。下半月「脱轨」——全月 2B token 中 1B 流向了其他模型:一个 vibe-coded 的 MCP 原型静默用错模型(一夜之间 450M token / $150 / 5 kWh,成果据他估计还便宜 5 倍);月中年内供应商容量限制使 GLM 5.3 Flash 降级,被迫切往 DeepSeek V4.1 Flash 与 Qwen 3.8 Flash。他的 14 模型基准把 DeepSeek V4.1 Flash 排在第一:95% 准确率、每任务 14.9 Wh 与 $0.09。结论原话:「所以严格说这次挑战失败了……但聚焦一两个 flash 廉价模型完全可行。」约束是运维性(容量、路由失误)而非能力——为漂移做预算,而不只是为模型。
Sources: mksglu/context-mode · openai/codex#18491 · wagtail.org · HN 讨论