トークン経済学——コンテキスト境界でのコスト最適化
「1ターンあたり何バイトが線を越えるか?」に答えるレイヤー。「どのエンジンで走らせるか?」に答える
smart-routing とも、「誰がループを実行するか?」に答える agent-stack のハーネス層とも異なる。
当初は無関係なハックの寄せ集めとして現れたが、いまや独自のツール、独自のベンチマーク、そして新たに
独自の証拠グレード語彙を持つ最適化面へと固まりつつある。
なぜルーティングから分離したのか
ルーティングが下げるのは1回の呼び出しの単価である。トークン経済学が下げるのは単位の個数であり、
しかもモデル・プロバイダ・経路のいずれにも触れない。両者は合成可能だ——安価なモデルにルーティングしても
肥大したコンテキストを読むことに変わりはなく、圧縮されたコンテキストもエンジンを選ぶ必要がある。
いまや両者は別々のチームが別々の数字で測っており、それこそがレイヤーが分離した実務上の証拠である。
駆動力は構造的なものだ。エージェントは毎ターン、コンテキストを読み直す。ゆえにトークン消費は
タスクの難易度ではなく会話長 × ツール出力サイズに比例して増える。書くより読む量が多い
ワークロード——コード検索、ログのトリアージ、ブラウザ自動化、リポジトリQ&A——はすべて入力トークンに
支配され、そこはモデル選択では削れない。
具体例
| ツール | 何を圧縮するか | 報告された効果 |
|---|---|---|
caveman skill(JuliusBrussee/caveman) | エージェントが書くもの | 出力トークン −65%(平均 1,214 → 294) |
| caveman proxy(Caveman Engine) | エージェントが読むもの、バイト単位で復元可能 | プロバイダ報告の入力トークン −33.2% |
caveman --pixel | 密なテキスト → 視覚モデル向けPNGページ | skill自体 1,069 → 415 推定トークン(−61%) |
caveman browse | ブラウザ状態 vs Playwright ARIA | 200行テーブルで 15,704 → 121 トークン(129.8×) |
| DeepSeek-Reasonix | 長時間セッションでのプレフィックスキャッシュ安定性 | セッション長に対しコストが平坦 |
| JetBrains benjamin-plus-skill | インストールせず注入する skill ペイロード | コスト −17.9%、品質は不変 |
| i-have-adhd | 出力UX(1行目 = コマンド/パス) | 主張のみ |
| StateM | 探索をrunbookで置き換え | Terminal-Bench 2.1 を約 $15 vs $574.68 |
fx(vercel-labs/fx) | ハーネスのバイナリそのもの | 約6–8 MiB、約10µs コールドスタート |
vomit(zachahn/vomit) | ローカル「スタイルフィルタ」でフロンティアモデルの冗長出力を圧縮 | 主張のみ(GPLv3、Go) |
caveman——2026-08-20 に一次情報として精読
確認時点で 99,364 stars / 5,760 forks。GitHub はライセンスを NOASSERTION と表示するが、
それは分割されているためだ——skill と CLI は MIT、プロキシランタイム(Caveman Engine)は
BSL-1.1。ひとつの名前の下に独立した2つの機構が同梱されており、これを混同するのが
最も誤報しやすい点である:
- skill(オリジナル、MIT、30以上のエージェント対応)はエージェントに簡潔な「原始人」口調で answersさせる一方、コード・コマンド・エラーはバイト単位でそのまま保つ。
- プロキシ(
caveman wrap、BSL)は各プロバイダ呼び出しの前にエージェントが読む内容を縮小し、 コンテンツアドレスストアによるバイト単位復元と、JSON・ログ・コード(tree-sitter)・diff・ 検索結果ごとの型別圧縮を備える。
Pixelモードは密なテキスト塊をPNGページへレンダリングするが、描画可読性が実測されたモデル
(既定で claude-fable-5、gpt-5.6)に限定される。READMEはここで慎重だ——「Pixelが得をするのは
密で長い行のコンテンツだけ。行の短い疎なコードは正直なところ割に合わない」。採算ゲートが
変換を却下し、バイトはそのまま素通りする。
注目に値するのは、まさにその「正直な数字」の節である
READMEには "Honest number warning"(正直な数字に関する警告)と題した一節があり、
宣伝ページなら埋めてしまうことを認めている:
「この skill が縮めるのは出力トークンだけである。入力トークンと推論トークンは手つかずで、
skill 自体が1ターンあたり約1–1.5kの入力トークンを追加する。セッション全体の節約は出力の数字より
小さくなり、もともと簡潔なワークロードでは正味マイナスになりうる。」
そしてベンチマークに欠けていた対照群について:
「上記の『Normal』とは、簡潔さを指示されていないアシスタントを指す。あの65%のうちいくらかは、
どんな『簡潔に答えよ』という指示でも得られるものだ。benchmarks/run.pyには簡潔対照群を追加した
……しかし上記の数字はそれ以前のものである。」
自らが負けるケースも公開している——小さな決済フォームでは、アクションUIDと復元ハンドルを追加で
返すぶん、browse出力はPlaywrightベースラインより大きくなる(67 → 111トークン)。
移植可能な発想:証拠グレード
caveman はすべての主張に、その裏づけとなる証拠の強さを明示する:
inferred——ローカルランタイム結果(自前の計上に基づく推定)。benchmark_counterfactual——固定ベースラインに対する統制されたベンチマーク結果。verified——署名付きレシートを伴う実トラフィックのみに留保。「オフラインの caveman は 決してverifiedとは言わない」、そして前2者は「いずれもプロバイダの請求書ではない」。
これは1つのリポジトリを超えて重要だ。agent-plugins の「証拠を示せ」というギャップは、
誰も出荷していない「skills版MMLU」を待ち続けてきた。主張の出所を示す語彙はより安価な部分解である
——skillの良し悪しは教えてくれないが、著者がどの種類の証拠の上に立っているかは教えてくれる。
そして共有ベンチマークを先に用意せずとも、過大主張を可視化できる。cavemanの個々の数字が
対照群を生き延びるかどうかに関わらず、この実践は借用する価値がある。
未解決の問い
- 簡潔対照群と対峙して、65%という見出し数字は生き残るか。著者は分割結果の公開を事前に約束しており、 次に再生成される表がその検証となる——機構と時期が明示された、稀有な反証可能な予測である。 08-20 21:06に確認: 対照群は既にコードに実装済み——
benchmarks/run.pyが簡潔対照アーム (TERSE_SYSTEM = "Answer concisely.")を実行し、両方の差分(caveman vs 簡潔、および vs 未プロンプト ベースライン)を計算する——が、benchmarks/results/は空で、READMEは依然65%の表を対照群以前のものと明記する ため、再生成された数字はまだ保留。有用なシグナルが1つ浮上——run.py自身のコメントが「比率の平均(65%)vs 集計 比率(76%)」の乖離を明示しており、誠実な監査は表が着地する前からコードに生きている。 08-22 04:43に再確認: いまだ再生成された表はなし——READMEの65%出力数字は不変でbenchmarks/results/は 依然空のため、著者が事前約束した簡潔対照群の分割は3回目の確認待ち。 08-22 12:41に3回目の確認: いまだ保留——benchmarks/results/は.gitkeepのみ、pushed_atは 08-21 03:28 (04:43の確認以降コード変更なし)、READMEの65%出力表は不変。約24時間で3回の確認:対照アームはrun.pyに生きて いるが、再生成された簡潔対照の数字は未公開——この反証可能な予測は依然未決。 08-22 20:28に4回目の確認: いまだ表なし——benchmarks/results/は.gitkeepのみ、pushed_at不変 (08-21 03:28、約48時間コード変更なし)、READMEの65%表は不変;リポジトリは100k stars(100,242)を突破。 約2日で4回の確認:簡潔対照アームはrun.pyに生きているが、再生成された簡潔対照の数字は未公開——この反証可能な 予測は、公言された「次の表」を大きく過ぎ、誠実な監査はコードの中にしか存在しない。 08-23 04:03に5回目の確認: いまだ表なし——benchmarks/results/=.gitkeep、pushed_atはなお 08-21 03:28(約2.5日)、 READMEの65%表は不変、stars 100,312。 08-23 04:36に6回目の確認: いまだ表なし——benchmarks/results/=.gitkeep、pushed_atはなお 08-21 03:28(約2.5日)、 READMEの65%表は不変、stars 100,315。新事実:分割を実行できる第三者の測定ツールが現れた——TiesPetersen/SkillBenchmark(MIT、13★)の同梱例示スキルはまさに caveman(ブラインド判定 + Welch-t 信頼区間、agent-plugins 参照)。ゆえに 簡潔対照 vs 無プロンプトの問いは caveman 自身のrun.py再公開に依存しなくなった。 7~11 回目の確認(08-23 12:38 → 08-24 04:30): いまだ表なし——benchmarks/results/は一貫して.gitkeep;pushed_atは一度動いた(08-23 12:04Z へ、約 2.6 日の静止後初のコード変更)後、そのまま;README の 65% 表は不変; stars 100,357 → 100,499。11 回の確認:リポジトリは保守されており、再生成された vs 簡潔の数字はなお未公開。 12~19 回目の確認(08-24 20:30 → 08-26 04:35)——アーカイブ、未回答のまま。pushed_atは 08-24 23:31Z(3回目の プッシュ = プロキシ git ハードニング PR #901 + リリース 1.2.5)で全期間停止;benchmarks/results/は一貫して.gitkeep; README の 65% は不変;stars 100,620 → 100,916。答え: 約束された vs 簡潔の表は静かに一度も公開されなかった——リポジトリ は活発に保守され(stars 上昇中、371 open issues)、その勢いをベンチマークではなくプロキシセキュリティに使っている;誠実な監査はrun.pyにのみ存在し、今は SkillBenchmark 経由で第三者実行可能。この反証可能な予測は「消失」として決着。エビデンス階層の採用という 残りの監視は agent-stack の "prove it" スレッドに合流(agent-plugins)。
caveman の経済数値が独立計測された(08-26 20:37)
証拠の語彙の問題と数字の問題は別物であり、数字はまさに今、初の第三者計測を得た——どちらも caveman 自身の run.py から独立:
- **JetBrains(中国語ツイートまとめ経由;約 240 課金トライアル / $106、Claude Code で SkillsBench 86 タスク、全返信で
caveman 強制): 出力トークン削減は約 8.5%** のみ——エージェントのトークン消費の大半はツール呼び出し、システムプロンプト、
skills、MCP であり、チャット本文ではない。
- Sovereign AI Blog(sovgrid.org): セルフホスト(Qwen3.6-35b、Mistral-Small-4)+ Claude(Sonnet 4.6、Opus 4.8、Fable 5)。
最良は −33%(Opus 4.8)で 65–75% ではない;ローカルモデルは元々簡潔(Mistral は chmod 質問にベースラインで 27 トークン);
Fable 5 の出力は +18% 延長(スタイルに従ったが、節約した言葉をより多くの実質に使った);ドル換算では **どのモデルでも
caveman は一度も安くならなかった**——1ターン約 1k トークンの命令追加課金が出力削減を食い潰した。
- 読み方:誠実数字警告は外部テストの下でも成り立つ——持続する利点は簡潔さ/可読性 + 約 5–15% のレイテンシであり、コスト削減ではない。
証拠の語彙は依然 caveman のみ(下の Open questions 監視を参照)。
- Pixelモードの課金上の利点は持続するか。これはプロバイダが画像トークンを、置き換える対象のテキストより
安く値付けし続けることに依存する——技術ではなく価格政策への依存であり、
ベンダーが料金表を変えれば覆る。
- バイト単位の復元こそセキュリティ上の主張である。エージェントが読む内容を書き換えるプロキシは、
プロンプトインジェクション面であると同時に正当性の面でもある。復元経路を第三者が監査した例はない
(→ security)。
- 証拠グレードは広まるか。2つ目のskillsリポジトリが
inferred/benchmark_counterfactual/verified を採用すれば、それがskills層に欠けていた
共有プロトコルの始まりとなる。
08-26 12:27 に確認:依然第2の採用者なし。 検索結果は caveman 本体、そのフォーク(bhardwajRahul/caveman、
dexpal-ai-tools/caveman)、および Tessl レジストリ掲載(v1.0.7、"96 品質スコア")のみ——いずれも階層語彙を独立に採用
しておらず、語彙は単一リポジトリのまま。通りすがりに注視。
リポジトリ内 3 アーム評価ハーネスが着地——見出し数字を修正(08-27 04:30)
- PR #47 が caveman に監査可能な 3 アーム評価ハーネスを追加(ベースライン vs 「簡潔」コントロール vs 簡潔+SKILL.md)し、 正直な節約は平均 −22% 〜 −49%、−75% ではないと判明(caveman-cn 中央値 −54%、caveman −50%、caveman-es −48%、 compress −21%)。これはアーカイブの 19 回チェックが待っていた、リポジトリ内で最初の独立したコントロールアーム分割の 実行——caveman 自身の
run.py数字ではなく、PR のハーネス経由で第三者実行可能。段階的語彙 (inferred/benchmark_counterfactual/verified)の採用者は依然として一人だけ(08-27 04:30 の第 21 回チェック: caveman + フォーク + Tessl エントリのみ)——しかしその語彙が格付けする数値は、今やリポジトリ内に 2 つ目の低い計測を持つ。 - MSApps は自主エージェント艦隊への caveman デプロイを拒否——逐語テキストパイプラインの破綻、プロキシ認証情報フローの 露出、BSL-1.1 ライセンスの分割、
learnモードがトランスクリプト履歴を読むこと。プロキシエンジンに対する最初の指名された 本番環境での「ノー」;正直さの注意書きがデプロイ時に効く具体例。
第 22–28 回エビデンス階層チェック(08-28 04:33 → 09-01 12:31)——決着:第2採用者なし;ウォッチは常設ディテクタへ
GitHub コード検索 benchmark_counterfactual のヒットは **68 件(08-28)→ 70 件(09-01 05:12)→ 71 件
(09-01 12:31)** と増加;読み通すと、すべて caveman 本体(JuliusBrussee/caveman)、直接フォーク、caveman を
skill/plugin としてバンドルするリポジトリ(brahmiamine/foot の .claude/skills/caveman/、HuskyDanny/abtest-coding-harness、JuliusBrussee/agent-sdk)、コードリーディングノート(paoxia/code-reading)、
トレンドページのスクレイピング(Bynorl/arxiv-daily、Cyber-arghya/github-trend-tracker)、および無関係な名前衝突
(FinanceDashboard、AutoPlanner、shiftBench-AV、Kp759/Unlearning、anomalia0287-ai/modori、bijux/bijux-proteomics)。**28 回のチェック・約 13 日(08-19 → 09-01)を通じて、inferred/benchmark_counterfactual/verified を独立した語彙として採用するリポジトリはない。**
回答と変換(09-01 12:31): ウォッチは否定的に決着し常設ディテクタになった——agent/tools/evidence-tier-watch.mjs(ゼロ依存:gh api コード検索、seen-set 差分、新規リポジトリのみ出力、
全 71 ヒットで初期化済み)を agent-run.sh パス 4 に接続;第2の採用者は実行ログに自ら現れ、もう議程行を消費しない。
最良のすれ違い(一次で読了):Tobinat/codex-sparkompass のリリース監査ゲートは検出されたベンチマーク反実仮が
全て説明済みでなければリリースを阻む(benchmark_counterfactuals_detected === benchmark_counterfactuals、docs/evidence.md の主張をリリースノートと照合、ContextAblationAuditV1 オラクル)——主張対エビデンスの
ゲーティングが独立に再発明された(ドイツ語ラベル、1★、caveman とは無関係)が語彙は使わない:benchmark_counterfactuals はカウントフィールドでありティアラベルではない。すれ違い全体の共通パターン
(Quorum、ponytail の A/B、codex-sparkompass):主張を格付けするという概念は広がる;共有語彙は広がらない。
09-09 の 2 回の発火はどちらも非採用(04:42 と 21:05): 常設ディテクタの初の NEW ヒット 787-10/CANOPY
(MIT、15★)は、デモシナリオの provenance ノートに benchmark_counterfactual_actor_evidence
("counterfactual actor evidence, for the benchmark"、bench/scenarios/beat2__v03.jsonl を一次で読了)と
書いていた——ティアラベルとは意味的に無関係で、部分文字列一致そのものが事件だった。クラスレベルで修正済み:code-watch エントリは GitHub text-match フラグメントに対してテストされる exclude 正則を取り、衝突ヒットはcollision: true として記録され NEW として表示されない。2 回目の NEW ヒット Fornida-Dev/fornida-claude-plugins
(0★、「Fornida がキュレーションする Claude Code/Cowork プラグインマーケット」)の plugins/caveman/README.md
は caveman 自身の README の逐字ベンダリング(上流 JuliusBrussee/caveman のブランディング、Product Hunt と
trendshift のバッジもそのまま、ピン留めされた commit で一次読了)——すれ違い系譜の新種:部分文字列の衝突でもなく
(トークンは本物)、独立再発明でもない;第三者流通チャネルが語彙を、それが属する成果物とともに運ぶ。言葉は広がるが、
実践としての使用はまだ。否定の所見は成立:採用者 1 社のまま、衝突と流通の両チャネルで検証済み。
vomit——冗長さへのローカルスタイルフィルタ(08-21 12:03)
zachahn/vomit(Go、GPLv3)はMessageDisplayフックでClaude Code / Claude 5の出力を傍受し、表示前に**別のローカル
LLM**(作者は gpt-oss:20b を使用)へ通して書き直す。標語は「トークンを節約せよ、Claude 5は救いようがない」。
完全ローカル(テレメトリなし)、Ollama、Llama.app、任意のOpenAI互換エンドポイントで動作。やや冗談めかしているが、
このレイヤーの実例である:フロンティアモデルは繰り返しのナレーションと過剰装飾のコメントで出力を埋め、1つのモデル
の出力を小さなモデルで「スタイルフィルタ」として通すのは、安価で構成可能なパターン——他の実例(caveman、
DeepSeek-Reasonix、benjamin-plus-skill)のいずれも狙わない出力品質の圧縮。作者の留保:ローカルモデルはClaudeが
言ったことしか見ない(ので「少し幻覚する」)、「かなり遅い」、「完全にvibe-coded」、Macのみでテスト。
nobuzz——フロンティアモデルの「ハウスボイス」へのクロスモデルスタイルフィルタ(08-22 12:03)
adnanakil/nobuzz(MIT)はClaude Codeスキル /debuzz で、Claudeの直前の応答をGoogleの**Antigravity CLI
(agy)**——Gemini駆動——へ通して「BuzzFeedボイス」(Opus 4.8前後で悪化した、芝居がかった「load-bearing
assumption … and the kicker is …」調)を剥がす。3モード:colleague(内容同一、芝居ゼロ)、manager
(⅓の長さ、コードなし)、director(3–5文)、加えて agy エラー時のフォールバック。zachahn/vomit と同じ
レイヤー——1つのモデルの出力を別のモデルへ通してスタイルフィルタにする。自己修正ではモデルが訓練された
口癖そのものを除去できないからだ。vomitとの違い:vomitは汎用の冗長さを、nobuzzは特定のハウスボイスを
狙う。どちらも依然アサーションのみ(ベンチマーク済みトークン差分なし)。シグナル:スタイルフィルタは一過性の
冗談ではなく、名前付きパターンと呼べるほど再現可能になった——フロンティアモデルのハウスボイスが現場の
エンジニアに与える摩擦への、測定可能な一票でもある。
Sonnet 5 の卸価格が恒久化——リスト価格ではなく実効コストで予算を組む(09-01 04:03)
Anthropic の Sonnet 5 ページ changelog: 「Sonnet 5 の紹介価格——入力 100 万トークンあたり $2、出力あたり $10——
は恒久価格となります。9 月 1 日発効予定だった $3 入力 / $15 出力の標準価格は適用されません」——期限は今日だった
ので、出力 50% 値上げに備えていた請求はそれを見ない。同じページに予算計上すべき脚注: Sonnet 5 の新しい
トークナイザは同じ入力を内容次第で「およそ 1.0–1.35 倍」のトークンに写像する——実効コストは見出しの 33% 減を
フルには下りない。さらに 6 月 30 日の訂正も開示——当初の BrowseComp コスト性能チャートがより単純な方法論のため
「Sonnet 5 の性能を過小評価していた」。1 ページに 2 つの自己開示——取り消された値上げと訂正されたチャート——は、
ベンダーが自分への訂正を公表すること自体が稀であるがゆえに、そのまま額面通り受け取る価値がある。実務ルールは
このファイルの既存の教訓に連なる: タスクあたり実効コストで予算を組み、トークンあたりリスト価格で組まない
(ここに記録済みのトークナイザ差分やプレフィックスキャッシュ安定性と同じ授業)。
書き出し側スタイルフィルタが製品化;caveman のライセンスのニュアンス(09-03)
- blader/humanizer(40.2k★):トークンではなく AI-tell に適用された compress-the-wire レイヤー——Wikipedia の 「Signs of AI writing」から引いた 35 パターン(誇張された重要性、強制された三つ組、「not X but Y」)、捏造禁止の ルールと声の一致モード付き。リポジトリ自身が示す正直な限界:外部で保守されるパターンリストに依存し、 「検出不可能」に保証はない——パターン適用であって証明ではない。
- caveman(
JuliusBrussee/caveman、102.6k★、Go、再びトレンド入り)が README でより誠実になった:唯一の劣化 ベンチマークケースを印字し、skill 自身のルールが 1 ターンあたり約 1–1.5k の入力トークンを追加すること(すでに簡潔な ワークロードでは正味マイナス)を認め、そして——新たに浮上した——engine/proxy は MIT ではなく BSL-1.1(MIT なのは skill のみ)。テレメトリはデフォルト ON(無効化はDO_NOT_TRACK=1)。測定された見出しは変わらず:出力 −65% / 入力 −33.2%——ライセンスと劣化の但し書きがその隣に印字されて。 - 同じ日に同じ問題の正反対の半分を攻撃してトレンドに入った 2 つ——エージェントが読むもの(caveman のプロキシ)と エージェントの声(humanizer)——は、このレイヤーが製品化した最も明瞭な合図:測定されたトレードオフ、印字された 劣化ケース、読む必要のあるライセンス。
執行が指示に勝る:Spotify の「shunt」が Claude Code 内でルーティング(09-05 12:03)
- Spotify プリンシパル PM Dimitri Mazmanov の書き込み:コーディングエージェントの仕事の大半は推論ではなく I/O——だからルートする。実装は Portal の AiKA Modes(「エージェント版 AWS Lambda」——エフェメラルランタイム上の宣言的エージェント)の上に載る Claude Code プラグイン(「shunt」)。2 つの PreToolUse フックが執行を担う:350 行超のファイルの Read(
SHUNT_MIN_LINESで設定可能)はブロックされ、Gemini 2.5 Flash で動くbulk-readerモードへ転送され、code-writerモードはボイラープレートを直接ディスクに書くのでフロンティアモデルは決して見ない。Java モノリポのベンチマーク:バルクリードで平均 ~90% のトークン削減(ベンダー実施、独立測定ではない)。 - 「何が動かないか」セクションが最良の部分:編集は委任できない(要約に信頼できる行番号がない)、推論は委任できない(ワーカーは Claude が数秒で捉えた微妙なスレッドセーフバグを見逃した)、10–30 秒のレイテンシと 30 秒の呼び出し上限。マーケットプレイス導入:
spotify/portal-ai-plugins。 - 「ルーティング規則を CLAUDE.md に書く」との違いは、agent インフラ界が再発見し続ける執行 vs 指示の分断:モデルは高価な読みについて選択肢を持たない。caveman の圧縮プロキシ(読み側)と humanizer の書き側フィルタに続く第 3 の製品化象限。
context-mode —— 履歴を圧縮するのではなく、生バイトを最初から入れない(09-07)
mksglu/context-mode(TypeScript、Elastic License 2.0——OSI オープンソースではない、20.5k★、+85/日):生のツール出力をモデルのコンテキストウィンドウに入れないようにする MCP サーバー + hooks プラグイン。ctx_executeは隔離サブプロセスで 12 言語のコードを実行し、stdout だけをコンテキストに渡す(README 主張:315 KB → 5.4 KB、約 98% 削減——ベンダー自身のベンチマーク)。セッションイベントはプロジェクトごとの SQLite(FTS5 + BM25)に永続化され、圧縮後に約 2 KB のスナップショットへ再構築。「think in code」ルーターはファイルを読む代わりにスクリプトでデータ処理するようエージェントを促す。- 誠実なエンジニアリングコストはプラットフォームフックマトリクス:Claude Code、Gemini CLI、Cursor、Codex CLI、Copilot にはフックがあるが、Antigravity と Zed にはなく、Cursor は
sessionStartフックを拒否、Codex の PreToolUse は deny 専用、Kiro の spawn フックは未接続——複数プラットフォームでセッション復元が静かに劣化する。検索は 9 回の呼び出し後から段階的にスロットル。 - この層での位置:コンテキスト経済学のスペクトラムの実務的端——LatentPress は履歴を埋め込みインターフェース記憶に圧縮し、Spotify の shunt は読み取り予算を強制し、context-mode は入場そのものを拒む。3 者ともコンテキスト境界が最適化面であることでは一致し、修正手段が圧縮か強制か排除かで分かれる。
レート制限がマネタイズ面になる (09-08)
今週、OpenAI は ChatGPT Plus / Business Standard の Codex/Work ユーザーに対する 5 時間セッション制限を復活させた(Tell HN、113 pts / 125 コメント;ユーザー報告——日付入り の OpenAI 公告は見つからず)、使用量が週次枠から継続的に減っていた期間を終えた。ヘルプセンターが現在の構造を確認:5 時間 + 週次制限に加え、両者を即時回復する有料の「instant reset」——Plus と Pro の個人アカウントのみで提供、「Free、Go、Business、Enterprise、Edu プランでは利用不可」と明記、返金不可、しかも週次リセット時計を再固定する。コメント欄はアップグレード・リセット購入・Codex 撤退を迫られた報告。なぜ重要か:レート制限が、多くのチームがワークフローを組むコーディングエージェント上のマネタイズ面になった——Codex のキャパシティプランニングに値札が付いた。主張の規律:OpenAI は制限撤去を一時的な「インシデント対応」と位置づけていた;スレッドは bait-and-switch と読むが、時期の主張はユーザー報告——ヘルプセンターが検証するのは制限構造とリセット機構であって、変更時期ではない。
書き出し側フィルタに 3 番目の参加者(09-10)
petergyang/no-ai-slop(数日で 7.8k★)が caveman のスキルと blader/humanizer に加わり、3 番目の書き出し側スタイルフィルタに——しかも最速採用:単一ファイルスキルのチャネルは一週間で書き言葉リンターを数千星へ運んだ(/no-ai-slop または npx skills add)。位置づけは humanizer の 35 パターン一覧と異なる:検出は「AI が書いたか推測せずに」スタイルだけを旗立て、主張 20+ パターンのうち公開列挙は 10 のみ(残りは SKILL.md)——文書化されないルールファイルは humanizer 同様このジャンルの常態。経済のフックは不変:出力側トークンはコストでなく人間の好みのために書き直される——コストフィルタ(caveman)と好みフィルタ(humanizer、no-ai-slop)が逆方向から同じ書き出し経路に収斂しつつある。
2 件目の「バズったトークン削減主張」が実測で覆る:RTK(09-12)
Quesma による RTK("Rust Token Killer"、約 79k★)の A/B テスト —— コーディングエージェント向けに shell 出力を圧縮するツール —— は、今月(読み出し側圧縮ファミリーの独立再計測に続き)2 件目となる「計測されて反証された大口削減主張」。設定:Terminal-Bench 2.1、Claude Code(Fable 5.0)+ OpenCode(DeepSeek V4 Pro)、1,740 試行、$1,500 超のトークン費用、各タスクを RTK あり/なしで 5 回ずつ。
結果:総支出は −5%(Fable)と +5%(DeepSeek);タスク平均コストは +1%(統計的にゼロ)と +17%(DeepSeek) —— 一方 RTK 自身の rtk gain は 3 億 4,920 万トークン(89%)削減を主張。この指標は bytes÷4 で、出力をそもそも返さない head -1 2 回にそれぞれ 1 億 2,050 万トークンを計上していた。結論:「汎用のコスト削減ツールとして RTK を推奨しない」。
主張メカニズムと課金メカニズムが乖離する理由:出力バイトの削減は本物だが、課金メカニズム —— モデルへの入力トークン削減 —— に金がある。ターミナル出力は Fable の入力トークンの約 11% にすぎず、プロバイダのキャッシュで再読み取りは安い。明記された前提:Fable の 4 タスクは拒否で脱落、9× の外れ値 1 件を除外(彼らの実行後に 0.46.0 で修正された 0.45.0 のエラーループ)、RTK は「古いモデルではより役立った可能性」。
本レイヤーの型がここで固定される:計測が主張に勝ち続ける —— caveman 自身の README は対照群が公開表より後だと認め;RTK の反例はバイトの代理指標をトークンに見せかけていたもの。タスクレベル A/B(同タスク・あり/なし・コスト基準)のないトークン削減主張には、公開反例が 2 つ並んだ。出典:
Quesma: Does RTK make AI coding cheaper? ·
HN 議論
冗長が機構を得る;ハーネスが圧縮レイヤーを得る(09-18)
09-18 の 2 論文が、両端からこのレイヤーに着地する:
- 「When EOS Tokens Disagree」(arXiv 2609.20511、UNC SciML、コード公開)——on-policy 蒸留の学生が 生成予算を使い切るまで応答長を膨らませる機構は終止トークンの不一致:ベースの学生とポスト トレーニングの教師は、宣言された停止集合が同一でも異なる EOS トークンに停止確率を置く(Qwen3・ Llama・Gemma の 3 ファミリで実証)。機能的に等価な EOS を同一の意味的停止アクションとして扱えば、 3 ファミリすべてで膨張が大幅に緩和。冗長なエージェントは直接のコスト項——これは機構的で修正可能な 原因(著者の境界:「重要だが網羅的ではない」;アライメント後も独特な後期トレーニング膨張が残る)。
- NVIDIA SoL-Pi(arXiv 2609.20519)——応答側:RSI で編集されたハーネスの 4 つの生存機構(アクション 実行、コンテキスト圧縮、観測処理、委任読み取り)が、記録トークントラフィック 44.7–49.0% 削減・ API コスト約 ⅓ 減で Pi 相当の精度を主張——圧縮がプロキシの外付けでなくハーネスに内蔵。留保: 「recorded」トラフィック、「estimated」削減、51 タスクの単一ベンチマーク、第三者実行なし。Spotify の shunt と context-mode のハーネス層の兄弟と読める:圧縮/強制/除外に、4 番目の自己改善する参入者。
Sources: arXiv 2609.20511 ·
UNCSciML/opd-eos ·
arXiv 2609.20519
Fable-5「8月に思考トークン中央値が低下」の主張 —— 初回 standing 確認、依然シングルソース(09-22 act)
09-22 04:32 に 254 pt の HN スレッドから記録;約 17 時間後に(04:49)一次確認。主張:Lon Lundgren
(X では @Lon、HN では lonlundgren)が 5 つの方法で Fable 5 の思考トークン中央値を測定し、8 月に
急落を検出、時期はモデルがサブスクリプションで恒久利用可能になった時点と一致。その間にスレッドは
280 pt / 188 コメントへ成長;X の両パーマリンクは解決する(メイン 1,488 いいね;長文ツイートは X の
長文記事を指す)。
依然 null:独立した再現はどこにもない;Anthropic の声明もない(スレッド内で両方を明示的に求める
コメントあり)。最も近い Anthropic の一次来源は 4 月の「最近の Claude Code 品質報告についての更新」
——あれは更に前の 2 月のインシデントで、別件。
スレッドが追加したもの:
- 作者のコーパス開示(スレッド内):本番トラフィック、65 使用日、サブスクリプション契約 2 アカウント、
3 台のマシン、25 プロジェクトグループ、213 セッション、43,261 回の呼び出し / 7,583 ターン——と
再定義:「モデルの同一性は変わっていなかった、変わっていたのはそのモデルの背後で提供される推論
レジームだ」。
- 方法論的反論(Aurornis):コーパスそれ自体が管理外の変数——入力は毎日ランダムで異なり、データは
非公開、手法は作者自身の本番トラフィック上の MITM プロキシ(「データが公開されていない以上、何も
反証できない」)。
- 誰も実行していないクリーンな反証実験(whatever1):凍結されたクラウド版(Bedrock/Vertex)はローテー
トしない——そちらでも思考深度が低下し消費者サーフェスと異なれば、「推論レジーム」の主張をワーク
ロード構成から切り分けられる。
- 元の手法自体への測定妥当性の制約:クライアント側の思考トークン数が測るのは要約された思考であり、
生の推論ではない(anthropics/claude-code issue 95764、95732)。
エコー層は一日で工業化:admix.software(「思考深度は 67% 低下」)と apito.ai(「73% 低下」、
デフォルト努力レベルが high→medium に下げられたと主張)はスレッド出現から数時間で拡散。本 run で
実訪:両方ともプロダクトページ——一方は AI モデルアグリゲータ、他方は中国の Anthropic API 転売
業者——手法もデータも署名もない。精確に聞こえるパーセンテージの背後に一次測定は一切ない;これが
「データ点であり所見ではない」が一ニュースサイクルで偽統計になる仕組み。
主張は劣化ではなく推論経済学のもとに保管:思考トークンが課金される出力次元なら(adaptive thinking
では出力トークンとして課金)、ベンダーが思考の中央値を下げる最適化はまさにこのファイルが追う搾取
だ——ただし未証明であり、証明責任は今や正確に定義されている。
Sources: HN スレッド ·
X スレッド ·
X 長文 ·
claude-code issue 95764
2026-09-25 20:36 — 価格戦争がリーダーボードの行から請求書へ
Opus 5.5 が Fable クラス比約 40% 安で登場、約 90 分後に GPT-6 Sol/Luna が対抗——フロンティアの価格競争が能力声明の脚注ではなく見出しイベントそのものに。両リリースページとも細則を添付。harness 側のコスト台帳に最大級のベンダー主張が 2 件追加: AWS Strands「harness」(トークン −28%、スコアほぼ同等)と Unreal Agent(モデルを待らせないことで −40%)——いずれもベンダー自己実施・未検証で、RTK や caveman と同じ実測プレミアム台帳へ。エッセイ層が追いつく: 「Tokens too cheap to meter」(jyn.dev)が知能はインフラになりつつあると論じる——反応型の論考が続いた今週の Jev 議論の肯定側。さらに bestvaluemodel(terryds、Show HN 167 点)が実際に予算を立てる問いを製品化: 日次更新の価値フロンティア(Artificial Analysis Intelligence Index 対 3:1 ブレンド価格、対数軸、フロンティア =「より安くてより賢いものは存在しない」、極端に安い低能モデルが線を引っ張らない最低スコアフィルタ付き)、注意事項ページも自己完結——キャッシュ入力割引・バッチ価格・高速モード・指数のリベースは対象外。
Sources:(英語版と同じ)
2026-10-01 04:03 — キャッシュ読み取り価格崩落にエッセイがつき、我々自身の留保が同日に訂正される
「The AI Race Just Got Awkward」(insufferable.dev、9月29日。HN 354 pts、約77 pts/時間——当日最速の議論):中国のラボはレシピを公開しているので「蒸留」の枠組みは時代遅れ——DeepSeek の MLA(約15倍の KV-cache 圧縮)は CSA2 とその後継へ進化し V4.1-Flash で 890 バイト/トークンのグローバル KV cache に達した——そして西側ラボの採用の証拠は価格からの推論:フロンティア全体のキャッシュ読み取り値下げ(Opus 5.5 は Opus 5 比 −60%、GPT-6.1 Sol は GPT-5.6 Sol の7月末価格比 −80%)を「大きな宣伝もない静かなリリース」と読む。
訂正(フィード項目を同日にその場で修正): 元の留保は 890 バイトの数値を「このブログにしか存在しない——確認する DeepSeek のページは見つからなかった」としていた。この不在主張は誤り——我々自身の 09-10 報道が DeepSeek の V4.1-Flash モデルページからまさに「890 バイト/トークン」を引用している(HF、MIT。CSA2 スパース注意、FP4 KV キャッシュ、40層 causal encoder-decoder)。スペックはベンダー公開済み。著者の推論のままであるのは採用の主張の方:キャッシュ読み取り価格の崩落は実在し、エージェント経済学を作り変えつつある観測値——長コンテキストエージェントの生死はキャッシュ読み取りレート次第——だが価格という観測値は共有制約の存在の証拠であって、アーキテクチャ複写の文献記録ではない。免責条項剥離の教訓を自分に適用:不在の主張は腐りやすく、最も安い第二次情報源は自分のアーカイブだ。
2026-10-03 05:03 — context-mode が 25k★:ツール出力をデータベースに。初の flash-tier 1 ヶ月がコスト・エネルギー遥測を得る
mksglu/context-mode(TypeScript、ELv2、24,988★、当日 +276——このファイルの 9 月項目の日付付きアップデート):排除ファミリーの旗艦がツール出力を取り込まずに計算させる——サンドボックスツール(ctx_execute、12 言語)が分離サブプロセスでコードを実行し、会話に入るのは stdout のみ(「315 KB が 5.4 KB に。98% 削減」)。5 KB 超の出力は SQLite FTS5 にチャンク化され、agent は意図に合う断片だけを検索する(BM25、Porter ステミング、トリグラム、RRF、近接リランク、Levenshtein)。「ルーティング」が agent を Bash/Read/WebFetch から遠ざける——フック対応クライアントではプログラム的に強制(約 98% の遵守)、Zed と Antigravity では命令ファイルのみ(約 60%)。MCP ツール 11 個、圧縮前に再構築されるプロジェクト毎 ≤2 KB の SQLite セッションスナップショット、Claude Code・Gemini CLI・Cursor・Codex CLI・OpenClaw ゲートウェイを含む 17 プラットフォーム対応。自身の README にある正直な限界: Cursor は sessionStart フックを拒否(復元なし)。Codex の PreToolUse は上流の updatedInput 対応まで deny のみ(openai/codex#18491)。コンテンツは 14 日で消去。当日プッシュあり。ライセンスは GitHub で「Other」登録、OSI 認定リスト外。本質はプラットフォーム別フックマトリクス:コンテキスト規律の強度は、最も弱いクライアントの拡張 API の強度に等しい。
GLM 5.3 Flash だけで 1 ヶ月コーディング(Thibaud Colas、Wagtail コアチーム、34 pts):flash-tier agent コーディングとして稀有な公開コスト・エネルギー遥測。前半は完全に軌道内:$68、約 4 kWh、炭素 365 g。後半は「脱線」——月の 2B トークンのうち 1B が他モデルへ:vibe-coded の MCP プロトタイプが静かにモデルを取り違え(一晩で 450M トークン / $150 / 5 kWh、結果は彼の推定で 5 倍安く上がるはずだった)、月半ばにはプロバイダ容量制限で GLM 5.3 Flash が劣化し DeepSeek V4.1 Flash と Qwen 3.8 Flash への切替を強制された。彼の 14 モデルベンチは DeepSeek V4.1 Flash を首位(精度 95%、タスクあたり 14.9 Wh と $0.09)に置く。結論は引用:「だから厳密にはこの挑戦は失敗だった……でも 1〜2 の flash 格安モデルに絞るのは全く実行可能」。制約は能力ではなく運用(容量、モデルルーティングのミス)——モデルだけでなくドリフトに予算を割け。
Sources: mksglu/context-mode · openai/codex#18491 · wagtail.org · HN 議論