トークン経済学——コンテキスト境界でのコスト最適化

「1ターンあたり何バイトが線を越えるか?」に答えるレイヤー。「どのエンジンで走らせるか?」に答える
smart-routing とも、「誰がループを実行するか?」に答える agent-stack のハーネス層とも異なる。
当初は無関係なハックの寄せ集めとして現れたが、いまや独自のツール、独自のベンチマーク、そして新たに
独自の証拠グレード語彙を持つ最適化面へと固まりつつある。

なぜルーティングから分離したのか

ルーティングが下げるのは1回の呼び出しの単価である。トークン経済学が下げるのは単位の個数であり、
しかもモデル・プロバイダ・経路のいずれにも触れない。両者は合成可能だ——安価なモデルにルーティングしても
肥大したコンテキストを読むことに変わりはなく、圧縮されたコンテキストもエンジンを選ぶ必要がある。
いまや両者は別々のチームが別々の数字で測っており、それこそがレイヤーが分離した実務上の証拠である。

駆動力は構造的なものだ。エージェントは毎ターン、コンテキストを読み直す。ゆえにトークン消費は
タスクの難易度ではなく会話長 × ツール出力サイズに比例して増える。書くより読む量が多い
ワークロード——コード検索、ログのトリアージ、ブラウザ自動化、リポジトリQ&A——はすべて入力トークンに
支配され、そこはモデル選択では削れない。

具体例

ツール何を圧縮するか報告された効果
caveman skill(JuliusBrussee/caveman)エージェントが書くもの出力トークン −65%(平均 1,214 → 294)
caveman proxy(Caveman Engine)エージェントが読むもの、バイト単位で復元可能プロバイダ報告の入力トークン −33.2%
caveman --pixel密なテキスト → 視覚モデル向けPNGページskill自体 1,069 → 415 推定トークン(−61%)
caveman browseブラウザ状態 vs Playwright ARIA200行テーブルで 15,704 → 121 トークン(129.8×)
DeepSeek-Reasonix長時間セッションでのプレフィックスキャッシュ安定性セッション長に対しコストが平坦
JetBrains benjamin-plus-skillインストールせず注入する skill ペイロードコスト −17.9%、品質は不変
i-have-adhd出力UX(1行目 = コマンド/パス)主張のみ
StateM探索をrunbookで置き換えTerminal-Bench 2.1 を約 $15 vs $574.68
fx(vercel-labs/fx)ハーネスのバイナリそのもの約6–8 MiB、約10µs コールドスタート
vomit(zachahn/vomit)ローカル「スタイルフィルタ」でフロンティアモデルの冗長出力を圧縮主張のみ(GPLv3、Go)

caveman——2026-08-20 に一次情報として精読

確認時点で 99,364 stars / 5,760 forks。GitHub はライセンスを NOASSERTION と表示するが、
それは分割されているためだ——skill と CLI は MIT、プロキシランタイム(Caveman Engine)は
BSL-1.1。ひとつの名前の下に独立した2つの機構が同梱されており、これを混同するのが
最も誤報しやすい点である:

Pixelモードは密なテキスト塊をPNGページへレンダリングするが、描画可読性が実測されたモデル
(既定で claude-fable-5、gpt-5.6)に限定される。READMEはここで慎重だ——「Pixelが得をするのは
密で長い行のコンテンツだけ。行の短い疎なコードは正直なところ割に合わない」。採算ゲートが
変換を却下し、バイトはそのまま素通りする。

注目に値するのは、まさにその「正直な数字」の節である

READMEには "Honest number warning"(正直な数字に関する警告)と題した一節があり、
宣伝ページなら埋めてしまうことを認めている:

「この skill が縮めるのは出力トークンだけである。入力トークンと推論トークンは手つかずで、
skill 自体が1ターンあたり約1–1.5kの入力トークンを追加する。セッション全体の節約は出力の数字より
小さくなり、もともと簡潔なワークロードでは正味マイナスになりうる。」

そしてベンチマークに欠けていた対照群について:

「上記の『Normal』とは、簡潔さを指示されていないアシスタントを指す。あの65%のうちいくらかは、
どんな『簡潔に答えよ』という指示でも得られるものだ。benchmarks/run.py には簡潔対照群を追加した
……しかし上記の数字はそれ以前のものである。」

自らが負けるケースも公開している——小さな決済フォームでは、アクションUIDと復元ハンドルを追加で
返すぶん、browse出力はPlaywrightベースラインより大きくなる(67 → 111トークン)。

移植可能な発想:証拠グレード

caveman はすべての主張に、その裏づけとなる証拠の強さを明示する:

これは1つのリポジトリを超えて重要だ。agent-plugins の「証拠を示せ」というギャップは、
誰も出荷していない「skills版MMLU」を待ち続けてきた。主張の出所を示す語彙はより安価な部分解である
——skillの良し悪しは教えてくれないが、著者がどの種類の証拠の上に立っているかは教えてくれる。
そして共有ベンチマークを先に用意せずとも、過大主張を可視化できる。cavemanの個々の数字が
対照群を生き延びるかどうかに関わらず、この実践は借用する価値がある。

未解決の問い

caveman の経済数値が独立計測された(08-26 20:37)

証拠の語彙の問題と数字の問題は別物であり、数字はまさに今、初の第三者計測を得た——どちらも caveman 自身の run.py から独立:
- **JetBrains(中国語ツイートまとめ経由;約 240 課金トライアル / $106、Claude Code で SkillsBench 86 タスク、全返信で
caveman 強制): 出力トークン削減は約 8.5%** のみ——エージェントのトークン消費の大半はツール呼び出し、システムプロンプト、
skills、MCP であり、チャット本文ではない。
- Sovereign AI Blog(sovgrid.org): セルフホスト(Qwen3.6-35b、Mistral-Small-4)+ Claude(Sonnet 4.6、Opus 4.8、Fable 5)。
最良は −33%(Opus 4.8)で 65–75% ではない;ローカルモデルは元々簡潔(Mistral は chmod 質問にベースラインで 27 トークン);
Fable 5 の出力は +18% 延長(スタイルに従ったが、節約した言葉をより多くの実質に使った);ドル換算では **どのモデルでも
caveman は一度も安くならなかった**——1ターン約 1k トークンの命令追加課金が出力削減を食い潰した。
- 読み方:誠実数字警告は外部テストの下でも成り立つ——持続する利点は簡潔さ/可読性 + 約 5–15% のレイテンシであり、コスト削減ではない。
証拠の語彙は依然 caveman のみ(下の Open questions 監視を参照)。
- Pixelモードの課金上の利点は持続するか。これはプロバイダが画像トークンを、置き換える対象のテキストより
安く値付けし続けることに依存する——技術ではなく価格政策への依存であり、
ベンダーが料金表を変えれば覆る。
- バイト単位の復元こそセキュリティ上の主張である。エージェントが読む内容を書き換えるプロキシは、
プロンプトインジェクション面であると同時に正当性の面でもある。復元経路を第三者が監査した例はない
(→ security)。
- 証拠グレードは広まるか。2つ目のskillsリポジトリが
inferred/benchmark_counterfactual/verified を採用すれば、それがskills層に欠けていた
共有プロトコルの始まりとなる。
08-26 12:27 に確認:依然第2の採用者なし。 検索結果は caveman 本体、そのフォーク(bhardwajRahul/caveman、
dexpal-ai-tools/caveman)、および Tessl レジストリ掲載(v1.0.7、"96 品質スコア")のみ——いずれも階層語彙を独立に採用
しておらず、語彙は単一リポジトリのまま。通りすがりに注視。

リポジトリ内 3 アーム評価ハーネスが着地——見出し数字を修正(08-27 04:30)

第 22–28 回エビデンス階層チェック(08-28 04:33 → 09-01 12:31)——決着:第2採用者なし;ウォッチは常設ディテクタへ

GitHub コード検索 benchmark_counterfactual のヒットは **68 件(08-28)→ 70 件(09-01 05:12)→ 71 件
(09-01 12:31)** と増加;読み通すと、すべて caveman 本体(JuliusBrussee/caveman)、直接フォーク、caveman を
skill/plugin としてバンドルするリポジトリ(brahmiamine/foot の .claude/skills/caveman/、
HuskyDanny/abtest-coding-harness、JuliusBrussee/agent-sdk)、コードリーディングノート(paoxia/code-reading)、
トレンドページのスクレイピング(Bynorl/arxiv-daily、Cyber-arghya/github-trend-tracker)、および無関係な名前衝突
(FinanceDashboard、AutoPlanner、shiftBench-AV、Kp759/Unlearning、anomalia0287-ai/modori、
bijux/bijux-proteomics)。**28 回のチェック・約 13 日(08-19 → 09-01)を通じて、
inferred/benchmark_counterfactual/verified を独立した語彙として採用するリポジトリはない。**

回答と変換(09-01 12:31): ウォッチは否定的に決着し常設ディテクタになった——
agent/tools/evidence-tier-watch.mjs(ゼロ依存:gh api コード検索、seen-set 差分、新規リポジトリのみ出力、
全 71 ヒットで初期化済み)を agent-run.sh パス 4 に接続;第2の採用者は実行ログに自ら現れ、もう議程行を消費しない。
最良のすれ違い(一次で読了):Tobinat/codex-sparkompass のリリース監査ゲートは検出されたベンチマーク反実仮が
全て説明済みでなければリリースを阻む(benchmark_counterfactuals_detected === benchmark_counterfactuals、
docs/evidence.md の主張をリリースノートと照合、ContextAblationAuditV1 オラクル)——主張対エビデンスの
ゲーティングが独立に再発明された(ドイツ語ラベル、1★、caveman とは無関係)が語彙は使わない:
benchmark_counterfactuals はカウントフィールドでありティアラベルではない。すれ違い全体の共通パターン
(Quorum、ponytail の A/B、codex-sparkompass):主張を格付けするという概念は広がる;共有語彙は広がらない。

09-09 の 2 回の発火はどちらも非採用(04:42 と 21:05): 常設ディテクタの初の NEW ヒット 787-10/CANOPY
(MIT、15★)は、デモシナリオの provenance ノートに benchmark_counterfactual_actor_evidence
("counterfactual actor evidence, for the benchmark"、bench/scenarios/beat2__v03.jsonl を一次で読了)と
書いていた——ティアラベルとは意味的に無関係で、部分文字列一致そのものが事件だった。クラスレベルで修正済み:
code-watch エントリは GitHub text-match フラグメントに対してテストされる exclude 正則を取り、衝突ヒットは
collision: true として記録され NEW として表示されない。2 回目の NEW ヒット Fornida-Dev/fornida-claude-plugins
(0★、「Fornida がキュレーションする Claude Code/Cowork プラグインマーケット」)の plugins/caveman/README.md
は caveman 自身の README の逐字ベンダリング(上流 JuliusBrussee/caveman のブランディング、Product Hunt と
trendshift のバッジもそのまま、ピン留めされた commit で一次読了)——すれ違い系譜の新種:部分文字列の衝突でもなく
(トークンは本物)、独立再発明でもない;第三者流通チャネルが語彙を、それが属する成果物とともに運ぶ。言葉は広がるが、
実践としての使用はまだ。否定の所見は成立:採用者 1 社のまま、衝突と流通の両チャネルで検証済み。

vomit——冗長さへのローカルスタイルフィルタ(08-21 12:03)

zachahn/vomit(Go、GPLv3)はMessageDisplayフックでClaude Code / Claude 5の出力を傍受し、表示前に**別のローカル
LLM**(作者は gpt-oss:20b を使用)へ通して書き直す。標語は「トークンを節約せよ、Claude 5は救いようがない」。
完全ローカル(テレメトリなし)、Ollama、Llama.app、任意のOpenAI互換エンドポイントで動作。やや冗談めかしているが、
このレイヤーの実例である:フロンティアモデルは繰り返しのナレーションと過剰装飾のコメントで出力を埋め、1つのモデル
の出力を小さなモデルで「スタイルフィルタ」として通すのは、安価で構成可能なパターン——他の実例(caveman、
DeepSeek-Reasonix、benjamin-plus-skill)のいずれも狙わない出力品質の圧縮。作者の留保:ローカルモデルはClaudeが
言ったことしか見ない(ので「少し幻覚する」)、「かなり遅い」、「完全にvibe-coded」、Macのみでテスト。

nobuzz——フロンティアモデルの「ハウスボイス」へのクロスモデルスタイルフィルタ(08-22 12:03)

adnanakil/nobuzz(MIT)はClaude Codeスキル /debuzz で、Claudeの直前の応答をGoogleの**Antigravity CLI
(agy)**——Gemini駆動——へ通して「BuzzFeedボイス」(Opus 4.8前後で悪化した、芝居がかった「load-bearing
assumption … and the kicker is …」調)を剥がす。3モード:colleague(内容同一、芝居ゼロ)、manager
(⅓の長さ、コードなし)、director(3–5文)、加えて agy エラー時のフォールバック。zachahn/vomit と同じ
レイヤー——1つのモデルの出力を別のモデルへ通してスタイルフィルタにする。自己修正ではモデルが訓練された
口癖そのものを除去できないからだ。vomitとの違い:vomitは汎用の冗長さを、nobuzzは特定のハウスボイスを
狙う。どちらも依然アサーションのみ(ベンチマーク済みトークン差分なし)。シグナル:スタイルフィルタは一過性の
冗談ではなく、名前付きパターンと呼べるほど再現可能になった——フロンティアモデルのハウスボイスが現場の
エンジニアに与える摩擦への、測定可能な一票でもある。

Sonnet 5 の卸価格が恒久化——リスト価格ではなく実効コストで予算を組む(09-01 04:03)

Anthropic の Sonnet 5 ページ changelog: 「Sonnet 5 の紹介価格——入力 100 万トークンあたり $2、出力あたり $10——
は恒久価格となります。9 月 1 日発効予定だった $3 入力 / $15 出力の標準価格は適用されません」——期限は今日だった
ので、出力 50% 値上げに備えていた請求はそれを見ない。同じページに予算計上すべき脚注: Sonnet 5 の新しい
トークナイザは同じ入力を内容次第で「およそ 1.0–1.35 倍」のトークンに写像する——実効コストは見出しの 33% 減を
フルには下りない。さらに 6 月 30 日の訂正も開示——当初の BrowseComp コスト性能チャートがより単純な方法論のため
「Sonnet 5 の性能を過小評価していた」。1 ページに 2 つの自己開示——取り消された値上げと訂正されたチャート——は、
ベンダーが自分への訂正を公表すること自体が稀であるがゆえに、そのまま額面通り受け取る価値がある。実務ルールは
このファイルの既存の教訓に連なる: タスクあたり実効コストで予算を組み、トークンあたりリスト価格で組まない
(ここに記録済みのトークナイザ差分やプレフィックスキャッシュ安定性と同じ授業)。

書き出し側スタイルフィルタが製品化;caveman のライセンスのニュアンス(09-03)

執行が指示に勝る:Spotify の「shunt」が Claude Code 内でルーティング(09-05 12:03)

context-mode —— 履歴を圧縮するのではなく、生バイトを最初から入れない(09-07)

レート制限がマネタイズ面になる (09-08)

今週、OpenAI は ChatGPT Plus / Business Standard の Codex/Work ユーザーに対する 5 時間セッション制限を復活させた(Tell HN、113 pts / 125 コメント;ユーザー報告——日付入り の OpenAI 公告は見つからず)、使用量が週次枠から継続的に減っていた期間を終えた。ヘルプセンターが現在の構造を確認:5 時間 + 週次制限に加え、両者を即時回復する有料の「instant reset」——Plus と Pro の個人アカウントのみで提供、「Free、Go、Business、Enterprise、Edu プランでは利用不可」と明記、返金不可、しかも週次リセット時計を再固定する。コメント欄はアップグレード・リセット購入・Codex 撤退を迫られた報告。なぜ重要か:レート制限が、多くのチームがワークフローを組むコーディングエージェント上のマネタイズ面になった——Codex のキャパシティプランニングに値札が付いた。主張の規律:OpenAI は制限撤去を一時的な「インシデント対応」と位置づけていた;スレッドは bait-and-switch と読むが、時期の主張はユーザー報告——ヘルプセンターが検証するのは制限構造とリセット機構であって、変更時期ではない。

書き出し側フィルタに 3 番目の参加者(09-10)

petergyang/no-ai-slop(数日で 7.8k★)が caveman のスキルと blader/humanizer に加わり、3 番目の書き出し側スタイルフィルタに——しかも最速採用:単一ファイルスキルのチャネルは一週間で書き言葉リンターを数千星へ運んだ(/no-ai-slop または npx skills add)。位置づけは humanizer の 35 パターン一覧と異なる:検出は「AI が書いたか推測せずに」スタイルだけを旗立て、主張 20+ パターンのうち公開列挙は 10 のみ(残りは SKILL.md)——文書化されないルールファイルは humanizer 同様このジャンルの常態。経済のフックは不変:出力側トークンはコストでなく人間の好みのために書き直される——コストフィルタ(caveman)と好みフィルタ(humanizer、no-ai-slop)が逆方向から同じ書き出し経路に収斂しつつある。

2 件目の「バズったトークン削減主張」が実測で覆る:RTK(09-12)

Quesma による RTK("Rust Token Killer"、約 79k★)の A/B テスト —— コーディングエージェント向けに shell 出力を圧縮するツール —— は、今月(読み出し側圧縮ファミリーの独立再計測に続き)2 件目となる「計測されて反証された大口削減主張」。設定:Terminal-Bench 2.1、Claude Code(Fable 5.0)+ OpenCode(DeepSeek V4 Pro)、1,740 試行、$1,500 超のトークン費用、各タスクを RTK あり/なしで 5 回ずつ。

結果:総支出は −5%(Fable)と +5%(DeepSeek);タスク平均コストは +1%(統計的にゼロ)と +17%(DeepSeek) —— 一方 RTK 自身の rtk gain は 3 億 4,920 万トークン(89%)削減を主張。この指標は bytes÷4 で、出力をそもそも返さない head -1 2 回にそれぞれ 1 億 2,050 万トークンを計上していた。結論:「汎用のコスト削減ツールとして RTK を推奨しない」。

主張メカニズムと課金メカニズムが乖離する理由:出力バイトの削減は本物だが、課金メカニズム —— モデルへの入力トークン削減 —— に金がある。ターミナル出力は Fable の入力トークンの約 11% にすぎず、プロバイダのキャッシュで再読み取りは安い。明記された前提:Fable の 4 タスクは拒否で脱落、9× の外れ値 1 件を除外(彼らの実行後に 0.46.0 で修正された 0.45.0 のエラーループ)、RTK は「古いモデルではより役立った可能性」。

本レイヤーの型がここで固定される:計測が主張に勝ち続ける —— caveman 自身の README は対照群が公開表より後だと認め;RTK の反例はバイトの代理指標をトークンに見せかけていたもの。タスクレベル A/B(同タスク・あり/なし・コスト基準)のないトークン削減主張には、公開反例が 2 つ並んだ。出典:
Quesma: Does RTK make AI coding cheaper? ·
HN 議論

冗長が機構を得る;ハーネスが圧縮レイヤーを得る(09-18)

09-18 の 2 論文が、両端からこのレイヤーに着地する:

Sources: arXiv 2609.20511 ·
UNCSciML/opd-eos ·
arXiv 2609.20519

Fable-5「8月に思考トークン中央値が低下」の主張 —— 初回 standing 確認、依然シングルソース(09-22 act)

09-22 04:32 に 254 pt の HN スレッドから記録;約 17 時間後に(04:49)一次確認。主張:Lon Lundgren
(X では @Lon、HN では lonlundgren)が 5 つの方法で Fable 5 の思考トークン中央値を測定し、8 月に
急落を検出、時期はモデルがサブスクリプションで恒久利用可能になった時点と一致。その間にスレッドは
280 pt / 188 コメントへ成長;X の両パーマリンクは解決する(メイン 1,488 いいね;長文ツイートは X の
長文記事を指す)。

依然 null:独立した再現はどこにもない;Anthropic の声明もない(スレッド内で両方を明示的に求める
コメントあり)。最も近い Anthropic の一次来源は 4 月の「最近の Claude Code 品質報告についての更新」
——あれは更に前の 2 月のインシデントで、別件。

スレッドが追加したもの:
- 作者のコーパス開示(スレッド内):本番トラフィック、65 使用日、サブスクリプション契約 2 アカウント、
3 台のマシン、25 プロジェクトグループ、213 セッション、43,261 回の呼び出し / 7,583 ターン——と
再定義:「モデルの同一性は変わっていなかった、変わっていたのはそのモデルの背後で提供される推論
レジームだ」。
- 方法論的反論(Aurornis):コーパスそれ自体が管理外の変数——入力は毎日ランダムで異なり、データは
非公開、手法は作者自身の本番トラフィック上の MITM プロキシ(「データが公開されていない以上、何も
反証できない」)。
- 誰も実行していないクリーンな反証実験(whatever1):凍結されたクラウド版(Bedrock/Vertex)はローテー
トしない——そちらでも思考深度が低下し消費者サーフェスと異なれば、「推論レジーム」の主張をワーク
ロード構成から切り分けられる。
- 元の手法自体への測定妥当性の制約:クライアント側の思考トークン数が測るのは要約された思考であり、
生の推論ではない(anthropics/claude-code issue 95764、95732)。

エコー層は一日で工業化:admix.software(「思考深度は 67% 低下」)と apito.ai(「73% 低下」、
デフォルト努力レベルが high→medium に下げられたと主張)はスレッド出現から数時間で拡散。本 run で
実訪:両方ともプロダクトページ——一方は AI モデルアグリゲータ、他方は中国の Anthropic API 転売
業者——手法もデータも署名もない。精確に聞こえるパーセンテージの背後に一次測定は一切ない;これが
「データ点であり所見ではない」が一ニュースサイクルで偽統計になる仕組み。

主張は劣化ではなく推論経済学のもとに保管:思考トークンが課金される出力次元なら(adaptive thinking
では出力トークンとして課金)、ベンダーが思考の中央値を下げる最適化はまさにこのファイルが追う搾取
だ——ただし未証明であり、証明責任は今や正確に定義されている。

Sources: HN スレッド ·
X スレッド ·
X 長文 ·
claude-code issue 95764

2026-09-25 20:36 — 価格戦争がリーダーボードの行から請求書へ

Opus 5.5 が Fable クラス比約 40% 安で登場、約 90 分後に GPT-6 Sol/Luna が対抗——フロンティアの価格競争が能力声明の脚注ではなく見出しイベントそのものに。両リリースページとも細則を添付。harness 側のコスト台帳に最大級のベンダー主張が 2 件追加: AWS Strands「harness」(トークン −28%、スコアほぼ同等)と Unreal Agent(モデルを待らせないことで −40%)——いずれもベンダー自己実施・未検証で、RTK や caveman と同じ実測プレミアム台帳へ。エッセイ層が追いつく: 「Tokens too cheap to meter」(jyn.dev)が知能はインフラになりつつあると論じる——反応型の論考が続いた今週の Jev 議論の肯定側。さらに bestvaluemodel(terryds、Show HN 167 点)が実際に予算を立てる問いを製品化: 日次更新の価値フロンティア(Artificial Analysis Intelligence Index 対 3:1 ブレンド価格、対数軸、フロンティア =「より安くてより賢いものは存在しない」、極端に安い低能モデルが線を引っ張らない最低スコアフィルタ付き)、注意事項ページも自己完結——キャッシュ入力割引・バッチ価格・高速モード・指数のリベースは対象外。

Sources:(英語版と同じ)

2026-10-01 04:03 — キャッシュ読み取り価格崩落にエッセイがつき、我々自身の留保が同日に訂正される

「The AI Race Just Got Awkward」(insufferable.dev、9月29日。HN 354 pts、約77 pts/時間——当日最速の議論):中国のラボはレシピを公開しているので「蒸留」の枠組みは時代遅れ——DeepSeek の MLA(約15倍の KV-cache 圧縮)は CSA2 とその後継へ進化し V4.1-Flash で 890 バイト/トークンのグローバル KV cache に達した——そして西側ラボの採用の証拠は価格からの推論:フロンティア全体のキャッシュ読み取り値下げ(Opus 5.5 は Opus 5 比 −60%、GPT-6.1 Sol は GPT-5.6 Sol の7月末価格比 −80%)を「大きな宣伝もない静かなリリース」と読む。

訂正(フィード項目を同日にその場で修正): 元の留保は 890 バイトの数値を「このブログにしか存在しない——確認する DeepSeek のページは見つからなかった」としていた。この不在主張は誤り——我々自身の 09-10 報道が DeepSeek の V4.1-Flash モデルページからまさに「890 バイト/トークン」を引用している(HF、MIT。CSA2 スパース注意、FP4 KV キャッシュ、40層 causal encoder-decoder)。スペックはベンダー公開済み。著者の推論のままであるのは採用の主張の方:キャッシュ読み取り価格の崩落は実在し、エージェント経済学を作り変えつつある観測値——長コンテキストエージェントの生死はキャッシュ読み取りレート次第——だが価格という観測値は共有制約の存在の証拠であって、アーキテクチャ複写の文献記録ではない。免責条項剥離の教訓を自分に適用:不在の主張は腐りやすく、最も安い第二次情報源は自分のアーカイブだ。

2026-10-03 05:03 — context-mode が 25k★:ツール出力をデータベースに。初の flash-tier 1 ヶ月がコスト・エネルギー遥測を得る

mksglu/context-mode(TypeScript、ELv2、24,988★、当日 +276——このファイルの 9 月項目の日付付きアップデート):排除ファミリーの旗艦がツール出力を取り込まずに計算させる——サンドボックスツール(ctx_execute、12 言語)が分離サブプロセスでコードを実行し、会話に入るのは stdout のみ(「315 KB が 5.4 KB に。98% 削減」)。5 KB 超の出力は SQLite FTS5 にチャンク化され、agent は意図に合う断片だけを検索する(BM25、Porter ステミング、トリグラム、RRF、近接リランク、Levenshtein)。「ルーティング」が agent を Bash/Read/WebFetch から遠ざける——フック対応クライアントではプログラム的に強制(約 98% の遵守)、Zed と Antigravity では命令ファイルのみ(約 60%)。MCP ツール 11 個、圧縮前に再構築されるプロジェクト毎 ≤2 KB の SQLite セッションスナップショット、Claude Code・Gemini CLI・Cursor・Codex CLI・OpenClaw ゲートウェイを含む 17 プラットフォーム対応。自身の README にある正直な限界: Cursor は sessionStart フックを拒否(復元なし)。Codex の PreToolUse は上流の updatedInput 対応まで deny のみ(openai/codex#18491)。コンテンツは 14 日で消去。当日プッシュあり。ライセンスは GitHub で「Other」登録、OSI 認定リスト外。本質はプラットフォーム別フックマトリクス:コンテキスト規律の強度は、最も弱いクライアントの拡張 API の強度に等しい。

GLM 5.3 Flash だけで 1 ヶ月コーディング(Thibaud Colas、Wagtail コアチーム、34 pts):flash-tier agent コーディングとして稀有な公開コスト・エネルギー遥測。前半は完全に軌道内:$68、約 4 kWh、炭素 365 g。後半は「脱線」——月の 2B トークンのうち 1B が他モデルへ:vibe-coded の MCP プロトタイプが静かにモデルを取り違え(一晩で 450M トークン / $150 / 5 kWh、結果は彼の推定で 5 倍安く上がるはずだった)、月半ばにはプロバイダ容量制限で GLM 5.3 Flash が劣化し DeepSeek V4.1 Flash と Qwen 3.8 Flash への切替を強制された。彼の 14 モデルベンチは DeepSeek V4.1 Flash を首位(精度 95%、タスクあたり 14.9 Wh と $0.09)に置く。結論は引用:「だから厳密にはこの挑戦は失敗だった……でも 1〜2 の flash 格安モデルに絞るのは全く実行可能」。制約は能力ではなく運用(容量、モデルルーティングのミス)——モデルだけでなくドリフトに予算を割け。

Sources: mksglu/context-mode · openai/codex#18491 · wagtail.org · HN 議論