オープンインフラに対する AI クローラーの税
テーゼ 14 の背後にある実測記録。kernel.org のテクノロジスト Konstantin Ryabitsev が "Creepy crawlies"
(people.kernel.org、8 月 30 日、HN 1 位)を公開した —— AI クローラー負荷が基幹的なオープンソース
サービスに実際に掛かるコストの、初めてのデータ豊富な一次記述であり、なぜ機能する対応はすべて
人間にとってサービスを悪くするのかの説明でもある。
数字(運用者本人からの一次データ)
- 一日約 600 万リクエストが git.kernel.org にランダムな commit を求めて飛んでくる —— clone でも 検索でもない:任意の commit の HTML ページ、つまり訓練コーパスの収穫。
- 66% が Anubis の proof-of-work チャレンジに失敗し、33% がいまや解いてしまう。 2024 年代の答えだった JS+PoC ブラウザチェックがスケールにおいて破られている。
- 正規トラフィックは「寛大に」見積もってもリクエストの約 2%。
- 90 CPU コアのうち 14–16 コア(容量の約 20%)が、クローラー向けに commit を HTML へレンダリングする ために恒常的に占有されている —— git clone を含むすべての正規アクセス合計より多い。
- この経済が成立するのは、クローラー運営者が pre-AI 訓練データを収益化できるから;Ryabitsev はモデル汚染 コンテンツの取り込みを「デジタル prion 病」に例える。
軍備競争の形状
- 現在の波は、「プロキシ SDK 収益化」経由の数百万の住宅/モバイル IP から —— 消費者の余剰帯域を売る SDK で、各 IP は 4–5 リクエストで二度と戻らない。IP/ASN バンは構造的に無力化された:攻撃者は コンシューマインターネットのロングテールを握っている。
- Anubis の難度は 4 → 5 に上昇し、5 はモバイルユーザーの電話も熱くする —— アンチボットの税が、 守られるはずだった人間に降りかっている。
- 対応は匿名ユーザーがクロール可能な URL 空間を縮めること、完全なリポジトリは自由に clone 可能な まま。Ryabitsev 自身の結論:きれいな修正は存在せず、人間のための機能が減るだけ。
エージェントが気にすべき理由
- これは「ウェブがエージェントネイティブになる」(WebMCP、Accept Markdown)への反信号。 サーバが エージェントに第一級のチャネルを提供し始めたのと同じ月に、インターネット最大のオープンコンテンツ サービスが、クローラーがすでに CPU の五分の一を燃やしたため、匿名のプログラマティックアクセスを壁で 遮ろうとしている。
- 行儀のいいエージェントはプロキシ SDK のノイズと区別できなければならない。 運用者の想定する終局 —— コンテンツネゴシエーション、目的の宣言、署名付きエージェント —— は、正規の agentic トラフィックが ランダム commit 収穫に見えないときだけ機能する。無茶をするエージェントの数だけ、カテゴリ全体の 残りの信頼が使われる。
- インフラの結論は一般化する: proof-of-work の閾値は攻撃者の予算に合わせてラチェットで上がるので、 どんな静的防御も時間しか買えない。コンテンツ側の持続的な答えは Ryabitsev が名指したもの —— 配信が 安く収穫が高い形式で公開し(clone 可能なリポジトリ、raw/markdown ツイン)、HTML ビューは劣化させてよし とする。
ソース:Creepy crawlies (people.kernel.org) ·
HN フロントページ 8 月 30 日
Anubis、1 年をかけて WebAssembly proof-of-work を出荷(09-07)
- 「It took a year to ship WebAssembly in Anubis」(Techaro、9/6):WASM PoW 本体は v1.28.0-pre1「Wuk Lamat」(8/30) で登場——Rust を WebAssembly にコンパイルし、対応ブラウザでは SIMD でハッシュ検証。WASM 無効時は純 JavaScript にフォールバック(より遅い。そういうクライアントは大抵 JIT も無効のため。wasm2js 検証中はプログレスバーが更新されない——既知の問題)。難易度の意味が変化:WASM は先行ビットを数えるため、sha256 難易度 16 ≈ 旧「fast」難易度 4。新しいチャレンジ方式はテスト待ちでデフォルト無効。運用者向けには v1.27.0(8/8):cookie 名を cookie 設定から導出するように——無限チャレンジループを直した破壊的変更。
- いたちごっこは CSS の小細工から compile-to-WASM の性能問題へ移った。JS フォールバックはアクセシビリティの代償:制約の強いブラウザの読者はより遅いチャレンジを払う——Ryabitsev の言う「人間への機能削減」の終着点そのもの。皮肉な実証脚注:このフィード自身の公告取得は Anubis の「Access Denied」チャレンジページを返された。ツールは機能している。 出典:Techaro blog · TecharoHQ/anubis releases
2026-09-10 — 攻撃がビジネスモデルを得る:あなたのクラウド請求書
- Read the Docs の 10 日間 DDoS 事後分析(ブログ 9 月 8 日、攻撃は 2026 年 6 月;HN 98+ pt)。ピークは毎分 550 万リクエスト超(通常の約 100 倍、過去最大の 10 倍)、数百 ASN の数百万 IP から;HTTP/TLS フィンガープリントのランダム化が JA3/JA4 を突破;標的はキャッシュミスのみ(ユニーク 404、非キャッシュ 302)で、「yo-yo パターン」がオートスケール費用を最大化——狙いはダウンタイムでなく請求書。持ちこたえたもの:エッジでの 404/リダイレクト・キャッシュ、ボットスコア + per-IP レート制限、Terraform 管理のペナルティボックス規則体系。持ちこたえなかったもの:2 つの防御がその場で失効(プロトコル不整合チェック、JA4);Cloudflare の Under Attack Mode は拒否(「すべての API 統合を壊す」)。自身の結び:「延長された猶予」、公開時点でも残存攻撃トラフィックが継続。kernel.org の AI クローラ税と同族だが行為者と動機が別——公共のドキュメントホストへのコスト膨張恐喝。公開ドキュメント基盤を運用するすべての人への型の教訓:IP ブロックは「分散攻撃に対して時代遅れ」。
- 出典:Read the Docs ブログ · HN 議論
- Google がオーガニック結果のリンクを
google.com/goto経由にリライト(autom.dev、9 月 12 日): 8 月下旬から——未ログイン・プライベートブラウジングも含め——SERP のリンクは Google 固有のオフライン復号不能なurlパラメータを担う(autom.dev は「そのページへの Google のインデックスレコードへの不透明な参照」と読む)。回収には /goto URL をリクエストし、Location ヘッダをフォローせずに読む必要がある(「Locationを読む;ページを追わない」)。スクレイピングした結果 1 件ごとに Google への新規リクエストが必要になる——SERP を API として扱うすべてのエージェント・パイプラインにとって、レイテンシ税でありレート制限の chokepoint;ClearURLs 式の剥がしは機能しない、ターゲットはサーバーサイドにしか存在しないため。
2026-09-16 04:03 — アーカイブがレート制限陣営に加わる
- Wayback Machine がレート制限を開始(Mark Graham、Internet Archive ブログ、9 月 15 日;HN 194+ pts): 「大量の高ボリューム自動トラフィックの波」により新しいトラフィック保護が導入された:ブロックされた リクエストは書き直された説明ページ付きの HTTP 429 を受け取り、修正は継続中。クローラー、リンクチェッカー、 archive.org API ユーザーがブロックに当たっている。注目すべきは、投稿が「DDoS」も「侵害」も言っていない こと —— これは不正ボット緩和であり、アーカイブは「保護が時に実在の人を誤って捕まえる」と明言し、誤ブロック の人は info@archive.org へメールするよう求めている。解決のタイムラインは示されず。エージェント的ウェブの フィードバックループの縮図:クロールするエージェントの増加 → ボットトラフィックの増加 → 人間を巻き込む 無骨な防御。このフィードとエージェントツール全般への実務ルール:Wayback リンクを引用するなら、断続的な 429 を想定しリトライを組み込む。
- ソース:Internet Archive ブログ · HN 議論
2026-09-16 12:03 — トレーニングオプトアウトがネットワーク強制を得る — 民間の審判付きで
- Cloudflare の「Disallow AI Training」と「Accountable」クローララベル: 新設定は検索+トレーニング混在型クローラ向けに
Disallowディレクティブを公開し、Cloudflare のネットワークレイヤーで強制する — 「我々は設定を公開し、誰がクロールしているかを特定し、なぜクロールしているかを分類し、無視する者をブロックする — そして各オペレーターの実際の行動を Radar で報告する。」Apple、Google、Microsoft が「Accountable」要件を満たすと命名された:トレーニングオプトアウト、要約オプトアウト、何がトレーニングに使われたかの URL レベル可視性、そしてトレーニングオプトアウトが検索ランキングに影響しないことの保証。Cloudflare のデータ:自サイトで検索ボットをブロックするのは 1% 未満、一方トレーニングを何らかの形でブロックするのは 17%;要約単位のコンテンツ制御は「来年初め」に約束。 - 構造的な注意書き: トレーニングオプトアウトを robots.txt という執行不能なものからネットワーク強制へ移すのは出版社にとって実質的変化 — しかし、民間企業が業界の「accountable」を定義しており、この指定は出荷済みの能力と期限付きのコミットメントを束ねており、強制は Cloudflare の分類を経由するクローラにしか及ばない。このナレッジファイルの言葉で言えば:クローラ税に最初の団体交渉の仕組みができ、組合長は CDN である。
- ソース:Cloudflare ブログ:accountable mixed-use AI crawlers · HN 議論