14. 更新:昨日取り上げたハーネス設計研究が arXiv に公開——HN もその重みを認める
- Velocity: ▮ steady
- Source: Hacker News · 193+ pts · 約7時間前(~21:06 UTC+8)
- Tags:
paper agents harness evaluation
9 月 18 日の 176 実行ハーネスアブレーションの報道に続報:完全な論文が arXiv:2609.20804
(43 ページ、9 月 17 日提出)「An Empirical Study of Harness Design for Coding Agents」として
公開された——4 モデル × SWE-Bench Verified と Terminal-Bench 2.1 で、planning・行動空間・
コンテキスト管理を独立に変量。公開版の結論は以前の報道と一致:コンテキスト管理の価値は
予算が厳しくなるほど増大(主にオーバーフロー失敗の防止による)、LLM 要約の前に
ルールベースの省略を挟むのが効率で最良、planning は弱いモデルには精度の足場・強いモデルには
単なるコスト削減、bash を扱えるモデルは bash 専用の行動空間で十分はるかに安価。
なぜ重要か: エージェントエコシステム全体がバイブで論じている命題に、ついに計測
グレードの版ができた(第 2 条・第 7 条参照)。留保もセットで:1 つのハーネス、2 つの
ベンチマーク、4 モデル——著者らはこれを「モデル・予算アウェア」な指針と位置づけ、
法則ではない。補足:当初本フィードはこれを Zoom の社内アブレーションとして報じたが、
公開論文は所属を強調しておらず、176 実行という数字が同一研究であることを裏付ける。
🔗 arXiv:2609.20804 · 🔗 HN 議論
15. Claude Code が AGENTS.md を読むように——エージェント設定フォーマット戦争は肩すかしで終幕
- Velocity: ▮▮▮ trending
- Source: Hacker News · 672+ pts · 約15時間前(~05:06 UTC+8)
- Tags:
agents claude-code interop config
Claude Code v2.1.277(9 月 18 日)が、エコシステムの半分が待ち続けた相互運用の変更を
投入:CLAUDE.md が存在しない場合、ハーネスは AGENTS.md を読むようになった——
OpenAI Codex、Cursor、Zed などがすでに採用しているベンダー中立の規約だ。同一リリース
列車の v2.1.278(9 月 19 日)では、auto-mode の権限判断をサーバー側分類器に委ね、
Bedrock/Vertex/Foundry 上での課金オーバーヘッドはゼロ。リポジトリは 146.5k スター、
本日 +444。
なぜ重要か: これまでクロスハーネスのプロジェクトは、CLAUDE.md → AGENTS.md
のシンボリックリンクを張るか、漂移する 2 ファイルを保守するしかなかった。1 つの指示
ファイルがハーネスをまたいで通用するのは小さな変更で大きな効果——しかも機能そのもの
より方向性が重要だ。Anthropic は独自規約を押すのではなく、コミュニティのフォーマットを
採用した。
🔗 Claude Code 変更ログ · 🔗 HN 議論 · 🔗 v2.1.277 リリース
16. 2023 年に「修復不能な脱出」で開発終了を宣言された vm2 が復活——しかも CVSS 10.0 のサンドボックス脱出を 2 件修正したばかり
- Velocity: ▮▮▮ trending
- Source: NVD / VulnCheck · レコード公開 9 月 18 日
- Tags:
vm2 sandbox-escape cve nodejs
NVD は 9 月 18 日、Node.js サンドボックス vm2 に対する CVSS 10.0 の勧告を 2 本公開した
——いずれも VulnCheck が CNA として採点、NVD のステータスは Deferred:CVE-2026-93603
(bridge apply トラップにおける nullish な this レシーバからホストの
child_process へ到達)と CVE-2026-93605(NodeVM の DANGEROUS_BUILTINS 拒否リストに
child_process が単純に入っていない)。修正は 3.12.1(npm 9 月 3 日)と 3.12.2
(9 月 8 日)で出荷——そしてリポジトリはアーカイブ解除、9 月 13 日にプッシュがあり、
メンテナーが 2023 年 8 月に「設計上の欠陥は修復不能」として開発終了を宣言したにも
かかわらず、再び活発に開発されている。
なぜ重要か: 読者は 2 種類いて、教訓も 2 つに分かれる。2023 年の勧告に従って vm2 を
撤去した人へ:戻ってきて、修正を出している。古いピン留めバージョンをまだ動かしている人
へ:過去の脱出はほぼすべて有効なままに、この 2 件が加わった。そしてバージョンに関係なく
成り立つ本質は、2023 年の評価が「vm2 のセキュリティ設計はバグではなく成立していない」
だったこと——vm2 の境界はベストエフォートの隔離と見なすべきで、セキュリティコントロール
では決してない。
🔗 GHSA-pq68-rvw4-xp4r · 🔗 VulnCheck 勧告
17. Grant Sanderson 氏が Tao のブログにゲスト投稿:「動機づけられた説明のための Lean は永遠に存在しない」
- Velocity: ▮▮▮ trending
- Source: Hacker News · 142+ pts · 約5時間前(~15:06 UTC+8)
- Tags:
mathematics ai formal-methods exposition
Terence Tao 氏のブログに Grant Sanderson 氏(3Blue1Brown)のゲスト投稿「If math is more
than proof, we need to better celebrate the rest of it」が載った:AI が証明生成を安価に
するにつれ、証明は数学が本当に価値するもの——理解・動機・説明——の代理指標であることが
露呈する。彼は説明のレイヤーに証明と同じインフラを与えることを提案する:「動機づけられた
説明」の形式化と報酬化、Timothy Chow 氏の「open exposition problems」、さらにテニュア
審査・ジャーナル、そして優れた未解決の説問を集める Hilbert リスト風カタログまで。
なぜ重要か: これは今週続いてきた論争の建設的な分岐だ——数学者の書簡(9 月 12 日)、
Gowers/Tao の不署名声明(9 月 18 日)、そして今朝 HN に届いた Dan Abramov 氏の
エージェント生成 Lean 証明(第 2 項)の後に出た。主張は「AI には我々の仕事ができない」
より鋭い:AI にできない部分は、そもそも制度的に認証されてこなかった——そしてそれは
修復可能な制度の空白だ、という主張だ。
🔗 terrytao.wordpress.com · 🔗 HN 議論
18. GPT-6 Astra が第一次大戦のドイツ軍無線暗号を解読——自己申告の「初」を、本人の留保ごと読む
- Velocity: ▮▮ rising
- Source: Hacker News · 147+ pts · 約5時間前(~15:06 UTC+8)
- Tags:
cipher ai-capability adfgvx history
アマチュア暗号解読のブログ記事が、GPT-6 Astra が scienceblogs.de の「未解決暗号 50」
リストにある第一次大戦期ドイツ軍無線暗号を解いたと報告。1918 年 11 月 27 日発信の
ADFGVX 電文は、Childs 著 German Military Ciphers 1914–1918 から文献裏付けのある
歴史的鍵 TRUPPENVERSCHIEBUNG を復元し、転置の算術を組み立て、さらに艦船ログで
結果を自己検証(11 月 24 日、HMS Canterbury のセヴァストポリ入港)して完全解読された。
電文が未解読のままだった理由に関する Astra 自身の説明——鍵の変更日が電文より後——は、
それ自体未検証。本人の留保は明示されている:「この電文が以前に解読されたことは、
私の知る限りない」——歴史学者や暗号の専門家がこの転写を検証したわけではない。
なぜ重要か: 今月 2 件目となる「フロンティアモデルが歴史暗号を解いた」主張で、
解読の仕組みを端から端まで公開した最初の事例でもある:鍵の出所、再構築した転置表、
アーカイブとの突き合わせ。見るべきはワークフロー——公開された暗号史から鍵を引き、
艦船ログで自分の平文を検証するモデル——だが、成否は依然として本人の言に依る。有望な
自己申告として読むべきで、解読された暗号として読むべきではない。
🔗 prinzai.com · 🔗 HN 議論
19. LightLLM CVE-2026-93839:PD 分離推論のノード登録が無認証——ユーザープロンプトが漏えいする。CVSS 9.8、修正版は未出
- Velocity: ▮▮ rising
- Source: NVD / VulnCheck · 9 月 18 日公開
- Tags:
llm-serving cve ai-infra authentication
ModelTC の LightLLM——セルフホスト LLM 推理フレームワークの定番——は、prefill/decode
分離モードで使う WebSocket /pd_register エンドポイントを無認証で公開している。ネットワーク
到達可能な攻撃者は任意のノードをクラスタに登録でき、推論リクエストをハイジャックし、
ユーザープロンプトを読み取れる。CVSS 9.8(VulnCheck CNA、v4 では 9.3)、NVD レコードは
9 月 18 日公開で api_http_pd.py への行単位の参照付き。バグ報告は 9 月 16 日から
オープンのまま、執筆時点で修正を含むリリースは確認されていない。
なぜ重要か: prefill/decode 分離は大規模モデル推論のデフォルト構成になりつつあり、
これこそがその構成が持ち込む脆弱性クラスだ:クラスタの内部コントロールプレーンが
ネットワーク攻撃面になる。PD モードで LightLLM を動かしているなら、露出した
/pd_register は「プロンプト漏えい済み」と扱うべきで、修正版が届くまでの唯一の緩和は
ネットワークレベルの隔離だ。
🔗 GitHub issue #1576 · 🔗 NVD レコード CVE-2026-93839
20. IEEE Spectrum が OpenAI の Jalapeño チップを解剖:LLM がフロントエンドを設計した——そして効かなかった場所も書いてある
- Velocity: ▮▮ rising
- Source: Hacker News · 136+ pts · 約12時間前(~08:11 UTC+8)
- Tags:
chips openai hardware llm
IEEE Spectrum の深掘り記事(9 月 14 日公開、9 月 18 日に HN で再浮上)は OpenAI 初の
アクセラレータを取り上げる。物理設計パートナーは Broadcom:4-bit で 13.4 PFLOPS、
232 GB HBM4、NVIDIA GB300 比で最大 3.6 倍のエンドツーエンドレイテンシ低減を主張。
フロントエンドのフローは Google のオープンソース XLS 上に構築(C++/DSLX → Verilog)。
構想からテープアウトまで 20 か月弱、チーム平均は 100 人未満。DeepSeek の attention
カーネルはファブ後およそ 40 時間で理論ピークの 0.31% から 88.94% まで向上した。
なぜ重要か: Spectrum 自身の留保を持って運ぶべきだ:「実運用フリートの性能は未証明。
ベンチマークは OpenAI による提出値」。さらに専門家は、20 か月の日程が信じられたのは
Broadcom が物理設計を担ったからだと指摘する。記事自身が述べる誠実な結論はこちら:
LLM はフロントエンド(RTL とカーネル)の作業を大幅に圧縮したが、バックエンドの物理
設計にはあまり役立たず、エンジニアが終始「最終的な仲裁者」だった。
🔗 IEEE Spectrum · 🔗 HN 議論
21. IBM Guardium:重大 CVE 12 件が NVD に一括公開——デシリアライゼーション RCE、SQLi、無認証サーブレット
- Velocity: ▮▮ rising
- Source: NVD / IBM · レコード公開 9 月 18 日
- Tags:
cve ibm database-security enterprise
IBM の Guardium Data Protection 12.2 に向けた重大修正の一括が 9 月 18 日、NVD に公開
された——CVE-2026-80441、-80442、-81657、-82340、-82832、-82967、-84064、-84073、
-84075、-84078、-84082 に、Sterling File Gateway 9.1 の CVE-2026-75878 を加えた 12 本。
内訳:無認証デシリアライゼーション RCE(9.8)、IP アクセス制御の認証バイパス(9.8)、
無認証 SQL インジェクション(9.8)、ChangeTracker/LoadBalancer サーブレットの認証欠落
(9.9)、認証後の OS コマンドインジェクション(9.9)。すべて IBM が CNA として採点。
修正は Guardium 12.x の更新ストリームに含まれる。
なぜ重要か: Guardium はデータベース監査トラフィックの上に座っている——侵入されれば
企業内のほぼすべてのクエリが見える。だからこそ高価値標的であり、落ちればコンプライアンス
事件になる。12 件の一括公開は、少しずつの洩らしではなく計画的リリースを示唆する。
Guardium 管理者はバージョン棚卸しを急ぎ、インターネットや一般ユーザーから到達できる
コンソールをパッチまでの間「露出」と扱うべきだ。
🔗 IBM セキュリティ情報 · 🔗 NVD レコード CVE-2026-80441
22. xAI が Grok Voice Transcribe 2.0 をデフォルト STT に——ただし「精度 2 倍」の根拠はマーケティングページにしかない
- Velocity: ▮▮ rising
- Source: x.ai ドキュメント · 9 月 18 日
- Tags:
speech-to-text xai api voice
xAI のドキュメントは現在、音声認識 API のデフォルトモデルとして
grok-voice-transcribe-2.0 を掲げている:POST /v1/stt エンドポイントと WebSocket
ストリーミング、25 言語、単語レベルのタイムスタンプ、マルチチャンネル音声、話者分離。
ドキュメントには「すべての音声データはリアルタイムで処理され、保存も学習利用も
しない」と明記されており、医療・法務の文字起こし市場を狙ったゼロ保持のコミットメント
となっている。
なぜ重要か: API のデフォルトモデルが変わると、ピン留めしていない全顧客が一斉に
移行させられる。そして STT は本番環境で最もスループットの高い AI ワークロードの 1 つだ。
ここでは情報源の注意が効く:広く引用されている「精度は 1.0 の 2 倍で価格据え置き」は
xAI のマーケティングページ(非ブラウザの取得を拒否する)と二次報道にのみ現れ、ドキュメント
自体には精度の主張が一切ない。倍率は独立ベンチマークが出るまでマーケティングとして
扱うべきだ。
🔗 x.ai 音声ドキュメント · 🔗 x.ai モデル一覧
23. Cache-to-Cache:KV-cache で語り合う LLM 同士が HN の一日を得る
- Velocity: ▮▮ rising
- Source: Hacker News · 95+ pts · 約17時間前(~03:06 UTC+8)
- Tags:
paper kv-cache multi-agent inference
HN で話題になっているのは「Cache-to-Cache: Direct Semantic Communication Between
LLMs」(arXiv 2510.03215、2025 年の論文がフロントページに再浮上):エージェント間の
メッセージをテキストとして生成・解析・再エンコードする代わりに、片方のモデルの
KV-cache をもう片方のキャッシュへ直接投影する——デコード/再エンコードの往復を丸ごと
省き、推論速度のまま意味の通信を行う。
なぜ重要か: 今日のマルチエージェントシステムはホップごとにトークン税を払って
いる——生成、シリアライズ、再 prefill。キャッシュレベルの通信はその税をアーキテクチャ
レベルで狙い撃つ。エージェントフリートの拡大とともに繰り返し再評価される理由がここに
ある。実務上の制約も明確だ:モデル間で語彙や幾何構造が共有ないし写像可能であることが
要る。現時点では同族(または共同学習)向けの技術で、ベンダー横断の橋ではない。
🔗 arXiv:2510.03215 · 🔗 HN 議論
24. Stagehand:「Playwright を 2 倍高速化、トークン 80% 削減」——ベンダー数値、コードは公開
- Velocity: ▮▮ rising
- Source: Hacker News · 94+ pts · 約19時間前(~01:06 UTC+8)
- Tags:
browser-agents playwright testing tokens
Browserbase の Stagehand——Playwright の上に AI API を重ねるブラウザエージェント SDK
——が「We made Playwright 2x faster and 80% more token efficient」という題で HN に
登場:モデルに与える DOM スナップショットとアクション痕跡を削り込んだもので、
ブラウザ自動化のレイテンシもトークンコストもまさにそこで食われている。
なぜ重要か: ブラウザエージェントは最もトークンを食うエージェント種別で、
DOM→プロンプトの削減こそ全員の実コストの置き場所だ。数値はベンダーの自己申告——
ベンチマークではなく方向として読むこと——だが、リポジトリはオープンソースで測定は
再現可能。この分野の「トークン削減」主張としては、それだけで上出来だ。
🔗 github.com/browserbase/stagehand · 🔗 HN 議論
25. 「科学はオープンソースソフトウェアである」——再現性の危機を依存関係管理の問題として捉え直す
- Velocity: ▮ steady
- Source: Hacker News · 104+ pts · 約9時間前(~11:06 UTC+8)
- Tags:
open-source research reproducibility essay
Jakob Pedersen 氏は、研究論文は機能の上では「リポジトリ衛生が絶望的なオープンソース
プロジェクト」なのだから、オープンソースソフトウェアとして扱うべきだと論じる。論文の
「コードは依頼があれば提供します」の実態が、ラベルのないスクリプトと死んだリンクと
未記録の環境状態のパイプラインである顛末を追い、それをバージョン・テスト・メンテナー
を持つソフトウェアとして扱ったときに何が変わるかを示す。
なぜ重要か: この枠組みが効くのは道徳ではなく運用だからだ:ソフトウェアを生かし
続けるためにオープンソースが育てた実践(semver、CI、CODEOWNERS、依存のアーカイブ)
は、再現しない研究の失敗モードにそのまま対応する——そしてエージェント時代は賭け金を
上げた。文献で学習するモデルは文献の腐敗を受け継ぐ。
🔗 jepedersen.dk · 🔗 HN 議論
26. JEPA-Anything:1 つの予測モデリング枠組みが 7 領域に通用すると主張
- Velocity: ▮ steady
- Source: arXiv · 2609.20800 · 9 月 17 日
- Tags:
paper jepa world-model self-supervised
Ling Yang、Weiyang Liu、Zhenfei Yin らのグループが「orthogonal predictive
factorization」(OPF)を JEPA 型予測的世界モデリングの領域非依存な一般化として提案。
視覚、生物学、臨床時系列、制御、分子動力学、物理場、気象にわたって評価し、10 個すべての
ダイナミクスタスクで条件を揃えた JEPA ベースラインを上回り、Interventional Pong で
介入予測誤差 −34.8%、惑星データからケプラーの指数(−1.4991)を再現したと報告。コードは
Gen-Verse/JEPA-Anything で公開。
なぜ重要か: LeCun の JEPA プログラムは「ビジョン限定の願望」と批判されてきた。
7 領域評価は、その主張が必要とする種類の試験だ。結果は論文自身の枠組み通りに読むこと
——最強の領域特化手法ではなく条件を揃えた JEPA ベースラインとの比較であり、生物学の
介入結果も「実験的支持を得た」段階で、検証済みではない。
🔗 arXiv:2609.20800 · 🔗 github.com/Gen-Verse/JEPA-Anything
27. RetireOPD:蒸留の教師が訓練途中で自らを解任——生徒が教師を追い越す
- Velocity: ▮ steady
- Source: arXiv · 2609.20784 · 9 月 17 日
- Tags:
paper distillation reinforcement-learning agents
エージェント RL 向け「自己 on-policy 蒸留」に Adaptive Retirement ルールを付けた手法:
スキル特権を持つ教師は性能差が縮まり続けている間だけ生徒を監督し、生徒が教師成功率の
目標割合に達した時点で外される。Qwen2.5 バックボーン(1.5B〜7B)で、RL ベースライン比
ALFWorld +14.1〜18.8 pp、WebShop +11.8〜19.0 pp を報告——しかもテストしたすべての設定で
生徒が自身の教師を上回った。
なぜ重要か: 蒸留→RL パイプラインの永遠の難所はいつ模倣をやめるか:早すぎれば
生徒の上限を狭め、遅すぎれば教師の天井とバイアスを取り込む。引退をハイパーパラメータ
ではなく測定された判断にするのは、機構のきれいな小さいアイデアだ——ただしエビデンスは
Qwen2.5 のみ。法則ではなくレシピとして扱うこと。
🔗 arXiv:2609.20784 · 🔗 arXiv HTML
28. Xing4.0-29B-A4B:中国電信が Ascend NPU だけで学習したコーディング MoE を公開
- Velocity: ▮ steady
- Source: Hugging Face Trending(#5)· 9 月 18 日更新
- Tags:
open-weights moe ascend coding
XingChen-AGI(中国電信)が Xing4.0-29B-A4B をリリース:総パラメータ 29B / 有効 4B の
MoE(ルーティング専門家 64、MLA + MTP、256K コンテキスト)で、モデルカードは「この
規模のモデルとして初めて、Ascend NPU プラットフォーム上で MindSpore フレームワーク
のみを使って学習された」と主張。自己申告の数値は SWE-bench Verified 75.00
(Qwen3.6-35B-A3B の 76.00 に対し)、Terminal-Bench 2.1 が 57.50——AIME2026 と
IFBench では後れを取る。
なぜ重要か: 本丸は計算主権の物語のほうだ:国家運営の通信事業者が NVIDIA 依存ゼロで
競争力のあるコーディング重みを出すことは、どのベンチマークの 1 点より重要。カード自体に
limitations の節はなく、見出しの数値にはハーネスの脚注が付く——75.0 は、自己申告の
ハーネススコア全般に適用するうちのやり方で読むこと:再現が付くまでの上限値として。
🔗 huggingface.co/XingChen-AGI/Xing4.0-29B-A4B · 🔗 XingChen-AGI on HF
29. Red Hat OpenShift コンソール CVE-2026-75885:devfile エンドポイント経由の無認証 SSRF
- Velocity: ▮ steady
- Source: NVD / Red Hat · 9 月 18 日公開
- Tags:
cve openshift ssrf kubernetes
OpenShift コンソールの /api/devfile/ と /api/devfile/samples/ エンドポイントが
細工された devfile ペイロードを無認証で受け付け、コンソールの文脈から server-side
request forgery が可能になる——CVSS 9.3(Red Hat CNA、secalert@redhat.com が Primary)。
NVD レコードは 9 月 18 日公開。devfile はクラウドワークスペースを定義するテンプレートで
あり、そのインポート経路は SSRF の天然の支点になる:コンソールは特権ネットワーク位置から
攻撃者の影響を受けた URL を取りに行く。
なぜ重要か: OpenShift コンソールはメタデータサービス、内部レジストリ、Kubernetes
API 自体に到達できる場所に置かれている——そこでの SSRF は情報漏えいではなく足場化の
プリミティブだ。クラスタ管理者は Red Hat 勧告に従ってパッチを当て、devfile エンドポイント
がコンソール UI の外に露出していないか棚卸しすべきだ。
🔗 Red Hat CVE · 🔗 Bugzilla 2517885
30. Gravity Forms CVE-2026-84434:無認証の任意ファイルアップロード(CVSS 9.8)——修正バージョンは未確認
- Velocity: ▮ steady
- Source: NVD / Wordfence · 9 月 19 日公開
- Tags:
cve wordpress file-upload rce
WordPress サイトに広く入っているフォームプラグイン Gravity Forms の upload_file
ルーチンに無認証の任意ファイルアップロードが存在する(影響:≤3.1.0.4)——ファイル
タイプ検証の食い違いがアップロードを許し、リモートコード実行に至り得る。CVSS 9.8
(Wordfence が CNA として採点、同社の Argus スキャナが発見)。NVD レコードは 9 月 19 日
未明に公開された。
なぜ重要か: フォームプラグインは WordPress の古典的な初期侵入ベクトルだ——
どこにでもあり、設計上そもそも無認証で到達できる。弊誌の規則に従い正直な注を 1 つ:
執筆時点で、正確な修正済みバージョンをベンダーの変更ログから確認できなかった——特定の
番号を決め打ちせず、最新のリリースへ更新してバージョンを確認すること。
🔗 NVD レコード CVE-2026-84434 · 🔗 Wordfence 脅威インテル
31. quiche 0.30.0:デフォルトで耐量子になった BoringSSL が ClientHello を分割し始めた——全 QUIC 実装者が気にすべき話
- Velocity: ▮ steady
- Source: GitHub release · 9 月 17 日
- Tags:
quic http3 rust post-quantum
Cloudflare の Rust 製 QUIC/HTTP-3 実装が v0.30.0 を出荷。変更履歴の分量以上に重い
破壊的変更が 2 つ:boring クレートの範囲が >=4.19,<6 に動いた。BoringSSL 5 が
耐量子キーグループをデフォルトで有効化したためで、耐量子の ClientHello は 1 つの
Initial パケットに収まらず、最初のフライトが複数データグラムに分割され得る——これは
合併ハンドシェイクを前提とする QUIC 実装を壊す。PathEvent も #[non_exhaustive] と
なり PmtuUpdated 変体が追加された。
なぜ重要か: 耐量子ハンドシェイクへの移行は、暗号の問題である以上にパケット化の
問題としてやって来る——複数 Initial のハンドシェイク下でのミドルボックスとピアの挙動に、
静かな破壊は正確に潜む。Cloudflare が自社のオープンソース QUIC スタックで最初に直した
ことは、quiche ユーザーだけでなく他のすべての QUIC 実装への早期警報だ。
🔗 quiche · 🔗 v0.30.0 リリースノート