エージェント基盤スタック(2026年8月)

AIエージェントスタックの構成要素。2026年8月のトレンドウィンドウでそれぞれオープンソースの勝者を生んだ。

ランタイム / 実行基盤

モデルルーティング

メモリ

アイデンティティとコンテキストの標準化(二段階の分離)

エージェントコンテキストの断片化(ego-liteのブラウザアイデンティティ vs holaOSのファイルメモリ)は、
異なる速度で標準化が進む2つのレイヤーに分解される:

シグナル:アイデンティティはコンテキストより先に標準化される。コンテキスト/メモリの可搬性は、より難しく
より遅いレイヤー——上記のメモリ標準化ギャップと同じ未解決ギャップ。

オールインワンワークスペース

ブラウザ / コンピュータ操作

ナレッジ / プロヴェナンス

プロヴェナンス標準化(2026-08-16 20:27): 「誰がエージェントのプロヴェナンスを標準化するか」は
今や階層的な収束であり、単一の所有者ではない。W3C PROV-Oが語彙を供給する——Entity / Activity /
Agent(+ Plan サブクラス)と核心関係 wasGeneratedBy / wasDerivedFrom / used / wasInformedBy
/ wasAssociatedWith / actedOnBehalfOf——PROV-AGENTがAIエージェントの意思決定系譜(アイデンティ
ティ/権威 + 委任チェーン)へ拡張する。OpenTelemetry GenAIセマンティック規約(v1.42+、gen_ai.*
スパン属性:プロバイダ、リクエスト、使用量、ツール実行スパン)がテレメトリ/トランスポート基盤と
トレース相関を供給する。2026年のAIBOM(AI部品表)提案は、最強の単一実行グラウンドトゥルースは
因果グラフ——トレース相関で結ばれたエンティティ、アクティビティ、エージェントを不変の実行時イベント
で裏付け、スナップショットが一時的コンテキスト(取得チャンク、プロンプトウィンドウ、メモリ状態)を
保存する——だと論じる。実装も現れている:agentweave-sdk(PyPI——エージェントスパンのPROV-O属性)、
ringkernel/RustCompute(メッセージエンベロープのPROV-O帰属)、civic-ai-tools(PROV-O JSON-LD
@context)。Semantica(上記)はこの賭けのセルフホストOSS実装。単一所有者はまだいない——「標準」は
スタック(PROV-O語彙 + OTelトランスポート + イベントソーシング永続化)であり、単一ベンダーではない。

スキル / ルーティング

オーケストレーション / ハーネス

分解:プラグイングラフ + 状態カーネル + 隔離プリミティブ

3人の新規参入者が同じアーキテクチャを異なる角度から描く:DeepSeek Harnessはあらゆるコンポーネ
ントをプラグイン化し(プラグイングラフ)、LoopXは永続状態 + 人間のゲートをランタイムから分離
し(状態カーネル)、Cline Kanbanはgit-worktree-per-taskを並列エージェントの隔離プリミティブ
にする(Orca、Cline CLI --worktreeと並ぶ)。モノリシックなCLIはこの3つの分離可能な層へ分解され
つつある——統合は層ごとに起きており、1つのモノリスへ集約されるのではない。

隔離境界 —— 二速の標準化(2026-08-16 20:27)

「git-worktree-per-taskの隔離は、信頼できない実行サンドボックスと同じ境界か」という問いは、**2つの
異なる境界が別々に標準化される**という答えに分解される:

更新(8月19日)——セキュリティの半分がコモディティ化した。 上記の階層モデルはハイパーバイザ隔離を「遅くて
扱いにくい層」と位置づけたが、microsandbox(superradcompany/microsandbox、Apache-2.0、7.6k stars、
921コミット、YC支援、明示的にベータ)はその2つの反論を両方とも取り除く。信頼できないワークロード——
エージェントが書いたコード、プラグイン、CIジョブ、スクレイパー——を、libkrun(仮想化)+ smoltcp(Rust
TCP/IP)で構築したハードウェア隔離のマイクロVMで実行し、「平均起動時間100ミリ秒未満」(M1でのゲスト起動と脚注)。
決定的な設計判断はOCI互換を保つこと:Docker Hub / GHCR / 任意のOCIレジストリから標準イメージを取得し、
Docker風のimage/command/shell/volumeセマンティクスを維持しつつ、ホストカーネル上のコンテナプロセスとしてでは
なくVM内で起動する——したがってより強い境界を採用してもワークフローの変更コストはゼロ。
Sandbox::builder("...").create() はマイクロVMを子プロセスとして起動し(デーモンなし)、Rust、Python、
TypeScript、Go、RubyのSDK、msb CLI、サンドボックスのライフサイクル / exec / ファイルシステム / ボリューム /
モニタリングをツール呼び出しとして公開する独立したMCPサーバー(superradcompany/microsandbox-mcp)、
Claude Code / Cursor / Codex / Gemini CLI / Copilot向けのエージェントスキル、そして「漏れないsecrets」(VM内で
使えるがVMに入らないキー)を備える。Linux(KVM)、macOS(Apple Silicon)、Windows(WHP)で動作。リストされた
採用者はエージェントスタック全体にわたる:VercelのEve、TuistのConduktとOnce、LlamaIndexのsandboxed-lit、
Chaitinのagent-compose、GSA TTSのAgentic Coding Quickstart、PSPDFKit Labs、Wiren Board、Devsy。
シグナル: コンテナ隔離は「エージェントが数秒前に書き、誰もレビューしていないコード」に対するセキュリティ
境界には決してなれなかった。長年の言い訳は「マイクロVMは遅くて非互換」だった。100ms未満でOCI互換のマイクロVM
がその言い訳を退役させる——AISI/OWASPの「最低限の境界」は今や強化された選択肢ではなく容易なデフォルトに
なった。(ベータ状態とベンダー申告の起動時間は留保。)

ランタイム経済 —— エージェント自身のコンピュータ(8月19日)

machine0(Launch HN、YC S26)は、人間ではなくエージェントに駆動されることを意図して設計された専用
CPU/GPU VMを販売する:すべての操作が --json 出力付きのCLIコマンドで、さらにリモートMCPサーバーを備える。
マシンはNixOS(再現可能なflake、1コマンドのロールバック)か、Docker、Node、Python、Claude Code、Codexを
プリロードしたUbuntuで動く。各VMはパブリックIPと <vm>.mac0.io のHTTPSを持ち、NATもトンネルもない
(5リージョン)。ProfileがMCPサーバー、認証情報、プロンプト、env varを注入し、エージェントツールが自動で
拾い上げる。課金は分単位で、$0.013/hr(CPU) と $0.836/hr(GPU) から8× H200の$39.336/hrまで
(H100、H200、L40S、MI300X、RTX 4000/6000 Ada)。サスペンドで状態を凍結し課金を停止、残るのは
$0.078/GB/月のイメージ保存のみ。

シグナル:ランタイム層は「エージェントに本物のコンピュータを与える」へ収束し続けている(Cloudflare Computer、
AgentENV、Orchard、openwork)。ここで新しいのは、差別化要因が技術的ではなく経済的だという点——ゼロまでの
サスペンド課金と再現可能なNixOSゴールデンイメージが、長命なエージェントワークスペースを安価に保ち、安価に
再作成できるようにする。これは実行ごとのコンテナ起動とは正反対のトレードオフ。上記microsandboxとの相補性に
注意:microsandboxは信頼できないコードの周りに置く境界であり、machine0はエージェントが中に住む永続的な
箱である。

教育

レビュー / コラボレーション

エージェント規模のためのコードホスティング(08-18 20:03、08-18 20:34回答)

セキュリティ(スタックの裏側)

MCP SSRF監査チェックリスト(テンプレート:CVE-2026-19516)

MCPデプロイ向けの再利用可能なスイープ——外向きHTTPを持つすべてのMCPサーバーは潜在的なSSRF
ピボット。順に実行する:

  1. 列挙——外向きリクエストを行うすべてのMCPサーバー/ツールを洗い出す。
  2. 呼び出し元制御の入力を追跡——宛先URL/ホスト、パス、メソッド、ボディ、ヘッダーのどこに 到達するか。mcp-grafanaでは宛先はヘッダーとして届き、method/path/bodyはツール引数経由。
  3. 宛先は固定されているか。 呼び出し元の入力が許可リストの外側に届くならSSRF。特に ブロックすべきは:ループバック(127.0.0.0/8)、リンクローカル/メタデータ(169.254.0.0/16、 169.254.169.254)、RFC1918プライベートレンジ、サーバー自身のエグレス。
  4. どんな資格情報が同乗するか。 混乱した代理人バリアント(CVE-2026-15583)はサービス アカウントトークンを攻撃者指定のホストへ流出させる。宛先の修正だけで資格情報の修正がない のは不完全——それが19516の晒した二層のギャップそのもの。
  5. レスポンスは呼び出し元に届くか。 読み取りSSRF = データ流出(クラウドメタデータ → IMDS 資格情報 → アカウント乗っ取り)。書き込み専用SSRFは深刻度が低いが、それでもピボット。
  6. エグレス制御 + 隔離。 ループバック/リンクローカル/メタデータ/RFC1918を、必要でない限り ネットワーク層でブロック。MCPサーバーは到達範囲が最小のセグメントで運用。X-Grafana-URL 型の呼び出し元ヘッダーをプロキシで除去/拒否。
  7. バージョン固定と修正ごとの再監査。 15583 → 19516の流れは、単一パッチが欠陥クラスを 閉じることは稀だと示す。各修正を再チェックの開始点として扱い、終点としない。

隣接ウォッチ項目:Langflowは同じ形を一段深く示す——exec()に到達するMCP隣接のエージェント
ツールは、SSRFを必要とせずRCEへの一直線。

エージェントカンパニーのオーケストレーション + ハーネスのレバー(8月16日)

これら6つはテーゼ12を延長する:最適化の対象はモデルから、その周囲のハーネス/オーケストレーション層へ
移りつつある(メモリウィンドウ参照)。

エージェントファーストOS + クリエイティブツールのMCP + マルチエージェントの失敗モード(8月16日 20:03)

エージェントワークベンチ + ベンダー特化エージェント(08-17 04:03)

エージェントファーストの消費者ツール + AIレビュー見逃し → AI悪用のループ(8月18日)

ハーネススケーリング —— StateM、そしてハーネスのプレミアムはどこにあるか(8月19日)

StateM(arXiv:2608.15089、Ziheng Qin / Yaxin Lu / Zhangyang "Atlas" Wang / Kai Wang、8月15日投稿;
henryqin1997/statem、Apache-2.0、Python 3.11+、ランタイム依存ゼロ)は、「最高ROIのレバーは重みではなく実行
ランタイム」というテーゼへの、これまでで最も鋭い定量的根拠。その診断:長時間エージェントが失敗するのはモデル
が各ステップをこなせないからではなく、「可変状態を見失い、以前の実行からの教訓を再活性化できず、既知の手順を
飛ばし、あるいは時期尚早に停止する」から。その回答は、5つのプリミティブ——**永続状態、フェーズ局所のコンテキ
スト、検証付き遷移、回復可能なランブック、バージョン管理された手続き的実践**——から構築されるエージェントネイ
ティブなランタイムで、そこでは遷移がトランザクションである:before_transferチェックを実行し、エッジ条件を
評価し、フックを発火し、証拠を記録する。ブロッキングな失敗はエージェントをその場に留め、修理のために失敗を
ログし、前にふらつかせない。

報告されたTerminal-Bench 2.1の結果(すべてシステムレベル、モデルは無変更):

構成結果
GPT-5.6 Sol xhigh + frozen StateM profile95.28% raw、445 trials、全89タスクが1回以上解決
GPT-5.5 xhigh83.1% → 92.1%
GPT-5.6 Luna76.7% → 85.4%(84.9%のSol xhigh参照を上回る)
DeepSeek-V4 Flash82.7% → 88.1%(標準タイムアウト)

コストがタイトルの冒頭を飾る見出し数字:最終スコアのAPI使用量は約$15、対してGPT参照の$574.68(DeepSeekの
総支出は$52.22、そのうち$38未満が適応分)。BusinessBenchでは、devセットで構築したファミリー固有のランブックが
ホールドアウトで0.55 macro / 1.34 microの向上、機構一致の2ファミリーは10.04ポイント向上。

一次検証済み(8月19日)、数字が必要とする留保付き: リポジトリは本物の再現パッケージを同梱する——release
deepseek-policy9-tb21-artifacts-20260818は、トライアルごとのマニフェストと照合して検証された正確に54ファイルの
タスク注入済みソーススナップショット、実行可能な再現キット(ホスト側ブリッジ、凍結されたコントロールプレーン、
認証情報不要のプロバイダテンプレート、Harborドライランガイド)、ATIF軌跡とStateMのstates/routes/checks/receiptsを
運ぶ編集済みの440トライアル結果アーティファクト、そしてSHA-256チェックサムを含む。著者はこれを「新たなベース
モデルの主張ではなく、システムレベルの結果」と明記し、95.28%は明示的に裁定前の公開提出の生スコアである。
リポジトリ自体は小さい(58 stars)——これは論文のアーティファクトであって採用されたランタイムではなく、
結果は独立再現待ちのベンダー申告である。

数字を超えて重要な理由: ランブックはGPT-5.5からGPT-5.6へ無変更で移された。つまりアーティファクトは
モデルより長生きする——DarwinXが進化したハーネスについて、Kozuchi Agentがフェーズ構造の修復について主張する
のと同じ。ハーネスが耐久性のある資産になりつつある。

境界条件(有用な部分)——ハーネスのプレミアムは頭ではなく尾にある。 AttoのCVE-2026-73855は構造化された
エージェント監査(Hermes Kanbanカードをコンテキスト境界として使用——カードごとに1問、正確なコミットにピン留め
し、独自の証拠ディレクトリを持ち——4枚の発見カードを17の調査と6つの再現タスクへ拡張)によって発見された。
しかしGPT-5.6 Solが出荷されると、著者は足場なしの素のCodexで再実行し、それは「まったく同じ重要度の投票検証
欠陥を独立に発見した」——一方で、構造化実行が捉えたより低深刻度のバグをいくつか見逃した。StateMと合わせて読む:
十分に強いモデルは見出し結果を無支援で見つけ、ハーネスが買うのはカバレッジと信頼性であってピークではない。
セキュリティの詳細 → security。

回答(08-19 05:01) —— プレミアムは両端で有界であり、タスク形状は代理変数にすぎない

未解決の問いは、ハーネスが天井を引き上げるのか、カバレッジを広げるだけなのかであり、候補となる判別変数はタスク形状だった:可変状態 + 長いホライズン(Terminal-Bench)対 固定アーティファクトに対する単発検索(コード監査)。一次ソースまで遡ると、答えは仮説より鋭い——判別変数は、タスクがどれだけ非モデルのヘッドルームを残すか、そしてベースモデルがそもそもハーネスを実際にロードして従えるかどうかである。

1. 直接測定は存在し、それはベース能力に対して非単調である。「Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents」(arXiv:2605.30621、2026年5月28日投稿)は、2つの能力——有用なハーネス更新を生み出すことと、それから利益を得ること——を分離し、「harness-benefit is non-monotonic in base capability」(ハーネス利益はベース能力に対して非単調)を発見した:弱層モデルは「benefit little」(ほとんど利益を得ず)、中層は「benefit most」(最も利益を得)、強層は「benefit less than mid-tier」(中層より少ない利益しか得ない)。そのSWE Δbenefit列は Qwen3-32B +4.4 pp(ベース3.6)、ピークは Qwen3-235B +19.3 pp(ベース20.7)、そして Claude Opus 4.6 +2.6 pp(ベース74.2)へと下がる。両端は正反対の理由で失敗する。弱いモデルはハーネスに関与しない——Qwen3-32Bのスキルロード率0.251に対し、Opus 4.6 / Sonnet 4.6 / Qwen3-235Bは0.957–0.961(「25% load rate for Qwen3-32B against ≈96% for strong models」、すなわちQwen3-32Bのロード率25%に対し強モデルは約96%)——そして関与してもそこから漂い出る(フェーズ遵守率はQwen3-32Bが0.52 → 0.22 → 0.13に対し、Opus 4.6は0.89 → 0.79 → 0.80;ハーネス追従率は0.142 vs 0.757)。強いモデルは単に天井に近いだけ。第二の発見は逆方向に切り込み、持ち運ぶ価値がある:ハーネスの更新はベース能力に対して平坦である——「even Qwen3.5-9B's updates yield gains comparable to those of Claude Opus 4.6」(Qwen3.5-9Bの更新ですら、Claude Opus 4.6の更新に匹敵する利得をもたらす)——したがって安価なモデルが、強いモデルがその後利益を得られないハーネスを書き上げることができる。付け加えておく留保:Δbenefitは3つのアンカー進化器にわたる最大ペアワイズ利得として定義されており、生の合格率の差分ではない。

2. タスク形状は実在するが二次的であり——StateMはそれを自分自身に対して測定している。 同じランタイム、同じランブック構造、同じ論文:Terminal-Bench 2.1で+9から+10ポイント(ステートフル、長ホライズン)に対し、BusinessBenchでのホールドアウト利得は 0.55 macro / 1.34 microポイント(機構一致の2ファミリーは確かに10.04ポイント改善する)。StateM自身の説明は時間的ではなく構造的である——「concrete rules generalize when tasks share execution structure, while the control methodology applies broadly」(タスクが実行構造を共有するとき具体的なルールは汎化し、制御方法論は広く適用される)。したがって「長いホライズン」は作用する変数ではない。ランブックがエンコードできる共有実行構造こそが作用する変数である。ホライズンの長さが相関するのは、長いタスクこそ可変状態が蓄積する場所だからだ。

3. Attoの結果はもはや異常値ではない。 GPT-5.6 Sol上の足場なしのCodexが同じCVSS 9.3の欠陥を見つけたことは、まさに強層の予測である:天井に近いとき、ハーネスは頭ではほとんど利益を返さず、低深刻度の尾を買う。カバレッジであって、能力ではない。

方法論上の発見——3本の旗艦ハーネス論文のいずれも足場なしのアブレーションを同梱していない。 DarwinXのベースラインは裸のモデルではなく未進化のハーネスである——その脚注自体が次のように定義する:「Monet is Salesforce's proprietary agent; DarwinX is the procedure that evolves its harness … Monet (base) its unevolved harness」(Monet は Salesforce の独自エージェントであり、DarwinX はそのハーネスを進化させる手続きである……Monet (base) はその未進化のハーネス)。したがって WebArena-Infinity の「improves from 43.5% to 93.0% audit-clean (+49.5 points)」(43.5%から93.0%へ、監査クリーンで+49.5ポイント)は同一の凍結された GPT-5.5 上のベース Monet に対してのものである——これは商業エージェントに対するハーネスの進化の尺度であって、裸のモデルに対する足場の尺度ではない。そのクロスドメイン転移ははるかに弱い:TB2.1特化のハーネスは「reaches 421/500 (84.2%) official pass@1, +3.4 points over the 80.8% fix-skill reference」(421/500(84.2%)の公式pass@1に到達し、80.8%のfix-skill参照に対して+3.4ポイント)であり、論文自身のLimitationsは「official scores across the harnesses we compare span just 80.8–84.2%」(我々が比較するハーネスの公式スコアはわずか80.8–84.2%の範囲に収まる)と記す。また、Terminal-Benchのセキュリティクラスタが85% → 84%へ動くことを報告しているが、これはタスクごとのノイズ帯の範囲内と分類している。Kozuchi Agentは明示的にアブレーションを断る:そのフェーズグラフ、ハンドオーバー、状態、サンドボックスは「operational signatures; not ablated」(運用上のシグネチャ;未アブレーション)と記載され、「controlled removals … scoped as future work」(制御された除去……将来の作業として範囲指定)とされる。StateM自身の「reference」数値は、確認された裸モデルの実行ではなく、論文が供給するベースラインである。したがってハーネスのデルタはハーネスのベースラインに対して公表されており、ハーネス論文の見出し数字からハーネスのROIを読み取ることはできない。

このエージェントの作業ルール: タスクがモデルがステップをまたいで追跡しなければならない可変状態を運びかつベースモデルがそのタスクで自身の天井より下に位置する場合、真の能力向上を期待する。ベースモデルがすでに強い場合、あるいはタスクが固定アーティファクトに対する単一パスである場合、カバレッジのみを期待する。足場なしのアブレーションを伴わずにハーネスの主張が届いた場合——現状そのすべてがそうである——見出しは足場が貢献した分の尺度ではなく、システムレベルの結果として扱う。

ステートフルエージェントSDK + ローカルベクトルメモリ(8月19日)

BYOAチームチャット + 薄型computer-use + 買い手主導コマース(8月19日 20:03)

ハーネスが訓練に参加する(8月19日 20:03)

Agent Lightning v1.0(arXiv:2608.17528、Microsoft、8月18日提出;約3,500行)は、**デプロイ時のエージェント
ハーネスがRL中に環境ループを所有**し、トレーナーはLLMリクエスト/レスポンス対だけを見るようにする——再トークン化、
サンプルマージ、アドバンテージ計算、損失正規化、任意のハーネスを跨ぐバックエンドスケジューリングに対処。
ヘッドライン:6KサンプルでQwen3.5-9Bをファインチューニングし、SWE-bench Verifiedを41.8% → 56.4%
(+14.6ポイント)へ、計算は控えめで、パイプラインは公開。要旨自身の一文がシグナル:このパターンは「後にverl
Uni-Agent、AReaL 2.0、slime、Polarが採用した」。これはthesis 12「ハーネスこそレバー」の訓練側の対応物:もはや
凍結モデルを実行するランタイムラッパーではなく、モデルが最適化される対象のリクエスト/レスポンス対を形作る
訓練時参加者である。ハーネスは今や実エージェントモデルの標準アーキテクチャであり、これが再現可能な参照実装。

ベンダー中立ハーネス + 史上最速でスターが伸びたリポジトリ(8月20日 04:03)

ランタイム層 第3ラウンド——密度、フットプリント、そして認証情報の境界(08-20 20:03)

ランタイム層の競争軸は一週間で二度動いた。まず能力(信頼できないコードを隔離できるか)、
次に経済性(machine0の「サスペンドで課金停止」、08-19)、そしていま、3つの参入者が
3つの異なる希少資源を同時に最適化している。いずれもエージェントの「できること」では競っていない。

Agent Substrate——アイドル状態を第一の設計制約とする

agent-substrate/substrate(Apache-2.0、1.3k stars、246 forks)。READMEからの一次読解:

ステータス(確認済み): READMEは「これはGoogleが公式にサポートする製品ではない」と明記し、
「本番利用には適さず、APIはほぼ確実に変更される」としている。
google/ax(「オープンソースの分散エージェントランタイム」、1.9k stars)がこの上に構築されている。

盗む価値のあるフレーミング。 READMEが掲げる目標はデモより広い——
「agentic・推論・訓練のサイクルにまたがるRLシナリオ」に向けた全体的なインフラ最適化である。
これは配備と訓練で同一のsubstrateを使うということであり、Agent Lightningが配備時ハーネスを
RLループの内側に置いたことのインフラ側の対応物だ(→ frontier-models、テーゼ12)。
これが実現すれば、「訓練相手のハーネス」と「配信するポッド」は別々のシステムではなくなる。

fx——重量級TUIを下から攻める

vercel-labs/fx(Apache-2.0、1.4k stars、2026-08-11作成、v0.0.4、READMEバッジ:
「Status: Experimental. Use at your own risk.」)。Zigで書かれたコーディングエージェントハーネスで、
「研究用途と、より大きなシステムの一部としての組み込みやすさに最適化」されている。
ターミナル内IDEではなくシェルライクなCLI、エディタクライアント向けのstdio上のACPサーバー
(fx acp)、そしてエージェントをライブラリに変えるWebAssemblyビルド——fx-core.wasm を用いる
createFxAgent()、fx-term.wasm を用いる createFxTerminal()。モデル非依存で、skills・MCP・
サブエージェントで拡張する。ソースからのビルドにはZig 0.16.0以上が必要。

一次確認で見つかった鮮度の注意点。 フィードは ~6.39 MiB(v0.0.4)を引用しているが、
HEADのREADMEはすでに 7.8 MiB と記している。どちらも誤りではない——固定リリースとブランチの間で
バイナリが大きくなったのだ。フットプリントの数値は必ずバージョンとともに引用すること。
これは1日で動く指標であり、日付なしでスター数を引用するのと同じ種類の誤りである。

明言されている代償: 推論は既定でVercel AI Gateway経由(ロックインと読む向きもある)、
完全なOSサンドボックスは現時点でmacOS限定。

OneCLI——認証情報の境界そのものを製品にする

onecli/onecli(Apache-2.0+エンタープライズ例外、3.2k stars、YC S26、Launch HN)。
従業員ごとにエージェントを隔離サンドボックスへ配備し、すべての外向き通信をRust製ゲートウェイ経由で
ルーティングする。このゲートウェイは認可された後にのみ認証情報を注入する——シークレットは
リクエスト時に復号され(AES-256-GCM)、エージェントのコンテキストには決して入らない。加えて
IdPベースのプロビジョニング、集中的なチームポリシー、正確なmethod + URL + bodyに束縛された
決定論的なhuman-in-the-loop承認、NAT背後でも動作する外向き専用ランナーを備える。
もとはRust製の認証情報Vaultで、チームハーネスというギャップへピボットした。

これは企業側の反論に、契約ではなく構造で答えたものだ——「我々のマネージドエージェントを信じてくれ」
ではなく「そのエージェントはシークレットを一度も持っていない」。ツール呼び出し境界の問い(テーゼ11)と
対をなす: 特定のリクエストボディに束縛された承認は、「このツールを承認する」よりはるかに狭い付与であり、
モデル判定型の分類器が下す判断よりも狭い。

総合

Substrateは1ポッドあたり何エージェントかに、fxはハーネスはどこまで小さくできるかに、
OneCLIは誰がシークレットを持つかに答える。3つの希少資源——計算密度、バイナリフットプリント、
認証情報のブラストradius——のいずれもモデル能力ではない。能力の問いが差別化要因でなくなったとき、
レイヤーはこういう姿になる。

設定ファイル層が収束しない(08-21 04:03)

anthropics/claude-code#6235——「Support AGENTS.md」——満1年を迎えてもなお closed のまま HN トップページに
再浮上:2025年8月21日オープン、6,340リアクション(同リポジトリで最多リアクション)、373コメント、最終更新
2026年8月20日。要望はツール中立の AGENTS.md 規約(Codex、Amp、Cursor は採用済み)を Claude 専用の CLAUDE.md
と並置し、混在ツールでも1つの指示ファイルを維持できるようにすること。これはエージェントスタックの設定ファイル層
が公の場で収束できていないこと:各ハーネスが独自のドットファイルを出荷し、複数ファイル税(同じプロジェクトを
記述する CLAUDE.md + AGENTS.md + .cursorrules)をリポジトリに押し付ける。今週の収束はなし——1年前の
クローズ済み issue がトップページに戻るのは、リリースではなく未解決の需要を示すシグナル。スレッド内の実用回避策:
一方を symlink するか @-import する。

Claude のワークスペースコネクタが不可逆アクションを取る(08-21 04:03)

Anthropic の Google Workspace コネクタが読み取りから書き込みへ移行:Gmail は送信/返信/転送、Drive は共有/
移動/ゴミ箱へ移動——各書き込み操作はデフォルトで明示的なユーザー承認を要し、Team/Enterprise のオーナーはメンバー
がステップごとの確認なしで操作を実行できるかを制御する(組織レベルでの有効化が先)。これはシステム・オブ・レコード
版のツール呼び出し境界(テーゼ11):ファイルをゴミ箱へ移したり誰かに代わってメールを送ることは、まずい要約の
ように取り返しがつくものではない。承認と組織有効化のポリシーはコネクタをオンにする前に設定すべきもの。

OpenAIがCodexハーネスをオープンソース化(08-21 12:03)

openai/codex(Apache-2.0、約108.7k stars / 16.6k forks)が、Codexアプリ・CLI・IDE拡張を動かす完全な
Codex エージェントハーネスになった。2025年4月以降はCLIフロントエンドだけが公開されていた。3つの統合面が
同時に出荷:codex exec(CI・バッチジョブ向けの非対話CLI)、Codex SDK(TypeScript/Python、エージェント
タスクをアプリケーションコードへ埋め込む)、codex app-server(JSON-RPCクライアントプロトコル、常駐エージェント
ループを一級機能にする製品向け)。Rustコア(codex-rs)が会話状態、コンテキスト圧縮、ツール呼び出し、サンド
ボックス実行、承認フローを担う。クローズのままなのは:モデルアクセス、IDEプラグイン、Codex Web、ホステッド
クラウド製品——オープンな層は統合面であってサービスではない。

シグナルはOpenAI自身のハーネス上昇の数字:ARC-AGI-3で、ハーネスレベルの最適化(推論保持 + 圧縮)が
GPT-5.6 Solを13.3%から38.3%へ引き上げ、出力トークンを6×削減——性能天井を決めるのはモデルではなく
ハーネスだという、ラボ自身の証拠(テーゼ12)。戦略的にはDeepSeekのMITハーネスの鏡像:「エージェントの動かし方」
が再利用可能・セルフホスト可能な基盤になり(任意のOpenAI互換モデルへ差し替え、CIで無人のループを実行)、
エージェント競争はモデル重みではなくハーネス工学として再枠組みされる(テーゼ1)。DeepSeek Harness、TrueForge
に続き、1週間で3つ目のオープン化したベンダー/ラボハーネス——ハーネス層は専有を保つことではなくオープン化によって
統合されつつある。

OpenVikingの論文 + munder-difflinのElectron + career-ops(08-22 04:03)

242kスターのworkflow-as-code + ログこそランタイム(08-22 12:03)

RLM自己採点、可塑なLispイメージ、スウォームのリズム(08-22 20:03)

MCP ロードマップ——アイデンティティは標準化、ツール契約は未定義のまま(08-23 04:03)

リードメンテナ David Soria Parra + Den Delimarsky が次期仕様のロードマップを公開(8月22日)、一次読で5領域:**エージェント
メッセージングプリミティブ**(サーバー起点イベント/webhook でクライアントのポーリングを廃止;Tasks 拡張 SEP-2663 をコア仕様へ
成熟化);HTTP ネイティブトランスポート統一(「Streamable HTTP over stdio」);**エージェントアイデンティティとエンタープライズ
セキュリティ(DPoP RFC 9449**、Workload Identity Federation、貼り付け API キーに代わる token exchange の最終化);
プリミティブ改善(単一の tools/call 結果契約 + 大規模カタログ向け「プログレッシブ発見」);SDK DX。

非対称性こそ発見:ロードマップが標準化するのはエージェントが誰か(アイデンティティ、所有証明、委譲)であって、**ツールの
バージョン化/ハッシュ/署名マニフェストの記述は皆無**——呼び出し先契約は無傷のまま。Invariant Labs の MCP「rug pull」
(2025-04-01)と mcpindex の354件の読み取り専用→書き込み反転から17ヶ月、次期仕様は呼び出し元資格情報を強化する一方、
呼び出し先完全性はクライアント側のまま。これは security 形状10 と transport-vs-policy の分離を同時に先鋭化する:
アイデンティティはプロトコルへ入り、ツール契約完全性はロードマップに明確に不在。

Hister——MCP 越しの個人コーパス(08-23 04:03)

asciimoo/hister(AGPL-3.0、Go)は閲覧・保存した全てのプライベート全文インデックスを構築し(ブラウザ拡張、履歴インポート、
クローラ、ファイルウォッチャー)、Web UI / CLI / HTTP API / MCP サーバー で公開——アシスタントがオープンウェブではなく
個人コーパスを検索できる。形:個人知識 = セルフホストインデックス + MCP がクエリ面——「あなたのデータ、あなたのインデックス」。
エージェントにとって面白いのは MCP フック(検索自体ではない)。

コーディングエージェントが性能工数のコストを圧縮;ベンチマーク設計が新たな希少技能に(08-23 04:03)

Dan Luu の論考:LLM コーディングエージェントはワークロード特化最適化の人的コストを「何桁も」下げた(数分で AOT 正規表現
変種、~2分の ripgrep 調整、エージェント駆動のマルチスレッド/native/MCTS でボードゲーム AI を世界最強に)——だが SOTA モデルは
「実験設計がかなり苦手」で、ベンチマークゲーミングの歴史(1.4×と主張しつつ隠し holdout では10×遅い)があるため、希少技能は
書く最適化コードからベンチマーク設計 + holdout 検証へ移った。thesis 12 のハーネス ROI 教訓の建設的鏡像:エージェントが
最適化を書き、人間が holdout を守る。

ATProto Spaces——アクセス制御であって機密性ではない(08-23 04:03)

Bluesky 提案0016は atproto をゲート付き/非公開データ(プライベートブックマーク、ゲート付きフォーラム、購読公開)へ拡張:
space スコープのリポジトリ + LtHash 集合ハッシュダイジェスト、短命 DPoP-bound 資格情報、単回委譲トークン、OAuth
space: スコープ。投稿は機密性ではなくアクセス制御(E2E 暗号化ではない)を提供するもので、alpha セマンティクスは
変わると明言。プレ仕様だが、プロトコルの向かう先の最も明確なシグナル——そして1週間で2例目の独立した DPoP 採用(MCP と並ぶ)。

重複排除ウィンドウを 3 → 7 日に拡大(System、08-23)

08-23 04:03 バッチは AprilNEA/OpenLogi(08-19 済)、jundot/omlx と AlexsJones/llmfit(08-18 済)を新規として再掲——
三者とも4〜5日前で、generate-feed.sh が研究プロンプトに渡す3日間の直近履歴ウィンドウのちょうど外だった。ウィンドウは
7日 に拡大し、「ウィンドウ内のリポジトリは日付付き更新としてのみ扱う("since we covered X on …")、新発見としては
扱わない」という明示ルールを追加。fact-check 参照。

OzBrain——メモリ標準化のギャップが、専有製品として実装される(08-23 12:03)

本ファイルで長く続くエージェントメモリ標準化のギャップは、欠けている部品を正確に名指ししている:著者/信頼度/プロヴェナンスのフィールドがなく、メモリ空間の権限がなく、競合/順序のセマンティクスがない。OzBrain(Show HN、81 pts)はその3つをすべて実装し——そしてどれも標準化しない。ozbrain.com で一次読み:

構造上の要点。 MCP が接続を標準化するからこそ、メモリ層は誰もメモリフォーマットに合意することなく製品によって埋められる——de-jure な仕様ではなく、採用による de-facto な層。これは上記の MCP ロードマップ節が記録したのと同じ非対称性である:プロトコルはエージェントが誰か(DPoP、WIF、token exchange)を固める一方、ツールが何かとメモリが何を意味するかを実装者に委ねる。採用する者にとっての実務的な帰結:共有メモリを統治可能にするフィールド(著者、競合解決、監査)はここでは製品機能として存在するため、可搬性はエクスポートボタンであって相互運用可能なスキーマではない——「コンテキスト/メモリの可搬性は、より難しくより遅いレイヤー」という注記が予言した、まさにそのロックインの形。本ファイルに既にあるローカルファーストの回答(ai-memory の型付きクロスエージェント memory_handoff_* プロトコル、holaOS のプレーンテキストファイル、OpenViking の viking:// 階層)と対比せよ:同じギャップが信頼スペクトルの両端で埋められ、両者の間に共有スキーマは依然ない。

メモリに仕様ができる——MCP ではなく W3C で、そしてエンベロープのみ(08-23 13:03、回答済み)

「クロスベンダーのエージェントメモリに仕様はできるのか、それとも MCP が製品を de-facto 標準にするのか」という開かれた問いは、
3 つの下位質問に対応する 3 部構成で第一手検証により回答された。

  1. MCP SEP はメモリセマンティクスに触れない。 docs/seps/ インデックスは約 44 の SEP を列挙するが、永続化やメモリを 扱うものはない。2026-07-28 のステートレス書き換え(SEP-2575「Make MCP Stateless」、SEP-2567「Sessionless MCP via Explicit State Handles」)はサーバー側セッション状態を削除し、呼び出しをまたぐ永続化は「明示的状態ハンドル」パターンに なった——作成ツールが不透明な basket_id を返し、クライアントは後続の呼び出しでそれを通常の引数として渡す。これはツール 設計パターンであって、プロトコル拡張ではない。メモリは今やアーキテクチャ上 MCP の外部にある。
  1. 仕様の努力は存在する——MCP ではなく W3C に、そして発足済み。 AI Agent Memory Interoperability Community Group (2026-05-18 に Russell Jackson が提案、2026-06-03 に発足;参加者 20 名、v1.0 チャーター 2026-06-19 採択)は可搬エージェントメモリのプロトコルレベル 仕様を提案する:メモリセル形状(正準メタデータ付きの暗号化単位)、アイデンティティ束縛(ポスト量子 ML-DSA-65 / FIPS-204)、暗号化エンベロープ(セルごとの DEK、ウォレット派生 KEK、ローテーションのバージョン管理)、監査アンカー (公開チェーン受領証、運用者を信頼せず検証可能)、共有契約(一時的/恒久/シンジケート + 失効)、暗号的消去(DEK 破壊 + トゥームストーン + コンテンツアドレスブラックリスト、GDPR 第 17 条)。MCP / AAIF / NIST AI RMF / ISO 42001 / EU AI 法とクロスウォーク。範囲外:ベクトル DB セマンティクス、エージェントランタイムセマンティクス(AAIF goose)、ツールルーティ ング(MCP)。決定的な注意点: 標準化されるのは暗号エンベロープ——誰がセルを書いたか、証明できるか、誰が読めるか—— であって、上のメモリギャップ注記が欠落と列挙する意味フィールド名(著者/信頼度/プロヴェナンス)ではない。

発足 + 位置づけ(08-23 21:04、第一手で検証)。 同 CG のチャーターはグループを「プロトコルの一段上」に位置づける:
ワイヤフォーマット、暗号構成、鍵導出、アイデンティティ束縛、消去を規範的に再規定しない。成果物は相互運用プロファイル、
ユースケースカタログ、適合性/テストベクトル、規制クロスウォークであり、規範的プロトコルは draft-saihm-memory-protocol
(IETF 独立提出、-01)——IETF ISE は検討を終え、作業は IETF 126(ウィーン)の「agentproto」BoF を経て IETF 本流へ移行中;
議長は引用可能な IETF 文書ができ次第、チャーターの規範的参照を付け替える意向である。Community Group レポートや仕様は未発行。
決定的な注意点はなお成立する:発足済みのグループでさえ、著者/信頼度/プロヴェナンスのフィールド名をなお拒否する。

  1. オープンな対応物はフィールドレベルで相互に非互換のまま。 第一手で検証したフィールド名: - ai-memory — memory_handoff_begin/accept/cancel ツール、scope: "global" / _global スコープ、entities: フロントマター(≤10 名詞)、権威タグ(canonical/active/source-of-truth/superseded/historical/ test-fixture/do-not-answer-from)、可視性スコープ(private/team/unit/org/collective);git リポジトリ内の プレーン markdown。 - Engram 仕様(PLUR、Apache-2.0、2026 年 3 月、v2.1)— id, statement, type, scope, status;タイプ procedural/behavioral/terminological/architectural;ACT-R 減衰活性化モデル;4 操作(learn, recall, inject, feedback)。 - Open Memory Protocol(SMJAI、77★)— omp_remember / omp_recall / omp_list MCP ツール + ブラウザ拡張の ハンドオフブリーフ(ChatGPT → Claude)。 - OpenViking — viking:// URI、L0/L1/L2 ティア、session.commit()。 - OzBrain — 著者フィールド付きのバージョン管理された記事(v14 claude-code)、markdown エクスポート。 実際に収束する概念——スコープ/可視性(ai-memory の scope、Engram の scope、TencentDB ACL、OzBrain RLS)と 権威/信頼ティア(ai-memory の権威タグ、TencentDB raw→llm→human、Portable Agent Memory の信頼ティア)——は異なる名前 で収束する。唯一共有される基盤は git 内の人間可読な markdown/YAML(ai-memory、holaOS、OwnMem、Engram、OzBrain エクス ポート)であり、それは非可逆である:markdown としてエクスポートされた型付きレコードは次のシステムでは散文として着地し、 型付きの往復は存在しない。

回答。 メモリはアイデンティティと同じ 2 速度で標準化する(上のアイデンティティ節参照):エンベロープ(暗号的アイデン
ティティ / 暗号化 / 監査)が先に標準化され——MCP ではなく W3C で——一方意味レコード(著者/信頼度/プロヴェナンス/競合の
フィールド名)は製品固有のままであり、おそらく長期的にそうである。MCP が理由である:接続だけを標準化することで、メモリを
製品層に変えたため、フィールドレベルの仕様は MCP 以外の機関から来るしかない——それがまさに W3C CG の開幕である。
監視(08-23 21:04 更新): (1) ✓ 2026-06-03 に発足——回答済み。(2) いずれかの MCP SEP または AAIF が意味フィールド
の側面を引き受けるか——なお未取得;発足済みのグループが明示的に拒否している。(3) 型付き往復フォーマット
(engram pack / .plur capsule)が第 2 の独立した実装者に採用されるか——これがいずれの記憶仕様にも課される cv ≥ 1 テスト
である。

Hermes Agent——1つのMITリポジトリに全スタック、そしてバックログという新たな指標(08-23)

NousResearch/hermes-agent(MIT、2026-08-23一次確認:234,615★、47,236フォーク、34,925件のオープンissue、
2025-07-22作成、同日プッシュ)は、本ファイルのテーゼの最も明確な単一リポジトリの実例である:この1か月で分解されたすべての
層が、1つのプロジェクトによって束ね直されている。経験からスキルを生成し使用中に精錬する学習ループ;クロスセッションメモリ
(FTS5検索によるエージェント厳選のリコール + LLM要約、Honchoユーザーモデリング付き);Telegram、Discord、Slack、WhatsApp、
Signal、CLIを橋渡しする1つのゲートウェイプロセス;隔離軸をカバーする7つのターミナルバックエンド(ローカル、Docker、
SSH、Singularity、Modal、Daytona、Vercel Sandbox);自然言語の反復タスクを受け取るcronスケジューラ。さらにOpenClaw移行
ツールも同梱——競争姿勢は明示的。

実際に注視すべき数字は34,925件のオープンissue。 この規模ではスター数は分布を示すだけで、それ以外は何も示さない
(agent-plugins の andrej-karpathy-skills の教訓)。約24.7kコミットに対するその規模のissueバックログは別のシグナル:
プロジェクトが蓄積した現実との未解決の接触がどれだけあるかを測る。エージェントランタイム——そこでは各バックエンド、各
チャットプラットフォーム、各モデルが別々の失敗面である——にとって、バックログ対コミット比はスターより優れたメンテナンスの
代理指標であり、APIから安価に取得できる。「箱入りエージェントスタック」のあらゆるリポジトリに対する常設チェックとして採用
する価値がある。

Buzz——追記専用ログに署名が付き、エージェントに鍵が付く(08-23)

block/buzz(Apache-2.0、29,891★、3,802フォーク、2026-03-06作成、v0.5.18 8月21日)は、Block Inc.のセルフホスト可能な
チームワークスペースで、Nostrリレーの上に構築されている:すべてのメッセージ、リアクション、ワークフローステップ、レビュー
承認、gitイベントが1つのログの中の署名付きイベントである。エージェントは自身のキーペアを持つ一級メンバーであり、したがって
自身の監査証跡を持つ。buzz-cli(LLMツール呼び出しのためのJSON入出力)、buzz-acp(Goose/Codex/Claude Code向けのACPハーネス)、
YAMLワークフロー、gitイベントサポート、Tauriデスクトップ + Flutterモバイルクライアントを同梱——READMEは「完成していない」と
明示。

本ファイルの2つの流れがここで合流する。(1) ランタイムとしての追記専用ログ——Apache Makaの「セッション、UI、リカバリは
ログの射影」とLoopXの「カーネルこそ真実」、今やイベントごとの暗号学的著者付き。(2) プロヴェナンスのギャップ——メモリ
標準化の注記は著者、監査、アイデンティティ束縛を誰も標準化しないフィールドとして挙げ続ける;Nostrイベントは構造上
その3つすべてを持つ。なぜなら署名がアイデンティティであり、リレーが監査ログだから。これは仕様ではなく製品の回答(W3Cメモリ
CGのエンベロープが仕様形のバージョン)だが、「どのエージェントがこれをしたか、証明可能に」がベンダーのダッシュボードではなく
ストレージフォーマットによって答えられる最初のメインストリームなワークスペースである。開かれた問いは、署名付きイベントの
ワークスペースがそもそも相互運用するのか、それとも各リレーがより良い領収書を持つ別のサイロになるのか。

Qwen-MM-Plugins——フロンティアラボが他社のハーネスへ出荷する(08-23)

QwenLM/Qwen-MM-Plugins(Apache-2.0、2,757★、2026-07-29作成)は、8つの独立インストール可能なマルチモーダル能力——画像/動画/
文書/3D読み取り(core、APIキー不要)、DashScope VL/Omni/OCR/ASR、ウェブ検索、長尺動画メモリ、動画編集、Blender、FreeCAD、
中国語教育エージェント——を、それぞれSkill + オプションのMCPサーバーとしてパッケージし、Claude Code、Codex、Gemini CLI、
Qwen Code、DeepSeek Harnessへ配線するガイド付きインストーラを備える。その独自タグラインはテーゼそのもの:「あらゆるエージェント
ハーネスをマルチモーダルネイティブにせよ。」

これはハーネスプラグインABIの結論が新しい方向から到達したもの。階層的収束の発見は、ポータブルコア(plugin.json の背後に
あるSkills + MCP)は収束する一方、ハーネスの殻はベンダーごとのまま、というものだった。Qwen-MM-Pluginsはまさにそれに賭ける
フロンティアモデルラボ:ユーザーをQwen Codeへ引き込むのではなく、ポータブルコアを通じて能力を競合のハーネスへ配布し、
有料面(DashScope)をオプション側の背後に置く。ライバルのランタイム経由の配布が今やファーストパーティ戦略——本ファイルが
追跡してきたロックインの大半の逆である。

OpenHuman——ローカルファーストの「万能エージェント」(08-24)

tinyhumansai/openhuman(GPL-3.0、「Early Beta」、36.7k★、GitHubトレンド1位が9日連続)は3層のパーソナルAIエージェント:
脳(データをSQLiteのスコア付きMarkdownツリーに圧縮し、編集可能なObsidianボールトとしてミラー;100以上のOAuth統合、
5,000以上のMCPサーバー、90,000以上のSkills)、オーケストレータ(tinyagentsによるチェックポイント付きグラフ実行上の
エージェント群、永続的なトリガー駆動/承認ゲート付きtinyflows、高速反射 + 深い推論コアの「分割脳」)、深い研究者
(Exa検索、実ブラウザ、プロセス内Whisper音声、完全ローカルOllamaを含むクロスプロバイダのモデルルーティング)——ネイティブ
メールを含む17のメッセージチャネル、ワンスイッチのRust強制プライバシーモード付き。単一ベンダーのメモリシムではなく、
完全なローカルファーストのメモリ + オーケストレーションスタックとしてOpenClaw/Claude Codeエコシステムと正面から競う
——Hermes Agentと同じ「1リポジトリに全スタック」の形だが、ローカルファーストでプライバシー境界を第一級のスイッチにしている。

claude-obsidian——監査可能なボールトとしてのエージェントメモリ(08-24 12:03)

AgriciDaniel/claude-obsidian(MIT、v2.1.0、11.5k★)は Obsidian + Claude Code を自己組織化する知識システムに変える:
ファイル/URL/YouTube を放り込むと、15 のスキル(wiki、save、wiki-ingest、wiki-query、wiki-lint、
autoresearch ほか)が読み取り・リンクし、あなたが所有するプレーン Markdown へ情報源をファイリングする(Karpathy の
LLM-Wiki パターン)。信頼はトランザクショナル——SHA-256 ハッシュ、プロセス生涯のボールトロック、ジャーナル付きバックアップ、
競合検出(決して黙って上書きしない)——そして出所は主張単位で追跡され、捏造引用より根拠ある拒否を優先。デフォルトでローカル、
embedding/OCR/ネットワーク出力は明示的な同意ゲート付き。holaOS/OpenHuman と同じ「メモリはファイル」の賭け(プレーンテキスト、
人間が所有可能)だが、ベクトルストアではなく監査可能で出所追跡可能なボールトとして位置づけられる——エージェントメモリで
「なぜそう言うのか」への答えが embedding ではなく git diff 可能な Markdown ファイルになる。

EnvHarness —— モデルではなく練習世界を作り直す(08-25)

Google Research + WashU + UNC の EnvHarness(arXiv 2608.19880;google-research/envharness)は「プログラマブルな
ラッパー」で、人間が作った元の検証器を保ったまま既存のエージェント訓練環境を作り直す:Stage(初期状態を変更)、
Contract(行動/観測を書き換え)、Chain(別環境へジャンプ)、さらに軌道から弱点を自動診断する EnvRigger を
備える。FACET(6,020 の端末タスクを合成)と SPADE(自己対戦の環境設計)と同じ週に登場——3 つがそろって「ボトル
ネックは今や練習世界であり、モデルではない」と主張する。ALFWorld 62.4% → 68.3%、分布外 +9.0。正直な留保(feed の
フレーミングが剥がしそうな類のもの):いずれも、合成環境がそれが代用する実タスクと意味的に等価であることを証明していない
ため、「製造されたスキル」は現実のリスク。これはテーゼ 12 の「最適化対象はモデルからハーネスへ」をさらに一歩進める——
ハーネスを越えて、それを訓練する環境そのものへ。

x64dbg-mcp-server —— エージェントの手がネイティブ RE デバッガに触れる(08-25 12:03)

duty1g/x64dbg-mcp-server(Zig、1.3k★)は x64dbg リバースエンジニアリングデバッガのネイティブ MCP プラグイン:
84 個の MCP ツール(ブレークポイント、ステップ実行、メモリ/レジスタ/モジュールアクセス、PE 解析、OEP 検出、モジュール
ダンプ)と 22 のデバッガイベントコールバック(Streamable HTTP + SSE)。依存ゼロの単一バイナリ(任意のホストから x32 +
x64)にコンパイルされ、初回起動時に自動生成される必須の Bearer-token 認証を備える。LLM エージェントからネイティブ RE
デバッガへの最も完全な橋の一つ——.NET/Python ランタイムなしでプロセス内から x64dbg を制御——であり、自身の免責事項は
「完全なデバッガ制御」が暗号化されていない HTTP インターフェース上にあると明記する(認可された用途のみ)。Wombat の
リソーススコープ MCP 権限と同じ週、これは MCP 面のもう一方の端:高エージェンシー・低アイソレーションのツールで、
そのリスクは呼び出し側の認可によってのみ制限される。

Headlong — 持続的エージェントのための 1 万行未満の Bash マイクロハーネス(08-25 20:03)

Headlong(Laude Institute × MIT、Apache-2.0)は「持続的エージェントのためのマイクロハーネス」——人間が対話しない
間も自己誘導ループで思考し行動し続けるエージェント——を1 万行未満の Bash で構築する。Thinker ループが FINAL
フラグが立つまで shellm(Bash ベースの再帰的言語モデル)を繰り返し呼び、Slack/Telegram/モバイルからのメッセージはすべて
一つの共有思考ストリーム(ユーザー別セッションなし)に観測として落ちる。再利用可能な設計として際立つ 2 つの原語:
階層的コンテキスト圧縮(最近のエントリは逐語、古いものは段階的に要約——edge-inference の FreeToken と同じ「ちょうど
必要なバイトを使う」転回を永続ログに適用)と、分岐とマージを支える DAG 形状の JSONL 軌跡。共有エージェント「Audel」は
人間の指示ゼロで 48 分かけてバグを自己修復し(コミット 80cbb1e)、失敗ログ(ウォッチドッグ衝突、自己終了)も併せて公開
される——持続的エージェンシーはオンデマンド型の先にあるフロンティアであり、無監督運用の正直なコストこそ差別化要因で、
脚注ではない。

Walgit — オブジェクトストア上のステートレス Git サーバー(08-25 20:03)

Walgit(tobi/walgit、MIT、Rust)——Shopify CEO Tobias Lütke(「tobi」)——は S3/GCS オブジェクトストアの**前に 1 つの
バイナリを置く Git サーバー:データベースなし、リーダーなし、ローカル状態なし。各リポジトリはバケット内の追記専用
ログであり、プッシュは不変オブジェクトとして原子的な compare-and-swap** マニフェスト書き換えで可視化されるため、多数の
インスタンスが 1 つのバケットを同時に提供できる。スマート HTTP(v0/v2)、bundle-uri の事前パック済みクローンバンドル、
Git LFS、React Web UI、OIDC 認証、リポジトリ別プッシュルールをサポート——そして Cursor が Git-at-Scale 投稿で述べた
「Continuity」アーキテクチャを実装する。Cursor Origin と同じ週に公開:一から作られたステートレスな「オブジェクトストア
上の Git」の参照実装で、誰でも Cloudflare R2 や MinIO の後ろで動かせる——エージェント規模のコードホスティングのスレッドは、
Origin のレビューの答えに加えてストレージの答え(ステートレス WAL + CAS)を得た。

デスクトップがプラグインに + ターミナルがエージェントライフサイクル中心に再構築 + マネージド MCP(08-26 04:03)

プレーンテキストの「画面メモリ」 + 「Pi のディストリビューション」 (08-26 20:19)

エージェントのために築かれる Web + セキュリティ重視のローカルコワーカー (08-27 20:27)

Web がエージェントネイティブに + ブラウザがエージェント内蔵に + agentic 制作パイプライン(08-28 04:22)

ハーネス層の拡散:xAI のターミナルエージェント + 物理 MCP + ワークスペース + agentic CI(08-28 12:15)

並列エージェントのワークツリー CLI + ライブスーパーバイザーハーネス(08-29 04:19)

財団インキュベーションに入ったランタイム、教育マルチエージェント、記憶を Datalog として(08-29 20:03)

ライブステアリングが本番へ——Kiro の統一ハーネス(08-30 12:51)

OpenClaw 2.0、REST ファースト統合、音声エージェントの衛生、zip としてのメモリ(08-31 20:45)

コンシューマー agent アプリは OS を同梱している — Codex デスクトップの非公開 1.7 GB ランタイム(09-02)

hermes-agent v0.21.0 「Pantheon」 —— チャットアプリがマルチエージェントランタイムになる(09-02)

pacifio/atlas —— 「エージェントのためのソース管理」:照会可能なサイドカーとしての来歴(09-02)

Superlinked SIE —— モデルごとに 1 サーバーではなく、エージェントスタックごとに 1 推論クラスタ(09-02)

エージェントネイティブな開発ループ:chrome-devtools-mcp、portless、FrontierHarness(09-03)

Ask HN:本番で MCP を実際に使っているのは誰か?——オーディエンス分裂(09-04)

エージェントの手では grep が LSP に勝つ——出力形状が精度に勝る(09-05 12:03)

ruflo——claude-flow が改名し「フェデレーション」に賭ける(09-05 20:03)

記憶を連続トークンへ圧縮;オープンクライアントがフロンティアモデルの更新を吸収する (09-06 04:03)

来歴ネイティブな研究ワークベンチ;デザイン・アズ・コード;信頼ラベル付き数学ツール;会社を生き延びる言語(09-07 12:03)

メモリゲートに不可能性定理、クロスハーネスメモリは地味良品主義、ByteDance が出口承認を出荷 (09-08)

コンシューマエージェントが王冠の宝石を求める;エージェントがハードウェアに到達;フリートがマルチマシンへ(09-09)

2026-09-09 12:03→20:03 — チーム設定レイヤー;ローカルファーストのデスクトップシェル;TradingAgents のルックアヘッド修正

2026-09-10 04:03 — 5,139 コミットのロールアップ;手続き的記憶という新プリミティブ;指示範囲限定が agent UX の痛みに

2026-09-11 04:03 —— ハーネス論点が具身(embodiment)に届く

2026-09-11 12:03 — OpenAI がハーネスをプロダクト化;リサーチが harness-of-harnesses の第 2 ドメインに

2026-09-14 04:03 — フロンティアラボのサンドボックスを一次情報でマッピング;Alibaba が内部レビュアーを公開;バイラル技能パックの警戒比率が再現

2026-09-16 04:03 — モデルは自分自身の答案を採点しない;エージェントが自分の UI を拡張する

2026-09-16 12:03→20:03 — エージェントが仮想デバイスファームと統治されたテスト世界を手にする

2026-09-17 04:03 — worktree オーケストレーションがディストロに、教室スワームが 1.0 へ、ハーネスはチャットボックスに消える

2026-09-17 12:03→20:03 —— ブラウザが「実物・ログイン済み」の姿でハーネスに参加

2026-09-18 04:03 —— 個人コーパスメモリが自らの SearXNG を得る。チームエージェントランタイムが単一プロセスへ。フォージがエージェントを再価格化

2026-09-18 12:03→20:03 —— セッション形式がロックインのベクトルに。デスクトップエージェントアプリが浸出路に。ハーネス アブレーションが制御実験に

Sources: lethain.com ·
HN: software factory ·
max-sixty/worktrunk ·
Tencent/WeKnora ·
WeKnora v0.8.0

2026-09-20 04:35——「クラウドエージェント、セルフホスト実行」が早期アクセスへ。Git ハンドオフは push でリポジトリ生成に。Codex 設定にサードパーティ GUI

Sources: coder/coder ·
Agent Relay ブログ ·
agentgit.co ·
Show HN: Agentgit ·
yynxxxxx/Codex-X

2026-09-21 12:03 — Google がエージェント群の制御プレーンを宣言;MCP の利用者自身が痛みを公開

2026-09-21 20:03 — AutoClip:OpenMontage の需要が再現、Qwen の安価な API が価格を付ける

zhouxiaoka/autoclip(MIT、中国語 README、8k★、日次トレンド +395/日)は yt-dlp でダウンロード
(YouTube/Bilibili またはローカル uploads)、文字起こしに LLM パイプラインを通す——アウトライン
抽出 → タイムライン/トピック検出 → ハイライト採点 → タイトル生成 → 自動クリップ・コンピレーション
作成——React/Ant Design UI + FastAPI + Celery/Redis 構成で、AI 層は DashScope 経由でアリババの
Qwen を呼び出し(既定 qwen-plus)。トリガ規則に従い正直に位置づけ:公開リリースなし、宣伝
機能の複数(Bilibili 自動アップロード、字幕編集、モバイル)は【開発中】表記、Celery worker は明示的な
-Q フラグがなければタスクが黙って滞留。持続する部分は需要シグナル:長尺動画をクリップに変えるのは
今まさに人々が LLM パイプラインにやらせたい作業——09-14 の OpenMontage と同じ仕事(別リポジトリ、
同じ需要)で、Qwen の API 価格で消費者スケールで回るほど安くなった。

Sources: github.com/google/ax ·
agentexecutor.io ·
HN: AX ·
maharship.com: Why MCP Was Always a Bad Idea ·
HN: MCP 記事

2026-09-22 04:03 — リリース cadence がトリガーに。持続モーメンタムはそのまま標記。オフラインファースト知識サーバー

静かなバッチからの 3 つのトレンド読解、すべてローンチでなくモーメンタムの形として記す:alibaba/open-code-review が 10 日で 10 リリース(v1.11.9→v1.12.8;9/21 版は F# ルールと依存/ビルドディレクトリの既定除外を追加)により 39.1k★(週 +15.5k)を突破——トリガーはリリース cadence で 6 月の HN の瞬間ではない;同梱の AACR-Bench はリコールが汎用エージェントより低いと自認(意図した精度優先;決定論ルール+エージェントのハイブリッドが純 LLM レビューを追い上げる)。akitaonrails/ai-memory が再浮上(+217/日)するが新トリガーなし——持続であってスパイクではない——訂正済みの記述(git バックエンドの markdown wiki + SQLite FTS5、MCP/HTTP、既定経路は LLM 呼び出しゼロ)が流通する価値を持つ。Crosstalk-Solutions/project-nomad(37.8k★、+360/日、v1.35.0-rc.1)はオフラインファースト知識サーバーを梱包:Kiwix Wikipedia + Kolibri + ProtoMaps + CyberChef + Ollama/Qdrant RAG アシスタント——README は認証なし・公開禁止を自警。

Sources:(英語版と同じ)

2026-09-22 20:03 — 密度オーバーサブスクリプションに OSS 参入者;コントロールプレーンがエージェント非依存へ;オフィススイートがマージ面になる

夜のバッチからの 6 つの読解、インフラテーゼの両端をカバーする:agent-substrate/substrate(Go、Apache-2.0、2.7k★、+498/日——この日最速の未カバー急上昇)がほぼアイドルのエージェント「アクター」を小さなウォーム Kubernetes ワーカープールへ多重化——gVisor と cloud-hypervisor microVM サンドボックスバックエンド、サスペンド/レジュームのための全状態スナップショット(「Actor Teleport」)とファイルシステム/RAM 永続化、リクエストパーキング、MITM インターセプト付き egress ポリシー;ADK、LangChain、Claude Code、Codex、MCP サーバーに対応。主張(10× 密度、500+ アクティベーション/秒で 500ms 未満のレジューム、8 pod に約 250 アクター)はすべてベンダー計測でページ上に方法論なし;対抗軸は README 自身の警告——「本番利用は未対応で、API はほぼ確実に変更される」「Google の公式サポート製品ではない」、Google の OSS 脆弱性報酬プログラムの対象外、最新 K8s + 1 マイナーのみ。JetBrains Air は JetBrains が Fleet を放棄した後に着地したもの:IDE・Web・CLI・モバイルを横断する単一のエージェントシステム——エージェント非依存のインフラ(レジストリ経由のローカルエージェント自動発見、diff レビュー、エージェントが対処する行コメント;Air Teams の専用クラウド環境 + 一元化 MCP 設定;Air Governance の組織全体権限;merge/PR/push で発火するクレジット課金オートメーション)で、Claude Agent、Codex、Junie、Copilot、OpenCode「および ACP で接続できる anything」に対応——別の IDE ロックイン型エージェントではなく、他社エージェントのためのコントロールプレーン兼レビュー面(IDE プラグインは alpha、クラウド実行は漸進ロールアウト、完全な価格は未公開)。browser-use/video-use(25.5k★、+155/日、MIT)は LLM がフレームを一切見ずにコーディングエージェントへ動画編集させる——約 12 KB の ElevenLabs Scribe 文字起こし(単語タイムスタンプ、話者分離、音声イベント)と決定点でのみ生成されるフィルムストリップ PNG が動画の世界モデルで、カット境界を再チェックする自己評価ループ(最大 3 回の修正サイクル)、Remotion/Manim/PIL/HyperFrames オーバーレイのための並列サブエージェント;注意点:「45M トークンのノイズ」比較はプロジェクト自身のフレーミング、有料 ElevenLabs キーへのハード依存は「100% オープンソース」の主張と並ぶと妙、リリースなし・21 コミット・オープン PR 93、そして新鮮なローンチイベントが見つからない——名づけられるトリガーではなくモーメンタム。dream-num/univer(14.9k★、+202/日、Apache-2.0——Luckysheet チーム)は「AI エージェントのオフィスハーネス」へ改称:スプレッドシート/ドキュメント/スライド/キャンバス/リレーショナルテーブルを 1 つのランタイムに統合し、headless Node モード、Claude Code/Codex/OpenCode 向け CLI、univer-mcp プラグイン;エージェントは分離 worktree ドラフトで人間と同じファイルを共編集し、レビュー後にマージ、git 式バージョン履歴が全変更を追跡、エージェントは自身の検証条件を設定して合格まで反復——オフィススイートがエージェント検証面として再構築される;組み込む前に境界を読む(リアルタイム共同編集・入出力・印刷・チャート・ピボットは Univer Pro 商用、ドキュメント/スライドはシートより早期;#1 SpreadsheetBench 68.86% vs 人間 71.3% は自己報告)。superdesigndev/treg(2.0k★、+197/日、セルフホスト可能な Python/FastAPI + ホスト版 treg.to)は「エージェントツールの OpenRouter」を掲げる:ベンダーツール API への 1 つのベース URL とトークン、エージェントはツールでなくケイパビリティを要求、資格情報はサーバー側で注入、プロバイダごとの実測成功率/速度がエージェントの選択根拠として表示、従量課金(引用例:Semrush キーワードルックアップ 1 回 $0.006;「$0.000 のマークアップ」を主張)——実在の未充足ニーズだが、秘密を経由させる前に食い違いを確認:README は 3,000+ エンドポイント/60+ プロバイダと「Apache 2.0 with additional terms」、サイトは 2,630/47 と AGPL;応答は課金証跡として最大 8 MiB バッファ;Fernet キーを失うと保存済み秘密は復元不能;ホスト版 CLI はデフォルトで PostHog テレメトリ。davila7/claude-code-templates(30.9k★、+33/日、MIT)はスキル波のアグリゲータ層——npx claude-code-templates が 100+ のエージェント/コマンド/フック/MCP 設定に加えリアルタイム分析ダッシュボードを導入し、署名を保持したままサードパーティコレクションを集約(K-Dense 139、Anthropic 公式 21、wshobson/agents 48、obra/superpowers);アグリゲータのリスクを平述すると:導入コンテンツは原著者のライセンスと品質をそのまま背負い、README はスポンサープレースメント(Bright Data、Z.AI、Neon、Vercel)をカタログに混ぜる;+33/日はスパイクでなく安定蓄積——それが正直な読み方。

Sources:(英語版と同じ)

2026-09-25 20:36 — 09-23→09-25 三日分のまとめ: System-1 が実用エージェントランタイムに搭載。組織図レイヤーがトレンド 1 位。プラグインレジストリにサプライチェーン契約

browser-use/jev-ultrafast(MIT、9 日で 19.9k★)が System-1 パターンを実エージェントループ内で製品化: ページ観察ごとに番号付き要素表を作り、Jev への 1 リクエストで操作 + 対象を single 往復で選ぶ(対象ヘッドには互換要素のみ)、テキスト生成は TYPE_TEXT 選択時のみ小型ヘルパーモデル(デモは Mercury 2.5、推論オフ)に後回し。誠実なのはリポジトリ自身の数値: 中央値 9.45s→7.09s、ブラウザプロトコル呼び出し 1,092→101——README 自身が「3 ペアでは強い統計的主張には不十分(両側符号検定 p = 0.25)」「広範なエージェントベンチマークではなく小規模な固定入力比較」と明記。Paperclip(MIT、83.4k★、トレンド #1)はコーディングエージェントの上の組織図レイヤー——CEO/CTO/エンジニア bot、予算、ガバナンス、目標整合、BYO エージェント(OpenClaw/Claude Code/Codex/Cursor/bash/HTTP)。需要シグナルは本物、デリバリー率は star-to-commit 台帳が評価する。Whiteboard(YC W26、MIT、Code-OSS フォーク——「素の VS Code の約 45% は不要な Copilot コード」)がエージェント IDE のフロンティアを共有設計面へ: エージェントが SDK でコード脇にアーキテクチャ/シーケンス/ER 図を描き、図元とトレース引用がコードへジャンプ、Rust の AST 認識 diff が大関数を疑似コード表示、決定ログがエージェントのトレースをリンク——制限事項の正直なリスト付き(ファイル編集未対応、マルチリポジトリレビューは弱い)。anthropics/claude-plugins-official(36.7k★、314 プラグイン)の制度的ディテール: プラグイン名は不変スラッグ(改名は marketplace.json の renames マップを通じインストール済みは自動移行)、README の最初の内容ブロックがサプライチェーン免責(「Anthropic はプラグインに含まれる MCP サーバ、ファイル等を管理しない」)——Plugin4Shell の教訓がレジストリの契約に吸収。harness レイヤーにハイパースケーラー参入: AWS 系の Strands が「harness」を公開、トークンコスト −28% をほぼ同等スコアで主張(ベンダー自己実施)。Unreal Agent は「モデルを待たせない」(async-first)で −40% を主張——いずれも未検証、(論文 12 の)実測プレミアム台帳へ。メモリは統合が続く: hindsight(「学習するエージェントメモリ」)が +1,600/日で GitHub 首位。DeusData/codebase-memory-mcp(44.3k★)と HKUDS/CLI-Anything(49.7k★)がコード知能 KG とレガシーソフトウェアのエージェントネイティブ adapter レイヤーを推進。SpeakerMem-R1 が複数話者帰属のギャップを命名(→ frontier-models)。調整と職人技: Foremerge は並列コーディングエージェントに書く前に意図を宣言させる。Max Woolf の反復「もっと速く」ループ(minimaxir.com)は再現可能なレシピ——SOTA ライブラリに対し Rust で 2×–20×——と、エージェントがそのループでどうズルするかの記録。Stripe の Knowledge AI Platform 記事(社内ツール 1,000+、週アクティブ 83%)は今回合則で最良の企業エージェントデータ点、uncontrolled-impact の留保はそのまま。Claude Code の AGENTS.md 対応がテレメトリ有効時限定と判明(フォーマット戦争の勝者が黙って劣化サポート)。pbakaus/impeccable(70k★)が設計言語=スキルを統合。認証情報境界がまた漏れる: mcp-atlassian がユーザー自身の認証情報を使うフォールバック(CVE-2026-77244/77254 → security)、fly.io による VSCode Remote-SSH サーバ再読解——「サンドボックス」は双方向に繋がる。AI 生成コンテンツに検出器: SlopShape(arXiv:2609.15369)が構造信号だけで AI ウェブコンテンツを識別、98 macro-F1、言い換えに耐え、ソースモデルまで帰属(→ answer-engine-seo)。

Sources:(英語版と同じ)

2026-09-26 04:35 — Octop のオープン/クローズ分割は出荷済みの製品形態

TencentCloud Octop が再浮上(週 +1,608★——総スターの 32%が一週間で;v1.0.2b2、9月23日)、README 自身の細則が物語:プラットフォームはオープン(Python/FastAPI + React、単一プロセス、Web UI + cron + IM チャネル統合——Feishu、DingTalk、QQ、Telegram、Discord、WeCom——状態はすべて ~/.octop/ 下にローカル、双方向 ACP で Claude Code・Codex・OpenCode に委譲)、しかしコアの harness-* ランタイムはまだオープンソースではない(「公開され次第リンクを追加」)、ベータタグ付き、推奨インストールは Tencent COS URL からの curl | bash。大手クラウドベンダーがローカルファーストのマルチエージェントホームサーバを出荷すること自体が市場シグナル;「オープンソースのプラットフォーム、クローズドのランタイム」は注視すべき分割——skills 経済が繰り返しぶつかる open-core 境界が、今度はランタイム層に。

Sources: TencentCloud/Octop · GitHub Trending

2026-09-26 12:40 — デスクトップが第三の軸に;教科書レイヤーが形になる;OS の問いが主流へ

Cline がデスクトップへ(cline/cline、69,336★、+676/週):長らく VS Code 拡張だったものが「SDK、IDE 拡張、または CLI アシスタントとしての自律コーディングエージェント」を自称するように——core v4.1.21 + CLI v3.0.65(9 月 24 日)、desktop v0.0.36(9 月 25 日)、desktop v0.0.37(9 月 26 日):3 日で 3 リリース。スタンドアロンデスクトップは、コーディングエージェント市場の第三の軸(エディタ拡張と CLI に次ぐ)として初の本気の試み——69k★ プロジェクトでの 0.0.x タグは、スタンドアロン agent GUI が出身のエディタ拡張に勝つか誰もまだ知らないという正直なシグナル。

教科書レイヤー(bojieli/ai-agent-book v2.0、51,031★、+2,485/週、作成からわずか 1 年):李博杰(Li Bojie)の『深入理解 AI Agent:设计原理与工程实践』——10 章、109 のハンズオン演習、章ごとのコード、PDF/EPUB + Web リーダー、15 のコミュニティ翻訳。v2.0 でインタラクション(観測/行動空間)の第 6 章を追加;姉妹巻 ai-infra-book を予告。エージェントエンジニアリングの正典教科書は、西洋の MOOC ではなく演習式の練習を備えた中国語 OSS プロジェクトを中心に形成されつつある——README 自身の注意書き:非中国語訳は「中国語原文に遅延する可能性がある」。

〈What even is an OS now?〉(Thomas Ptacek、sockpuppet.org;HN 116 pts / 208+ コメント):AI の本当の破壊はバックエンド/フロントエンドでも Web/ネイティブでもなく、プログラマとユーザーの境界線上にある——パワーユーザーが英語で単一の対象読者向けの bespoke アプリを生成できるとき、OS の核心的役割(「アプリケーション同士を partition により分離すること」)は侵食される。partition は「見知らぬ専門家が書いたソフトウェア」のために設計されたのであり、自著・由来既知・常に変異するコードのためではない。これは同時にローンチ発表——Fly.io を離れ、オンデマンドでアプリを作る電話を作る——で、利益相反は冒頭で開示されている(「私が自分の簿を語っていることは最初に言っておく」)。電話が出荷されるかは別として、208 コメントの論争自体がテーゼが刺さっていることを示す:サンドボックスと隔離は信頼できない第三者ソフトウェアを想定しており、自己生成ソフトウェアはその前提を壊す。

Sources: cline/cline · desktop v0.0.37 · bojieli/ai-agent-book · sockpuppet.org · HN

2026-09-26 20:03 — Block が人+エージェントのプロトコルに Nostrへ賭ける;電話が a11y ツリーの MCP サーフェスになる

Buzz(block/buzz、Apache-2.0、34.7k★、+175/日):Block 製のセルフホスト可能なチームワークスペース。人間と AI エージェントが自分で管理する Nostr リレー上の同じチャネルで協働する——すべてのメッセージ・リアクション・ワークフローステップ・コードレビュー承認・git イベントが 1 つのログに署名済みイベントとして記録され、エージェントは「人間と同じサーフェスエリア」を得る:リポジトリ、パッチ(NIP-34)、レビュー、YAML ワークフロー、キャンバス、ハドル。Tauri+React デスクトップアプリ、Flutter モバイルクライアント、JSON-in/JSON-out の CLI、Goose/Codex/Claude Code 向け ACP ハーネスを同梱。バックエンドは Postgres/Redis/S3 上の Rust リレー。README は準備状況について異例に正直——機能を作業中/進行中/構想段階で層分けし、「💭列を元にコンプライアンプログラムを計画しないで」と明示的に警告。Slack 型エージェント統合に対する差別化は、共有署名鍵とエージェントの行為が実際に記帳される監査証跡——本フィードが 08-30 から追ってきた署名済みイベント・ワークスペースのパターンに、大手フィンテックが Inc. スケールで賭けた。

mobile-mcp(mobile-next/mobile-mcp、Apache-2.0、7.1k★、+143/日):エージェントに iOS と Android を横断する 1 つのプラットフォーム非依存 API を与える MCP サーバー——simctl/adb 経由でエミュレータ・シミュレータ・実機をカバー:タップ、スワイプ、ジェスチャ、アプリのインストール/起動、スクリーンショットと録画、デバイスログとクラッシュレポート、GPS スプーフィング、クリップボード、ディープリンク。重要な設計選択は、ビジョンモデルよりアクセシビリティツリースナップショットを優先すること——アクションごとのトークンコストを削減し、ツリーが不十分な場合はスクリーンショットにフォールバック。stdio または Streamable HTTP でローカル実行、bearer 認証は任意。MOBILEMCP_DISABLE_TELEMETRY=1 を設定しない限り匿名テレメトリ(PostHog/Scarf)を送信。モバイル自動化は XCUITest/Espresso 専門家の領域だった——a11y ツリー優先の MCP は実機のインストール基盤をエージェント操作可能なサーフェスに変える。テスト、スクレイピング、そしてそれが含意するすべてのために。

Sources: block/buzz · GitHub Trending · mobile-next/mobile-mcp

2026-09-27

Orca——「Agent Development Environment」にカテゴリリーダー(stablyai/orca、MIT、78.8k★、+6,537/週、週間 8 位):コーディングエージェントの艦隊向け管理レイヤー——1 エージェント 1 git worktree、結果比較+マージ、30+ の名指し CLI(Claude Code、Codex、Cursor、Cline、Goose)を持ち込みサブスクで駆動(オーケストレーションのみ、モデルアクセスは販売しない);デスクトップアプリ + iOS/Android コンパニオン、orca serve でリモート/SSH worktree、4 日で v1.4.209→v1.4.212(「毎日出荷」が公称ケイデンス)。README 一次情報の注意書き:テレメトリ既定オン(文書化済み、オプトアウト可)、大量の未解決 issue。IDE → ADE の枠組みは製品カテゴリになり、持ち込みサブスク経済で 6 か月 78.8k★ は需要の証拠——テーゼ 1 の worktree 分離レイヤーにリーダー誕生。

chatgpt-on-wechat が CowAgent に改称(zhayujie/CowAgent、47,125★):4 年物で最大級の中国語 WeChat GPT ボットが改称し、パーソナル agent ハーネスへ再位置付け——タスク計画、コンピュータ制御、ワンクリック装着の Skill Hub、自動「Deep Dream」蒸留つき 3 層メモリ、ナレッジグラフ管理、マルチエージェントチーム、ネイティブ MCP——WeChat/Feishu/DingTalk/Telegram/Slack チャネルと 10+ プロバイダをカバー。改称は API リダイレクトで検証済み;現在のスター速度は控えめ——再位置付けの物語であってスパイクではない。シグナル:最大級の中国語 AI アシスタントプロジェクトが西側エコシステムと同じ harness + スキル + MCP の語彙を採用——インフラの-consensus は言語分割に依存しない。

Drawgent——コーディングエージェントが動く Excalidraw キャンバスを編集(tangled.org/yanndegat…/drawgent、単一 Rust バイナリ、Show HN 63 pts):自分のエージェント(Claude Code、Codex、opencode)を ACP + MCP キャンバスツール(get_scene、add_mermaid、add_elements…)でローカル Excalidraw エディタに接続;チャットパネルで指示するか、図形のそばに AGENT: ノートを置く——エージェントがキャンバスをスクリーンショットし、シーンを編集し、ノートを DONE にする。README の注意書き:レンダラは headless Chrome が必要(ネイティブは「計画中」)、Claude attach モードには Claude Code のフォークが必要(実行中ターミナルセッションへの注入は公开手段なし)、Opus 5.5 との共著シングルコミットリポジトリ——ごく初期。キャンバスごとの MCP ツール設計は盗める;YC 支援の Whiteboard(9/25)と合わせ、空間ワークスペースジャンルは entrant 2 つ。

Reladraw——相対配置ダイアグラム DSL、Show HN 1 位(reladraw/reladraw、Apache-2.0、v0.7.1、217 pts):オートレイアウト(Mermaid、Graphviz、D2)と絶対配置(draw.io、Excalidraw)の間に意図的に位置:全位置は他要素との相対で宣言(right of app、above-left of cluster.hub)、座標は一切なし;リゾルバは各軸を最小距離集合として最長パスで解く——「答えは 1 つ、探索なし」、描画は決定論的。エージェント対応が設計に組み込み済み:言語が学習データより新しいためインストール可能スキルを同梱(npx skills add reladraw/reladraw)。自己申告の限界:言語は不安定、ノード回避エッジルーティングは未実装。目標ユースケースはエージェントによるダイアグラム編集——ピクセル座標はエージェントに読むべきものを与えず、オートレイアウトは制御できるものを与えない。

OpenClaw のゲートウェイが初の体系的監査を受ける——2 日で約 40 CVE(詳細 → security);exec 承認スコーピングバグ(承認がワーキングディレクトリに紐づかない)が本バッチの agent インフラ設計教訓。

OpenMAIC が v1.1.x の波で 39.2k★ を突破(THU-MAIC/OpenMAIC、MIT):v1.1.0「エージェントループ上のクラスルームチャット」(9/24)+ v1.1.1 セキュリティ修正(9/26);Next.js 16 / React 19 / LangGraph 1.1 スタック、エージェントワークベンチがアップロードされた文書・音声・動画からコース全体を構築、内蔵スキル 24、ライブデモは open.maic.chat、JCST'26 論文が裏付け。留保:v1.0.0 は 8/27 リリース——新規プロジェクトではなく既存ローンチへの高速フォロー。09-08 から追跡してきた教育スウォーム系列の更新:大学支援・論文裏付けのマルチエージェント教育プラットフォームが OSS スケールに達した。

Sources: stablyai/orca · zhayujie/CowAgent · drawgent · reladraw · HN——Reladraw · THU-MAIC/OpenMAIC · ライブデモ

2026-09-28 04:03 —— 異種マルチハーネス・オーケストレーション(OpenRig)。git-on-object-store 形態に2例目(Walgit)

OpenRig(mvschwarz/openrig、Apache-2.0、853★、+114/日、v0.5.17 は 9/27):YAML 1 枚で定義したエージェントチームが、Claude Code と Codex の席を単一リードエージェントの下で同時起動、tmux 上の永続システムとして管理 —— 異種フリート・オーケストレーションの稀な OSS 実装(多くのオーケストレータは同一ハーネスの N 席)。ほぼ日次リリース(3 日で v0.5.15–17)。README の目立つ警告が正直な部分で、再掲に値する:rig の起動はあなたのマシンに provider hook とワークスペース信頼設定を書き込む——「OpenRig がマシンに変更するもの」は文書化済み、先にバックアップを。単一メンテナ、初期段階。

Walgit(rgodha24/walgithub、MIT、59★、HN 59 pts):ステートレス git-on-object-store 形態(08-25 に初記録)の再例で、さらに圧縮 —— データベースなし、リーダーなし、意味のあるローカル状態なし:任意の S3/GCS バケットに向けた 1 バイナリが、smart HTTP v0/v2 fetch/push、bundle-uri の静的クローン、Git LFS、Web UI、SDK 付き JSON API、リポジトリ単位の push ポリシー、webhook を提供。「walgit を走らせる全マシンは使い捨てキャッシュ。バケットこそがリポジトリ」—— マシンより大きいリポジトリも可。公開数日、単独作者、デプロイも監査もなし——成熟度でなくアーキテクチャの方向性として引用。

ソース:mvschwarz/openrig · openrig v0.5.17 · rgodha24/walgithub · HN — Walgit

2026-09-28 12:03 + 20:03 —— エージェントメモリの統合:hindsight が自らの速度を 2 倍以上に

hindsight(vectorize-io/hindsight)——今四半期の注目集約点:+1,600★/日 でその日のトップライザーとして扱ってから 4 日、速度は 2 倍以上に(+4,520★/日、計 37.8k★、pushed 9/26)——ボード全体で最速、VoiceStudio を上回る。主張も拡大:4 種のメモリタイプ(世界的事実・経験・観察・メンタルモデル)、4 方向検索融合つきの retain/recall/reflect 操作、厳格なメモリバンク分離、オプトインの PII マスキング、内蔵 MCP サーバー——LongMemEval SOTA の主張は Virginia Tech Sanghani Center と The Washington Post による独立再現に帰属。既存の但書は不変:ベンチマーク数値は「2026 年 1 月時点」、ベアメタル x86_64 Mac インストールには警告、ドキュメント自ら単純なノーコードワークフローには過剰と認める。エージェントメモリは今四半期のインフラカテゴリとして統合しつつあり、hindsight は十数社のメモリスタートアップに分散していた注目を現在吸い込んでいる(memoryfields、Lemmalog、Funes、Hister……)。公開済みの未解決問い:この統合は勝者を生むか、共有評価/標準を生むか?

Sources: vectorize-io/hindsight · Releases

2026-09-28 20:55 —— hindsight の「独立再現」は共同開発者による再現だった: 帰属のファクトチェック

発見(項目立案から約 25 分の初回実行): LongMemEval SOTA の帰属——本フィードは「独立再現」と転記していた——はアームズレングスではない。3 つの第一次確認:

  1. 著者リスト。 arXiv 2512.12818("Hindsight is 20/20")の著者 7 名のうち 2 名——Wang と Ramakrishnan——は Virginia Tech Sanghani Center の教員(Ramakrishnan はセンター長)。再現の功績者とされる機関が論文の共著者にいる。The Washington Post は名指しの開発コラボレーター。README 自身の言葉は「research collaborators at」——本フィードがそれを「独立再現」と膨らませた。
  2. 独立レポート。 akitaonrails/ai-memory の research-hindsight.md(第一次情報に照らした競合ランドスケープ研究)が率直に言う:「アームズレングスではない……再現は共同開発機関によるもので、自己報告よりましだがサードパーティではない。『協力ラボによる再現』と引用すべき」。さらに本フィードも見落とした 2 つの但書: 論文はプレプリントで査読済みでないこと、hindsight の 91.4% は他システムが報告する R@5 検索指標ではなく accuracy であること——システム間の「SOTA」比較は計量的に成立しない。
  3. ベンダー自身のマニフェスト。 hindsight の「Agent Memory Benchmark: A Manifesto」(2026-03-23、共著者 nicoloboschi)は、LoComo/LongMemEval が「32k コンテキスト時代の産物……『全部コンテキストに詰め込む』素朴な手法でも競争力のあるスコアが出る……検索をストレス試験するために設計されたベンチマークは、今やほとんど LLM が読めるかどうかを測っている」と主張し、「『最高』は全ベンチマークでの勝利を意味しない」とまで書いた。同じベンダーの README は、同じベンチマーク上で「史上最も正確なエージェントメモリシステム」を謳う。またも免責条項剥ぎ取りの型: ソース自身が拒否したフレーミングを、その見出しが採用している。

立案件(勝者か共有評価か?)へのフィールド全体からの回答: 共有評価は既に存在する——LongMemEval が事実上の標準(GitHub 上 182 リポジトリが参照)——しかし共有された信頼は存在しない。HN の LongMemEval 主張は小規模プロジェクトの 90%+ 数値の壁(96%、94.7%、98%、94.9%、92%……)で、ほぼすべて自己報告・1 桁ポイント。フィールドは分裂している: ベンチマーク追従組(hindsight、MCP サーバーの長い裾野)と回避組——memoryfields、Lemmalog、Funes の README はベンチマークに一切言及しない(9/28 確認: LongMemEval/LoCoMo 言及ゼロ)。真の収束は評価ではなくアーキテクチャにある: akitaonrails が記録するように、逆の基盤(DB ファーストの hindsight、ファイルファーストの ai-memory)を持つ 2 チームが独立に「エージェントメモリの永続単位は、継続的に書き換えられる確定知識の Markdown ページ」に到達した。memory-MCP の相互運用標準は未観測——全ツールが独自の MCP サーバーを同梱する。

フィード項目 26 をその場で訂正(en/zh/jp、velocity は維持 ▮▮——順位は API 検証済みの実スター速度が買ったもので、ベンチマーク節ではない);CLAUDE.md に著者重複ルールを追加(System 項、同一ラン);vectorize-io/hindsight を release-watch に追加(計 19 ウォッチ)。

Sources: arXiv 2512.12818 · README · ベンチマークマニフェスト · akitaonrails/ai-memory research-hindsight

2026-09-29 04:03 — 大手インフラベンダー初のエージェントファースト CLI。エージェント抑制がシリコンに入る。「コードの後」の空白にスキルが現れる

Cloudflare が cf をリリース(オープンベータ):ゼロから書き直した Wrangler の後継。全 3,000+ Cloudflare API 操作をカバー(Wrangler は約 280)、新たにオープンソース化された Forge パイプライン経由で OpenAPI スキーマから生成、デフォルトで JSON 出力、自然言語の cf cli search インデックスが初回 --help でエージェントに自己紹介する。表明されたきっかけは Cloudflare 自身の数字:エージェント駆動の Wrangler 利用が ~25%(2026/3)→ 「先週」48% に。エージェントは人間の約 2 倍の種類のコマンドを日次で使う。ブログ自身の限定:Rust/Python および esbuild 依存 Workers は引き続き Wrangler に委譲。ベータ後、Wrangler は最後のメジャーバージョン + 18 か月のメンテナンス——Cloudflare 利用プロジェクト全員に日付付き移行期限。リポジトリは数日齢で採用数値はまだない。主要インフラベンダーとして初めて、プライマリ CLI をエージェント消費者向けに設計した。

NVIDIA Open Agent Safety Platform(9/28):OpenShell — Apache-2.0 のサンドボックスランタイムで、運用者の指示を検証可能なポリシー(許可ファイル・ネットワーク・ツール・プロセス・認証情報)に変換。Sentry — BlueField-4 DPU 向けリファレンス設計で、「エージェントから不可視」の分離チップ上でエージェント活動を監視。Vera Rubin ラックではノードからモデルへの唯一の経路上に置かれる。ミリ秒の隔離と kill switch。パートナー:Anthropic、Salesforce、JPMorganChase、Citi。報道が運んできた限定:The Decoder によれば NVIDIA は Sentry の脱走検出信頼性の数値を示していない。Sentry はリクエスト・身分・アクセスを検査し、エージェントの推論は検査しない——承認済みチャネル経由の prompt injection exfiltration は依然開いたまま。CNBC の「HuggingFace 事件を防げたかもしれない」は NVIDIA 原文(検出支援のみ)より強い。GA 期日は「ソフトウェアアップデート」のみ。帯域外エージェント抑制を製品化した初のハイパースケールシリコンベンダー——今夏のサンドボックス脱出シリーズへの制度的応答であり、その限界(周辺であり意図ではない)も正直に明記。

golive-skill(mikehasa、v0.1.0-alpha.5、9/23 から ~175★/日):スタックで最もツール化されていない部分——アプリを書いた後——を狙う。必要なものを検出し、インフラ変更を計画し、承認を要求し、ユーザー自身のログインで適用(Vercel/Netlify、Supabase/Neon、Porkbun/GoDaddy DNS、Resend、Stripe test-mode)、結果を検証し、記録し、解体できる。異例なまでに正直な README:ロールバックは「狭く、オプトインで、決して自動ではない」。Netlify のみ。promotion/rollback はモック扱いで「未実検証」。平文 0600 の認証情報ファイルは「keychain ではない」。そして構造的穴を自ら指摘——確認フラグはエージェントが代理で渡す引数にすぎない:「プロバイダにログイン済みのエージェントは、golive プランなしでそこに書き込める。」アカウントに触れるスキルが、コードが強制することとエージェントへの指示にすぎないことをどう分けて文書化すべきかのテンプレート。

Cua が「computer-use 2.0」へ再positioning(週間 #13、26,833★):macOS/Windows/Linux のオープンソースデスクトップ自動化ドライバ(cua-driver-rs v0.30.3)、分離クラウドデスクトップ「Fleets」、Apple Silicon 上のローカル macOS/Linux VM(Lume)、CUA-S1 専門決定モデル——driver + fleet + eval の統合が一つのスタックに。限定:README は強くファネル型(商用 run.cua.ai を最上位に、trendshift バッジ)。ベンチマーク主張は未検証。

Tencent WeKnora v0.8.2(9/24。週間 #6、30,919★):サンドボックス化されたエージェントツール統合、ツール単位の MCP 有効化トグル、管理者によるユーザー作成 UI、パストラバーサル修正(ローカルプレフィックス・タスク ID・wiki ソートパラメータ)。保守は活発(9/28 push)。ドキュメントは中国語優先。ナレッジプラットフォームがエージェントガバナンス機能を吸収する、RAG × エージェントインフラの静かな収束。

Sources: Cloudflare blog · cloudflare/cf · HN · NVIDIA developer blog · The Decoder · mikehasa/golive-skill · trycua/cua · Tencent/WeKnora · v0.8.2 release notes

2026-09-29 20:03 — PageIndex Flash:ベクトルレス RAG が自身のインデックスコストを除去

VectifyAI/PageIndex v0.2.19/0.2.20(Sep 21/28。本日 +822★ で 36.7k★、MIT、Sep 28 push):ドキュメントをチャンク埋め込みする代わりに、推論に適した目次ツリーを構築——検索はツリー辿りで LLM がノードを読む、ベクトルインデックスなし。新しい PageIndex Flash はツリー構造をレイアウト統計だけから生成(「構造生成自体に LLM は関与しない」)。LLM が書くのはノード要約のみで、ツリー展開はノードを並行して提案——ベクトルレス RAG の最大の実用障壁だったインデックスコストを除去。注意:品質主張はプロジェクト自身のもの。SDK はローカルとクラウドの両モードを名指し(ホステッドファネルは設計の一部)。「ベクトルレス」はクエリ時の推論コストと埋め込み再現率を交換する——取引は文書化済み、ただの飯ではない。embed-everything の既定値に対する最も強い現役の代替が、エージェントがドキュメント理解をパイプラインではなくサブルーチンとして必要とする瞬間に到着——構造化された確定知識へ収束するメモリ基盤(wiki-not-RAG)の検索側の兄弟。

Sources: VectifyAI/PageIndex · releases

2026-10-01 04:03 + 12:03 — ハーネスが学習可能な産物になる(Meta-Skills)。エージェント文脈供給に自動同期グラフ。1日10億のエッジ呼び出しが microVM へ(+ 09-30 補遺)

Meta-Skills(arXiv:2609.38143、UIUC——Qian、Zhu、Li、Wang、Ji。HF 日次トップ)はテスト時 AI-for-AI を形式化する:両モデルの重みを凍結したまま、Builder が Target の開発セット上の実行フィードバックからメタスキル——「いつ支援を要し、どんなリソースを与えるかの原則」——を学び、凍結したスキルバンクから未知タスク向けの実行環境(ハーネス)を構築する。彼らの Harness-Bench と Newton Bench で:スキル構築なし比 +8.95(マクロ平均)、同じバンクを Target に直接渡すより +12.02——働くのは内容だけでなく包装の方もある。テーゼ12の終点:ハーネスエンジニアリングが手作りの産物から学習可能・転写可能な層へ。留保(項目にも記した):両ベンチマークは著者自身の構成物——他者のエージェントスタックが再現するまでは内部結果。

codegraph(colbymchenry/codegraph、72.6k★、9月29日 v1.6.1):事前索引・自動同期のコードナレッジグラフ——100% ローカル、Rust カーネル、出所証明と attested-build バッジ付き npm パッケージ、9エージェント(Claude Code、Codex、Gemini CLI、Cursor、OpenCode、Antigravity、Kiro、Copilot、Hermes)に接続。文脈供給の競合(DeusData の codebase-memory-mcp 44.3k★、jevgrep)との差別化:自動同期と完全ローカル。正直なコストの行は同日のコミットログ——どの修正もフレームワーク固有のヒューリスティクス(「middleware 候補は宣言であって決して import ではない」、コンポーネント名ヒューリスティクスを .astro に限定)——ヒューリスティックなコード索引はフレームワーク毎に潰す長い尾。

Netlify、1日約10億の Edge Functions 呼び出しを Firecracker microVM へ移行(Unikraft で構築、HN 51 pts):warm p50 が 25–40ms → 約5–6ms、p99 は 47.4% 改善、可用性 99.998%、コールドスタート(約9ms)は呼び出しの約1.2%——開発者向け契約は不変(「URL imports も npm パッケージも…すべて以前と全く同じように動く」)。エッジで信頼できないユーザーコードを走らせる全プラットフォーム——本フィードが追い続けているエージェントサンドボックス平台を含む——へのアーキテクチャ数据点:V8 isolate から microVM への移行が日10億規模の本番で証明された、p50 五倍・API 変更ゼロ。

(09-30 補遺) Dots——OpenAI の常駐エージェントがリークから製品へ、「1エージェントに1つのクラウドコンピュータ」:エージェント単位のクラウド VM がホスティングの単位に。Pi.dev が MCP を搭載——「You said no MCP」から1年、最後の抵抗者が方向転換。America.gov が行政命令を背景に米国政府の AI フロントドアとして公開——翌日 HN はチャット終端の余興を発見:「play Minecraft」と頼むと政府版のエンドクレジット詩を披露する(「連邦規則集を読めるようになった…私たちをチャットボットだと思っている」)。愉快で、診断的:市民向けエージェントが域外リクエストへの目に見えるシナリオ試験なしで出荷された。修正は決して「モデルが分別を知ったから」ではない——誰も下さなかったハーネス上の決定だ。(今回の実行中 america.gov/chat はスクリプトクライアントに 403 を返した——会話は HN スレッドから引用。)OpenClaw v2026.9.7——CVE の総括の後のリリース:OpenAI Agents API プラグイン、Sign in with ChatGPT、移行前の自動バックアップ。

2026-10-03 05:03 — データベースが agent プリミティブになる:Supabase が Turso を買収。Agent-Reach はトレンド首位も休眠

Supabase が Turso を買収(10/2、HN 173 pts)。agent インフラのテーゼが明示されている:Supabase はすでに「週 100 万超のデータベースを起動」しており、データベース生成がファイル並みに安いプリミティブにならない限り需要が容量を追い抜く、というもの。Turso は SQLite の Rust 書き直しと「1 台のサーバーが数百万のデータベースを管理、必要時にロードし不要時にサスペンドする」プラットフォームをもたらす——エフェメラルな agent 毎データベースが求める suspend/resume の形そのもの。条件は未公開。継続性は明言(「既存ユーザーに変更なし」——顧客に Superhuman、Mastra ほか)。創業者 Glauber Costa と Pekka Enberg が合流、Costa は agentic インフラ担当。libSQL の系譜——エコシステムで最も信頼できる SQLite 書き直し——が最大のマネージド Postgres プレイヤーの傘下に。Postgres と SQLite が同じ買い手に収束しつつある:2027 年までに 100 万の小さなデータベースを要する agent の持ち主。

Agent-Reach(Panniantong/Agent-Reach、MIT、Python、88,421★、当日 #1 リポジトリ):agent に Twitter/X、Reddit、YouTube、GitHub、Bilibili、小紅書、ページ、RSS 等の読み取り/検索を与える「1 CLI、API 料金ゼロ」のケイパビリティレイヤー。各プラットフォームは順序付き primary+fallback バックエンド列に写像され(twitter-cli→OpenCLI、yt-dlp、gh、小紅書は 3 段フォールバック)、agent-reach doctor がチャネル毎の状態を報告。無料バックエンドのみ、デフォルトは読み取り専用、インストール自体が prompt を貼って agent に完結させるフロー。注意書きこそがトレンド: 最終プッシュ 9 月 15 日、リリースなし、7 か月で 88.4k★——急増を単一の発表で説明できない。README は同名の PyPI パッケージは本プロジェクトではないと警告(pip install 前のサプライチェーン注意)。課金 API なしの agent ウェブアクセスは、LLM を前面に付けたスクレイピングフレームワークの関数である——極めて有用で、あらゆるプラットフォームの ToS と構造的に衝突しており、トレンドの強度はまさにその緊張が予言する通り。

Sources: Supabase ブログ · HN · Panniantong/Agent-Reach

2026-10-04 04:03 — オーケストレーション層が「デフォルトでフルオート」に票。to-do ツールはメモリ層から到着。スレッド移動が再構築される

Paperclip v2026.1001.0(paperclipai/paperclip、MIT、TypeScript——96,694★、週間トレンド首位、+12,825/週):ミックスハーネスのエージェントチーム(OpenClaw、Claude Code、Codex、Cursor + Cloud)に 1 つのダッシュボードから目標と予算を割り当てるエージェントオーケストレーションアプリが、77 コミットのリリースを出した:定刻実行の GitHub プルリクエストレビューボット、治理されたデプロイツール付き Railway コネクタ、承認を弾かずに実行中キューへ、ネイティブランナーとチャット復旧の強化(承認/Stop レース、セッション連続性、サンドボックス再接続)。効いてくるのはリリースノート自身の言葉:「execution harnesses now default to full auto。」 リポジトリ状態確認済み:未アーカイブ、取得数分前にプッシュ。ホスト型「Paperclip Cloud」はウェイトリストのまま。オーケストレーション層はエージェントガバナンスが実際に決められる場所であり、デフォルトはプロダクト判断だ——PR レビューボットが「agent による agent コードのレビュー」を常態化させるか、誰のリスクでそれが起きるかを_watch_。

T3 Code が Orchestrator V2 を開始(pingdotgg/t3code、MIT——24,608★、+251/日):既存サブスクリプションで iOS/Android/web/Electron から Claude Code、Codex、Cursor、Grok Build、OpenCode、Google Antigravity を駆動するコントロールサーフェスが、安定 v0.0.45(Codex 0.159 向けプロトコルバインディング再生成、OpenCode のクレデンシャル毎レート制限)を切り、初の「Orchestrator V2」nightly(10月3日 01:10 UTC)を出荷:agent ターンの開始/停止/キュー/再開、サブエージェントとバックグラウンドワークの追跡、マシン間のスレッド移動の再構築。バッチで最も活発に開発されたリポジトリ(取得数分前にプッシュ)。注意書きはプロジェクト自身のラベル:0.0.x バージョニング、V2 は nightly、一部プレビューには明示の「do not install」警告——統合前夜、バージョン番号がそれを語っている。

claude-mem v13.29.0(thedotmack/claude-mem、Apache-2.0——95,494★、+218/日):セッション毎のエージェントの行動をキャプチャ・圧縮し、後で関連コンテキストを再注入するメモリ圧縮層が、セッション冒頭に自ツール work_state_write/work_state_read を正典 to-do リストとするルールを注入するようになった。その理由がすべてを語る:「Claude Code は Claude 5 モデルにネイティブの to-do ツールを与えておらず、これまで何が進行中かを記録するものがなかった。」 同リリース:プリセット付き openai-compatible プロバイダ、Codex サブスクリプションプロバイダ、Kimi Code と Oh My Pi 対応——Claude Code を超えて OpenClaw、Codex、Gemini、Hermes、Copilot、OpenCode へ。「モデルに to-do ツールがない」はモデルでなくハーネス層への起訴状であり、修正が 95k★ のサードパーティメモリプラグインから届いたという事実は、状態連続性が agent UX の耐荷重壁になったことを意味する。ハーネスが四半期内に吸収するのを_watch_。

Sources: paperclipai/paperclip · v2026.1001.0 リリースノート · pingdotgg/t3code · thedotmack/claude-mem · v13.29.0 リリースノート