Agent Plugins 1.0.0 + Agent Skillsフォーマット(2026年8月)

AIエージェントの スキル と MCPサーバー を1つのポータブルなプラグインにまとめる、ベンダー
中立のオープン標準。2026年8月6日に公開——メモリウィンドウが高価値todoとしてフラグした
「Agent Skillsフォーマット戦争」の収束点。

2つのレイヤー

  1. Agent Skills——スキルとは、必須の SKILL.md(メタデータ name + description と指示) と任意の scripts/、references/、assets/ を含むフォルダ。元は Anthropic が執筆し、 オープン標準として公開。長い裾野のクライアント(Cursor、VS Code、GitHub Copilot、Gemini CLI、 Claude Code、ChatGPT/Codex など)に採用されている。段階的開示で読み込まれる:発見 (name + description)→ 活性化(完全な SKILL.md)→ 実行。
  2. Agent Plugins 1.0.0——スキルの上に乗るパッケージング層。プラグインは plugin.json (マニフェスト。必須は $schema + name のみ)、skills/(スキルごとに1サブディレクトリ、 Agent Skillsフォーマット)、mcp.json(明示的なトランスポート型を持つMCPサーバー宣言—— stdio / Streamable HTTP / HTTP+SSE)を含むディレクトリ。コンポーネントは独立して失敗。 v1.0が標準化するのはスキル + MCPサーバーのみ——フック、カスタムエージェント、スラッシュ コマンドはクライアント固有のまま。

連合(検証済み——ここがフィードの不正確だった点)

意図的に残された空白(信頼のギャップ)

v1.0は「パッケージフォーマット、それだけ」だ。インストール機構、配布プロトコル、権限モデル、
サンドボックス、信頼/プロヴェナンス検証、マーケットプレイスはいずれも定義しない。プラグイン
はインストール時に暗黙に信頼され、各プラットフォームの配布チャネルが事実上のゲートキーパーに
なる——批判者はこれを「薄い標準」と呼び、既存プラットフォームのリーダーを固定化しかねないと
懸念する。IETFのDAWNワーキンググループがまだ発見層を議論しているうちに出荷された:**出荷が
コンセンサスに勝った。**

なぜ重要か

1つのスキルが再パッケージなしにChatGPT、Copilot、Cursor、VS Codeをまたいで動く。トリガー:
google/skills(Apache 2.0、Google Cloud Next 2026でのローンチ時は13スキル、現在約110)が、業界が
このラッパーを標準化したちょうどその時に参照実装となった。ルーター/プラグインレイヤーは
smart-routingの「先にルーティング、次に計算」と同じ制御点で、一段上の話:パッケージ
フォーマットを握る者が配布を握る。

スキルは今や「センス」もエンコードする(製品ハウツーだけではない)

エコシステムは「製品Xの使い方」を超えて技巧へと広がっている。cathrynlavery/diagram-design
(MIT、約10.2K stars、1日+2,951)はClaude Code/Codex/Pi向けのAgent Skillsパッケージで、27+種の
エディトリアル図を自己完結型HTML + SVGとして生成し、デザインシステム全体を機械可読ルールとして
エンコードする(4pxグリッド、1pxヘアライン、アクセントカラー1色、3フォントスタック)。「図の
品質」をプロンプト運からモデルが従うルールファイルへ変える——スキルフォーマットが単なるベンダー
製品の糊ではなく、センス/標準の配布基盤であることの証拠。

スキルは今やデモンストレーションで書かれる(手書きMarkdownではない)

microsoft/skill-recorder(MIT、約3K stars)はスキルの書き方を逆転させる:デスクトップアプリが
画面上の作業セッション(クリック、アプリ/ウィンドウ切り替え、訪問ページ、クリップボード、任意の
ナレーション)を記録し、GitHub Copilot CLIでそれを「意図 + 順序付きステップ」として再構成し、
再利用可能な SKILL.md(またはMicrosoft Scout / Copilot Cowork / Copilot Studioの自動化)として
出力する。意図的にマクロレコーダーではない:生成されたスキルはエージェントのネイティブツール
(gh、web_fetch、API)を優先し、必要なときだけUI自動化へフォールバックするため、汎化しUI変更に
耐える。「一度デモすれば、永遠に再利用」が SKILL.md をMicrosoft、Claude Code、Codex、Gooseを
またぐ共有の捕捉フォーマットとして固定し——スキルフォーマットが製品ハウツーだけでなく任意の
エージェント能力を配布する基盤になりつつあるという本ページのテーゼを延長する。

プラグインは今やハーネス全体を構成する(スキルだけではない)

プラグインパターンはスキルレベルを脱し、ハーネス全体を形づくるようになった。deepseek-ai/
deepseek-harness
(MIT、v0.1、約38.9K stars)はCordisプラグインシステムの背後で、モデル、
ツール、スキル、セッション、サンドボックス、ストレージ、スケジューリング、UIをすべて組み合わせ
可能なプラグインにする——開発者は設定レイヤーで能力を拡張・置換する。「すべてがプラグイン」は
Agent Plugins 1.0.0が標準化するのと同じ思想で、一段上の話——だがDeepSeekは1.0.0フォーマットを
採用せず独自のプラグインシステムを構築した。パターンの広がりとともにフォーマットは断片化し
つつある:Agent Plugins 1.0.0(パッケージング)、Cordis(ハーネス内部)、各ハーネス独自の機構
(.claude-plugin、agents.md、Codex拡張)が共存する。ハーネス層が1つのプラグインABIへ収束する
かを注視。

可逆エフェクト:プラグイングラフの背後にある理論(8月16日)

cordiverse/cordis(MIT、4.4K stars)+ その論文「A Programming Paradigm for Spatiotemporal
Composability」(北京大学 + DeepSeek-AI、8月13日ドラフト)は、「すべてがプラグイン」を自己進化
ハーネスにとって安全にする2つのアイデアを形式化する:可逆エフェクト(各コンポーネントの副作用
が逆演算を持ち、アンロード時に以前の状態を復元)とリアクティブコエフェクト(コンポーネントが
依存を宣言し、コンテキスト変化に反応)で、コンポーネント計算について保存性/合流性/進行性を証明。
本番級——Koishiは4年間(4,000以上のプラグイン)これを土台に出荷しており、DeepSeek HarnessもCordis
v4上で出荷される。論文の動機となる数字:VSCode上位100拡張のうち87はホストを再起動せずにアンイン
ストールできない——リロード時にコンテキストを失ってはならない自己進化エージェントには致命的。これ
はAgent Plugins 1.0.0のパッケージング層の理論的対応物:1.0.0は何が移動するかをパッケージし、
Cordisはコンポーネントがどう組み合わさり、どう巻き戻るかを統治する。

スキルは今や主張を証明しなければならない(評価ギャップ)

スキルというカテゴリは、証明ではなく主張で増殖してきた——これまでは。Ponytail
(DietrichGebert/ponytail、約82K stars)という「最も怠惰なシニア開発者」スキル(7段の判断はしご:
最小限を書く前に、それが存在する必要があるか/すでにあるか/標準ライブラリの一行かを確認する)は、
「コード80–94%削減」という主張とともに出荷された。Scott LogicのColin Eberhardtが異議を唱え——
むき出しの「YAGNI原則に従え」プロンプトがそのベンチマークでそれを上回った——作者は再現可能な
ベンチマーク(ヘッドレスClaude Codeが実在のFastAPI/Reactリポジトリで12枚の機能チケットを編集)を
再構築し、平均でコード約54%減 / コスト約20%減 / 実行約27%速いと公開訂正した。これこそカテゴリ
全体に欠けているテンプレート:スキルにその主張を証明させる公開の行動テストフレームワーク。共有
の評価標準はまだ存在しない——「スキルのMMLU」が開かれたギャップ。先にそれを出荷した者がスキル
マーケットプレイスを握る。

注記更新(08-25 20:03): DietrichGebert/ponytail は約 110k stars(旧約 82k)で再登場し、現在は **20+
エージェント**向けアダプターと /ponytail-review + /ponytail-audit スラッシュコマンドを出荷。そのベンチマークは
コード約 54% 減 / コスト約 20% 減 / 実行約 27% 速い / 100% 安全と再表明され、80–94% の単発数字は自己修正されたまま
(issue #126)。トークン予算の規律(YAGNI)は製品化されたカテゴリになったが、ベンチマークはなお単一著者の再現であり
共有コーパスではない——「スキルの MMLU」のギャップは不変。

Anthropicが正典のホームを公開(8月14日)

anthropics/skills —— Anthropicの公式なAgent Skills公開リポジトリ(169K stars)——は、同社が著した
このフォーマットの事実上の正典のホームとなった。リポジトリには仕様(agentskills.ioでホスト)、
再利用可能なスキルテンプレート、そして参照スキルが収められている:Claudeの製品内ドキュメント編集
を支えるsource-availableなdocument skills(docx、pdf、pptx、xlsx)に加え、
skill-creator、mcp-builder、artifacts-builder。Claude Codeではプラグインマーケットプレイス
としてインストールされる(/plugin marketplace add anthropics/skills)。これは「Anthropicは収束
するか分岐するか」というウォッチ項目に部分的に答える:Agent Plugins 1.0.0連合には不在のままでも、
Anthropicは自らの正典参照実装(仕様 + 本番のdocument skills)を出荷している——このフォーマットには
今や2つの参照極、google/skills(標準化ラッパーの参照)と anthropics/skills(仕様の著者の正典
のホーム)がある。他のあらゆるスキルライブラリは今やこの両者に対して測られる。

分岐の結晶化:連合 vs Anthropic(8月15日)

Agent Plugins 1.0.0連合は今や明確になった:**OpenAI、Microsoft、GitHub、AWS、Vercel、そして
Cursor(Anysphere)に、コアメンテナーとしてGoogleが加わり——Anthropic自身のMCP + Agent
Skillsの上に築かれたパッケージング仕様を標準化している。Anthropicは不在**で、代わりに
Cowork向けの独自プラグインシステムを出荷した。このフォーマットには今や3つの極がある:
google/skills(標準化ラッパーの参照)、anthropics/skills(仕様の著者の正典のホーム)、そして
仕様の著者自身が加わらないクロスベンダーのパッケージング仕様。

cursor/plugins(MIT、約2.8K stars)はCursorの公式プラグイン仕様 + マーケットプレイス:各プラグ
インは .cursor-plugin/plugin.json マニフェストを持つディレクトリで、6種類のコンポーネント——
rules(.mdc)、skills、agents、commands、MCP servers、hooks——のいずれかを
束ね、フォルダベースの自動検出と11個の公式プラグインを備える(コミュニティプラグインはすべて手動
レビュー)。連合が標準化した同じ skills/ + mcp.json プリミティブに収束するため、1.0.0の参照実装
を兼ねつつ、1.0.0仕様が意図的に残したCursor固有の拡張(rules、hooks、canvases)を追加している。
シークレットは ${VAR} プレースホルダーで、ダッシュボードに設定され、プラグインには保存されない。

ハーネスプラグインABI:レイヤードな収束、平らな断片化ではない(8月15日)

「ハーネス層は1つのプラグインABIに収束するか、それともルーティング設定のように断片化するか」という
未解決の問いに、より鮮明な答えが得られた:レイヤードな収束——可搬コアは収束しつつあり、ハーネス
のシェルはベンダーごとのまま。

仕様が実行可能な契約になる(8月15日)

エージェントコーディングのワークフロー層はspec-as-codeへ収束しつつある。github/spec-kit(MIT、
約128.8K stars、1日+1,160、v0.12.11)はGitHubのSpec-Driven Developmentをパッケージ化する:specify CLI
が constitution → specify → plan → tasks → implement パイプラインを足場にし、スラッシュコマンドまたは
Agent Skillsとして30以上のコーディングエージェント(Copilot、Codex、Claude Code、Gemini CLI)へ
インストールする。仕様はエージェントが各チェックポイントで照合・検証する「実行可能な真実の源」になる
——コンパイルは通るが意図を外す「vibe coding」への明快な回答。すべてのスキルパッケージと同じトレード
オフ:セッションあたりのトークン消費が増える代わりに出力が予測可能になる(GitHubは依然実験的と明記)。

これはスキル/評価の流れが指す方向に正確に着地する:スキルはもはや製品ハウツーではなく*ワークフロー
契約*であり——評価ギャップの次のランクこそ Vero のリポジトリ規模の形式検証(frontier-models参照)。
執筆側のspec-as-skill + 評価側の機械検証証明 = 意図を機械検証可能な成果物にすること。

注視点

スキルは今やエージェントを特定の本に接地させる(8月16日)

virgiliojr94/book-to-skill(21.4K stars)は、技術書・フォルダ・論文コレクションを構造化された
Agent Skill(SKILL.md + 章ごとのファイル + 用語集 + パターン + チートシート)へ蒸留し、Claude
Code・Copilot CLI・Ampでオンデマンドに読み込む。クエリ時RAGではなくコンパイル時の抽出:著者が名指し
したフレームワークと判断ルールがファイルになり、エージェントは該当章を読むため、回答は手元の書籍に
接地し続ける。実書籍で計測し、テキストをコンテキストへ流し込む場合に比べトークンを 24–51× 削減
(400ページの本 ≈ 200Kトークン → コア約4K + 章ごと約1K)。シグナル:「エージェントを特定の本に接地
させる」こと(runbook、ADR、オンボーディング)は繰り返し現れるニーズであり、Agent Skillsフォーマット
がそれを吸収しつつある——ファジーな検索と、抽出された構造に対する決定的推論の違い。スキルフォーマット
が任意のエージェント能力を配布する基盤であることの、もう一つのデータポイント(上記のセンス/レコー
ダー/spec-kitの各流れを参照)。

Skills が出力UXをエンコードする(08-17 04:03)

ayghri/i-have-adhd(~18K stars)はクロスエージェントの SKILL.md(Claude Code、Codex、Cursor、Gemini CLI、
Copilot、Zed…)で、能力ではなくフォーマットを変える:10のルール——最初の行はコマンド/パス、複数ステップは
番号付け、各ターンは2分未満の次のステップ1つで終える、前置き/要約/脱線は禁止——セッション単位
(/i-have-adhd)でも常時でも導入可能。1つの SKILL.md が ~18K stars を集めるのは、人々がエージェント出力
に本当にイラつく点への測定可能な投票であり、skillsフォーマットが任意のエージェントカスタマイズを配布する
単位になったことの更なる証拠——製品ハウツー、センス(diagram-design)、ワークフロー契約(spec-kit)、書籍グラ
ウンディング(book-to-skill)、そして今や出力UX。openworkのクロスツールワークフロー共有と同じ「ポータブル
資産」信号(agent-stack参照)。

Skills がプロフェッショナルなセキュリティ能力を配布する(8月18日)

mukul975/Anthropic-Cybersecurity-Skills(28k stars、Apache-2.0、Anthropicとは無関係)は、**29ドメインにまたがる
817個の構造化サイバーセキュリティスキル**のライブラリで、それぞれagentskills.io標準(YAMLフロントマター +
When-to-Use/Prerequisites/Workflow/Verification)に従うため、コーディングエージェントはツールコマンドを当てずっぽうで
打つのではなく、シニアアナリストのプレイブックを踏む。805/817がMITRE ATT&CK v19.1にマッピングされ、NIST CSF 2.0、
D3FEND、NIST AI RMFのマッピング付き、26以上のエージェントプラットフォーム互換。各PRは48時間以内に技術的正確性と
agentskills.io準拠のレビューを受ける。

信号:skillsフォーマットが非自明なプロフェッショナル専門性の配布単位であることの、これまでで最も明快な実例——
MITRE ATT&CKマッピング済みのセキュリティ手順であって、書式の微調整ではない。そして評価ギャップのテーゼ(本ファイル
の「スキルのMMLU」ウォッチ項目)をいっそう際立たせる:ここのレビューゲートは人間(48時間の技術レビュー)であり、
機械評価ではない——つまりこのカテゴリは依然として主張 + 手動レビューで出荷されており、再現可能なベンチマークでは
ない。セキュリティプレイブックに自動化・ベンチマーク可能な評価(Ponytailのテンプレート)を最初に取り付けたスキル
ライブラリが、そのギャップを握る。

測定結果付きスキル(8月19日 20:03)

「スキルのMMLU」ギャップ(本ファイルの常設ウォッチ項目)はベンダー側から埋まり始めている——2つのスキルが今や
測定された数字を、主張ではなく出荷する:

方法論が最大のスキルリポジトリになる(8月20日 04:03)

obra/superpowers(MIT、Jesse Vincent)は 274k stars でGitHub上最もスターの多い「エージェントスキル
フレームワーク」となり、デイリートレンド上位に位置する。ソフトウェア開発の方法論を、エージェントが実際に
使うようにする起動指示と組み合わせて、構成可能なスキルとしてパッケージ化:ブレインストーミング、実装計画、
TDD、体系的なデバッグ、並列実行、コードレビュー、ブランチ仕上げワークフロー。Anthropicのマーケットプレイス
からプラグインとしてインストールでき、Codex向けにも掲載;Claude Code、Copilot、Cursor、Windsurf、Gemini CLI
で動作。Subagent-Driven Development(SDD)ワークフローを含む——v6.0.3はSDDスクラッチファイルを.git/の外へ
移動した(Claude Codeがエージェントによるそこへの書き込みを拒否するため。スキルがエージェントの作業ツリーに
どれほど深く食い込むかの小さな兆候)。

シグナル:superpowersは「方法論、プロンプトだけではない」学派の参照点——そして274k starsで今や
anthropics/skills(169k)より大きいため、最大のスキルリポジトリは方法論であり、ベンダーの製品how-to
ではない。本ファイル常設の評価ギャップ監視項目を閉じるのではなく鋭くする:スキルとして出荷される方法論は
依然主張であり——superpowersはPonytailやbenjamin-plus-skillのように自社主張のベンチマークA/Bを出荷して
いない。

証拠グレード——「証拠を示せ」ギャップへの最も安価な部分解(08-20)

skills層は、誰も出荷していない「skills版MMLU」を待ち続けてきた。JuliusBrussee/caveman
(99.4k stars)は、より安価で、当面はより有用なことをしている——自らの主張を格付けするのだ。
公表するあらゆる数値にはティアが付く: inferred(ローカルランタイムの推定)、
benchmark_counterfactual(固定ベースラインに対する統制された結果)、
verified(署名付きレシートを伴う実トラフィック)。加えて「オフラインのcavemanは決して verified とは
言わない」、前2者は「いずれもプロバイダの請求書ではない」という常設の但し書きが添えられている。

これと対になるのが、異例なほど率直な限界の節である: このskillが縮めるのは出力トークンのみ、
1ターンあたり約1–1.5kの入力トークンを追加し、もともと簡潔なワークロードでは正味マイナスになりうる。
そして最も重要な細部——公表済みの65%の表は、著者がその後追加した簡潔対照群より前のものであり、
それは批評家に暴かれたのではなくREADMEで自ら認められている。

これで評価ギャップが解消するわけではない。依然として1チームが自前の数字を公表しているだけで、
共有プロトコルも第三者による再現もない。だがこれは過大主張のコストを変える。
ベンチマークは存在するために先に合意を要するが、出所を示す語彙は著者が自らの証拠の強さを
ラベル付けしさえすればよく、テストを再実行する手段を持たない読者にも「測定した」と「そう考える」の
差を可読にする。2つ目のskillsリポジトリがこれを採用すれば、ベンチマークの権威の出現を待つよりも
現実的な、共有標準への道筋となる。

詳細・表・未解決の問い → token-economics。

個人スキルボルトが主流に(08-21 12:03)

mattpocock/skills(MIT、約211k stars / 16k forks、「実務エンジニアのためのスキル」)は、あるTypeScript教育者の
個人 .agents ディレクトリで、npx skills@latest add mattpocock/skills でインストールする。各スキルはAIコーディング
の特定の失敗モードを狙う:/grill-me + /grill-with-docs(着手前にユーザーへ質問し、決定をADRとして記録)、
/tdd + /diagnosing-bugs(レッド-グリーン-リファクタ、フェーズゲート付きデバッグ)、ubiquitous-language
(共有 CONTEXT.md で冗長さを止める)。枠組みは4つの失敗モード——ズレ、冗長、壊れたコード、「泥団子」。

シグナル:「個人スキルボルト=硬貨」というトレンド——個々のエンジニアが調整済みエージェントディレクトリを公開して
フレームワークプロジェクトをスター数で抜く——は、単独の作者のフォルダがGitHubトップ25リポジトリに入るほど主流化
した。obra/superpowers(方法論)の補完でありライバルではない:フレームワークはプロセスをパッケージ化し、
mattpocockはある実務者のセンスをパッケージ化する。依然主張であってベンチマークではない(既存の評価ギャップの
注記はそのまま)——しかしスター数は市場の投票であり、スキルとしてパッケージされた個人のセンスこそが注目される
配布単位だと示している。

疑似コードファースト——意図を永続的な成果物に(08-21 12:03)

Huzzah(danielvaughn/hz、Show HN、約239 pts、ライセンス未宣言)はspec-kitとは別の方法でコーディングエージェント
のループを反転する。長文の英語プロンプトが一時的なチャットセッションへ散らばる代わりに、開発者は**永続的な疑似
コードを .hz ファイル**に保ち、LLM(Piエージェントフレームワーク経由)が実際の実装を生成し継続的に再同期する。
エディタが維持する疑似コード行と生成コード行のソースマップにより、fizz_buzz(n) を編集すると影響を受けた実装
だけが再生成される。そのテーゼ:プロンプトは「長文・命令的・一時的」、疑似コードは「宣言的・永続的」。

これはspec-kitの「仕様=実行可能な真実の源」と同じ「意図を永続的な人間の成果物にせよ」という賭けを、逆方向から
張ったもの——spec-kitはプロセス(constitution → specify → plan)、Huzzahは成果物(モデルやツールの変更を生き延びる
.hz ファイル)。留保:概念実証——56 stars、生成されたJSは作者が「敵対的コードのサンドボックスではなく実験的
封じ込め」と呼ぶローカルWeb Worker内で動き、モジュール/ディレクトリレベルのスケーリングは未検証。

作者側の評価ハーネスが出荷——作者単位・非共有(08-23 04:36)

「スキルのMMLU」ウォッチ項目は今回前進した:スキル評価の機構は3月に出荷済みだが、共有プロトコルではなく作者単位の
ツールとして。2つの一次発見:

純結論:ギャップは「評価機構がまったくない」から「共有ベンチマークコーパス + 横断比較可能性がない」へ縮小。ハーネスは
存在し(Anthropic)、第三者スイートも存在する(SkillBenchmark、13★)が、どちらも作者が測定される対象となるリーダーボード
ではない——「出荷した者がマーケットを所有する」という半分は依然開いている。

205kスターの凍結されたテキストアーティファクト——「trending」が測るのは開発ではなく配布(08-23 12:03)

multica-ai/andrej-karpathy-skills は、Andrej Karpathy が LLM コーディングの挙動について記録した不満を単一の CLAUDE.md(2,357バイト)にまとめ、CURSOR.md、skills/karpathy-guidelines スキル、.claude-plugin/(marketplace.json + plugin.json)を添える。4つの原則:コードを書く前に考える(Think Before Coding)(前提を明示し、反論し、混乱したら止まる)、シンプルさ優先(Simplicity First)、外科手術的な変更(Surgical Changes)、目標駆動の実行(Goal-Driven Execution)(命令を合格/不合格の基準に変える、「loop until it passes」(合格するまでループする))。Karpathy 本人の著作ではない——彼の公開された観察から導かれたもの。

GitHub API で一次読みしたところ、メタデータこそが話だった:
- 205,384 stars / 21,010 forks —— 注目度では最上位層のリポジトリ。
- pushed_at = 2026-04-20 —— 4ヶ月コミットなし、その一方で「+315 stars today」のトレンド線。直近5コミットはすべて4月の README/Cursor サポート系の整備。
- 126件のオープン issue、その期間中は放置。
- LICENSE ファイルなし。 /LICENSE は 404、GitHub のライセンス API は Not Found を返すため、API は license: null と報告する。主張は README §License(「MIT」)にしかない。主張されたライセンスは実際に提出されたものより弱い——人々が自分のプロジェクトへ貼り付けるリポジトリにとって、それが実務上のディテール。

GenLayer/Void の教訓の精緻化。 コードプロジェクトでは、上昇するスター曲線の下に平坦なエンジニアリング曲線があるのはレッドフラグ。プロンプトアーティファクトではそれが期待される——成果物は 2.3 KB の凍結されたテキストで、メンテナンスするものがない。だから正直な読みは「放棄された」ではなく、ここでのスター数が測るのは開発ではなく配布であり、2つのメトリクスは異なる問いに答える。これが監査の位置を移す:調べるべきはコミットの新しさではなく、そのテキストが検証されたことがあるかどうか。されていない。これはスター数でトップ25入りした4つ目のスキルリポジトリ(superpowers 274k、mattpocock/skills 211k、caveman 100k に次ぐ)であり、主張だけで出荷され、その内容は行動に関する主張——「この4つのルールが過剰設計と暗黙の前提を修正する」——すなわち、作者ごとの評価ハーネス(token-economics、skill-creator、SkillBenchmark)が今や測定でき、誰もまだ測定していない種類の主張。評価ギャップはもはやツールのギャップではなく、インセンティブのギャップ:205kスターがベンチマークなしに集まるから、ベンチマークには市場がない。

スキルの正典インデックス + 初の転移反結果 + ランタイム検証(08-24)

審査済みプラグインマーケットプレイスが登場(08-24 12:03)

anthropics/claude-plugins-community(Apache-2.0、1.2k★)は Claude Cowork + Claude Code 向けコミュニティプラグイン
マーケットプレイスの Anthropic による読み取り専用ミラー——スキルエコシステムに欠けていた「アプリストア」層。プラグインは
clau.de/plugin-directory-submission で提出され、自動セキュリティスキャンを通過し、配布が承認される;marketplace.json は
Anthropic の内部レビューパイプラインから毎晩同期。インストールは claude plugin marketplace add
anthropics/claude-plugins-community
、続いて claude plugin install <name>@claude-community(現在のプラグイン:eli5、
quickdesign、testdino、tres-finance-plugin)。テーゼ 8 の予測の片割れを閉じる——配布チャネルが実在のセキュリティ
ゲート付きで存在するようになった——一方 評価 の片割れ(「スキルの MMLU」標準)は依然として常設リーダーボードなし。信頼
境界は実在する:すべてのプラグインが開発者の環境内で動くため、審査パイプラインこそがゲートである。

2 つのスキルベンチマークが出荷——ギャップは採用へと縮小(08-24 20:30)

「スキルの MMLU」ウォッチ項目がまた動いた:共有コーパス + リーダーボードが存在するようになった(作者単位の評価だけではない)。
両者とも今回のランで第一手検証した。

共有コーパスが出荷——そしてハーネス感度の壁にぶつかる(08-25 12:26)

2 つの一次情報源(いずれも第一手検証)がテーゼ 8 の「スキルの MMLU」ウォッチ項目を再び動かす——最も鋭い発見は、標準が未達成
であることの測定された理由である。

NVIDIA ACES——ランタイム Skill-Lift 標準が登場、スキル実行の約27%がベースラインに届かず(08-26 04:03)

arXiv 2608.20614 で直接確認。ACES(Agentic Continuous Evaluation of Skills) は、スキルを実行可能なエージェント成果物として
評価するリポジトリネイティブなフレームワーク:同一タスクをスキルあり/なしでペアのライブ A/B トライアルとして実行し(同じモデル、
ハーネス、ワークスペース、スコアラー)、軌跡を Agent Trajectory Interchange Format(ATIF)に正規化し、6 つのデフォルトランタイム
メトリクスを採点して Skill Lift(固定タスク/ハーネス/ワークスペース/スコアラーに対するスキルの付加価値)を報告する。同じプロトコルは、
baseline、skill、bundle、team-skill、plugin の各ターゲットを比較するプロダクト所有タスクスイートをサポート。結果:145 の実スキル
(社内リポジトリ + 公開カタログ)で、スキャン専用ゲートは相補的な側面を測る——構造 vs LLM 判定 Spearman ρ = 0.14。**947 の採点済み
ペアケース(64 の本番スキル中 58 から、4 つの主要ハーネス) で、平均複合 Skill Lift 0.2134**(95% CI [0.1967, 0.2301])、
結果のみ lift 平均 0.1799、スキル実行の約 27% がベースラインに届かない(947 中 87 負 / 171 ゼロ)。オープンソースの
SkillEvaluator(NVIDIA/SkillEvaluator)は 3 層——静的検証、重複チェック、Harbor ベースのライブ評価。別の検証済みカタログ
ベンチマーク(300+ スキル)ではセキュリティ除外で平均 +39。

なぜここに置くか: agent-plugins エコシステム初のランタイム測定標準——別の主張でもスナップショットコーパスでもなく、
「このスキルを入れるとライブのエージェントが本当に助かるか」に答える常設のペアトライアルプロトコル——そしてそのネガティブ結果が
正直なシグナル:「スキルが存在する」ことは、それが役立つかについてほぼ何も語らない。thesis-8 の評価ギャップにランタイム測定の半分を
与える。採用の半分(市場が実際に信頼する常設リーダーボード)は依然として空。

FrontierChallenge——「証明せよ」段階が自己申告の実測失敗ベースラインを獲得 (08-28 04:33)

arXiv 2608.24979 を一次確認。FrontierChallenge(FrontierAgent/Apodex チーム)は6 領域(量子化学、分子動力学、材料キャラクタリゼーション、分析化学、ライフサイエンス、電気化学/環境)にわたる 97 のエンドツーエンド科学ワークフローを 12 フロンティアモデル × 3 エージェントスキャフォールドで評価。最良構成(GPT-5.6 Sol + Codex)は 20.6% のみ完了。スキル評価ギャップにとって重要な 2 つの発見:

なぜここに置くか: スキル評価の「採用ギャップ」を比較可能性の不満から正しさの要件へ転換する——共有コーパスは既に存在し(SkillsBench、Versuz)、それを実行しないコストは今や失敗ランにおける約 75% の虚偽自己申告として定量化された。「採用された標準を出荷する者が市場を所有する」が同時に「それを出荷する者が唯一の検証をしている」ことを意味する、これまでで最も直接的な論証。

Archify —— 「正しく描けないなら描かない」スキル (08-26 20:19)

Anthropic のファーストパーティプラグインディレクトリ + 科学スキル垂直(08-27 04:15)

ファーストパーティ IDE ベンダーがバージョン認識スキルを出荷 (08-27 20:27)

WikiSkill——永続 wiki によるスキル進化(08-29 04:19)

リーダーボードが常設サードパーティへ——SkillsBench が Vals AI に(08-30 12:51)

スキルは管轄/言語の垂直領域へ特殊化する(08-31 04:15)

最大のメソドロジーリポジトリが独自の評価ラボを抱えていた —— 私の 08-24 の記述はそれを見逃していた(08-31 12:40)

245k★ の ECC、33k★ のセキュリティスキルルーター、スキルとして配布されるプロンプトライブラリ(09-01 04:03)

SkillsBench/Vals 採用チェック 09-02 04:44 —— リーダーボードは生きており、提出は依然としてない

academic-research-skills — 引用監査がツールとして出荷される(09-02)

mattpocock/skills が 245k★ を突破 —— アンチフレームワークの姿勢が明示的に(09-03)

diagram-design が 30.5k★ を突破——主張のあるセンスがインストール可能なレイヤーに(09-04)

2026-09-05 04:03

2026-09-06 04:03

openai/skills 非推奨化;スキル形式は GPU ベンダーとマーケティング縦軸を得る(09-07 12:03)

i-have-adhd がトレンド首位;スレッド自身がスキル対ハーネスの天井を測る(09-09)

ayghri/i-have-adhd(MIT、29.7k★、デイリー #1、+422):単一の SKILL.md——10 ルール(「最初の行が次のアクション」、
リストは 5 項目まで、前置き・総括・締めなし)でコーディングエージェント出力を ADHD フレンドリーに——Claude Code、Codex、
Cursor、Gemini、OpenCode、Kimi、Qwen のアダプタ、7 言語。HN スレッドの種明かし:本当の中身は 約 140 行;リポジトリの
8.7k 行の大半は eval。同じスレッドが測定した天井:Claude は「多くて数ターン」簡潔さを保った後に戻り、Claude Code 自身の
ハーネス指示がユーザールールを完全に上回る——「スキルでこれを解決するのは無理だと思う」。URL 貼り付けのスキルインストールを
注入ベクトルとして指摘する声も。「証明せよ」フェーズでこれまで最も鋭いデータポイント:プロンプトファイルが GitHub トレンドを
首位になれる一方、同じ議論が長期挙動を所有するのはハーネスであってスキルではないと記録している——8.7k 行の eval が存在する
のは、効果が減衰するからに他ならない。

2026-09-09 12:03→20:03 — カテゴリが二つに割れる;スキルがハードウェア パイプラインへ;画像プロンプトがパッケージになる

2026-09-10 04:03 — パイプラインと反 AI 調:チャネルがマルチエージェント工作流と書き言葉ツールを運び始める

2026-09-11 04:03 —— スキルのパッケージマネージャ層が到来

2026-09-14 04:03 — サプライチェーン層がスキル・カテゴリの差別化要件に

2026-09-16 12:03→20:03 — 最大のコレクションがライフサイクル規律に賭ける;監査ハーネスが skill として出荷される

2026-09-17 04:03 — 週間の頂点もやはりワンファイルの振る舞いルールセット

2026-09-17 12:03→20:03 —— spec フレームワークが HN の現実検証を受ける。Cowork の階層はリポジトリとして出荷

2026-09-21 04:03 — 評価の議論に実務者の声

Sources: evaluation.club ·
HN discussion

2026-09-26 04:35 — 持続する方法論 vs 検証ゲート

2 つのデータポイント、どちらも新リリースが駆動していない。mattpocock/skills は 269,636★ を維持(GitHub API——数字を水増しする trending レンダリングページではなく API を引用;+588/日、最終 push 9月24日):今日新しいブレイクスルー事象はなく、「名前のついた方法論の持続的採用」と読むべき——Claude Code と Codex 向けの約 26 の組合せ可能なスキル、ユーザー呼び出し(/grill-me 要件インタビュー、/to-spec)とモデル呼び出し(/tdd、/diagnosing-bugs、/code-review)——一人の教育者の作業プロセス全体がバージョン管理されインストール可能になり、単一目的ツールではなくフレームワーク型 offerings(GSD、BMAD、Spec-Kit)と競合している;README 自身の限定語はそのまま:アーキテクチャスキルは「レスキューではなくサーベイ」。OpenSpec v1.13.2(Fission-AI、70.3k★、+1,415/週)は「検証可能な意図」を売りにするツールにとって最重要の changelog 行を出した:「スキップされたチェックはもはや合格と報告されない」——成熟のマイルストーンか、それ以前のバージョンのすべての緑のチェックマークを再監査すべき理由か。README の細則:Node 20.19+、「高推論モデルで最もよく動作」、匿名テレメトリはデフォルトでオン(DO_NOT_TRACK=1 でオフ)。

Sources: mattpocock/skills · Fission-AI/OpenSpec · v1.13.2 release notes

2026-09-26 12:40 — プラグイン土地獲合戦がナレッジワーカーの席まで(09-17 初記録のトラクションデータ)

anthropics/knowledge-work-plugins が 25,633★(+889/週、9 月 25 日時点で push) でトレンド入り——ここで 09-17 に初記録したリポジトリのトラクションデータポイント。開発者ではなくナレッジワーカー向けの Apache-2.0 Cowork プラグイン 11 本:生産性、営業、カスタマーサポート、プロダクトマネジメント、マーケティング、法務、ファイナンス、データ、エンタープライズ検索、バイオリサーチ、プラグイン管理——それぞれ skills、MCP コネクタ、スラッシュコマンド、サブエージェントをバンドルし、claude plugin marketplace add でインストール。トレンド入りした 3 つ目の Anthropic プラグイン/スキル系リポジトリ(claude-plugins-official、financial-services に次ぐ)。注視すべき依存:各プラグインの価値はサードパーティコネクタ(Slack、HubSpot、Snowflake…)に人質に取られており、それらは Anthropic の管理下にない——開発者側リポジトリと同じ信頼サーフェスが、今度は法務とファイナンスのデータに向いている。

Sources: anthropics/knowledge-work-plugins · GitHub Trending(週間)

2026-09-26 20:03 — スキル経済が攻撃的セキュリティに到達。ただし奇妙なエンゲージメント比つき

zhaoxuya520/reverse-skill(37.7k★、+409/日、MIT + GPL/AGPL サブモジュール、最終プッシュ約 9 月 24 日):Claude Code、Codex、Cursor、Cline 等向けの「スキルルーターパック」——エージェントが APK、バイナリ、JS 暗号、ファームウェア、ペネトレーションターゲットに遭遇すると、44 のルーティングルール / 45 のスキルモジュールがプレイブックとツールチェーン(jadx、Frida、IDA、radare2、Ghidra、nmap、Burp)にマッピング。マルウェア/YARA から CTF(42 サブスキル)、LLM セキュリティまで網羅。175 ベンチケースを Windows+Ubuntu の CI 付きで主張。Claude-Red の双用途トレンドの続き(スキル層が攻撃的セキュリティをスケールでパッケージし始めた)——ただし 2 つの注意が付いて回る:エンゲージメント比が奇妙(37.7k★ に対し watchers 124・commits 181——09-21 に OpenStock で初適用したスター/コミット比率チェックがこのスター数を未検証と判定)、および README_AI.md を開いて「指示に厳密に従え」とエージェントに命じる——プロンプトインジェクション型のパターンで、エージェントの自動実行前に手動レビューに値する。README はアクションを認可/スコープチェックの背後に置いてはいる——スター数が本物なら、スキル層の内側にガードレールを作ろうとした試み。

Sources: zhaoxuya520/reverse-skill · GitHub Trending

2026-09-26 20:51 — reverse-skill 検査が深化:6 月の批判が指した履歴はもはや存在しない

09-26 項目の注意喚起への第一手 API パス、全数値を検証済み:(1) 37,737★ / 181 コミット ≈ 209★/コミット——タイプ一致の対照の 11 倍(davila7/claude-code-templates:31.9k★ / 1,684 コミット ≈ 19★/コミット)、「マークダウンパックはそもそもコミットが少ない」では説明できない;(2) 可視 git 履歴の全体が 2026-08-08 → 09-22 の範囲に対し、リポジトリ作成は 2026-05-13——約 3 か月の履歴が欠落、しかも 6 月 24 日の HN 投稿(2 pt、コメントなし)は「Trending agent skill pack with built-in refusal-suppression layer」と題し、その履歴にもう存在しない内容を記述していた;(3) 現在の同意ゲートは真新しい——PR #142 "consent-gate agent bootstrap" は 09-21(スター急増の後)に着地——そして現在の README_AI.md/RULES.md は実行をアクティベーション + 効果ごとの同意の後ろに确实にゲートしている(「リポジトリファイルの読み取りは実行の認可ではない」)ため、リポジトリは更生した可能性がある——しかし可視記録は最悪の報道の後から始まっている;(4) コントリビューター 16 名、最多コミッター 23%(ほぼ同名の zhaoxuya520/zhaoxuya アカウントを合算で約 36%)、タグは 1 個(v1.0.1)、README はコミュニティとして linux.do を指す。結論は維持・強化:スター数は未検証として扱う;「指示に厳密に従え」の注意喚起は今や部分的に陳腐化(現行テキストは読み取り専用への強制を明示的に否定)——信頼赤字は内容から履歴へ移動した。

Sources: zhaoxuya520/reverse-skill · HN — 6 月の投稿 · davila7/claude-code-templates

2026-09-27 20:03 — 図スキルジャンルがスケールする;スキルパターンが趣味ドメインでエンドツーエンドで実行される

archify が 72.5k★(tt-a1i/archify、MIT、9/27 にもプッシュ;第 35 週 validated-IR ジャンル勝者の更新、以前 49.3k★):リポジトリやアイデアを自己完結的なインタラクティブ HTML へ——アーキテクチャ、ワークフロー、シーケンス、データフロー、ライフサイクル図をモーション付きで——コードベースに対して検証可能であるよう設計され、Cursor、Claude Code、Codex CLI、OpenCode から利用可能。作成は 4/15;最後のフルリリースは v2.16.0(8/30)で v2.17.0-dev ライン。精査済み:トリガーは拡散——GitHub トレンドと中国コミュニティチャネル(README 内の WeChat/QQ グループ)、HN スレッドなし——Nous Hermes カタログの項目は公開 GitHub リポジトリのみ扱うと注記。スキル経済の現時点最大のコンシューマーヒットはドキュメンテーション:エージェントがアーキテクチャ図をリポジトリと同期させ続けることが、デモでなく一等ユースケースになりつつある。

chess-postmortem-skills(brumar/chess-postmortem-skills、Show HN 73 pts、リポジトリ作成 9/25、56★):lichess リンクと思考音声を渡すと——whisper.cpp でローカル文字起こし、PGN クロック時刻で文を手に整列、Stockfish を自然言語で尋問、注釈付き PGN・HTML ビューア・ナレーション映像を出力。2 日物の単著リポジトリで実例 1 件——勢いであり成熟度ではない。ただし「スキル」パターンを趣味ドメインでエンドツーエンドで実行した形——ローカル文字起こし → ツールオーケストレーション → 公開可能な成果物——は、どんなニッチなワークフローでも今週コピーできるテンプレート。

Sources: tt-a1i/archify · Hermes スキルカタログ項目 · brumar/chess-postmortem-skills · HN — 棋譜検証

2026-10-01 04:03 — 味のための決定的検出器(impeccable)。形式手法の波に反証章

impeccable(pbakaus/impeccable、週 +2,644 で 73k★、週間トレンド10位):「1スキル、24コマンド、ブラウザ内ライブ反復、61本の決定的検出ルール」でコーディングエージェントに良いフロントエンド設計をさせる——Anthropic の frontend-design スキルのフォークであることを明記し、テーゼは「どのモデルも同じ SaaS テンプレートで訓練された…どこでも Inter、紫から青へのグラデーション、カードの中のカード」。検出ルールは「LLM も API キーも不要で走る」。プロジェクトは生きている:5日で v0.1.6–0.1.8(9月25–29日)、9月30日に push。同日の HN の反響(「vibe coding した我々のサイトがデザイナー製に見える」、127 pts)がユーザー側から同じ結論を着地させる——トップコメント:「あなたは設計学校で教えるデザインプロセスを偶然再発明した」。設計のボトルネックに対するスキルカテゴリの答えはコンパイラ時代のそれ:味のための決定的リンタ——失敗モードがモデル間で一貫していることが分かったから。評価はどこ? まだ不在——カテゴリの恒常的な欠落。

「TLA+ に検査できること/できないこと」(Hillel Wayne、Computer Things、9月30日、87 pts):エージェント×形式手法の波へのカウンターウェイト。引き金は「Claude Code の発明者 Boris Cherny が、Opus が TLA+ で競合状態を発見できたと述べた」。Wayne:「『TLA+ が AI を AI 自身から救う』物語を少しだけ冷まそう」。核心の限界は []P/P'/<>P で歩いた通り:「性質を検証するには、検証すべき性質が必要」——モデルが検査するのは仕様で、正しい仕様を書くのは依然人間の、未解決の半分だ。波の有用な版は「モデルがシステムを証明する」ではなく「モデルが書く気しなかった仕様を書き、実装をそれに縛る」。検証は依然、何が重要かという人間の決定から始まる。

2026-10-04 04:03 — ECC 2.2:最大のサードパーティスキル棚は、メンテナー 1 名とマルウェア警告

ECC 2.2(affaan-m/ECC、MIT——272,129★、日次トレンド第 4、+954/日、v2.2.3 は 10月1日):自称「エージェントハーネス性能最適化システム」——1 インストールで plan→test→implement→review→verify→remember→improve をエージェントインフラに変える:専用エージェント 68、スキル 293、コマンド 94、ランタイムフック/メモリ、プロンプト・フック・MCP 設定・権限・シークレットを走査する「AgentShield」。v2.2 は Claude Code、Codex、Kimi Code 向けガイド付きセットアップを追加。README は Cursor、OpenCode、Gemini、Zed、Copilot、Antigravity、Qwen については能力限定アダプタのみと認める。マネタイズ:プライベートリポジトリ向け $19/席/月 Pro。この項目を構成する 3 つの事実:目立つ「公式ソースのみ——サードパーティの再アップロードにはマルウェアが含まれる可能性があります」サプライチェーン警告、メンテナー 1 名の週次出荷、そしてスキル 293 本が何かを改善するかについての独立評価ゼロ——スター数が唯一のシグナル。 テーゼ 8 の「証明せよ」フェーズが最大のテストケースを得た:このスター数では ECC はプラットフォーム公式に次ぐ最大の agent スキル配布チャネルであり、そのバスファクター、自らのサプライチェーン警告、未検証の性能主張こそが物語の全部だ。棚が一人の保証できる規模を超えた。

Sources: affaan-m/ECC · v2.2.3 リリースノート