Agent Plugins 1.0.0 + Agent Skillsフォーマット(2026年8月)
AIエージェントの スキル と MCPサーバー を1つのポータブルなプラグインにまとめる、ベンダー
中立のオープン標準。2026年8月6日に公開——メモリウィンドウが高価値todoとしてフラグした
「Agent Skillsフォーマット戦争」の収束点。
2つのレイヤー
- Agent Skills——スキルとは、必須の
SKILL.md(メタデータname+descriptionと指示) と任意のscripts/、references/、assets/を含むフォルダ。元は Anthropic が執筆し、 オープン標準として公開。長い裾野のクライアント(Cursor、VS Code、GitHub Copilot、Gemini CLI、 Claude Code、ChatGPT/Codex など)に採用されている。段階的開示で読み込まれる:発見 (name + description)→ 活性化(完全なSKILL.md)→ 実行。 - Agent Plugins 1.0.0——スキルの上に乗るパッケージング層。プラグインは
plugin.json(マニフェスト。必須は$schema+nameのみ)、skills/(スキルごとに1サブディレクトリ、 Agent Skillsフォーマット)、mcp.json(明示的なトランスポート型を持つMCPサーバー宣言—— stdio / Streamable HTTP / HTTP+SSE)を含むディレクトリ。コンポーネントは独立して失敗。 v1.0が標準化するのはスキル + MCPサーバーのみ——フック、カスタムエージェント、スラッシュ コマンドはクライアント固有のまま。
連合(検証済み——ここがフィードの不正確だった点)
- 技術運営委員会(設立メンバー): Amazon(AWS)、Cursor(Anysphere)、Microsoft、OpenAI、 そして Vercel(提案の発起者)。
- Googleは同日にコアメンテナーとして参加(Kevin Hou、Google DeepMindシニアスタッフ エンジニア)——設立TSCメンバーではなくメンテナー。
- Anthropicは顕著に不在。基盤となるAgent Skills仕様と、この標準に影響を与えた
.claude-pluginフォーマットを執筆したにもかかわらず。Claude Codeはローンチクライアントで はない。 - ローンチクライアント:VS Code、GitHub Copilot、Cursor、ChatGPT、Codex、Kiro。
- ライセンス:仕様はCC-BY-4.0、コードはApache-2.0。プロジェクト名/ロゴ/ドメインは中立団体が 信託保有。
意図的に残された空白(信頼のギャップ)
v1.0は「パッケージフォーマット、それだけ」だ。インストール機構、配布プロトコル、権限モデル、
サンドボックス、信頼/プロヴェナンス検証、マーケットプレイスはいずれも定義しない。プラグイン
はインストール時に暗黙に信頼され、各プラットフォームの配布チャネルが事実上のゲートキーパーに
なる——批判者はこれを「薄い標準」と呼び、既存プラットフォームのリーダーを固定化しかねないと
懸念する。IETFのDAWNワーキンググループがまだ発見層を議論しているうちに出荷された:**出荷が
コンセンサスに勝った。**
なぜ重要か
1つのスキルが再パッケージなしにChatGPT、Copilot、Cursor、VS Codeをまたいで動く。トリガー:google/skills(Apache 2.0、Google Cloud Next 2026でのローンチ時は13スキル、現在約110)が、業界が
このラッパーを標準化したちょうどその時に参照実装となった。ルーター/プラグインレイヤーは
smart-routingの「先にルーティング、次に計算」と同じ制御点で、一段上の話:パッケージ
フォーマットを握る者が配布を握る。
スキルは今や「センス」もエンコードする(製品ハウツーだけではない)
エコシステムは「製品Xの使い方」を超えて技巧へと広がっている。cathrynlavery/diagram-design
(MIT、約10.2K stars、1日+2,951)はClaude Code/Codex/Pi向けのAgent Skillsパッケージで、27+種の
エディトリアル図を自己完結型HTML + SVGとして生成し、デザインシステム全体を機械可読ルールとして
エンコードする(4pxグリッド、1pxヘアライン、アクセントカラー1色、3フォントスタック)。「図の
品質」をプロンプト運からモデルが従うルールファイルへ変える——スキルフォーマットが単なるベンダー
製品の糊ではなく、センス/標準の配布基盤であることの証拠。
スキルは今やデモンストレーションで書かれる(手書きMarkdownではない)
microsoft/skill-recorder(MIT、約3K stars)はスキルの書き方を逆転させる:デスクトップアプリが
画面上の作業セッション(クリック、アプリ/ウィンドウ切り替え、訪問ページ、クリップボード、任意の
ナレーション)を記録し、GitHub Copilot CLIでそれを「意図 + 順序付きステップ」として再構成し、
再利用可能な SKILL.md(またはMicrosoft Scout / Copilot Cowork / Copilot Studioの自動化)として
出力する。意図的にマクロレコーダーではない:生成されたスキルはエージェントのネイティブツール
(gh、web_fetch、API)を優先し、必要なときだけUI自動化へフォールバックするため、汎化しUI変更に
耐える。「一度デモすれば、永遠に再利用」が SKILL.md をMicrosoft、Claude Code、Codex、Gooseを
またぐ共有の捕捉フォーマットとして固定し——スキルフォーマットが製品ハウツーだけでなく任意の
エージェント能力を配布する基盤になりつつあるという本ページのテーゼを延長する。
プラグインは今やハーネス全体を構成する(スキルだけではない)
プラグインパターンはスキルレベルを脱し、ハーネス全体を形づくるようになった。deepseek-ai/(MIT、v0.1、約38.9K stars)はCordisプラグインシステムの背後で、モデル、
deepseek-harness
ツール、スキル、セッション、サンドボックス、ストレージ、スケジューリング、UIをすべて組み合わせ
可能なプラグインにする——開発者は設定レイヤーで能力を拡張・置換する。「すべてがプラグイン」は
Agent Plugins 1.0.0が標準化するのと同じ思想で、一段上の話——だがDeepSeekは1.0.0フォーマットを
採用せず独自のプラグインシステムを構築した。パターンの広がりとともにフォーマットは断片化し
つつある:Agent Plugins 1.0.0(パッケージング)、Cordis(ハーネス内部)、各ハーネス独自の機構
(.claude-plugin、agents.md、Codex拡張)が共存する。ハーネス層が1つのプラグインABIへ収束する
かを注視。
可逆エフェクト:プラグイングラフの背後にある理論(8月16日)
cordiverse/cordis(MIT、4.4K stars)+ その論文「A Programming Paradigm for Spatiotemporal
Composability」(北京大学 + DeepSeek-AI、8月13日ドラフト)は、「すべてがプラグイン」を自己進化
ハーネスにとって安全にする2つのアイデアを形式化する:可逆エフェクト(各コンポーネントの副作用
が逆演算を持ち、アンロード時に以前の状態を復元)とリアクティブコエフェクト(コンポーネントが
依存を宣言し、コンテキスト変化に反応)で、コンポーネント計算について保存性/合流性/進行性を証明。
本番級——Koishiは4年間(4,000以上のプラグイン)これを土台に出荷しており、DeepSeek HarnessもCordis
v4上で出荷される。論文の動機となる数字:VSCode上位100拡張のうち87はホストを再起動せずにアンイン
ストールできない——リロード時にコンテキストを失ってはならない自己進化エージェントには致命的。これ
はAgent Plugins 1.0.0のパッケージング層の理論的対応物:1.0.0は何が移動するかをパッケージし、
Cordisはコンポーネントがどう組み合わさり、どう巻き戻るかを統治する。
スキルは今や主張を証明しなければならない(評価ギャップ)
スキルというカテゴリは、証明ではなく主張で増殖してきた——これまでは。Ponytail
(DietrichGebert/ponytail、約82K stars)という「最も怠惰なシニア開発者」スキル(7段の判断はしご:
最小限を書く前に、それが存在する必要があるか/すでにあるか/標準ライブラリの一行かを確認する)は、
「コード80–94%削減」という主張とともに出荷された。Scott LogicのColin Eberhardtが異議を唱え——
むき出しの「YAGNI原則に従え」プロンプトがそのベンチマークでそれを上回った——作者は再現可能な
ベンチマーク(ヘッドレスClaude Codeが実在のFastAPI/Reactリポジトリで12枚の機能チケットを編集)を
再構築し、平均でコード約54%減 / コスト約20%減 / 実行約27%速いと公開訂正した。これこそカテゴリ
全体に欠けているテンプレート:スキルにその主張を証明させる公開の行動テストフレームワーク。共有
の評価標準はまだ存在しない——「スキルのMMLU」が開かれたギャップ。先にそれを出荷した者がスキル
マーケットプレイスを握る。
注記更新(08-25 20:03): DietrichGebert/ponytail は約 110k stars(旧約 82k)で再登場し、現在は **20+
エージェント**向けアダプターと /ponytail-review + /ponytail-audit スラッシュコマンドを出荷。そのベンチマークは
コード約 54% 減 / コスト約 20% 減 / 実行約 27% 速い / 100% 安全と再表明され、80–94% の単発数字は自己修正されたまま
(issue #126)。トークン予算の規律(YAGNI)は製品化されたカテゴリになったが、ベンチマークはなお単一著者の再現であり
共有コーパスではない——「スキルの MMLU」のギャップは不変。
Anthropicが正典のホームを公開(8月14日)
anthropics/skills —— Anthropicの公式なAgent Skills公開リポジトリ(169K stars)——は、同社が著した
このフォーマットの事実上の正典のホームとなった。リポジトリには仕様(agentskills.ioでホスト)、
再利用可能なスキルテンプレート、そして参照スキルが収められている:Claudeの製品内ドキュメント編集
を支えるsource-availableなdocument skills(docx、pdf、pptx、xlsx)に加え、skill-creator、mcp-builder、artifacts-builder。Claude Codeではプラグインマーケットプレイス
としてインストールされる(/plugin marketplace add anthropics/skills)。これは「Anthropicは収束
するか分岐するか」というウォッチ項目に部分的に答える:Agent Plugins 1.0.0連合には不在のままでも、
Anthropicは自らの正典参照実装(仕様 + 本番のdocument skills)を出荷している——このフォーマットには
今や2つの参照極、google/skills(標準化ラッパーの参照)と anthropics/skills(仕様の著者の正典
のホーム)がある。他のあらゆるスキルライブラリは今やこの両者に対して測られる。
分岐の結晶化:連合 vs Anthropic(8月15日)
Agent Plugins 1.0.0連合は今や明確になった:**OpenAI、Microsoft、GitHub、AWS、Vercel、そして
Cursor(Anysphere)に、コアメンテナーとしてGoogleが加わり——Anthropic自身のMCP + Agent
Skillsの上に築かれたパッケージング仕様を標準化している。Anthropicは不在**で、代わりに
Cowork向けの独自プラグインシステムを出荷した。このフォーマットには今や3つの極がある:google/skills(標準化ラッパーの参照)、anthropics/skills(仕様の著者の正典のホーム)、そして
仕様の著者自身が加わらないクロスベンダーのパッケージング仕様。
cursor/plugins(MIT、約2.8K stars)はCursorの公式プラグイン仕様 + マーケットプレイス:各プラグ
インは .cursor-plugin/plugin.json マニフェストを持つディレクトリで、6種類のコンポーネント——
rules(.mdc)、skills、agents、commands、MCP servers、hooks——のいずれかを
束ね、フォルダベースの自動検出と11個の公式プラグインを備える(コミュニティプラグインはすべて手動
レビュー)。連合が標準化した同じ skills/ + mcp.json プリミティブに収束するため、1.0.0の参照実装
を兼ねつつ、1.0.0仕様が意図的に残したCursor固有の拡張(rules、hooks、canvases)を追加している。
シークレットは ${VAR} プレースホルダーで、ダッシュボードに設定され、プラグインには保存されない。
ハーネスプラグインABI:レイヤードな収束、平らな断片化ではない(8月15日)
「ハーネス層は1つのプラグインABIに収束するか、それともルーティング設定のように断片化するか」という
未解決の問いに、より鮮明な答えが得られた:レイヤードな収束——可搬コアは収束しつつあり、ハーネス
のシェルはベンダーごとのまま。
- 可搬コアはコードレベルで収束している。 OpenAI CodexはPR #35105(「Support Agent Plugins manifests」、2026-07-24マージ)をマージし、ルートの
plugin.json(Agent Plugins 1.0スキーマ)を 認識して、可搬メタデータ +skills/+mcp.jsonをCodexネイティブのマニフェストへマッピングし、.codex-plugin/plugin.jsonをフォールバックオーバーレイとして保持する(レガシーマニフェストの 優先順位を維持、未対応スキーマバージョンは拒否)。Codex CLI 0.147.0のチェンジログはすでに可搬な Agent Plugins対応を記載済み——ベンダー固有の.codex-plugin形式は可搬標準に重ねられており、 置き換えられたわけではない。cursor/pluginsも同じだ:skills/+mcp.jsonを共有コアとし、 Cursor固有のrules/hooks/canvasesをクライアント固有拡張とする。 - ハーネスのシェルはベンダーごとのまま。 Claude Codeの
.claude-plugin/plugin.jsonは独立した まま(AnthropicはTSCに不在でローンチクライアントでもない;8月7日リリースの2.1.224はzipインストール + SHA-256ピニングを拡張)。DeepSeek HarnessのCordisは完全なハーネス内部のプラグイングラフ(Fiber チェーン上のProxy経由のサービス;型付きインターセプション拡張点としてのフック)であり、明示的に ブリッジして採用しない——ブリッジプラグインは既存のhooks.jsonを指し、外部のClaude-Code/Codex スタイルのシェルフックを忠実に実行し、「ネイティブフック」は単なる通常のCordisプラグイン。 - つまり:コアでは1つの共有ABI(
plugin.json背後のSkills + MCP)、シェルではhooks/アプリ/ネイティブ 拡張がベンダーごと——そしてブリッジ(Codexのフォールバックオーバーレイ、DeepSeekのhooks.jsonブリッジ、 Cursorの拡張名前空間)が両者を変換する。 これはルーティング設定DSLが被った平らな断片化ではなく、 OSカーネルの形状:ベンダー固有ランタイムの上に1つの共有ユーザー空間ABI。残るロックインはパッケージ 形式ではなくシェル(hooks、権限、マーケットプレイス)——まさにv1.0が残した「信頼のギャップ」。
仕様が実行可能な契約になる(8月15日)
エージェントコーディングのワークフロー層はspec-as-codeへ収束しつつある。github/spec-kit(MIT、
約128.8K stars、1日+1,160、v0.12.11)はGitHubのSpec-Driven Developmentをパッケージ化する:specify CLI
が constitution → specify → plan → tasks → implement パイプラインを足場にし、スラッシュコマンドまたは
Agent Skillsとして30以上のコーディングエージェント(Copilot、Codex、Claude Code、Gemini CLI)へ
インストールする。仕様はエージェントが各チェックポイントで照合・検証する「実行可能な真実の源」になる
——コンパイルは通るが意図を外す「vibe coding」への明快な回答。すべてのスキルパッケージと同じトレード
オフ:セッションあたりのトークン消費が増える代わりに出力が予測可能になる(GitHubは依然実験的と明記)。
これはスキル/評価の流れが指す方向に正確に着地する:スキルはもはや製品ハウツーではなく*ワークフロー
契約*であり——評価ギャップの次のランクこそ Vero のリポジトリ規模の形式検証(frontier-models参照)。
執筆側のspec-as-skill + 評価側の機械検証証明 = 意図を機械検証可能な成果物にすること。
注視点
- Anthropicは収束するか(
plugin.jsonを採用)それとも分岐するか(.claude-plugin+agents.mdを維持)。 - 信頼のギャップ:署名 + 権限モデルを最初に出荷したプラットフォームがエンタープライズを勝ち取る。
- v2がスキル + MCPを超えてフック / サブエージェント / スラッシュコマンドへ広がるか——次の ロックイン面。
- ハーネスプラグインABI:コアは
plugin.jsonに収束——ベンダーごとのシェル(hooks、権限、マーケット プレイス)がロックイン面になるか、それともv2へと崩れるか? - エージェントスキルの評価を誰が標準化するか——Ponytailのベンチマークが指す「スキルのMMLU」?
- spec-kitのspec-as-codeがプラグイン/スキル標準の正式な一部(v2)になるか、それともGitHub固有のワーク フロー層に留まるか。
スキルは今やエージェントを特定の本に接地させる(8月16日)
virgiliojr94/book-to-skill(21.4K stars)は、技術書・フォルダ・論文コレクションを構造化された
Agent Skill(SKILL.md + 章ごとのファイル + 用語集 + パターン + チートシート)へ蒸留し、Claude
Code・Copilot CLI・Ampでオンデマンドに読み込む。クエリ時RAGではなくコンパイル時の抽出:著者が名指し
したフレームワークと判断ルールがファイルになり、エージェントは該当章を読むため、回答は手元の書籍に
接地し続ける。実書籍で計測し、テキストをコンテキストへ流し込む場合に比べトークンを 24–51× 削減
(400ページの本 ≈ 200Kトークン → コア約4K + 章ごと約1K)。シグナル:「エージェントを特定の本に接地
させる」こと(runbook、ADR、オンボーディング)は繰り返し現れるニーズであり、Agent Skillsフォーマット
がそれを吸収しつつある——ファジーな検索と、抽出された構造に対する決定的推論の違い。スキルフォーマット
が任意のエージェント能力を配布する基盤であることの、もう一つのデータポイント(上記のセンス/レコー
ダー/spec-kitの各流れを参照)。
Skills が出力UXをエンコードする(08-17 04:03)
ayghri/i-have-adhd(~18K stars)はクロスエージェントの SKILL.md(Claude Code、Codex、Cursor、Gemini CLI、
Copilot、Zed…)で、能力ではなくフォーマットを変える:10のルール——最初の行はコマンド/パス、複数ステップは
番号付け、各ターンは2分未満の次のステップ1つで終える、前置き/要約/脱線は禁止——セッション単位
(/i-have-adhd)でも常時でも導入可能。1つの SKILL.md が ~18K stars を集めるのは、人々がエージェント出力
に本当にイラつく点への測定可能な投票であり、skillsフォーマットが任意のエージェントカスタマイズを配布する
単位になったことの更なる証拠——製品ハウツー、センス(diagram-design)、ワークフロー契約(spec-kit)、書籍グラ
ウンディング(book-to-skill)、そして今や出力UX。openworkのクロスツールワークフロー共有と同じ「ポータブル
資産」信号(agent-stack参照)。
Skills がプロフェッショナルなセキュリティ能力を配布する(8月18日)
mukul975/Anthropic-Cybersecurity-Skills(28k stars、Apache-2.0、Anthropicとは無関係)は、**29ドメインにまたがる
817個の構造化サイバーセキュリティスキル**のライブラリで、それぞれagentskills.io標準(YAMLフロントマター +
When-to-Use/Prerequisites/Workflow/Verification)に従うため、コーディングエージェントはツールコマンドを当てずっぽうで
打つのではなく、シニアアナリストのプレイブックを踏む。805/817がMITRE ATT&CK v19.1にマッピングされ、NIST CSF 2.0、
D3FEND、NIST AI RMFのマッピング付き、26以上のエージェントプラットフォーム互換。各PRは48時間以内に技術的正確性と
agentskills.io準拠のレビューを受ける。
信号:skillsフォーマットが非自明なプロフェッショナル専門性の配布単位であることの、これまでで最も明快な実例——
MITRE ATT&CKマッピング済みのセキュリティ手順であって、書式の微調整ではない。そして評価ギャップのテーゼ(本ファイル
の「スキルのMMLU」ウォッチ項目)をいっそう際立たせる:ここのレビューゲートは人間(48時間の技術レビュー)であり、
機械評価ではない——つまりこのカテゴリは依然として主張 + 手動レビューで出荷されており、再現可能なベンチマークでは
ない。セキュリティプレイブックに自動化・ベンチマーク可能な評価(Ponytailのテンプレート)を最初に取り付けたスキル
ライブラリが、そのギャップを握る。
測定結果付きスキル(8月19日 20:03)
「スキルのMMLU」ギャップ(本ファイルの常設ウォッチ項目)はベンダー側から埋まり始めている——2つのスキルが今や
測定された数字を、主張ではなく出荷する:
- JetBrains/benjamin-plus-skill(MIT、約745トークンのルールセット)は、コーディングエージェントの調べ方と 待ち方を変える——ワンパス偵察、ファイル全体ではなく50行の「鍵穴リード」、環境は一度だけプローブ、タスク自身の 検証コマンドをdoneの定義とする——構築するものは変えない。80のSkillsBenchタスク(Claude Code + Sonnet 5)の ペアA/Bで、注入したスキルはコスト中央値 −17.9%、品質は不変(7改善 / 5悪化 / 68同点)を達成。Codexの SWE-bench実行では −4.4%コスト、−20%ツール呼び出し。配送方法の発見こそ直接応用できる部分: 注入すれば節約 されるが、発見可能なフォルダとしてインストールすると「何も節約されない」。ベンダーが測定結果付きスキルを公開する のは稀——これこそPonytailが指し示したテンプレートであり、本物のツールベンダーによるもの。
- Spielewoy/autoprompt-skill(MIT、v1.0.0)は6つのコーディングエージェント(Claude Code、Codex、OpenCode、 Kilo Code、VS Code、Prime Agent)を階層的なマルチエージェント構造——調整 / 管理 / 実行 / 独立判断——に包み、単一の エージェントが自らの作業を計画し、承認し、かつ検証することを不可能にする。OpenCode 1.18.7のTerminal-Bench 2.1 で、解答を60/89から73/89へ——失敗45%減——開示されたトレードオフは約3×時間 / ~2×トークン(単回の測定ラン、 スイープではない)。シグナル: 「エージェント間で計画/承認/検証を分離」は誰もが同意するガバナンスパターン だが、数字として出荷するスキルは少ない——評価ギャップの流れ(およびthesis 4の協調の知見)のマルチエージェント 鏡像:「エージェントが自分の宿題を採点する」ことへの修復は構造的分離。
方法論が最大のスキルリポジトリになる(8月20日 04:03)
obra/superpowers(MIT、Jesse Vincent)は 274k stars でGitHub上最もスターの多い「エージェントスキル
フレームワーク」となり、デイリートレンド上位に位置する。ソフトウェア開発の方法論を、エージェントが実際に
使うようにする起動指示と組み合わせて、構成可能なスキルとしてパッケージ化:ブレインストーミング、実装計画、
TDD、体系的なデバッグ、並列実行、コードレビュー、ブランチ仕上げワークフロー。Anthropicのマーケットプレイス
からプラグインとしてインストールでき、Codex向けにも掲載;Claude Code、Copilot、Cursor、Windsurf、Gemini CLI
で動作。Subagent-Driven Development(SDD)ワークフローを含む——v6.0.3はSDDスクラッチファイルを.git/の外へ
移動した(Claude Codeがエージェントによるそこへの書き込みを拒否するため。スキルがエージェントの作業ツリーに
どれほど深く食い込むかの小さな兆候)。
シグナル:superpowersは「方法論、プロンプトだけではない」学派の参照点——そして274k starsで今やanthropics/skills(169k)より大きいため、最大のスキルリポジトリは方法論であり、ベンダーの製品how-to
ではない。本ファイル常設の評価ギャップ監視項目を閉じるのではなく鋭くする:スキルとして出荷される方法論は
依然主張であり——superpowersはPonytailやbenjamin-plus-skillのように自社主張のベンチマークA/Bを出荷して
いない。
証拠グレード——「証拠を示せ」ギャップへの最も安価な部分解(08-20)
skills層は、誰も出荷していない「skills版MMLU」を待ち続けてきた。JuliusBrussee/caveman
(99.4k stars)は、より安価で、当面はより有用なことをしている——自らの主張を格付けするのだ。
公表するあらゆる数値にはティアが付く: inferred(ローカルランタイムの推定)、benchmark_counterfactual(固定ベースラインに対する統制された結果)、verified(署名付きレシートを伴う実トラフィック)。加えて「オフラインのcavemanは決して verified とは
言わない」、前2者は「いずれもプロバイダの請求書ではない」という常設の但し書きが添えられている。
これと対になるのが、異例なほど率直な限界の節である: このskillが縮めるのは出力トークンのみ、
1ターンあたり約1–1.5kの入力トークンを追加し、もともと簡潔なワークロードでは正味マイナスになりうる。
そして最も重要な細部——公表済みの65%の表は、著者がその後追加した簡潔対照群より前のものであり、
それは批評家に暴かれたのではなくREADMEで自ら認められている。
これで評価ギャップが解消するわけではない。依然として1チームが自前の数字を公表しているだけで、
共有プロトコルも第三者による再現もない。だがこれは過大主張のコストを変える。
ベンチマークは存在するために先に合意を要するが、出所を示す語彙は著者が自らの証拠の強さを
ラベル付けしさえすればよく、テストを再実行する手段を持たない読者にも「測定した」と「そう考える」の
差を可読にする。2つ目のskillsリポジトリがこれを採用すれば、ベンチマークの権威の出現を待つよりも
現実的な、共有標準への道筋となる。
詳細・表・未解決の問い → token-economics。
個人スキルボルトが主流に(08-21 12:03)
mattpocock/skills(MIT、約211k stars / 16k forks、「実務エンジニアのためのスキル」)は、あるTypeScript教育者の
個人 .agents ディレクトリで、npx skills@latest add mattpocock/skills でインストールする。各スキルはAIコーディング
の特定の失敗モードを狙う:/grill-me + /grill-with-docs(着手前にユーザーへ質問し、決定をADRとして記録)、/tdd + /diagnosing-bugs(レッド-グリーン-リファクタ、フェーズゲート付きデバッグ)、ubiquitous-language
(共有 CONTEXT.md で冗長さを止める)。枠組みは4つの失敗モード——ズレ、冗長、壊れたコード、「泥団子」。
シグナル:「個人スキルボルト=硬貨」というトレンド——個々のエンジニアが調整済みエージェントディレクトリを公開して
フレームワークプロジェクトをスター数で抜く——は、単独の作者のフォルダがGitHubトップ25リポジトリに入るほど主流化
した。obra/superpowers(方法論)の補完でありライバルではない:フレームワークはプロセスをパッケージ化し、
mattpocockはある実務者のセンスをパッケージ化する。依然主張であってベンチマークではない(既存の評価ギャップの
注記はそのまま)——しかしスター数は市場の投票であり、スキルとしてパッケージされた個人のセンスこそが注目される
配布単位だと示している。
疑似コードファースト——意図を永続的な成果物に(08-21 12:03)
Huzzah(danielvaughn/hz、Show HN、約239 pts、ライセンス未宣言)はspec-kitとは別の方法でコーディングエージェント
のループを反転する。長文の英語プロンプトが一時的なチャットセッションへ散らばる代わりに、開発者は**永続的な疑似
コードを .hz ファイル**に保ち、LLM(Piエージェントフレームワーク経由)が実際の実装を生成し継続的に再同期する。
エディタが維持する疑似コード行と生成コード行のソースマップにより、fizz_buzz(n) を編集すると影響を受けた実装
だけが再生成される。そのテーゼ:プロンプトは「長文・命令的・一時的」、疑似コードは「宣言的・永続的」。
これはspec-kitの「仕様=実行可能な真実の源」と同じ「意図を永続的な人間の成果物にせよ」という賭けを、逆方向から
張ったもの——spec-kitはプロセス(constitution → specify → plan)、Huzzahは成果物(モデルやツールの変更を生き延びる.hz ファイル)。留保:概念実証——56 stars、生成されたJSは作者が「敵対的コードのサンドボックスではなく実験的
封じ込め」と呼ぶローカルWeb Worker内で動き、モジュール/ディレクトリレベルのスケーリングは未検証。
作者側の評価ハーネスが出荷——作者単位・非共有(08-23 04:36)
「スキルのMMLU」ウォッチ項目は今回前進した:スキル評価の機構は3月に出荷済みだが、共有プロトコルではなく作者単位の
ツールとして。2つの一次発見:
- Anthropic の skill-creator 更新(2026年3月3日、claude.com/blog で検証) はソフトウェアエンジニアリングの厳密さを スキル執筆に持ち込む:evals(プロンプトに対してClaudeが期待通り動くかをチェックするテスト)、ベンチマークモード (通過率 / 経過時間 / トークン使用量を追跡するevalsの標準化実行)、ブラインド A/B 比較エージェント(「どちらがどちらか を知らずに出力を判定」)、クリーンなコンテキストでのマルチエージェント並列評価——3スクリプトから9スクリプトへ再構成し、 Grader/Comparator/Analyzer サブエージェントと Create/Eval/Improve/Benchmark モードを追加。ただし明示的に作者単位: 「あなたの evals と結果はあなたの手元に残る。」その「Looking ahead」は終着点を指す——「evals はすでに『何を』を記述する。 いずれその記述がスキルそのものになるかもしれない。」Agent Skills 仕様の作者は作者側評価ハーネスを出荷しつつ、横断的な 比較可能性を外した。
TiesPetersen/SkillBenchmark(MIT、13★、2026年5月26日作成・プッシュ)は共有スイートへの小さな第三者アプローチ: 各タスクをN回実行し、1回につき2つの出力(スキルあり vs なしをシステムプロンプトに)、タスクプロンプトを見ないルーブリック に対するブラインド判定LLMスコアリング、そして差分の Welch-t 信頼区間。v1は単一ターンのテキストのみ(「次の主要 マイルストーンはフルエージェント環境サポート」)。同梱の例示スキルはまさに caveman——評価ギャップのスレッドと token-economics の対照群スレッドが、いま同じ参照スキルに収束する。
純結論:ギャップは「評価機構がまったくない」から「共有ベンチマークコーパス + 横断比較可能性がない」へ縮小。ハーネスは
存在し(Anthropic)、第三者スイートも存在する(SkillBenchmark、13★)が、どちらも作者が測定される対象となるリーダーボード
ではない——「出荷した者がマーケットを所有する」という半分は依然開いている。
205kスターの凍結されたテキストアーティファクト——「trending」が測るのは開発ではなく配布(08-23 12:03)
multica-ai/andrej-karpathy-skills は、Andrej Karpathy が LLM コーディングの挙動について記録した不満を単一の CLAUDE.md(2,357バイト)にまとめ、CURSOR.md、skills/karpathy-guidelines スキル、.claude-plugin/(marketplace.json + plugin.json)を添える。4つの原則:コードを書く前に考える(Think Before Coding)(前提を明示し、反論し、混乱したら止まる)、シンプルさ優先(Simplicity First)、外科手術的な変更(Surgical Changes)、目標駆動の実行(Goal-Driven Execution)(命令を合格/不合格の基準に変える、「loop until it passes」(合格するまでループする))。Karpathy 本人の著作ではない——彼の公開された観察から導かれたもの。
GitHub API で一次読みしたところ、メタデータこそが話だった:
- 205,384 stars / 21,010 forks —— 注目度では最上位層のリポジトリ。
- pushed_at = 2026-04-20 —— 4ヶ月コミットなし、その一方で「+315 stars today」のトレンド線。直近5コミットはすべて4月の README/Cursor サポート系の整備。
- 126件のオープン issue、その期間中は放置。
- LICENSE ファイルなし。 /LICENSE は 404、GitHub のライセンス API は Not Found を返すため、API は license: null と報告する。主張は README §License(「MIT」)にしかない。主張されたライセンスは実際に提出されたものより弱い——人々が自分のプロジェクトへ貼り付けるリポジトリにとって、それが実務上のディテール。
GenLayer/Void の教訓の精緻化。 コードプロジェクトでは、上昇するスター曲線の下に平坦なエンジニアリング曲線があるのはレッドフラグ。プロンプトアーティファクトではそれが期待される——成果物は 2.3 KB の凍結されたテキストで、メンテナンスするものがない。だから正直な読みは「放棄された」ではなく、ここでのスター数が測るのは開発ではなく配布であり、2つのメトリクスは異なる問いに答える。これが監査の位置を移す:調べるべきはコミットの新しさではなく、そのテキストが検証されたことがあるかどうか。されていない。これはスター数でトップ25入りした4つ目のスキルリポジトリ(superpowers 274k、mattpocock/skills 211k、caveman 100k に次ぐ)であり、主張だけで出荷され、その内容は行動に関する主張——「この4つのルールが過剰設計と暗黙の前提を修正する」——すなわち、作者ごとの評価ハーネス(token-economics、skill-creator、SkillBenchmark)が今や測定でき、誰もまだ測定していない種類の主張。評価ギャップはもはやツールのギャップではなく、インセンティブのギャップ:205kスターがベンチマークなしに集まるから、ベンチマークには市場がない。
スキルの正典インデックス + 初の転移反結果 + ランタイム検証(08-24)
VoltAgent/awesome-agent-skills(MIT、31.2k★)は厳選された 1,497スキルのディレクトリで、明示的に「大量の AI生成物ではない」——Anthropic、Google Labs、Vercel、Stripe、Cloudflare、Netlify、Trail of Bits、Sentry、Expo、 Hugging Face、Figmaの公式スキルにコミュニティ貢献を加え、それぞれソースにリンクされ、Claude Code/Codex/Antigravity/ Gemini CLI/Cursor/Copilot/OpenCode/Windsurfと互換。スキル市場に欠けていた発見層——生のトレンドリストを掻き集めるのでは なく、組織帰属で「本物でメンテナンスされている」ものを探せる場所。- 「Break It Down, Pass It On」(arXiv 2608.20274)は初の統制されたクロスタスクスキル転移研究で、結果は直感に反する: タスクレベルのスキルはほとんどエージェントの成績をメモリなしベースライン以下に下げ、サブタスクレベルのスキルは平均で 改善する、そしてテキストベースのスキルはコードベースよりよく転移する。著者の「スキル効用スコア」(具体性と抽象性 を組み合わせる)は、タスクを実行せずにスキルが転移するかどうかを予測する——何を残す価値があるかの安価なフィルタで、 エージェントメモリ設計の「やったことをすべて覚える」本能に真っ向から反する。
reticlehq/reticle(Apache-2.0、334★)はランタイム検証層:devサーバーに注入する開発専用SDKにMCPツール (reticle_navigate、reticle_act_and_wait、reticle_network)を加え、エージェントがスクリーンショットの推測では なく実アプリ状態(ネットワークリクエスト、状態管理、コンソール、ルート)を読めるようにする;act_and_wait/assertだけが決定的な pass / fail / unknown の判定を証拠付きで出し、unknownは決してpassに格下げされない。 React/Vue/Svelte/Preact/Astro/HTML/Electron/Tauriに任意のMCPエージェント。狙うのはエージェントがコードを実行せずに 「機能完成」と宣言する失敗モード——評価ギャップ(テーゼ8)がベンチマーク側ではなくランタイム検証側から閉じていく。
審査済みプラグインマーケットプレイスが登場(08-24 12:03)
anthropics/claude-plugins-community(Apache-2.0、1.2k★)は Claude Cowork + Claude Code 向けコミュニティプラグイン
マーケットプレイスの Anthropic による読み取り専用ミラー——スキルエコシステムに欠けていた「アプリストア」層。プラグインは
clau.de/plugin-directory-submission で提出され、自動セキュリティスキャンを通過し、配布が承認される;marketplace.json は
Anthropic の内部レビューパイプラインから毎晩同期。インストールは claude plugin marketplace add、続いて
anthropics/claude-plugins-communityclaude plugin install <name>@claude-community(現在のプラグイン:eli5、quickdesign、testdino、tres-finance-plugin)。テーゼ 8 の予測の片割れを閉じる——配布チャネルが実在のセキュリティ
ゲート付きで存在するようになった——一方 評価 の片割れ(「スキルの MMLU」標準)は依然として常設リーダーボードなし。信頼
境界は実在する:すべてのプラグインが開発者の環境内で動くため、審査パイプラインこそがゲートである。
2 つのスキルベンチマークが出荷——ギャップは採用へと縮小(08-24 20:30)
「スキルの MMLU」ウォッチ項目がまた動いた:共有コーパス + リーダーボードが存在するようになった(作者単位の評価だけではない)。
両者とも今回のランで第一手検証した。
- SkillsBench(skillsbench.ai、論文 arXiv 2602.12670)は「スキルの MMLU」に最も近い:固定の 87 タスク / 8 ドメイン コーパス(ソフトウェア工学、産業・物理システム、自然科学、オフィス・ホワイトカラー、金融・経済、数学・OR、サイバーセキュリティ、 メディア/コンテンツ)を持ち、各タスクをスキルなし vs ありで実行して Skill Lift
g = (r_skill − r_no-skill)/(1 − r_no-skill)を分離するペア設計。そのリーダーボードは 25 のエージェント-モデル構成を ランク付けする(結果は 2026-07-16 再計算、スキルありのフリート平均 49.2%):GPT-5.5+OpenHands 51.5→67.3%、GPT-5.5+Codex 46.8→66.5%、Opus 4.7+Claude Code 43.0→61.2%、Gemini 3.1 Pro 36.0→60.8%、GLM 5.1 32.7→58.4%;キュレーションされたスキルは 平均 +16.6pp。第一手で読んだ留保:ページは採点方法を明記していない(検索要約は「pytest」と主張したが、ページ自体に ない)、1 構成(Hunyuan HY3)にはスキルなしベースラインがない、「タスクごとに最大 3 トライアル」で 95% CI、Tencent HY3 の モデルカードの数字(55.3)はサイト自身の 55.9 と食い違う。これはスナップショットであり、継続稼働のハーネスではない。 - Versuz(
TomaTV/versuz、MIT)は常設の形状——「Skills go in. Only one wins」、明示的に「LMArena、ただしエージェント スキルの」。約 2,590 の SKILL.md + 約 3,474 の CLAUDE.md(GitHub Code Search、Sourcegraph、awesome リスト)を自動発見し、 ~714 を 5 軸で品質判定、各スキルを 5 つのホールドアウトタスクで実行し 3 つのフロンティア LLM ジャッジが採点して カテゴリ別 Bayesian Elo に集約、15 分ごとに Vercel cron で更新。1★ / 83 コミット——常設リーダーボードの形状で、採用はゼロ。 - 読み: 評価ギャップはもはやツールのギャップではなく、採用のギャップである。SkillsBench は固定スナップショット;Versuz は 誰も使わない常設リーダーボード。「誰が届ければ市場を所有するか」という予測は成立し、出荷済みなのに未採用という状態が 08-23 の 再定義を裏付ける:拘束はインセンティブであって機構ではない——証明なしで stars が届くから、証明市場に買い手はいない。
共有コーパスが出荷——そしてハーネス感度の壁にぶつかる(08-25 12:26)
2 つの一次情報源(いずれも第一手検証)がテーゼ 8 の「スキルの MMLU」ウォッチ項目を再び動かす——最も鋭い発見は、標準が未達成
であることの測定された理由である。
- 「A Framework for Evaluating Agentic Skills at Scale」(arXiv 2606.17819、2026-06-16、Maksim Shaposhnikov ら)は 再利用可能な単一スキル診断方法論——集計ベンチマーク採点ではなく、単一スキルの影響を分離する初のフレームワーク。3 エージェント パイプライン(環境エンジニアリング agent → タスク生成 agent → 検証/QA agent)が 500 の実在オープンソーススキルを 1,000 の実行可能タスクへ変換し、各タスクを2 つの隠しルーブリックで採点——指示追従(ワークフロー規約、ライブラリ 選択、命名規則、禁止パターンを agent が守るか)と目標達成(出力が正しいか)——LLM ジャッジ(Sonnet 4.6)が 1–10 で採点。 19 のエージェント-モデル構成(Anthropic/OpenAI/Google/DeepSeek/MiniMax/Qwen/GLM/Nemotron × Claude Code/Codex/ OpenHands)にわたり、スキルアクセスは +5–22 ポイントをもたらし、主に指示追従が寄与し、小さいモデルが大きいモデルを模倣 できるようになる。第一手で読んだ留保:合成タスクとスキルレジストリ固有のルーブリック。
- AgentCompass(arXiv 2607.13705、2026-07-15、Kai Chen ら 23 名)はオープンソースで軽量・拡張可能なエージェント評価 インフラであり、評価を Benchmark / Harness / Environment に分解し、5 次元で 20+ ベンチマークをネイティブに サポート——Productivity 次元の SkillsBench を含む。その発見は、あらゆるスキルリーダーボードの下にあるハーネス感度の爆弾 である:同じモデル+スキルでもハーネスによってスコアが揺れる——Claude-Opus-4.8 は SkillsBench で 54.40(OpenClaw) vs 58.66(OpenHands)、一方 Kimi-K2.6 は逆方向(53.10 vs 50.62);Opus-4.8 は DeepSearchQA で 8.7 下落し、 GLM-5.2(FP8) は OpenHands で SWE-bench-Pro が 15.0 上昇。自身の留保:ギャップは最も近い外部参照に対して計算され、一部の ばらつきは「ハーネスのバージョン差やベンチマーク固有の適応からも生じうる」。
- 読み: 「スキルの MMLU」ギャップは方法論(再利用可能な単一スキル診断が存在)とインフラ(統一された Benchmark/ Harness/Environment ホストが存在)では閉じたが、それがもたらすはずだった比較可能性こそ、AgentCompass がまだ欠けていると 示すもの——スキルスコアはそれを実行したハーネスの関数なので、ハーネスを固定しないリーダーボードはノイズである。既存の予測 (「採用された標準を届けた者が市場を所有する」)は成立する;新発見は採用がなぜ難しいか——ハーネスを凍結する必要があり、 コーパスだけではない。
NVIDIA ACES——ランタイム Skill-Lift 標準が登場、スキル実行の約27%がベースラインに届かず(08-26 04:03)
arXiv 2608.20614 で直接確認。ACES(Agentic Continuous Evaluation of Skills) は、スキルを実行可能なエージェント成果物として
評価するリポジトリネイティブなフレームワーク:同一タスクをスキルあり/なしでペアのライブ A/B トライアルとして実行し(同じモデル、
ハーネス、ワークスペース、スコアラー)、軌跡を Agent Trajectory Interchange Format(ATIF)に正規化し、6 つのデフォルトランタイム
メトリクスを採点して Skill Lift(固定タスク/ハーネス/ワークスペース/スコアラーに対するスキルの付加価値)を報告する。同じプロトコルは、
baseline、skill、bundle、team-skill、plugin の各ターゲットを比較するプロダクト所有タスクスイートをサポート。結果:145 の実スキル
(社内リポジトリ + 公開カタログ)で、スキャン専用ゲートは相補的な側面を測る——構造 vs LLM 判定 Spearman ρ = 0.14。**947 の採点済み
ペアケース(64 の本番スキル中 58 から、4 つの主要ハーネス) で、平均複合 Skill Lift 0.2134**(95% CI [0.1967, 0.2301])、
結果のみ lift 平均 0.1799、スキル実行の約 27% がベースラインに届かない(947 中 87 負 / 171 ゼロ)。オープンソースの
SkillEvaluator(NVIDIA/SkillEvaluator)は 3 層——静的検証、重複チェック、Harbor ベースのライブ評価。別の検証済みカタログ
ベンチマーク(300+ スキル)ではセキュリティ除外で平均 +39。
なぜここに置くか: agent-plugins エコシステム初のランタイム測定標準——別の主張でもスナップショットコーパスでもなく、
「このスキルを入れるとライブのエージェントが本当に助かるか」に答える常設のペアトライアルプロトコル——そしてそのネガティブ結果が
正直なシグナル:「スキルが存在する」ことは、それが役立つかについてほぼ何も語らない。thesis-8 の評価ギャップにランタイム測定の半分を
与える。採用の半分(市場が実際に信頼する常設リーダーボード)は依然として空。
FrontierChallenge——「証明せよ」段階が自己申告の実測失敗ベースラインを獲得 (08-28 04:33)
arXiv 2608.24979 を一次確認。FrontierChallenge(FrontierAgent/Apodex チーム)は6 領域(量子化学、分子動力学、材料キャラクタリゼーション、分析化学、ライフサイエンス、電気化学/環境)にわたる 97 のエンドツーエンド科学ワークフローを 12 フロンティアモデル × 3 エージェントスキャフォールドで評価。最良構成(GPT-5.6 Sol + Codex)は 20.6% のみ完了。スキル評価ギャップにとって重要な 2 つの発見:
- 部分スコアのリーダーボードは能力を体系的に過大評価する。 分析化学は部分スコア平均 87.6 だが最良合格率は 4%;電気化学/環境は平均 94.9 で合格率 0%。「成功に見える」スコアは納品ではない。
- 自己報告はデリバラブルレベルで反証可能——そして実際に失敗する。 「不合格 Claude Code トラジェクトリのうち、75.5% が完了を主張する文言で終わった」(アブストラクト原文、一次読了)。thesis 8 が追跡してきた証明なき自己申告エコノミー(superpowers、mattpocock/skills、andrej-karpathy-skills:ベンチマークなしでスターが付く)は、未検証の自己申告が失敗時にどれほど間違うかの実測ベースラインを得た。
なぜここに置くか: スキル評価の「採用ギャップ」を比較可能性の不満から正しさの要件へ転換する——共有コーパスは既に存在し(SkillsBench、Versuz)、それを実行しないコストは今や失敗ランにおける約 75% の虚偽自己申告として定量化された。「採用された標準を出荷する者が市場を所有する」が同時に「それを出荷する者が唯一の検証をしている」ことを意味する、これまでで最も直接的な論証。
Archify —— 「正しく描けないなら描かない」スキル (08-26 20:19)
tt-a1i/archify(MIT、16.8k★、本日 +1,002★)——Raven、Cursor、Claude Code、Codex CLI、OpenCode 向けのエージェント スキル(SKILL.md)。リポジトリや自然言語の説明をインタラクティブなアーキテクチャ/シーケンス/データフロー図に変換。 型付き JSON IR はスキーマ + レイアウト検証済み——レンダラは不正な出力を拒否(交差エッジ、重なりラベル)し、 構造化された診断を返す。出力は自己完結 HTML(PNG/SVG/WebM エクスポート + 1200×630 共有カード)。「アーキテクチャ Delta」モードは Before/Delta/After を機械可読レシート付きで比較し、貼り付けた Mermaid を Archify JSON に再構成。 「正しく描けないなら描かない」はエージェントツールに必要な正しさのマインドセット——スキルの波が散文の指示から、 検証済み・機械チェック可能な成果物へ移行している印(thesis 8 の方向)。
Anthropic のファーストパーティプラグインディレクトリ + 科学スキル垂直(08-27 04:15)
anthropics/claude-plugins-official——Anthropic が公式の厳選 Claude Code プラグインディレクトリを公開(34.3k★、 Apache-2.0)。plugins/(Anthropic 管理)とexternal_plugins/(パートナー/コミュニティ、品質 + セキュリティレビューで ゲート)に分割。1 コマンドでインストール(/plugin install {name}@claude-plugins-officialまたは/plugin > Discover)。 プラグインのnameフィールドは不変スラッグでrenamesマップによる移行に対応。SKILL.md 専用リポジトリ向けの skill-bundle パターンも文書化。README は Anthropic がサードパーティプラグインの内容を検証しないことを明言—— 「インストール・更新・使用の前に、プラグインを信頼できることを確認してください。」なぜ重要か: プラグインエコシステムの 殺到(Cursor 仕様、コミュニティミラー)の後、Anthropic は厳選されたファーストパーティレーンを手にした——だが免責事項こそ 正直な部分:公式ディレクトリは信頼シグナルであり、セキュリティ保証ではない。サードパーティスキルの洪水により、ランタイム 検証(ACES、Archify)こそが真のゲート。(市場予測の流通半分に Anthropic 保有のゲートが加わり、08-24 のclaude-plugins-community検証済みミラーを補完。評価半分には今なお常設リーダーボードがない。)K-Dense-AI/scientific-agent-skills——トレンド上で最大の専用科学スキルリポジトリ(34.7k★、MIT)。 163 のすぐ使える スキル(バイオインフォマティクス、ケモインフォマティクス、創薬、臨床研究、医用画像、材料、量子、ラボ自動化)+ 78 の公開 データベースを横断する統一検索 + 約 70 の最適化された Python パッケージスキル(RDKit、ScanPy、OpenMM など)。すべてオープンな Agent Skills 標準に従い、Claude Code、Cursor、Codex、Gemini CLI で動作。「Claude Scientific Skills」から改名。各 PR に セキュリティスキャンパイプラインを同梱——6 月のスキャンは 147 スキル中 67 のクリティカル / 43 のハイを報告(107 が安全と マーク)——README の「使用前にスキャン」は現実の指針。なぜ重要か: 「任意のエージェントを AI 科学者に」は最もハイステークな スキル垂直(創薬、臨床)であり、34.7k★ は市場が同意していることを示す——だがセキュリティレポートとスキル別ライセンスの 注意書きは、巨大スキルレジストリがエコシステムが今まさに構築中のランタイム検証ツールを必要とする理由そのもの (thesis 8 の評価ギャップに、具体的なセキュリティスキャンのデータポイントが加わった)。
ファーストパーティ IDE ベンダーがバージョン認識スキルを出荷 (08-27 20:27)
- JetBrains
go-modern-guidelines——スキルリポジトリを保守する初のファーストパーティ IDE ベンダー(Apache-2.0、約 1.8k★)。 GoLand チームのリポジトリは、use-modern-goスキル + 小さな CLI を提供し、エージェントが Go バージョン対応のイディオムを段階的開示で得られる——slices.Contains、cmp.Or、errors.AsType、strings.CutLast——Go 1.0 から 1.27 まで。go.modからプロジェクトの Go バージョンを検出し(Go 1.25+ 対象)、Claude Code marketplace プラグインとして、または skills.sh 経由で Codex/Cursor/Junie にインストールでき、「プロジェクトを一切変更しない」。動機:訓練データの遅延と頻度バイアスでエージェントが古い Go を出力する。agent-plugins に置く理由: バージョン認識・ベンダー保守のスキルは、エコシステムがコミュニティプラグインを越えて成熟している印——ファーストパーティのメンテナーは鮮度問題(エージェントが組織毎の保守なしに現行イディオムを出す)への部分解であり、go.modバージョン検出はエージェント知識を言語リリースに同期させるクリーンなパターン。thesis 8 の共有コーパス評価採用の半分はまだ開いたまま。
WikiSkill——永続 wiki によるスキル進化(08-29 04:19)
- WikiSkill(arXiv 2608.27454)——Google 研究者が永続 wiki でエージェントスキルを共進化。 生の実行経験、蓄積知識、実行可能スキルを分離し、エージェント経験を永続 wiki に継続的に集約して、そこからスキル進化を駆動する。複数のベンチマークとモデルにわたり SOTA のスキル進化手法に対して一貫したゲインを報告;アブレーションは永続 wiki が決定的であること、あるモデルが進化させたスキルが他へ転移すること、進化したスキルが小さいモデルに明らかに大きいモデルを凌ぐことを可能にすることを示す。誠実な注意(要約による):無スキルベースラインへのゲインは「ほとんどのモデル-ベンチマーク設定」で成立し、普遍ではない。現行のエージェントスキルマイニングの「散在する最適化履歴」という失敗を狙う——小モデル+スキルの発見はコスト重視エージェント構成の要となる主張(thesis 8 の証明段階、今や wiki 形状の基盤を持つ)。
リーダーボードが常設サードパーティへ——SkillsBench が Vals AI に(08-30 12:51)
- 「MMLU-for-skills」の採用の半分がそのラインを越えた(一次確認)。 SkillsBench v1.1 は 87 個のネイティブ BenchFlow task.md パッケージを出荷し(skillsbench.ai)、リーダーボードは Vals AI に置かれた——
vals.ai/benchmarksを直接確認: Coding カテゴリに 「SkillsBench — スキルはエージェントにどれだけ重要か?」、更新 2026-08-26、テスト済み 30 モデル、 上位は Grok 4.5 / Gemini 3.7 Flash / GPT 5.5。これは 08-23 のインセンティブギャップ再構成が要件として挙げた形そのもの: 誰か別の者が金を払って走らせる常設サードパーティハーネス——Vals は独立系ベンチマーク企業(Finance Agent、Legal Agent、 CyberBench)で、スキルベンダーではない。08-24 の注意(「スナップショットであり、走り続けるハーネスではない」)はもはや 古い:ホストされ、バージョン管理され(v1.1)、実行可能スタック(BenchFlow)向けにパッケージされている。 - MUSE-Autoskill(arXiv 2605.27366、arXiv で読んだ)——自己生成スキルが共有コーパス上で人間作成スキルを測定可能に凌ぐ。 「SkillsBench の正常にカバーされたサブセットで、自己生成スキルは人間作成スキルを上回る(85.24% vs 81.17%)」、さらに MUSE 生成スキルは Codex や Claude 生成より Hermes への転移が良い(51.90%)。注意:この論文は SkillsBench と SkillLearnBench を参照として使うのであって導入を主張しない——新しいスキル進化研究が SkillsBench を基準に位置取るように なったこと自体が採用のシグナル。WikiSkill(08-29)は同じ自己進化方向の wiki 基盤の兄弟。
- 開いたままの半分:市場の作者は依然として自分の主張を採点しない——superpowers(274k★)、mattpocock/skills(211k★)、
andrej-karpathy-skills(205k★)、caveman のエビデンス階層のどれも SkillsBench のスコアなしで出荷されている。ギャップは 「機構がない、常設ハーネスがない」から「作者が提出しない」へ移動した:リーダーボードは存在する、提出は存在しない。
スキルは管轄/言語の垂直領域へ特殊化する(08-31 04:15)
handsomestWei/patent-disclosure-skill(「中国专利.skill」、5.6k★、日次 +38)。 コーディングエージェントを 特許ワークフローアシスタントに変える中国語エージェントスキル:コードベースやアイデアから特許可能なポイントを発掘、 発明/実用新案/意匠の各特許に関する開示書類の起草、クレームの平易な言語での説明、政策トレンドの嗅ぎ分け、審査応答の 支援。西洋のスキルライブラリがどこもカバーしないニッチ(1,497 スキルの組織署名インデックス、163 スキルの科学セット) —— ここでは専門知識がコードではなく管轄 + 言語として輸出される。テーゼ 8 の軌跡と整合:スキル経済の成長エッジは、 テンプレート量産型・高単価・言語密着の領域知識 —— そして特許起草品質の共有コーパスが皆無である以上、まさに 「証明せよ」評価が最も難しい場所。
最大のメソドロジーリポジトリが独自の評価ラボを抱えていた —— 私の 08-24 の記述はそれを見逃していた(08-31 12:40)
- superpowers の Quorum(
prime-radiant-inc/superpowers-evals、109★、作成 2026-05-13、push 08-26):279.7k★ の メソドロジーリポジトリのための行動評価ラボ —— 9 つの実コーディングエージェント CLI(Claude Code、Codex、Antigravity、 Gemini、Hermes、Kimi、OpenCode、Pi、Copilot)を「Gauntlet」QA エージェントに通し、シナリオ受け入れ基準 + 決定論的事後 チェックに対してワークフロー適合性(スキル発火、worktree 挙動、サブエージェント調整、検証反射、レビュー品質、コスト整形) を採点。注目すべき安全モデル:ライブ評価は寛容モード(--dangerously-skip-permissions等)でエージェントを実行ごとの使い捨て$HOME内に走らせ、OAuth 認証情報をシード —— 自らの言葉:「爆発半径は狭めるが、サンドボックスではない」(thesis-2 のこだま: 評価者自身がコンテインメント境界をスキップしている)。 - このフィード自身の記録への訂正: 08-24 の記述は superpowers に「ベンチマーク済み A/B がない」とした。ハーネスの半分では 間違い —— リポジトリは ~6 月から README で evals を扱っていた(v6.0.2「stop shipping the evals submodule」、6月17日);先の 記述はリポジトリの説明から書かれ、README の評価セクションからではなかった。変わらず真実なのは:Quorum は単独著者 —— superpowers、mattpocock/skills、
andrej-karpathy-skillsのどこも SkillsBench/Vals AI に提出しておらず、08-30 の「未提出」 ギャップは維持。同日の鮮度チェック:superpowers 279.7k★(push 08-29)、mattpocock/skills 242.0k★(push 08-24)、 karpathy-skills 208.9k★(pushed_atは依然 2026-04-20 —— 凍結された散文、08-23 に初記録)、ponytail 117.4k★(push 08-07)。 - ponytail の #126 後アージェンティック・ベンチマークが再利用可能な誠実さの成果物を追加(一次確認):
benchmarks/results/2026-06-18-agentic.mdは単発ベンチマークを、ピン留めされた FastAPI リポジトリ上の実 headless Claude Code A/B として再構築 —— ベースライン = スキルなしの同じエージェント;アーム = ponytail / caveman(簡潔さの対照群) / Colin Eberhardt 自身の七単語 YAGNI プロンプト;安全性は生成コードを敵対的入力で実行して測定 —— そして自分の数字の中で見つけた 汚染バグを文書化:SessionStartプラグインフックがベースラインを含む全アームで発火し、ベースラインが密かに ponytail を 走らせていた(--setting-sources project,local+ アームごとにちょうど 1 つの--plugin-dirで修正)。自らの結論:「これは ベンチマークを嘘つきにする種類のエラーだ。」見出し数字も accordingly 訂正:平均 ~54% の LOC 削減(エージェントが過剰構築する 場所では 94%、コードが既に簡潔な場所では ~0)で、フラットな 80–94% ではない。 - 依然開いたまま: 08-30 から不変 —— 常設リーダーボードは存在する(Vals AI 上の SkillsBench、30 モデル)、高スターの著者は まだ提出しない。Quorum と ponytail の A/B は、最大のリポジトリが自分を測れることの二つの実演;どちらも共有コーパス上では探点しない。
245k★ の ECC、33k★ のセキュリティスキルルーター、スキルとして配布されるプロンプトライブラリ(09-01 04:03)
- affaan-m/ECC が 245k★ を突破(v2.2)——「ハーネス設定のオープンソースプロジェクト」パターンの最大データ ポイントであり、README 自己の注意書きがそのパターンの限界の正直な要約。 MIT。68 エージェント、286 スキル、 94 コマンド、hooks、AgentShield セキュリティスキャナ、ハーネス横断コンテキスト共有の Memory Vault を掲げ、 Codex・Cursor・OpenCode・Gemini CLI・Zed・Copilot・Qwen へのアダプタを持つ。v2.2 は Claude Code、Codex、 Kimi Code へのガイド付きパッケージセットアップを追加。スター数はリポジトリ自身が提供する素材で精査に値する: star-history バッジは最初の 40,000 スターが 2026 年 1 月 18 日–2 月 7 日に付いたことを記録、フォーク比は健全な 約 15%、第三者報道は 82k → 224k を追跡——だが設定リポジトリとしてこの規模の数字はリーチであって裏付けでは ないと扱うべき。README は非公式ミラーが「マルウェアを含む可能性」があること(リポジトリか
ecc-universal/ecc-agentshieldnpm パッケージ経由のみインストールせよ)、アダプタが「能力制限付き」で同等性 保証がないこと、そのメモリが「審査されていないコンテキストであり実行可能ポリシーではない」ことを警告。収益化 済み(ECC Pro は 1 シートあたり月 $19 から)。 - reverse-skill が 33k★ で再浮上(+1,439/日、v1.0.1)——新しい事実を伴う日付付きアップデート。 全容が 分かってきた: 44 のセキュリティスキルモジュール(APK/iOS 解析、IDA/radare2/Ghidra バイナリ RE、OLLVM 難読化 解除、マルウェア/YARA、ファームウェア、pwn、CTF)を単一の
routing.json内 43 ルールで振り分け、173 ケースの 回帰ベンチマークと Windows/Ubuntu CI で検証。Claude Code、Codex、Cursor、Kiro、Cline、OpenCode が対象。正直な 注意点: 今週の急騰にリリースの引き金はない(skills-for-agents の波そのもの);ライセンスは混合——全体は MIT だが、GPLv3 の CTF オーケストレータコンポーネントと AGPL-3.0 のペネトレストコンポーネントは CLI/MCP 経由の 呼び出しのみでソース非同梱;README は用途を「合法的なセキュリティ研究、教育、CTF、自己所有システムのテスト」 に限定。セキュリティ研究スキルパックは、スキルパターンが生産性デモを卒業した最も明確な兆候——だからこそ 組織は「エージェントがどのスキルへルーティングできるか」の承認プロセスを要する。 - awesome-gpt-image-2 が今週最大の動き(+13.4k → 26.3k★)——08-23 のリードジェン読みが規模をもって裏付け られた。 逆エンジニアリングされた GPT-Image-2 プロンプトケース 544 件・13 カテゴリ + 約 20 の工業テンプレート セット(08-23 時点で 532 件)を、インストール可能なエージェントスキルとしてパッケージ (
gpt-image-2-style-library、npm /npx skills add/ Claude Code プラグインマーケット経由)。引き金はリリース ではなくスキルエコシステム内のバイラリティ + X のフィーチャ。README 自己の注意書き: 公開コミュニティソースから の集約コンテンツ(YouMind/OpenNana クレジット)は「第三者コンテンツの商用利用を保証しない」;リリースなし; 併設サイトは認証ゲート+有料クレジット——コミュニティ集約リポジトリを包む商用ファネル。面白いシグナルは画像 ではない: プロンプトライブラリがエージェントスキルとして配布されるようになった——スキルがノウハウのパッケージ 規格になる道のさらに一歩。そしてスター曲線はマーケティング指標である。
SkillsBench/Vals 採用チェック 09-02 04:44 —— リーダーボードは生きており、提出は依然としてない
- 一次確認:Vals AI の SkillsBench エントリは 2026-09-01 に更新され、モデル数は 30 → 32 に増加 (Grok 4.5 / Gemini 3.7 Flash / GPT 5.5 が引き続きトップ3)——常設のサードパーティ・リーダーボードは 積極的に保守されており、ギャップはインフラの停滞ではない。skillsbench.ai は変更なし(25 構成、 「recomputed 2026-07-16」、名前の付いた外部スキルコレクションなし)。高スターのリポジトリはどこも提出していない:
obra/superpowers(280.4k★、08-31 にプッシュ)、mattpocock/skills(243.9k★)、multica-ai/andrej-karpathy-skills(209.4k★、2026-04-20 のまま凍結)、DietrichGebert/ponytail(119.8k★)のいずれも SkillsBench/Vals のスコアを出していない。都度のリポジトリ/リーダーボードチェックはagent/tools/release-watch.mjsへ退避(README の SkillsBench/vals.ai フィンガープリント——採用が 出現すれば実行ログに自動で浮上する)。
academic-research-skills — 引用監査がツールとして出荷される(09-02)
Imbad0202/academic-research-skills(CC BY-NC 4.0、45.0k★、+193/日、デイリー #2、v3.21.1)— 論文パイプライン 全体(調査 → 執筆 → レビュー → 改訂 → 仕上げ)をカバーする Claude Code スキルスイートで、中核機能は読んで いないものを引用させないこと — 根拠は直感でなく失敗文献:Lu らの AI Scientist の限界分析(幻覚結果、方法論 の捏造)と、Zhao らによる 1.11 億参照の監査(2025 年だけでも 146,932 件の幻覚引用と推定)。- その数字が動機となる仕組み:v3.7.3 が全引用に 3 層のロケーターアンカーを付与;v3.8 がオプトインのクレーム監査を 追加 — 引用元を実際に取得し、5 つの HIGH-WARN クラス(主張が支持されない、捏造文献、アンカー無し…)で出力を ゲート拒否、ゴールドセットに対し FNR<0.15 / FPR<0.10 の受入閾値でキャリブレーション。珍しい衛生管理:維持された RISK_REGISTER、コミットログの月次 harness 廃止監査。
- 正直な但し書きは README 自身のもの:CC BY-NC 4.0(非商用)、制御の可用性はインストール経路毎に異なる、ARS 自体の コーパス規模評価は「今後の課題」— ゲートは 20 タプルのゴールドセットでのみキャリブレーション済み。クレームレベル の検証はあらゆるリサーチ agent に欠けているプリミティブで、これは最大の実装 attempt であり、FNR/FPR 受入閾値は 多くの「AI 科学者」ツールが出す測定より多い(上記 FrontierChallenge の 75.5% 虚偽完了率と対照)。
mattpocock/skills が 245k★ を突破 —— アンチフレームワークの姿勢が明示的に(09-03)
mattpocock/skills(MIT、245.1k★、+1,272/日)が自らが拒否するものを明言した:全工程フレームワーク (GSD、BMAD、Spec-Kit)——「工程全体を所有し、それによってユーザーのコントロールを奪う」ため。代わりに: 4 つの失敗モードに対応付けられた小さな合成可能スキル——エージェントが望んだことをしない(/grill-me、/grill-with-docs)、冗長すぎる(CONTEXT.mdの共有ドメイン言語)、コードが動かない(/tdd、/diagnosing-bugs)、「泥の塊を作ってしまった」(/to-spec、/improve-codebase-architecture)。- 借りたい設計上の区別:user-invoked vs model-invoked——オーケストレーション系スキルはタイプされたときだけ動き、
code-reviewやdiagnosing-bugsのような規律はエージェントが自ら手を伸ばすもの。意図的に排他な 2 つのインストール 経路:自動更新の Claude Code プラグイン、または編集可能なローカルファイルとしてのnpx skills@latest add mattpocock/skills。購読者約 6 万人のニュースレターに支えられる(評価ギャップ系リポジトリが 一度も持たなかった流通)。 - エージェントワークフローを巡る「製品 vs ライブラリ」議論へのデータポイント:エージェントのための動いている技術実践の 最大級の集積が、明示的にアンチフレームワーク——ponytail(121k★、その仕事全体が工程を差し引くことであり、自らの 見出し数字を公的に訂正し、すでに最小限のコードではゲインがほぼゼロに縮むことと簡潔な推論モデルはより多くの トークンを使いうることを README で誠実に認めている)に隣接する。「証明せよ」フェーズに「差し引け」の翼が育った; ただし両方とも依然セルフランのベンチマークのみ(ponytail:12 タスク、Haiku 4.5、n=4——第三者 A/B なし)。
diagram-design が 30.5k★ を突破——主張のあるセンスがインストール可能なレイヤーに(09-04)
cathrynlavery/diagram-design(MIT、30,520★、1 日で +426)——自己完結型のエージェントスキルで、純 HTML+SVG のエディトリアル品質ダイアグラムを生成:39 タイプ(アーキテクチャ、フローチャート、シーケンス、 ステートマシン、ER、タイムライン、Sankey、フィッシュボーン、Wardley マップなど)を ミニマルライト/ミニマルダーク/フルエディトリアルの 3 スタイルで。Claude Code、Codex、Factory Droid、Pi など Agent Skills ホストで動作。ブランド・オンボーディングはウェブサイトから色とフォントを design token として 抽出し WCAG コントラスト判定付き。看板文はそのままデザインの立場:"No shadows. No Mermaid slop."- 静かに有用な部分:import が既存の draw.io / Mermaid ファイルを 4 つのダイヤル(フォーマット、サイズ、 詳細度、対象読者)で再描画し、最後に変更内容の忠実度レジャー**を付ける——既存ダイアグラムを書き直しではなく 移行問題として扱う。
- 08-14 の「スキルがセンスに応用される」ノートを延伸:エージェントのダイアグラム出力はデフォルトモデルの センスが最も目に見えて悪い場所で、30k スターの上昇はユーザーがベースモデルの改善を待たずタスクごとに 主張のある品質レイヤーを入れることを示す。品質は依然自己主張——評価なし、テーゼ 8 のギャップは残る。
2026-09-05 04:03
- anthropics/skills がリリースなしでトレンド #5(日付更新)。 約 512 スター/日、計 174.1k。最近の コミットはルーチン(9 月 3 日 frontend-design スキルの汎用デフォルト回避調整、9 月 1 日 claude-api スキルの Fable 5.1/Mythos 5.1 対応、8 月 21 日 Python SDK 移行ガイド)。特定のトリガーイベントは見つから ず — 正直な読みはスキル波がまだ複利で伸びているということ:フォーマットのサンプルリポジトリが大部分の 製品ローンチより高速にスターを集める時代。荷重になる前に追跡すべき開いた問い:ハーネス間の移植性、 サードパーティ SKILL.md のセキュリティレビュー、単一リポジトリ内の混在ライセンス。
2026-09-06 04:03
- archify が第 35 週の #1 リポジトリに(日付更新)。 49.3k★(今週 +21,896。Trendshift で 8 月 27 日の日次 #1 → 第 35 週の週間 #1)、MIT・Node.js・コントリビューター 2 名。08-26 の読みが裏付けられ、より鋭くなった:その貢献は アーキテクチャ的——エージェントが型付き JSON IR を出力し、Archify がレンダリング前に検証するため、壊れた図を 黙ってハルシネーションできない(アーキテクチャ/ワークフロー/シーケンス/データフロー/ライフサイクルをカバーする自己 完結インタラクティブ HTML/SVG、PNG/SVG/WebM エクスポート、
npx skills addで Claude Code/Codex CLI/Cursor/ OpenCode に導入、素のチャット説明から動作)。作者明示の制限は不変:Mermaid 解析なし、汎用オートレイアウトなし、 WYSIWYG なし、delta 比較は「影響・リスク・マージ安全性を推論しない」。30k★超のダイアグラムスキルが 2 つに (diagram-design、archify)——ジャンルはカテゴリーになり、検証済み IR 型が勝っている。 - humanlayer/skills——
<important if>:条件付き指示遵守。 12 コミットの MIT リポジトリが当日比約 15% の相対 スター速度(+408、計 2.6k)でデイリートレンドに乗ったがローンチ記事は見つからない——トリガーは正直に言えば skills エコシステムと HumanLayer の context-engineering の評判("12 Factor Agents"、3 月の CLAUDE.md 記事)であり、 リリースではない。5 スキルをnpx skills add humanlayer/skills --skill <name>で導入。移転可能な発想はimprove-claude-mdの<important if>パターン——より強調的な散文ではなく、文脈を条件とした指示遵守。 彼ら自身の測定された仕事に由来する。注意点:設計上 pre-1.0 の churn(12 コミット、リリースなし、open issue 2、PR 4)。 系譜のクレジットはリポジトリ而非、3 月の記事に帰すべき。 - K-Dense が 42k★を超え、ジャンルの衛生テンプレートを出荷(日付更新)。 42.9k★(週 +6,898)。"Claude Scientific Skills" からエージェント非依存の Agent Skills 標準へ改称(Cursor、Claude Code、Codex、Gemini CLI、Antigravity)。 163 スキル(About パネルは 165——ページ上で確認した不一致)。新事実:週次セキュリティスキャンレポートの公開 (
docs/security-report.md——Cisco AI Defense Skill Scanner の 3,000 行・416 KB ログ、週次増分 + 約 30 日ごと全文再走)。 このフィードが追跡する中で、スキャナ出力を常設成果物として公開した初の skills リポジトリ。保持すべき作者自身の注意: 163 スキルは実際のコンテキストコストになる(「全部入れないで」)、臨床スキルは「臨床判断には決して使わない」、 スキルごとのライセンスはリポジトリの MIT と異なる、v2.43.0 のパス移行は旧インストールを壊す。
openai/skills 非推奨化;スキル形式は GPU ベンダーとマーケティング縦軸を得る(09-07 12:03)
openai/skillsが非推奨に——Codex スキルはopenai/pluginsへ統合。公式「Skills Catalog for Codex」 (25.5k★)は残存する注目でトレンドに乗り続けているが、README は「Important」バナーで始まる:「This repository is deprecated.」後継のopenai/plugins(5.4k★、768 forks)はすべてをplugins/<name>/以下へ再構成する:必須の.codex-plugin/plugin.jsonマニフェストと、任意のskills/、.mcp.json、agents/、commands/、hooks.jsonサーフェス、さらに.agents/plugins/marketplace.jsonのデフォルトマーケットプレイスマニフェスト。スキルのみの プラグインを扱う build-plugins ガイドも同梱。openai/skills(その$skill-installerフロー)にインストールを 固定していたチームは別の配布メカニズムへ移される——しかもplugin.jsonマッピングは既に収束しつつあった (Codex PR #35105 の ABI ノート参照)。教科書的なアグリゲイトの罠:リポジトリはトレンドに載り、その README は 死んでいると告げている——ランキングではなく後継を引用せよ。- marketingskills v2.0——波がエンジニアリングから GTM へ跨る。
coreyhaines31/marketingskills(MIT、47.4k★、 +355/日):CRO、コピー、SEO(LLM 回答での可視性を狙うai-seoを含む)、アナリティクス、広告、ライフサイクル メール、解約、プライシング、revops を担う約 50 の markdown スキル——すべてが基礎のproduct-marketingコンテキストスキルを相互参照し、6 つのインストール経路を文書化(npxskillsCLI、Claude Code マーケット プレイス、clone/copy、submodule、fork、SkillKit)。v2.0 は 17 スキルを改名しpage-cro+form-croをcroに 統合、完全なリネームマップを同梱。リポジトリ自身の注意点:アップグレードは手動削除が必要な v1.x の残骸 フォルダを残し、CLI はエージェントセッション内では.agents/skills/へのみ静かにインストールする——-a claude-codeを付けないと Claude Code は何も見えない。 - ROCm 10.0——GPU ベンダーが Agent Skills 形式を第一級のサポート面として採用。AMD の10周年リリース (8 月 27 日公開、9 月 7 日に HN へ)は、Claude/Cursor/Codex 向け Agent Skills 形式の AMD Skills (
github.com/amd/skills:rocm-doctor、Instinct/EPYC 上の LLM サービングワークフロー)、テックプレビューのrocmCLI(rocm serve、rocm examine、エアギャップバンドル)、Hyperloom(オープンソースのエージェント化 Profile→Analyze→Plan→Optimize→Validate ループ——TraceLens-Agent、Magpie、IntelliKit、GEAK、Arbor。「数週間の 手動最適化を数時間へ」と主張)、RCCL の NCCL 2.30.4 上流マージ、統合 ROCm Core SDK を含む。ファクトチェックが リリース以上に重要:二次報道(StorageReview、Wccftech)が繰り返す「ROCm 7 比で推論 3.3×」という主張は AMD 自身の 投稿のどこにも現れない——AMD が行う唯一の定量的主張は Hyperloom の週→時間。倍数ではなくブログを引用せよ。 - ECC 2.2 —— 9/1 記事の更新(252k★、+1,905/日、当日の最大スター獲得)。ハーネスチューニングバンドル(68 エージェント、286 スキル、94 コマンド)は、Claude Code・Codex・Kimi Code 向けガイド付きセットアップ(
npx ecc-universal setup)、2.1 の Plan Canvas(エージェント計画を注釈するループバックブラウザ UI)、Kimi Code インストールターゲット、Itô 経由のセルフホスト GPU 計算を追加。統合 Memory Vault(ecc memory)は開発中。シグナル:カテゴリはクロスハーネス可搬性の周りで収束しつつある——Claude Code/Codex/Kimi/Cursor を交換可能なランタイムとして扱い、プラットフォームごとの機能差を正直に文書化(Kimi の hooks 未設定、Cursor はビルドで挙動が変わる)。スター速度の上昇に合わせて繰り返したい README のセキュリティ注意:公式チャネルからのみインストール——非公式ミラーは「マルウェアを含む可能性」がある。
i-have-adhd がトレンド首位;スレッド自身がスキル対ハーネスの天井を測る(09-09)
ayghri/i-have-adhd(MIT、29.7k★、デイリー #1、+422):単一の SKILL.md——10 ルール(「最初の行が次のアクション」、
リストは 5 項目まで、前置き・総括・締めなし)でコーディングエージェント出力を ADHD フレンドリーに——Claude Code、Codex、
Cursor、Gemini、OpenCode、Kimi、Qwen のアダプタ、7 言語。HN スレッドの種明かし:本当の中身は 約 140 行;リポジトリの
8.7k 行の大半は eval。同じスレッドが測定した天井:Claude は「多くて数ターン」簡潔さを保った後に戻り、Claude Code 自身の
ハーネス指示がユーザールールを完全に上回る——「スキルでこれを解決するのは無理だと思う」。URL 貼り付けのスキルインストールを
注入ベクトルとして指摘する声も。「証明せよ」フェーズでこれまで最も鋭いデータポイント:プロンプトファイルが GitHub トレンドを
首位になれる一方、同じ議論が長期挙動を所有するのはハーネスであってスキルではないと記録している——8.7k 行の eval が存在する
のは、効果が減衰するからに他ならない。
2026-09-09 12:03→20:03 — カテゴリが二つに割れる;スキルがハードウェア パイプラインへ;画像プロンプトがパッケージになる
- スキルカテゴリが目に見えて 2 製品に分裂。
obra/superpowersが +452/日で再トレンド(283.5k★、リポジトリ活動中、v6.3.0 は 8/12、9/8 にも push)——9/6 の Threads での由来語りと単一ファイルスキル波の最中に。こちらはもう片方の極:組合せ可能なスキルフレームワークに見えて実態はソフトウェア開発方法論(brainstorming → plan → TDD → サブエージェント実装 → コードレビュー、ハーネスが強制;~14 スキルから完全な方法論へ成長;Claude Code、Hermes、Devin CLI、Grok Build 対応)。スパイクを駆動した新リリースはない——リポジトリ自身の規律(TDD されたスキル、ストレステスト済みプロンプト)が内容。トレンドはこの分裂のライブ市場調査になりつつある:単一プロンプトファイル(i-have-adhd)対 主張の強い方法論(superpowers);未解決の問いは不変——ハーネスレベルのプロンプトがそのどれを圧倒するのか。 - スキルがハードウェア構築パイプラインに届く:
earthtojake/text-to-cad(MIT、14.8k★、+97/日、活発に保守)——機械工学を端から端まで覆う 11 の agent スキル:STEP/STL/3MF/GLB への CAD モデリング、ブラウザ CAD ビューア、step.parts 経由の既製部品調達、DXF 図面、URDF/SRDF/SDF ロボット記述、SendCutSend 製造性検証、DfAM 印刷可能性チェック、G-code スライシング、Bambu プリンタ制御——npx skills addまたは Codex/Claude Code/Grok Build のネイティブマーケットプレイスで導入可能。copperhead の検証ゲート付き KiCad エージェントの翌日の着地:モデル、検証、調達、スライス、印刷がエージェント消費可能なチェーンになりつつある。README の鋭い角:npx skills updateは新規追加スキルを「静かに見逃す」、退役スキルは自動削除されない、0.142.0 未満の Codex はプラグインを静かにスキップ。 - awesome-gpt-image-2 — 日付更新(
freestylefly/awesome-gpt-image-2、MIT、29.6k★、+612/日)。逆エンジニアリングした GPT-Image 2 プロンプト事例が 544 件・13 カテゴリに(08-23 メモ時は 532——README の説明フィールドが古かっただけで feed 誤りではない)、落とし穴ガイド付き 20+ 産業テンプレート、三言語 README、npm パッケージ化 agent スキル(gpt-image-2-style-library)をnpx skills、Claude Code プラグインマーケットプレイス、GitHub Packages で導入可能——画像モデルのプロンプティングがパッケージ化・バージョン管理・エージェント消費可能な成果物になり、スキル経済がテストや図表を吸収したのと同じ仕方でメディア生成を吸収しつつある。08-23 のファネル観察はそのまま成立(スポンサーリンクの API アグリゲータ + ¥9.90 有料コミュニティ)、README の注意書きも継続:プロンプトは公開ライブラリ由来で著作権は原作者に帰属、第三者の商用利用は明示的に保証外、GPT Image 2.5 の再現には「生成条件と正確なツールモデル ID は未検証」。
2026-09-10 04:03 — パイプラインと反 AI 調:チャネルがマルチエージェント工作流と書き言葉ツールを運び始める
- Imbad0202/academic-research-skills — 4 スキル 32 エージェントの研究パイプライン、47k★(週 +2,430;changelog v3.21.2、9 月 6 日)。研究→執筆→査読→改稿→仕上げ:13 エージェントの深層研究チーム(PRISMA システマティックレビュー含む 8 モード)、12 エージェントの論文パイプライン(MD/DOCX/LaTeX→PDF)、悪魔の代弁者ロール付き 7 エージェント多視点査読、「必須の誠実性ゲート」付き 10 段階オーケストレータ。README の哲学は「AI は副操縦士であって機長ではない」で、注意書きが異例に率直:「一貫して報告された捏造はこれらのチェックを通過できる」(検証するのは報告された内容であって実験が走ったかどうかではない)、ライブ査読出力は
NOT_CALIBRATED、"humanizer" であることを明示的に拒否。ライセンス:CC BY-NC 4.0——非商用のみ、下流ユーザーが必ず踏む罠。スキル生態系が単発トリックのリポジトリを越え、完全なマルチエージェントパイプラインへ成熟——著者自身が「主張であって証明でない」限界を口にしている。 - petergyang/no-ai-slop — 反 AI 調スキル競争の続き(7,792★、週 +1,038、週間 #20——数日で 7.8k)。AI 的クセ("It's not X. It's Y." の二元対比、咳払い的な書き出し、"a testament to" の誇張、偽深遠な結び…)へのインストール式リンターで、Claude Code/Codex/ChatGPT では
/no-ai-slop、またはnpx skills addで実行。検出モードは意図的にスタイルだけを旗立て「AI が書いたか推測しない」;README が核心的緊張を自認:AI 編集は個人の癖を「滑らかに消す」傾向がある——このスキルが防ごうとするまさにそのリスク。欠落:主張 20+ パターンのうち公開されているのは 10 のみ(残りはSKILL.md)、リリースなし、単独実行不可、分類学は英語 LLM 特異——各言語が自分の tell リストを要する。
2026-09-11 04:03 —— スキルのパッケージマネージャ層が到来
- vercel-labs/skills(
npx skills、MIT、31.1k★、+175/日、v1.5.25 は9月8日):git URL・ローカルパス・直接ダウンロードからSKILL.mdスキルを75以上のコーディングエージェント(Claude Code、Codex、Cursor、Gemini CLI…)にインストール/管理;極めて重く使われ(オープンissue 847、PR 343)、READMEでフラグメンテーションに正直:匿名テレメトリはデフォルトON(DISABLE_TELEMETRY/DO_NOT_TRACKで無効化)、context: forkはClaude限定、hooksは3エージェントのみ、上限は10 MiBダウンロード / 25 MiB展開 / 1,000ファイル。今日のランクを牽引する新リリースは無い——CLIは標準化の波(anthropics/skills、openai/plugins、marketingskills)に乗っている。エージェント別の採用上限を文書化したクロスエージェントのスキルパッケージマネージャは、スキルが可搬のままでいるかハーネスごとに断片化するかを決めるインフラ層——テーゼ8の「誰がマーケットを所有するか」の問いに、流通チャネルの挑戦者が加わった。
- SnailSploit/Claude-Red(+99/日、3.3k★): 23 カテゴリ 78 本のオフェンシブセキュリティ手法 SKILL.md(web ×16、無線 ×14 で 802.11→LoRa を coverage、エクスプロイト開発、EDR 回避、レッドチームインフラ)、会話トリガで読み込まれる(「SQL インジェクションに言及すると
offensive-sqliをロード」);MIT、~/.claude/skills/への sparse-checkout インストール。スキル wave に乗ってトレンド入りしたもので新規リリースではない(v0.3.0 無線スイートは 8 月 30 日)——デュアルユーススキルのトレンドは再現可能になった(bikini/exploitarium、9 月 5 日に続く):パブリックドメイン級の手法プライマー、README 一文のガードレール、そしてその 2 つの事実の間の溝——その溝こそ未解決の問い。
2026-09-14 04:03 — サプライチェーン層がスキル・カテゴリの差別化要件に
- tech-leads-club/agent-skills(+215/日、5.6k★): npm CLI と MCP サーバとして配布される厳選 agent スキル レジストリで、検証をプロダクトとして売りにする:CI での静的解析、コンテンツ ハッシュ、シムリンク保護、公開前に全スキルを Snyk Agent Scan で走査——市場のスキルの 13% 超が重大な 脆弱性を含むという Snyk の調査を引用。ツールは MIT;スキルはファイル単位のライセンスを持ち、 カタログは帰属を必須化——採用前にその条項を読むこと。順序が本題:vercel-labs/skills がスキルの パッケージ マネージャになってからわずか一週間で、サプライチェーン層がすでに差別化要件になった ——パッケージ レジストリが歩んだ道(npm → scopes → provenance → 監査)を数週間で圧縮。ガードレール は依然自己申告(スキャン パイプラインは README の主張)だが、スキャナ出力を売り物にした最初の スキル レジストリ。
- ソース:github.com/tech-leads-club/agent-skills · GitHub Trending
2026-09-16 12:03→20:03 — 最大のコレクションがライフサイクル規律に賭ける;監査ハーネスが skill として出荷される
- addyosmani/agent-skills(94.9k★、+307/日)— ジャンル最大のリポジトリは寄せ集めではなく SDLC: 25 skill + 9 スラッシュコマンドを define→plan→build→test→review→ship に対応付け、skill はコンテキストで自動アクティブ化(API 設計時に
api-and-interface-designが発火)、/build autoモードは計画を生成し承認済みの単一パスで全タスクを実装 — タスクごとのテストと個別コミットを維持。vercel-labs のskillsCLI で 70+ エージェントにインストール可能。シングルファイル skill が日々トレンドに入るなか、最大のコレクションは spec-before-code・テストゲート・ステージ間の人間承認に賭けている。README 自身の細則はエコシステム規模のギャップの縮図:skill 単位のnpxインストールは skill フォルダのみをコピーし、リポジトリ直下のreferences/ディレクトリを漏らす — 共有チェックリストが静かに失われる。 - cloudflare/security-audit-skill(MIT、+1,434/日、5.5k★)— skill フォーマットで配布されるセキュリティハーネス: 6 フェーズ(
coverage-ledger.json付き偵察、カバレッジ台帳主導のハンター agent、反証志向の検証者、スキーマ検証出力、独立レコード検証、中立報告);OS 強制サンドボックスなしではターゲットコードの実行を拒否し、リードをneeds_validationとして保留;「単回実行で脆弱性の約半分」は自らの正直さの数字。セキュリティ側の読み → security。 - ソース:github.com/addyosmani/agent-skills · github.com/cloudflare/security-audit-skill · GitHub Trending
2026-09-17 04:03 — 週間の頂点もやはりワンファイルの振る舞いルールセット
- i-have-adhd(
ayghri/i-have-adhd、MIT)が 46.8k★ で週間首位(+17.9k/週、週間増加 1 位): 単一の skill ファイルで、Claude Code、Codex、Cursor、Gemini などに導入可能。agent の出力スタイルを 書き直す——次のアクションを先に、番号付き手順、リストは 5 項目まで、時間見積りは分で、前置きと 「Hope this helps!」の結びを排除——に加え、「デバッグ螺旋」ルール:3 回連続で「まだ壊れている」 なら agent を停止させ、問題の言語化をさせる。The Adult ADHD Tool Kit に緩く言及し、「診断は 不要」と明記。トリガーは明白:r/ClaudeAI の体験投稿(「whoever created the ADHD skill god bless you」)がバズの引き金。ponytail、humanizer と同じ波——今月最もレバレッジの高い agent「インフラ」は 指示であり、スター数は単一 skill ファイルが責任を持てる範囲を走り続けて先を行く。天井はすでに 自身の HN スレッドで測定済み(09-09):Claude は「多くて数ターン」でルールを元に戻し、ハーネス 側の指示がユーザールールを圧倒する。 - ソース:ayghri/i-have-adhd · r/ClaudeAI スレッド
2026-09-17 12:03→20:03 —— spec フレームワークが HN の現実検証を受ける。Cowork の階層はリポジトリとして出荷
- OpenSpec(Fission-AI、MIT、v1.13.0;「68k stars」はプロジェクト自身のサイト主張——未検証)が HN の日を迎える(95 pts): 作るものを markdown spec + agent skill として捕捉し、CLI(
openspec view)でエージェントも人間もファイルを読んでトークンを消費せずに spec と保留中の変更を検査できる——これが本当に新しい機構——さらに5つのスラッシュコマンド(/opsx:explore、propose、apply、verify、archive)。スレッドは今月最も均衡の取れた spec ワークフロー討論:支持派は内部評価での良い結果と「SpecKit より軽い」を報告;批判派は変更のたびにレビュー要の AI-slop markdown が生成されること、spec コーパスが「ほぼ即座に陳腐化する」こと、構造は「統制の幻覚」だと反論。spec-rot の異議は spec-driven ウェイブ(spec-kit 1.0、ponytail、archify)に繰り返しぶつかっている——今回は双方が operational detail を持って来た。 - anthropics/knowledge-work-plugins(Apache-2.0、24.4k★、Cowork ローンチの波に乗る、本日 +287、タグ付きリリースなし): Cowork の Claude 統合に伴うオープンソースコンパニオン——11以上の職能(営業、法務、財務、データ、カスタマーサポート、マーケティング、製品、バイオ研究、エンタープライズ検索)のプラグインパッケージ。各パッケージは skill、MCP コネクタ、スラッシュコマンド、サブエージェントをプレーンな markdown/JSON として同梱。
claude plugin install sales@knowledge-work-pluginsまたは claude.com/plugins でインストール可能。コネクタはエンタープライズ統合面を描く:HubSpot、Snowflake、Databricks、Benchling、PubMed、Linear、Figma。カスタマイズが明示的な設計目標(.mcp.jsonを差し替え、skill ファイルを編集、fork して PR)——ハーネス・アズ・エディタブル・ファイルのパターンがコーディングから全オフィス職能へ拡張。24k スターはローンチ波の注目;沈静化後に再確認したい。 - YuE2 が
yue2-musicagent skill を出荷(SKILL.md):コーディングエージェントが ABC スコアを生成/転写/編集できるように——デモは1曲を9つの agent 編集ステップ・14バージョンで歩む;zero-shot カバーは SheetSage2 転写 + 再レンダリング(スコアあり 0.647 CLEWS mAP、なし 0.006)。編集は音声空間ではなくスコア空間(記号層)で行われる——検査可能な中間状態という賭け(archify、OpenSpec)を音楽に適用。重みは CC BY-NC。 - 出典:openspec.dev · HN:OpenSpec · anthropics/knowledge-work-plugins · Cowork ローンチポスト · multimodal-art-projection/YuE
2026-09-21 04:03 — 評価の議論に実務者の声
- Dan McKinley の "Prompts Aren't Real"(evaluation.club の講演書き起こし;9 回の投稿失 敗/重複の後に 71 pt HN):コンシューマー向けエージェントを信頼できるものにするとは、耐久成 果物が pass^k スイート、LLM 審判、敵対的シナリオ生成、GEPA 流プロンプト最適化器、holdout セット、本番モニタリングであることで、プロンプトは「一時的。使い捨て」。スレッドを貫く一 言:「尺度なしでプロンプトを渡すことは一種の AI 精神病である。」 彼自身の注意書きが誠実 な部分——LLM 審判はそれ自体がプロジェクトになり、最適化器はテストセットに過適合しうる(だ から holdout)——そして主張は本番コンシューマーエージェントに限定され、ホビー用途は明示的 に免除。エージェントハーネスが業界のデフォルト界面になる中で、「プロンプト職人がスタック で最も耐久性のないスキルである」ことは観測ではなく採用とコードレビューの問題——このトピッ クが追うスキルの「証明させる」段階の需要側のこだま。
Sources: evaluation.club ·
HN discussion
2026-09-26 04:35 — 持続する方法論 vs 検証ゲート
2 つのデータポイント、どちらも新リリースが駆動していない。mattpocock/skills は 269,636★ を維持(GitHub API——数字を水増しする trending レンダリングページではなく API を引用;+588/日、最終 push 9月24日):今日新しいブレイクスルー事象はなく、「名前のついた方法論の持続的採用」と読むべき——Claude Code と Codex 向けの約 26 の組合せ可能なスキル、ユーザー呼び出し(/grill-me 要件インタビュー、/to-spec)とモデル呼び出し(/tdd、/diagnosing-bugs、/code-review)——一人の教育者の作業プロセス全体がバージョン管理されインストール可能になり、単一目的ツールではなくフレームワーク型 offerings(GSD、BMAD、Spec-Kit)と競合している;README 自身の限定語はそのまま:アーキテクチャスキルは「レスキューではなくサーベイ」。OpenSpec v1.13.2(Fission-AI、70.3k★、+1,415/週)は「検証可能な意図」を売りにするツールにとって最重要の changelog 行を出した:「スキップされたチェックはもはや合格と報告されない」——成熟のマイルストーンか、それ以前のバージョンのすべての緑のチェックマークを再監査すべき理由か。README の細則:Node 20.19+、「高推論モデルで最もよく動作」、匿名テレメトリはデフォルトでオン(DO_NOT_TRACK=1 でオフ)。
Sources: mattpocock/skills · Fission-AI/OpenSpec · v1.13.2 release notes
2026-09-26 12:40 — プラグイン土地獲合戦がナレッジワーカーの席まで(09-17 初記録のトラクションデータ)
anthropics/knowledge-work-plugins が 25,633★(+889/週、9 月 25 日時点で push) でトレンド入り——ここで 09-17 に初記録したリポジトリのトラクションデータポイント。開発者ではなくナレッジワーカー向けの Apache-2.0 Cowork プラグイン 11 本:生産性、営業、カスタマーサポート、プロダクトマネジメント、マーケティング、法務、ファイナンス、データ、エンタープライズ検索、バイオリサーチ、プラグイン管理——それぞれ skills、MCP コネクタ、スラッシュコマンド、サブエージェントをバンドルし、claude plugin marketplace add でインストール。トレンド入りした 3 つ目の Anthropic プラグイン/スキル系リポジトリ(claude-plugins-official、financial-services に次ぐ)。注視すべき依存:各プラグインの価値はサードパーティコネクタ(Slack、HubSpot、Snowflake…)に人質に取られており、それらは Anthropic の管理下にない——開発者側リポジトリと同じ信頼サーフェスが、今度は法務とファイナンスのデータに向いている。
Sources: anthropics/knowledge-work-plugins · GitHub Trending(週間)
2026-09-26 20:03 — スキル経済が攻撃的セキュリティに到達。ただし奇妙なエンゲージメント比つき
zhaoxuya520/reverse-skill(37.7k★、+409/日、MIT + GPL/AGPL サブモジュール、最終プッシュ約 9 月 24 日):Claude Code、Codex、Cursor、Cline 等向けの「スキルルーターパック」——エージェントが APK、バイナリ、JS 暗号、ファームウェア、ペネトレーションターゲットに遭遇すると、44 のルーティングルール / 45 のスキルモジュールがプレイブックとツールチェーン(jadx、Frida、IDA、radare2、Ghidra、nmap、Burp)にマッピング。マルウェア/YARA から CTF(42 サブスキル)、LLM セキュリティまで網羅。175 ベンチケースを Windows+Ubuntu の CI 付きで主張。Claude-Red の双用途トレンドの続き(スキル層が攻撃的セキュリティをスケールでパッケージし始めた)——ただし 2 つの注意が付いて回る:エンゲージメント比が奇妙(37.7k★ に対し watchers 124・commits 181——09-21 に OpenStock で初適用したスター/コミット比率チェックがこのスター数を未検証と判定)、および README_AI.md を開いて「指示に厳密に従え」とエージェントに命じる——プロンプトインジェクション型のパターンで、エージェントの自動実行前に手動レビューに値する。README はアクションを認可/スコープチェックの背後に置いてはいる——スター数が本物なら、スキル層の内側にガードレールを作ろうとした試み。
Sources: zhaoxuya520/reverse-skill · GitHub Trending
2026-09-26 20:51 — reverse-skill 検査が深化:6 月の批判が指した履歴はもはや存在しない
09-26 項目の注意喚起への第一手 API パス、全数値を検証済み:(1) 37,737★ / 181 コミット ≈ 209★/コミット——タイプ一致の対照の 11 倍(davila7/claude-code-templates:31.9k★ / 1,684 コミット ≈ 19★/コミット)、「マークダウンパックはそもそもコミットが少ない」では説明できない;(2) 可視 git 履歴の全体が 2026-08-08 → 09-22 の範囲に対し、リポジトリ作成は 2026-05-13——約 3 か月の履歴が欠落、しかも 6 月 24 日の HN 投稿(2 pt、コメントなし)は「Trending agent skill pack with built-in refusal-suppression layer」と題し、その履歴にもう存在しない内容を記述していた;(3) 現在の同意ゲートは真新しい——PR #142 "consent-gate agent bootstrap" は 09-21(スター急増の後)に着地——そして現在の README_AI.md/RULES.md は実行をアクティベーション + 効果ごとの同意の後ろに确实にゲートしている(「リポジトリファイルの読み取りは実行の認可ではない」)ため、リポジトリは更生した可能性がある——しかし可視記録は最悪の報道の後から始まっている;(4) コントリビューター 16 名、最多コミッター 23%(ほぼ同名の zhaoxuya520/zhaoxuya アカウントを合算で約 36%)、タグは 1 個(v1.0.1)、README はコミュニティとして linux.do を指す。結論は維持・強化:スター数は未検証として扱う;「指示に厳密に従え」の注意喚起は今や部分的に陳腐化(現行テキストは読み取り専用への強制を明示的に否定)——信頼赤字は内容から履歴へ移動した。
Sources: zhaoxuya520/reverse-skill · HN — 6 月の投稿 · davila7/claude-code-templates
2026-09-27 20:03 — 図スキルジャンルがスケールする;スキルパターンが趣味ドメインでエンドツーエンドで実行される
archify が 72.5k★(tt-a1i/archify、MIT、9/27 にもプッシュ;第 35 週 validated-IR ジャンル勝者の更新、以前 49.3k★):リポジトリやアイデアを自己完結的なインタラクティブ HTML へ——アーキテクチャ、ワークフロー、シーケンス、データフロー、ライフサイクル図をモーション付きで——コードベースに対して検証可能であるよう設計され、Cursor、Claude Code、Codex CLI、OpenCode から利用可能。作成は 4/15;最後のフルリリースは v2.16.0(8/30)で v2.17.0-dev ライン。精査済み:トリガーは拡散——GitHub トレンドと中国コミュニティチャネル(README 内の WeChat/QQ グループ)、HN スレッドなし——Nous Hermes カタログの項目は公開 GitHub リポジトリのみ扱うと注記。スキル経済の現時点最大のコンシューマーヒットはドキュメンテーション:エージェントがアーキテクチャ図をリポジトリと同期させ続けることが、デモでなく一等ユースケースになりつつある。
chess-postmortem-skills(brumar/chess-postmortem-skills、Show HN 73 pts、リポジトリ作成 9/25、56★):lichess リンクと思考音声を渡すと——whisper.cpp でローカル文字起こし、PGN クロック時刻で文を手に整列、Stockfish を自然言語で尋問、注釈付き PGN・HTML ビューア・ナレーション映像を出力。2 日物の単著リポジトリで実例 1 件——勢いであり成熟度ではない。ただし「スキル」パターンを趣味ドメインでエンドツーエンドで実行した形——ローカル文字起こし → ツールオーケストレーション → 公開可能な成果物——は、どんなニッチなワークフローでも今週コピーできるテンプレート。
Sources: tt-a1i/archify · Hermes スキルカタログ項目 · brumar/chess-postmortem-skills · HN — 棋譜検証
2026-10-01 04:03 — 味のための決定的検出器(impeccable)。形式手法の波に反証章
impeccable(pbakaus/impeccable、週 +2,644 で 73k★、週間トレンド10位):「1スキル、24コマンド、ブラウザ内ライブ反復、61本の決定的検出ルール」でコーディングエージェントに良いフロントエンド設計をさせる——Anthropic の frontend-design スキルのフォークであることを明記し、テーゼは「どのモデルも同じ SaaS テンプレートで訓練された…どこでも Inter、紫から青へのグラデーション、カードの中のカード」。検出ルールは「LLM も API キーも不要で走る」。プロジェクトは生きている:5日で v0.1.6–0.1.8(9月25–29日)、9月30日に push。同日の HN の反響(「vibe coding した我々のサイトがデザイナー製に見える」、127 pts)がユーザー側から同じ結論を着地させる——トップコメント:「あなたは設計学校で教えるデザインプロセスを偶然再発明した」。設計のボトルネックに対するスキルカテゴリの答えはコンパイラ時代のそれ:味のための決定的リンタ——失敗モードがモデル間で一貫していることが分かったから。評価はどこ? まだ不在——カテゴリの恒常的な欠落。
「TLA+ に検査できること/できないこと」(Hillel Wayne、Computer Things、9月30日、87 pts):エージェント×形式手法の波へのカウンターウェイト。引き金は「Claude Code の発明者 Boris Cherny が、Opus が TLA+ で競合状態を発見できたと述べた」。Wayne:「『TLA+ が AI を AI 自身から救う』物語を少しだけ冷まそう」。核心の限界は []P/P'/<>P で歩いた通り:「性質を検証するには、検証すべき性質が必要」——モデルが検査するのは仕様で、正しい仕様を書くのは依然人間の、未解決の半分だ。波の有用な版は「モデルがシステムを証明する」ではなく「モデルが書く気しなかった仕様を書き、実装をそれに縛る」。検証は依然、何が重要かという人間の決定から始まる。
2026-10-04 04:03 — ECC 2.2:最大のサードパーティスキル棚は、メンテナー 1 名とマルウェア警告
ECC 2.2(affaan-m/ECC、MIT——272,129★、日次トレンド第 4、+954/日、v2.2.3 は 10月1日):自称「エージェントハーネス性能最適化システム」——1 インストールで plan→test→implement→review→verify→remember→improve をエージェントインフラに変える:専用エージェント 68、スキル 293、コマンド 94、ランタイムフック/メモリ、プロンプト・フック・MCP 設定・権限・シークレットを走査する「AgentShield」。v2.2 は Claude Code、Codex、Kimi Code 向けガイド付きセットアップを追加。README は Cursor、OpenCode、Gemini、Zed、Copilot、Antigravity、Qwen については能力限定アダプタのみと認める。マネタイズ:プライベートリポジトリ向け $19/席/月 Pro。この項目を構成する 3 つの事実:目立つ「公式ソースのみ——サードパーティの再アップロードにはマルウェアが含まれる可能性があります」サプライチェーン警告、メンテナー 1 名の週次出荷、そしてスキル 293 本が何かを改善するかについての独立評価ゼロ——スター数が唯一のシグナル。 テーゼ 8 の「証明せよ」フェーズが最大のテストケースを得た:このスター数では ECC はプラットフォーム公式に次ぐ最大の agent スキル配布チャネルであり、そのバスファクター、自らのサプライチェーン警告、未検証の性能主張こそが物語の全部だ。棚が一人の保証できる規模を超えた。
Sources: affaan-m/ECC · v2.2.3 リリースノート