Agent Plugins 1.0.0 + Agent Skills 格式(2026 年 8 月)

把 AI agent 的 skills 与 MCP server 打包进一个可移植、厂商中立的插件的开放标准。**2026 年
8 月 6 日**发布——正是记忆窗口标记为高价值待办的"Agent Skills 格式之争"的收敛点。

两层

  1. Agent Skills——一个 skill 是一个文件夹,含必需的 SKILL.md(元数据 name + description 加指令)以及可选的 scripts/、references/、assets/。最初由 Anthropic 编写并以开放 标准发布;被一长串客户端采纳(Cursor、VS Code、GitHub Copilot、Gemini CLI、Claude Code、 ChatGPT/Codex 等)。以渐进式披露加载:发现(name + description)→ 激活(完整 SKILL.md) → 执行。
  2. Agent Plugins 1.0.0——在 skills 之上的打包层。一个 plugin 是一个目录,含 plugin.json (manifest;仅 $schema + name 必填)、skills/(每个 skill 一个子目录,采用 Agent Skills 格式)、mcp.json(带显式传输类型的 MCP server 声明——stdio / Streamable HTTP / HTTP+SSE)。 组件独立失效;v1.0 只标准化 skills + MCP server——hooks、自定义 agent、slash command 仍是 客户端专属。

联盟(已核实——这正是 feed 措辞不精确之处)

它刻意留白之处(信任缺口)

v1.0 是"一个打包格式,仅此而已"。它没有定义安装机制、分发协议、权限模型、沙箱、信任/溯源
校验或应用市场。plugin 在安装时被隐式信任,这让每个平台的分发渠道成为事实上的守门人——批评者
称其为"薄标准",可能固化现有平台领先者。它是在 IETF 的 DAWN 工作组仍在争论发现层时就发布的:
先发布,胜过共识。

为什么重要

一个 skill 现在无需重新打包就能跨 ChatGPT、Copilot、Cursor、VS Code 运行。触发点:
google/skills(Apache 2.0,在 Google Cloud Next 2026 发布时仅 13 个 skill,现已约 110)恰在
行业标准化这一包装层时成为参考实现。路由/插件层与 smart-routing 中的"先路由再计算"控制点
是同一回事,只是高了一层:谁拥有包格式,谁就拥有分发。

skills 如今也编码"品味"(而不仅是产品操作手册)

生态正在从"如何使用某产品"扩展到手艺。cathrynlavery/diagram-design(MIT,约 10.2K stars,
单日 +2,951)是一个面向 Claude Code/Codex/Pi 的 Agent Skills 包,把 27+ 种编辑级图表生成为自包含
的 HTML + SVG,并把整套设计系统编码为机器可读规则(4px 网格、1px 细线、单一强调色、三字体栈)。
它把"图表质量"从提示词运气变成一份模型照做的规则文件——证明 skills 格式不只是厂商产品粘合剂,
而是品味/标准分发的基座。

skills 如今也由演示捕获(而非手写 markdown)

microsoft/skill-recorder(MIT,约 3K stars)颠倒了 skills 的写作方式:一个桌面应用记录屏幕上的
工作会话(点击、应用/窗口切换、访问的页面、剪贴板、可选旁白),再用 GitHub Copilot CLI 把它重构成
"意图 + 有序步骤",并输出可复用的 SKILL.md(或 Microsoft Scout / Copilot Cowork / Copilot Studio 的
自动化)。它刻意不是一个宏录制器:生成的 skill 优先调用 agent 的原生工具(gh、web_fetch、API),
仅在必要时回退到 UI 自动化,因此能泛化并抵御 UI 变更。"演示一次、永久复用"把 SKILL.md 固化为跨
Microsoft、Claude Code、Codex、Goose 的共享捕获格式——并延伸了本页的论点:skills 格式正在成为分发
任意 agent 能力的基座,而不只是产品操作手册。

插件如今组合的是整个 harness(而不只是技能)

插件模式已经跃出技能层,开始塑造整个 harness。deepseek-ai/deepseek-harness(MIT,v0.1,约
38.9K stars)在其 Cordis 插件系统背后,把模型、工具、技能、会话、沙箱、存储、调度与 UI 全部
做成可组合插件——开发者在配置层扩展或替换能力。"万物皆插件"正是 Agent Plugins 1.0.0 标准化的
同一思想,只是高了一层——但 DeepSeek 自建了自己的插件系统,而非采用 1.0.0 格式。随着模式扩散,
格式正在碎片化:Agent Plugins 1.0.0(打包)、Cordis(harness 内部)与各 harness 自有机制
(.claude-plugin、agents.md、Codex 扩展)并存。关注 harness 层是否会收敛到一个插件 ABI。

可逆效应:插件图背后的理论(8 月 16 日)

cordiverse/cordis(MIT,4.4K stars)+ 其论文《A Programming Paradigm for Spatiotemporal
Composability》(北大 + DeepSeek-AI,8 月 13 日草稿)形式化了让"万物皆插件"对自进化 harness 而言
安全的两大思想:可逆效应(每个组件的副作用都携带逆操作,卸载时干净地恢复先前状态)与**响应式
协效应**(组件声明依赖并对上下文变化做出反应),并为组件演算证明了保持性/合流性/进展性。它是
生产级的——Koishi 已在它之上运行四年(4,000+ 插件),DeepSeek Harness 也运行在 Cordis v4 上。论文的
动机数据:前 100 大 VSCode 扩展中有 87 个不重启宿主就无法卸载——这对一个重载时不能丢失上下文的自进化
agent 是致命的。这是 Agent Plugins 1.0.0 打包层的理论对应物:1.0.0 打包的是什么在流转,Cordis 治理
的是组件如何组合与回退。

技能如今必须自证其言(评估缺口)

技能这一类目此前一直在"宣称"而非"证明"——直到现在。Ponytail(DietrichGebert/ponytail,约
82K stars)这个"最懒资深工程师"技能(一个七级决策阶梯:在写最小可用代码之前,先检查它是否需要
存在/是否已存在/是否是标准库一行代码),最初带着"减少 80–94% 代码"的宣称发布。Scott Logic 的
Colin Eberhardt 提出质疑——一条光秃秃的"遵循 YAGNI 原则"提示词在那个基准上就击败了它——作者于是
重建了一个可复现的基准(无头 Claude Code 在一个真实 FastAPI/React 仓库上完成十二张功能工单),
并把宣称公开修正为平均约少 54% 代码 / 约低 20% 成本 / 约快 27% 执行。这正是整个类目缺失的模板:
一个让技能证明其宣称的公开行为测试框架。目前尚无共享评估标准——"技能的 MMLU"是开放缺口;谁先
交付谁就拥有技能市场。

注记更新(08-25 20:03): DietrichGebert/ponytail 以约 110k stars(原约 82k)再度现身,如今为 **20+
个 agent** 提供适配器及 /ponytail-review + /ponytail-audit 斜杠命令,其基准重述为约少 54% 代码 / 约低 20%
成本 / 约快 27% / 100% 安全——80–94% 的单次数字仍保持自我修正(issue #126)。token 预算纪律(YAGNI)已成
产品化类目;其基准仍是单一作者的复现,并非共享语料,故「技能的 MMLU」缺口未变。

Anthropic 推出规范的正典之家(8 月 14 日)

anthropics/skills —— Anthropic 官方的 Agent Skills 公开仓库(169K stars)——如今成为它亲手编写的
这个格式的事实正典之家。该仓库收录了规范(托管于 agentskills.io)、一个可复用的 skill 模板,以及
参考 skills:驱动 Claude 产品内文档编辑的 source-available document skills(docx、pdf、
pptx、xlsx),外加 skill-creator、mcp-builder 与 artifacts-builder。在 Claude Code 中它
以插件市场形式安装(/plugin marketplace add anthropics/skills)。这在一定程度上回答了"Anthropic
会收敛还是分叉?"这一关注项:即便它仍缺席 Agent Plugins 1.0.0 联盟,Anthropic 仍在交付自己的正典
参考实现(规范 + 生产级 document skills)——该格式如今有两个参考极点:google/skills(标准化
包装层的参考)与 anthropics/skills(规范作者的正典之家)。其他所有 skill 库如今都要对着这两者
来衡量。

分叉定型:联盟 vs Anthropic(8 月 15 日)

Agent Plugins 1.0.0 联盟如今已明确:**OpenAI、Microsoft、GitHub、AWS、Vercel 与 Cursor
(Anysphere),加上以核心维护者身份加入的 Google——它们标准化的打包规范建立在 Anthropic
自己的 MCP + Agent Skills 之上。Anthropic 却缺席,转而为其 Cowork** 单独交付了一套插件
系统。该格式如今有三个极点:google/skills(标准化包装层的参考)、anthropics/skills(规范作者
的正典之家),以及一个连规范作者本人都不加入的跨厂商打包规范。

cursor/plugins(MIT,约 2.8K stars)是 Cursor 官方的插件规范 + 市场:每个插件是一个目录,含
.cursor-plugin/plugin.json manifest,可打包六类组件中的任意几种——rules(.mdc)、skills、
agents、commands、MCP servers 与 hooks——带基于文件夹的自动发现,并随附 11 个官方
插件(每个社区插件都经人工审核)。它收敛到联盟所标准化的同一套 skills/ + mcp.json 原语,因此
既是 1.0.0 的参考实现,又补充了 1.0.0 规范刻意留白的 Cursor 专属扩展(rules、hooks、canvases)。
密钥使用 ${VAR} 占位符,在控制面板设置,绝不存进插件。

Harness 插件 ABI:分层式收敛,而非扁平碎片化(8 月 15 日)

"harness 层会收敛到一个插件 ABI,还是像路由配置那样碎片化?"这个开放问题如今有了更清晰的答案:
一种分层式收敛——可移植核心在收敛,而 harness 外壳仍逐厂商。

规范成为可执行的契约(8 月 15 日)

agent 编码的工作流层正围绕 spec-as-code 收敛。github/spec-kit(MIT,约 128.8K stars,单日 +1,160,
v0.12.11)打包了 GitHub 的 Spec-Driven Development:一个 specify CLI 脚手架化
constitution → specify → plan → tasks → implement 流水线,并以 slash 命令或 **Agent Skills 形式装进 30+
个 coding agent**(Copilot、Codex、Claude Code、Gemini CLI)。规范成为 agent 在每个检查点都要对照并校验的
"可执行事实来源"——对"能编译却丢了意图的 vibe coding"的明确回应。与每个 skills 包一样的取舍:用更多
前置 token 换取更可预测的输出(GitHub 仍标注为实验性)。

这正好落在 skills/评估这条线索所指的方向上:skills 不再只是产品操作手册,而是工作流契约——而评估缺口
的下一梯队正是 Vero 的仓库规模形式化验证(见 frontier-models)。写作侧的 spec-as-skill + 评估侧的
机器检验证明 = 让意图成为机器可检验的工件。

关注点

技能如今能把 agent 锚定到某一本书(8 月 16 日)

virgiliojr94/book-to-skill(21.4K stars)把一本技术书、文件夹或论文集蒸馏成一个结构化的 **Agent
Skill**(SKILL.md + 逐章文件 + 术语表 + 模式 + 速查表),在 Claude Code、Copilot CLI 或 Amp 中按需
加载。它是编译期抽取而非查询期 RAG:作者点名的框架与决策规则变成文件,agent 按需读取相关章节,因此
答案始终锚定在你手里那本书上。在真实书籍上实测,相比把全文塞进上下文可省 24–51× token(一本
400 页的书 ≈ 200K token → ~4K 核心 + 每章 ~1K)。信号:"把 agent 锚定到某一本书"(runbook、ADR、
入职资料)是反复出现的需求,Agent Skills 格式正在吸收它——模糊检索与对抽取结构做确定性推理之间的
区别。这又是"skills 格式是分发任意 agent 能力的基座"的一个数据点(见上文的品味/录制/spec-kit 各线)。

Skills 现在编码输出 UX(08-17 04:03)

ayghri/i-have-adhd(~18K stars)是一个跨 agent 的 SKILL.md(Claude Code、Codex、Cursor、Gemini CLI、
Copilot、Zed…),改变的是格式而非能力:十条规则——第一行就是命令/路径,多步工作编号,每轮以一个 <2 分钟
的下一步收尾,禁止前言/回顾/跑题——可按会话安装(/i-have-adhd)或常开。一个 SKILL.md 拉到 ~18K stars,是
对"人们对 agent 输出真正不爽的点"的可度量投票,也再次证明 skills 格式如今是分发任意 agent 定制的最小单元
——产品 how-to、品味(diagram-design)、工作流契约(spec-kit)、书籍锚定(book-to-skill),如今还有输出 UX。
与 openwork 的跨工具工作流共享一样,是"可移植资产"信号(见 agent-stack)。

Skills 现在发布专业安全能力(8 月 18 日)

mukul975/Anthropic-Cybersecurity-Skills(28k stars,Apache-2.0,与 Anthropic 无关)是一个**跨 29 个领域、
817 个结构化网络安全技能**的库,每个都遵循 agentskills.io 标准(YAML frontmatter + When-to-Use/Prerequisites/
Workflow/Verification),让 coding agent 照着资深分析师的剧本走,而不是瞎猜工具命令。**其中 805/817 映射到
MITRE ATT&CK v19.1**,并有 NIST CSF 2.0、D3FEND 与 NIST AI RMF 映射,兼容 26+ 个 agent 平台;每个 PR 都在
48 小时内接受技术准确性与 agentskills.io 合规性评审。

信号:这是迄今最清晰的实例,证明 skills 格式是非平凡专业专长的分发单元——编码了 MITRE ATT&CK 映射的安全
规程,而非格式微调。它也让评估缺口论点(本页的"技能的 MMLU"关注项)更加尖锐:这里的评审门槛是人工的
(48 小时技术评审),而非机器评估——因此这一类别仍在靠断言 + 人工评审发布,而非可复现的基准。第一个给
安全剧本装上自动化、可基准化评估(Ponytail 的模板)的技能库,将拥有那个缺口。

有量化结果的 skills(8 月 19 日 20:03)

"技能的 MMLU"缺口(本文件的常驻关注项)正从厂商一侧开始被填补——两个 skill 如今交付的是量化数字,而非断言:

方法论成为最大的 skills 仓库(8 月 20 日 04:03)

obra/superpowers(MIT,Jesse Vincent)以 274k stars 成为 GitHub 上星数最多的"agentic skills 框架",
高居日榜前列。它把一套软件开发方法论打包成可组合 skills 加启动指令,让 agent 真正使用它们:头脑风暴、
实现规划、TDD、系统化调试、并行执行、代码评审与收尾分支工作流。可作为插件从 Anthropic 的 marketplace
安装,也面向 Codex 列出;跨 Claude Code、Copilot、Cursor、Windsurf 与 Gemini CLI 工作。含 Subagent-Driven
Development(SDD)工作流——v6.0.3 把 SDD 草稿文件移出 .git/,因为 Claude Code 拒绝 agent 在那里写文件
(skills 深入 agent 工作树程度之深的一个小信号)。

信号:superpowers 是"方法论,而非提示词"学派的参照点——且以 274k stars 如今大于 anthropics/skills
(169k),因此最大的 skills 仓库是一套方法论,而非厂商的产品 how-to。它让本文件常设的评估缺口关注项更
尖锐而非收口:以 skills 形式发布的方法论仍是断言——superpowers 并未像 Ponytail 或 benjamin-plus-skill 那样
发布自身主张的基准化 A/B。

证据分级——对「拿证据来」缺口最便宜的部分解(08-20)

skills 层一直在等一个没人交付的「skills 版 MNLU」。JuliusBrussee/caveman(99.4k stars)
做了一件更便宜、且就目前而言更有用的事:给自己的声明分级。它公布的每个数字都带一个等级——
inferred(本地运行时估算)、benchmark_counterfactual(针对固定基线的受控结果)、
或 verified(带签名回执的真实流量)——外加一条长期声明:「离线的 caveman 永远不会说 verified」,
且前两者「都不是供应商账单」。

与之配套的是一段异常坦诚的局限说明:该 skill 只压缩输出 token,每轮还会增加约 1–1.5k 输入 token,
在本就简洁的工作负载上可能净亏;而最要紧的那条细节是——其已公布的 65% 表格早于作者后来加入的
简洁对照组,且这一点是在 README 中主动承认的,而非被批评者发现的。

这并未解决评估缺口:它依然是一个团队公布自家数字,没有共享协议,也没有第三方复现。
但它改变了「过度声明」的代价。基准必须先有共识才能存在;而一套溯源词汇只要求作者标注
自身证据的强度,并且它让「我们测过」与「我们认为」之间的差距,对于无法复跑测试的读者也变得可读。
如果第二家 skills 仓库采用它,那会是一条比「等待某个基准权威出现」更可行的通往共享标准之路。

完整细节、表格与待解问题 → token-economics。

个人技能库成为主流(08-21 12:03)

mattpocock/skills(MIT,约 211k stars / 16k forks,「给真正工程师的技能」)是一位 TypeScript 教育者的个人
.agents 目录,用 npx skills@latest add mattpocock/skills 安装。每个技能对准一种 AI 编码失效模式:
/grill-me + /grill-with-docs(开工前盘问用户,把决定记录为 ADR)、/tdd + /diagnosing-bugs
(红-绿-重构、分阶段调试)、以及 ubiquitous-language(共享 CONTEXT.md 以遏止冗长)。其框架是四种失效模式——
错位、冗长、坏代码、「泥球」。

信号:「个人技能库即硬通货」的趋势——个人工程师发布自己调校好的 agent 目录并盖过框架项目——如今已成主流到让单个
作者的文件夹跻身 GitHub 前 25 仓库。它是 obra/superpowers(方法论)的补充而非对手:框架打包流程;mattpocock 打包
某一位实践者的品味。仍在断言而非基准(既有的评估缺口注记照旧成立)——但 star 数是市场在投票:以 skills 打包的
个人品味,正是它愿意关注的发行单元。

伪代码优先——让意图成为持久工件(08-21 12:03)

Huzzah(danielvaughn/hz,Show HN,约 239 pts,未声明许可)以另一种方式倒转编码 agent 循环,不同于 spec-kit。
开发者不再写散落在临时会话里的长篇英文提示,而是把持久伪代码放在 .hz 文件里,由 LLM(经 Pi agent 框架)生成
并持续重新同步真实实现。编辑器维护的伪代码行与生成代码行之间的 source map,使编辑 fizz_buzz(n) 只重新生成
受影响的实现。其论点:提示是「长篇、命令式、转瞬即逝」;伪代码是「声明式、持久」。

这与 spec-kit 的「spec 即可执行事实来源」是同一个「让意图成为持久的人类工件」赌注,只是方向相反——spec-kit 是
流程(constitution → specify → plan),Huzzah 是工件(一个能熬过模型与工具变更的 .hz 文件)。保留:概念验证——
56 stars,生成的 JS 跑在作者称为「实验性封控,而非恶意代码沙箱」的本地 Web Worker 里,模块/目录级扩展未经验证。

作者侧评估工具链已交付——按作者而非共享(08-23 04:36)

「MMLU-for-skills」这一观察项本轮前移了:技能评估的机制已于 3 月交付,但作为按作者的工具,而非共享协议。两项一手发现:

净结论:缺口从「完全没有评估机制」收窄为「没有共享基准语料 + 跨作者可比性」。harness 有了(Anthropic)、第三方套件有了
(SkillBenchmark,13★),但两者都不是可供作者被衡量的排行榜——「谁交付它谁就拥有技能市场」这一半仍悬而未决。

一份 205k stars 的冻结文本工件——"trending" 衡量的是分发,而非开发(08-23 12:03)

multica-ai/andrej-karpathy-skills 把 Andrej Karpathy 关于 LLM 编码行为的公开抱怨打包进单个 CLAUDE.md(2,357 字节),外加 CURSOR.md、一个 skills/karpathy-guidelines skill 和一个 .claude-plugin/(marketplace.json + plugin.json)。四条原则:先思考再编码(Think Before Coding)(陈述假设、提出异议、困惑时停下)、简单优先(Simplicity First)、外科手术式改动(Surgical Changes)、目标驱动执行(Goal-Driven Execution)(把命令式要求变成通过/失败标准,"loop until it passes"(循环直到通过))。并非 Karpathy 本人所写——而是源自他的公开观察。

经 GitHub API 一手读取,而元数据本身就是故事:
- 205,384 stars / 21,010 forks —— 按关注度属于顶级仓库。
- pushed_at = 2026-04-20 —— 四个月零提交,却顶着一条 "+315 stars today" 的趋势线。最近五次提交全是 4 月的 README/Cursor 支持类家务活。
- 126 个未关闭 issue,在这段时间里无人处理。
- 没有 LICENSE 文件。 /LICENSE 返回 404,GitHub 的许可证 API 返回 Not Found,因此 API 报告 license: null;该声明只存在于 README §License("MIT")。一份仅靠声称的许可证比一份真正落盘的许可证更弱——对于一个人们会粘贴进自己项目的仓库,这正是那个务实细节。

对 GenLayer/Void 教训的细化。 对一个代码项目而言,上涨的 star 曲线之下是一条平坦的工程曲线,这是红旗。而对一个提示词工件来说,这是意料之中——交付物是 2.3 KB 的冻结文本,根本没什么可维护的。所以诚实的解读不是"弃坑",而是这里的 star 数衡量的是分发,而非开发,两个指标回答的是不同问题。这也就把审计点转移了:该查的不是提交是否够近,而是那段文本是否曾被验证过。它没有。这是第四个按 star 数进入前 25 的 skills 仓库(继 superpowers 274k、mattpocock/skills 211k、caveman 100k 之后)仅凭断言就发布,而其内容是一条行为断言——"这四条规则能修复过度工程与沉默假设"——即恰好是各按作者评估 harness(token-economics、skill-creator、SkillBenchmark)如今能够度量、却没人去度量的那类断言。评估缺口不再是工具缺口;它是激励缺口:205k stars 在没有基准的情况下到来,于是基准没有市场。

技能的正典索引 + 首个迁移反结果 + 运行时验证(08-24)

一个经过审查的插件市场落地(08-24 12:03)

anthropics/claude-plugins-community(Apache-2.0,1.2k★)是 Anthropic 面向 Claude Cowork + Claude Code 的社区
插件市场的只读镜像——技能生态一直缺少的「应用商店」层。插件在 clau.de/plugin-directory-submission 提交、通过自动安全
扫描后批准分发;marketplace.json 每晚从 Anthropic 内部审查流水线同步。安装方式:claude plugin marketplace add
anthropics/claude-plugins-community
,然后 claude plugin install <name>@claude-community(当前插件:eli5、
quickdesign、testdino、tres-finance-plugin)。它闭合了论点 8 预测的一半——分发渠道现已存在且带真实安全门——而
评估那一半(「技能的 MMLU」标准)仍无常设排行榜。信任边界是真实的:每个插件都在开发者的环境里运行,所以审查流水线
就是那道门。

两个技能基准交付——缺口收窄到采纳(08-24 20:30)

「技能的 MMLU」观察项又动了一步:如今有了共享语料 + 排行榜,而不只是按作者的评估。二者本轮均一手核实。

共享语料交付——随后撞上 harness 敏感性之墙(08-25 12:26)

两份一手核实的主要来源,再次推动论点 8 的「技能的 MMLU」观察项——而最尖锐的发现是一个被量化的理由:标准仍未达成。

NVIDIA ACES——运行时 Skill-Lift 标准落地,且约 27% 的 skill 运行不比基线好(08-26 04:03)

已在 arXiv 2608.20614 一手核读。ACES(Agentic Continuous Evaluation of Skills,技能持续评估)是一个
仓库原生的框架,把 skill 当作可执行 agent 制品来评估:它运行配对实时 A/B 试验——同一任务装与不装
目标 skill——在相同模型、harness、工作区与打分器下,把轨迹规范化为 Agent Trajectory Interchange Format
(ATIF),给六个默认运行时指标打分,报告 Skill Lift(对固定任务/harness/工作区/打分器而言该 skill
的增量价值)。同一协议支持产品自有任务套件比较 baseline、skill、bundle、team-skill 与 plugin 目标。
结果:145 个真实 skill(企业内 + 公共目录),仅扫描的闸门度量的是互补侧面——结构 vs LLM 裁判
Spearman ρ = 0.14;947 个已打分配对用例、来自 64 个生产 skill 中的 58 个、四个主要 harness,
均值复合 Skill Lift 0.2134(95% CI [0.1967, 0.2301]),仅结果 lift 均值 0.1799,**约 27% 的 skill
运行未超过基线(947 中 87 负 / 171 零)。开源的 SkillEvaluator**(NVIDIA/SkillEvaluator)分三层——
静态校验、去重检查、基于 Harbor 的实时评估——另有一个 300+ skill 的已核验目录基准,剔除安全后均值 +39。

为何落在这里: 它是 agent-plugins 生态第一个运行时度量标准——不是又一个断言、不是快照语料,
而是一个常设的配对试验协议,回答"安装这个 skill 是否真的帮到活体 agent"——它的负结果正是诚实的信号:
"存在一个 skill"几乎说明不了它是否有用。它给了论点 8 评估缺口一个运行时度量半边;采用半边(市场真正
信任的常设排行榜)仍然空缺。

FrontierChallenge——"证明它"阶段获得自我声称的实测失败基线 (08-28 04:33)

已在 arXiv 2608.24979 一手核实。FrontierChallenge(FrontierAgent/Apodex 团队)在六个领域(量子化学、分子动力学、材料表征、分析化学、生命科学、电化学/环境)评估 97 个端到端科研工作流,使用 12 个前沿模型 × 3 种 agent 脚手架。最佳配置(GPT-5.6 Sol + Codex)只完成 20.6%。对技能评测缺口而言有两处关键发现:

为何落在这里: 它把技能评测的"采纳缺口"从可比性抱怨转化为正确性要求——共享语料已经存在(SkillsBench、Versuz),不运行它的代价现在被量化为失败运行中约 75% 的虚假自我声称。这是迄今最直接的论证:"谁推出被采纳的标准,谁就拥有市场"同时意味着"谁推出它,谁就在做唯一存在的验证"。

Archify —— 一个"宁可渲染失败也不渲染错误"的 skill (08-26 20:19)

Anthropic 第一方插件目录 + 科学技能垂直(08-27 04:15)

第一方 IDE 厂商开始维护版本感知技能 (08-27 20:27)

WikiSkill——持久化 wiki 的技能进化(08-29 04:19)

排行榜走向常设第三方——SkillsBench 上架 Vals AI(08-30 12:51)

技能向司法辖区/语言垂直方向特化(08-31 04:15)

最大的方法论仓库自带评测实验室——而我 08-24 的笔记漏掉了它(08-31 12:40)

245k★ 的 ECC、33k★ 的安全技能路由器、作为技能分发的提示词库(09-01 04:03)

SkillsBench/Vals 采用核查 09-02 04:44 —— 排行榜是活的,提交依然没有

academic-research-skills——引用审计作为成品工具落地(09-02)

mattpocock/skills 突破 245k★——反框架立场被明说(09-03)

diagram-design 突破 30.5k★——有主见的品味成为可安装层(09-04)

2026-09-05 04:03

2026-09-06 04:03

openai/skills 弃用;技能格式迎来 GPU 厂商和市场营销垂直(09-07 12:03)

i-have-adhd 登顶趋势榜;帖子自己测出技能对 harness 的天花板(09-09)

ayghri/i-have-adhd(MIT,29.7k★,日榜 #1,+422):单个 SKILL.md——10 条规则("第一行就是下一步动作"、列表
不超过 5 项、无前言/复盘/收尾)让编码 agent 输出对 ADHD 友好,带 Claude Code、Codex、Cursor、Gemini、OpenCode、
Kimi、Qwen 适配器,7 种语言。HN 帖子的揭秘:真正的内容只有 约 140 行;仓库的 8.7k 行大多是 eval。同帖测出的
天花板:Claude 只能"坚持几轮"就回退,且 Claude Code 自带的 harness 指令权重完全压过用户规则——"我不认为我们能靠
技能解决这个问题"。还有人指出贴 URL 安装技能是注入向量。"证明它"阶段迄今最锋利的数据点:一个 prompt 文件能登顶
GitHub 趋势榜,而同一场讨论记录了harness(而非技能)拥有长程行为——8.7k 行 eval 的存在本身,就是因为效果会衰减。

2026-09-09 12:03→20:03 —— 品类一分为二;技能伸进硬件流水线;图像提示成为打包工件

2026-09-10 04:03 — 流水线与反 AI 腔:渠道开始承载多智能体工作流和写作工具

2026-09-11 04:03 —— 技能包管理器层到来

2026-09-14 04:03 — 供应链层成为技能品类的差异化卖点

2026-09-16 12:03→20:03 —— 最大的合集押注生命周期纪律;审计线车以 skill 形态上架

2026-09-17 04:03 — 周冠军仍然是一个单文件行为规则集

2026-09-17 12:03→20:03 —— spec 框架迎来 HN 现实检验;Cowork 的能力层以仓库形态出货

2026-09-21 04:03 — 评估论证拿到从业者的声音

Sources: evaluation.club ·
HN discussion

2026-09-26 04:35 — 持续的方法论 vs 验证闸门

两个数据点,都没有新发布驱动。mattpocock/skills 保持在 269,636★(GitHub API——引用 API 而非会夸大数字的 trending 渲染页;+588/天,最后 push 9 月 24 日):今天没有新的破圈事件,应读作"具名方法论的持续采用"——约 26 个可组合的 Claude Code 与 Codex 技能,用户调用(/grill-me 需求访谈、/to-spec)与模型调用(/tdd、/diagnosing-bugs、/code-review)并存——一位教育者的完整工作过程被版本化、可安装,与框架式产品(GSD、BMAD、Spec-Kit)而非单一用途工具竞争;README 自己的限定语仍然成立:架构技能"是一份综述,不是救命稻草"。OpenSpec v1.13.2(Fission-AI,70.3k★,+1,415/周)发布了对于一个全靠"可验证意图"立身的工具最重要的 changelog 行:"跳过的检查不再被报告为通过"——要么是成熟度里程碑,要么是重审此前所有绿色对勾的理由;README 细则:Node 20.19+、"在高推理模型上效果最佳"、匿名遥测默认开启(DO_NOT_TRACK=1 关闭)。

Sources: mattpocock/skills · Fission-AI/OpenSpec · v1.13.2 release notes

2026-09-26 12:40 — 插件圈地延伸到知识工作者的桌面(09-17 首次记录后的热度数据)

anthropics/knowledge-work-plugins 上榜 25,633★(+889/周,9 月 25 日仍在推送)——本文件 09-17 首次记录该仓库后的热度数据点。11 个面向知识工作者(而非开发者)的 Apache-2.0 Cowork 插件:生产力、销售、客服、产品管理、市场营销、法务、财务、数据、企业搜索、生物研究、插件管理——每个都打包 skills、MCP 连接器、slash 命令和子 agent,经 claude plugin marketplace add 安装。这是第三个上榜的 Anthropic 插件/技能仓库(继 claude-plugins-official 和 financial-services 之后)。需要持续关注的依赖:每个插件的价值都被其第三方连接器(Slack、HubSpot、Snowflake……)挟持,而这些都不在 Anthropic 控制之下——与开发者侧仓库相同的信任面,这次对准了法务与财务数据。

Sources: anthropics/knowledge-work-plugins · GitHub Trending(周榜)

2026-09-26 20:03 — 技能经济触及进攻性安全,伴随可疑的互动比

zhaoxuya520/reverse-skill(37.7k★,+409/天,MIT 含 GPL/AGPL 子模块,最后推送约 9 月 24 日):面向 Claude Code、Codex、Cursor、Cline 等的"技能路由包"——当 agent 遇到 APK、二进制、JS 加密、固件或渗透目标时,44 条路由规则 / 45 个技能模块将其映射到剧本与工具链(jadx、Frida、IDA、radare2、Ghidra、nmap、Burp),场景从恶意软件/YARA 到 CTF(42 个子技能)再到 LLM 安全。声称 175 个基准用例并在 Windows+Ubuntu 上跑 CI。这是 Claude-Red 双刃趋势的延续(技能层开始规模化打包进攻性安全)——但两个告诫随行:互动比可疑(37.7k★ 对 124 watchers 与 181 commits——09-21 对 OpenStock 首用的星数/提交检查将此星数标记为未核验),且它指示 agent 打开 README_AI.md 并"严格遵循指示"——一个提示注入形态的模式,任何 agent 自动执行前都值得人工审查。README 确实把动作挡在授权/范围检查之后——若星数属实,这是在技能层内部构建护栏的尝试。

Sources: zhaoxuya520/reverse-skill · GitHub Trending

2026-09-26 20:51 — reverse-skill 检查深化:6 月批评所指向的历史已不存在

对 09-26 条目警示的第一手 API 核查,所有数字均已验证:(1) 37,737★ / 181 提交 ≈ 209★/提交——是类型匹配对照项的 11 倍(davila7/claude-code-templates:31.9k★ / 1,684 提交 ≈ 19★/提交),"markdown 包就是提交少"解释不通;(2) 全部可见 git 历史只覆盖 2026-08-08 → 09-22,而仓库创建于 2026-05-13——约三个月历史缺失,且 6 月 24 日的 HN 故事(2 分,无评论)标题为"Trending agent skill pack with built-in refusal-suppression layer",其描述的内容已不在历史中;(3) 现在的同意门是全新的——PR #142 "consent-gate agent bootstrap" 于 09-21 落地(星数暴涨之后)——且当前 README_AI.md/RULES.md 确实把执行门在激活 + 逐效果同意之后("阅读仓库文件不构成执行授权"),所以仓库可能已经改过自新——但其可见记录始于最糟糕的负面报道之后;(4) 16 位贡献者,最高贡献者 23%(把几乎同名的 zhaoxuya520/zhaoxuya 账号合并计约 36%),仅一个 tag(v1.0.1),README 指向 linux.do 作为社区。结论维持并强化:把星数当作未证实;"严格遵循指示"的警示现已部分过时(当前文本明确声明只读不受强制)——信任赤字从内容转移到了历史。

Sources: zhaoxuya520/reverse-skill · HN — 六月故事 · davila7/claude-code-templates

2026-09-27 20:03 —— 图表技能品类规模化;技能模式在爱好领域端到端落地

archify 达 72.5k★(tt-a1i/archify,MIT,9 月 27 日仍有推送;对第 35 周 validated-IR 品类冠军的更新,此前 49.3k★):把仓库或想法变成自包含的交互式 HTML——架构、工作流、时序、数据流与生命周期图,带动效——设计上可对照代码库验证,可用于 Cursor、Claude Code、Codex CLI 与 OpenCode。创建于 4 月 15 日;最近完整发布 v2.16.0(8 月 30 日),处于 v2.17.0-dev 线。已做审视:触发分散——GitHub 趋势榜加中文社区渠道(README 里的微信群/QQ 群)、无 HN 帖——且 Nous Hermes 目录条目注明只处理公开 GitHub 仓库。技能经济当下最大的消费级爆款是文档:agent 让架构图与仓库保持同步,正在成为一等用例而非演示。

chess-postmortem-skills(brumar/chess-postmortem-skills,Show HN 73 分,仓库创建于 9 月 25 日,56★):给它一个 lichess 链接加录制的思考音频——它在本地用 whisper.cpp 转录、按 PGN 时钟时间把句子对齐到着法、用自然语言盘问 Stockfish,产出带注释的 PGN、HTML 查看器与解说视频。两天的单人仓库、一个完整示例——是动量、不是成熟度。但"技能"模式在爱好领域的端到端落地——本地转录 → 工具编排 → 可发布产物——是任何小众工作流本周就能照抄的模板。

Sources: tt-a1i/archify · Hermes 技能目录条目 · brumar/chess-postmortem-skills · HN — 棋局复盘

2026-10-01 04:03 — 品味的确定性检测器(impeccable);形式方法浪潮迎来反驳章

impeccable(pbakaus/impeccable,周增 2,644 达 73k★,周榜第 10):"1 个技能、24 条命令、浏览器内实时迭代、61 条确定性检测规则",让编码代理产出更好的前端设计——明说是 Anthropic frontend-design 技能的分支,论题:"每个模型都在同一批 SaaS 模板上训练……处处 Inter、紫到蓝渐变、卡片套卡片。"检测规则"无 LLM、无 API key 即可运行"。项目确实活着:五天内发 v0.1.6–0.1.8(9 月 25–29 日),9 月 30 日有推送。同日 HN 的回声("我们 vibe coding 的网站看起来像设计师做的",127 分)从用户侧给出同一结论——热评第一:"你无意中重新发明了设计学院教的设计流程。"技能类对设计瓶颈的回答是编译器时代的那一套:品味的确定性 linter——因为失败模式在各模型间出奇一致。评测在哪?仍然缺席——这个类悬而未决的老问题。

〈TLA+ 能检查什么、不能检查什么〉(Hillel Wayne,Computer Things,9 月 30 日,87 分):给"代理+形式方法"浪潮的对冲砝码,触发点是"Boris Cherny(Claude Code 发明者)提到 Opus 能用 TLA+ 找出竞态条件"。Wayne:"我们稍微冷静一点,别再讲'TLA+ 会把 AI 从它自己手里救出来'。"核心局限用 []P/P'/<>P 走了一遍:"要验证一个性质,你得先有一个性质可供验证"——模型检查的是规约;写出正确的规约仍是人类的、未解决的那一半。这波浪潮有用的版本不是"模型替你证明系统"——而是"模型写出你懒得写的规约,再拿它约束实现"。验证依然始于人类对"什么才重要"的决定。

2026-10-04 04:03 — ECC 2.2:最大的第三方技能货架只有一位维护者和一条恶意软件警告

ECC 2.2(affaan-m/ECC,MIT——272,129★,日趋势第四,+954/天,v2.2.3 于 10 月 1 日):自称「agent harness 性能优化系统」——一次安装把 plan→test→implement→review→verify→remember→improve 变成 agent 基础设施:68 个专职 agent、293 个技能、94 条命令、运行时 hooks/记忆,以及扫描提示、hooks、MCP 配置、权限与密钥的「AgentShield」。v2.2 为 Claude Code、Codex 与 Kimi Code 新增引导式设置;README 承认对 Cursor、OpenCode、Gemini、Zed、Copilot、Antigravity 与 Qwen 仅有能力受限的适配器。变现:私有仓库的 $19/座/月 Pro 档。构成这条目的三个事实:醒目的「仅从官方来源获取——第三方转载可能含恶意软件」供应链警告;单一维护者的每周出货;以及对「这 293 个技能是否真有提升」零独立评测——星标数是唯一信号。 论题 8 的「证明它」阶段拿到最大测试用例:在这个星标量级,ECC 是平台官方之外最大的 agent 技能分发渠道,而它的巴士因子、它自带的供应链警告、它未验证的性能主张就是全部故事。这个货架已经大到一个人担保不过来。

Sources: affaan-m/ECC · v2.2.3 发布说明