个人 skill 包诚实自评:五类可用性短板

问题:看起来完整,但没在真实项目跑过

本周对个人 Claude Code skill 包做了一次自评。42 个 skill,87 个 in-skill references,平均 129 行。数字看起来完整。

但最大的缺口一眼可见:整个 pack 没有任何证据表明这些 skill 在真实项目里跑过

Steps 是规范化的最佳实践陈述,不是从真实会话提炼的工作流。一个 /tdd skill 写了红绿重构步骤,但没记录」在实际 Next.js + Prisma 项目里这样跑通了」。使用者按 Steps 执行,遇到现实复杂度(monorepo、遗留代码、CI 差异)时,skill 没有应对指引 ——Steps 假设的是理想路径。

这是评分没到 9 的根本原因。

本周其他进展

  • swarmflow vs teammate 两种编排方案实际运行对比,swarmflow 串行路径完善
  • GLM 下子 agent 停止问题定位:思维链过长被截断,卡在」想完没做」
  • Figma UIUX 工作流搭建,关键点是人工介入审计
  • research / reader 调优,借鉴 pptagent researcher 提示词支持表格公式原生内容

深入:五类可用性短板

flowchart TD
    A[skill 包短板] --> A1[1.零实战验证]
    A --> A2[2.阶段分布失衡]
    A --> A3[3.技能边界重叠]
    A --> A4[4.触发词机械]
    A --> A5[5.references 深度不均]

1. 零实战验证 —— 最大专业化缺口

如上。对比 obra / superpowers,它明确标注」agentic skills framework & software development methodology that works」——「that works」是有用户验证背书的。我的 pack 没有 case study、没有」用 X skill 解决了 Y 问题」的示例、没有已知限制说明。

2. 阶段分布失衡

pie title skill 阶段分布
    "03-design (12)" : 12
    "01-product (3)" : 3
    "05-tune (2)" : 2
    "07-verify (3)" : 3
    "其他" : 22

03-design 占 12/42 = 28%,其中 4 个是图片生成(imagegen-web/imagegen-mobile/brandkit/image-to-code)—— 对多数工程使用者是边缘需求,却占了近 1/10 的 pack 体积。核心工程技能(architecture/api-design/schema-design)反而被稀释。

05-tune 只有 2 个(performance + simplify),但性能优化、技术债管理、可维护性在真实项目里是高频需求。07-verify 只有 3 个,缺 linting/static-analysis、dependency-audit。

3. 技能边界仍有重叠,路由会困惑

  • simplify vs codebase-design:都讲重构,Not-for 互相指向但使用者难判 ——「我要重构这段乱代码」该调哪个?
  • implement vs tdd:边界靠」pre-agreed seams」这种内部术语,新使用者不懂。
  • research vs market-research vs tech-selection:三个调研技能,Not-for 三角互指。

4. 触发词覆盖中英但不覆盖意图变体

description 用」Triggers on X」模式,但真实用户表达多变。/debugging 触发词有」读日志」、」排查错误日志」,但没有」这个报错什么意思」、」为什么返回 null」—— 后者是高频真实表达。

对比 obra / superpowers 用更语义化的 description(不列触发词列表,靠意图匹配),Claude 的 auto-invocation 对语义 description 匹配更好。硬编码触发词列表是 v1.3 时代的设计,现在看略机械。

5. references 深度不均

87 个 in-skill references 平均 129 行,但分布不均。frontend-design 有 22 个 references(~1788 行),而 implement/tdd/context-engineering 等高频核心技能的 reference 偏薄。设计侧过深、实现侧偏浅 —— 与阶段失衡同源。

沉淀

五类短板的本质是同一条:「看起来完整」不等于」真的能用」。skill 包要从」写 Steps」转向」在真实项目里跑过再提炼」。后续优先级:

  1. 补实战验证:选真实项目跑通,从会话提炼工作流
  2. 阶段再平衡:加强 05-tune、07-verify,稀释 03-design 图片生成占比
  3. 边界去重叠:简化 Not-for 三角互指
  4. 触发词语义化:从硬编码列表转向意图描述

参考资料