个人 skill 包诚实自评:五类可用性短板
写了 42 个 skill 的个人包,做一次诚实自评:零实战验证、阶段失衡、边界重叠、触发词机械、references 深度不均。看起来完整不等于真的能用。
写了 42 个 skill 的个人包,做一次诚实自评:零实战验证、阶段失衡、边界重叠、触发词机械、references 深度不均。看起来完整不等于真的能用。
多 agent 工作流黑盒不可调试。在 skill 的每个阶段边界旁路写 trace,只读不改控制流,卡住时一眼定位停在哪步哪个 agent。
调研九问 agent 生态,找到一条主线:skill 驱动。skill 里写 workflow.md 声明子 agent,框架再动态生成 workflow.py 执行。声明式编排 + 动态生成,是复杂多步任务的好设计。
原生引擎崩溃不一定是你的错。用 vanilla 当对照组,一次对比就能分清是上游缺陷还是自己的 bug。
从 "理解" 进入 "开发" 的这一周,最核心的是把几十个依赖的编译流程拆成可复现的步骤,形成一张编译地图,再固化个人开发流。
面对一堆仓库和一个还不存在的基础环境,这周的经验是:先画模块关系图定位切入点,把编译部署流程走一遍,再用环境受限的时间做纯脑力工作。
入职第一周做了三件事:搭环境、定目标、补基础。最值得写的是 knomate 的双端分离架构 —— 把权限和安全边界定死在架构里。
RAG 系统的回答质量参差不齐,固定阈值无法适应不同知识库。本文设计了 "在线计算原始分 + 离线分位数阈值" 的架构,用近 7 天真实数据分布动态决定置信度分级。
开发支付 API 时发现 Bearer Token 字符串直接比对存在时序攻击风险,这篇文章记录了从发现漏洞到用常量时间算法修复的完整过程。
在一个需要长期维护的运维平台中,选择自建 RAG 而非集成 LangChain 等框架。这背后的决策不只是代码量的问题,而是对可控性和长期维护成本的权衡。