最近 skill 自优化挺火:微软 SkillOpt 拿基准分数当信号,darwin-skill 拿手写 测试题+评委团打分。两个问题:一次只能优化一个你想到的 skill——我装了 230+ 个,瓶颈是我的注意力,不是优化器;而且离线评审永远看不见真实使用—— skill 真正翻车那次、用户怎么纠正的,它们不知道。
所以我写了 lamarck,名字就是冲着 darwin 去的:装一次,全部已装 skill 进入 被动观察,哪个值得进化由证据浮现,不靠人工圈选:
两个 hook 静默记录每次真实 skill 调用,带 skill 文件内容哈希——每笔编辑 都有前后版本窗口,效果指标是用户纠正率(行为数据),不是模型自评 (darwin 引用的论文自己说 LLM 自评准确率约 46%)。 翻车的调用自动蒸馏成回归用例——测试题从现实里收割,零人工编写。 进化有门:≥2 次独立同类 gap 才出提案,有界编辑,用户三选一,后面还有 replay 重放、成对盲评、版本分窗三道回滚防线。 用进废退是字面意思:连续 10 次干净的 skill 降为抽查(收敛);90 天没人 引用的评分条目出修剪提案(废退)。离线优化器只会越改越长。 它用同一套规则进化自己,CHANGELOG 就是可审计的自进化史。 证据方面(自称"自我进化"的东西都该被怀疑,所以):机制自测 44/44,CI 三平台 (ubuntu/macos/windows);突变基准的协议先 commit 进仓库再跑评委—— 已知劣化变体拦截 4/5 、已知改善变体误拦 0/2,原始 verdict 逐字入库,漏网的 那个有公开分析。真实生产案例还在积累,没有的数字不吹。
安装一条命令:npx lamarck-skill(自动接 hook 、备份 settings 、装完自跑 自测)。MIT,遥测不出本机。
https://github.com/newdee/lamarck-skill
欢迎来砸 bench 协议——它就是为可复现设计的。