节点赞助商

stebest

"用进废退"的 全 skill 进化系统

  •  
  •   stebest · 17h 47m ago · 644 views

    最近 skill 自优化挺火:微软 SkillOpt 拿基准分数当信号,darwin-skill 拿手写 测试题+评委团打分。两个问题:一次只能优化一个你想到的 skill——我装了 230+ 个,瓶颈是我的注意力,不是优化器;而且离线评审永远看不见真实使用—— skill 真正翻车那次、用户怎么纠正的,它们不知道。

    所以我写了 lamarck,名字就是冲着 darwin 去的:装一次,全部已装 skill 进入 被动观察,哪个值得进化由证据浮现,不靠人工圈选:

    两个 hook 静默记录每次真实 skill 调用,带 skill 文件内容哈希——每笔编辑 都有前后版本窗口,效果指标是用户纠正率(行为数据),不是模型自评 (darwin 引用的论文自己说 LLM 自评准确率约 46%)。 翻车的调用自动蒸馏成回归用例——测试题从现实里收割,零人工编写。 进化有门:≥2 次独立同类 gap 才出提案,有界编辑,用户三选一,后面还有 replay 重放、成对盲评、版本分窗三道回滚防线。 用进废退是字面意思:连续 10 次干净的 skill 降为抽查(收敛);90 天没人 引用的评分条目出修剪提案(废退)。离线优化器只会越改越长。 它用同一套规则进化自己,CHANGELOG 就是可审计的自进化史。 证据方面(自称"自我进化"的东西都该被怀疑,所以):机制自测 44/44,CI 三平台 (ubuntu/macos/windows);突变基准的协议先 commit 进仓库再跑评委—— 已知劣化变体拦截 4/5 、已知改善变体误拦 0/2,原始 verdict 逐字入库,漏网的 那个有公开分析。真实生产案例还在积累,没有的数字不吹。

    安装一条命令:npx lamarck-skill(自动接 hook 、备份 settings 、装完自跑 自测)。MIT,遥测不出本机。

    https://github.com/newdee/lamarck-skill

    欢迎来砸 bench 协议——它就是为可复现设计的。

    Supplement 1  ·  10h 27m ago
    本质上是一个“生产环境自进化系统”:不是让某一个 Skill 被优化一次,而是让你安装的所有 Skill ,在真实使用过程中持续积累证据,然后在满足条件时进化
    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2775 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 19ms · UTC 12:12 · PVG 20:12 · LAX 05:12 · JFK 08:12
    ♥ Do have faith in what you're doing.