sampeng

jev 的类似开源这两天都爆了,测了一下 laya

  •  
  •   sampeng · 2 days ago · 861 views
    因为我把 jav 扩展到了自动选择 thinking 的等级,想看看效果。
    然后就突发奇想,我已经用了 1 年的 vb 了,积攒了大量的 jsonl 。于是让 astra 来进行抽取 10000 条符合可以做 thinking 判定的。但是太多了,我怕 astra 给我标记了。先抽取出 200 条来做一个基线。用 astra 和 sol 进行独立评分,然后喂给 jev 看看 jev 的结果情况(这是不是就是蒸馏 astra 。。。)。。因为我打算直接拿这个来训练微调 laya 。

    看结果不是很好


    | 指标 | Laya 多语言版 | 翻译+ Laya 英文版 | Jev |
    |---|---:|---:|---:|
    | 与共识等级一致 | 22.6% | 38.7% | 68.5% |
    | 最多相差一档 | 53.2% | 76.6% | 96.8% |
    | 判低两档及以上 | 52 条 | 5 条 | 1 条 |
    | 总延迟中位数 | 71ms | 3.19 秒 | 377ms |

    jev 肯定是有大量的判例来进行训练的,不是一蹴而就的。laya 的 readme 也说了他裸跑不如 jev ,但是根据训练进行特化微调训练,是可以达到甚至超过 jev 的。

    我打算试试看看效果。

    case1.更换底模
    case2.用微调。

    这个东西值得研究的价值在于在某一个小的领域等于 SOTA 的效果。还是很有价值的。。。我刚就在想。

    大模型在 agent 的 loop 中前期要暴力思考使用 read/grep 工具来探索,有时候这个就要 1-2 分钟,如果这个 1-2 分钟缩短到 5 秒内。是不是有显著的帮助,当然这只是探讨。。也不是专业搞这个的。
    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5444 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 21ms · UTC 03:27 · PVG 11:27 · LAX 20:27 · JFK 23:27
    ♥ Do have faith in what you're doing.