tangyehui's recent timeline updates
tangyehui

tangyehui

V2EX member #434873, joined on 2019-08-09 19:14:24 +08:00
Today's activity rank 447
tangyehui's recent replies
@coefu 请问错在哪里呢
@nickyadance23 这里有两层问题,1. skill 本身如何做 a/b ,由于 skill 的路由本身是个概率系统,有可能相互影响不好评估。2. metric/reward 如何随着迭代同时进行进化,防止被 hacking 。

至于可靠性的问题,主要还是由概率的方式来做,就是测试 x 次,99% 没有问题;概率系统很难像纯代码一样,可以靠 lean 这样的东西完全证明没问题,只能说几乎处处可靠。
@skuuhui 从 SoL-Pi 的爆火和 no free lunch 的角度来讲,未来 harness+model 协同进化是需要根据场景调优的。现在大家都还刚开始,欢迎提提意见啊!也求个 star 哈哈。
求大家点点 star ,给点意见啊
@nightwind 有兴趣可以点个 star ,持续关注一下。非常感谢!
@sampeng 感谢建议!下面是对 automation 任务的统计结果。
每题耗时 | Luna max | Astra max
Agent 平均运行时间 | 5 分 51 秒 | 5 分 39 秒
Agent 运行中位数 | 5 分 23 秒 | 5 分 28 秒
含环境准备、执行和评分的平均时间 | 7 分 07 秒 | 8 分 30 秒
@lancevps tb 的任务有点太长了,自己的 token 烧不动了,欢迎 contribute 实验结果。在 tb 2.1 上是 Luna + Gear-tuned DSH 84.26%,Astra + Codex 87.4%, Fable + ClaudeCode 83.8%。
2 days ago
Replied to a topic by tommyZZM 程序员 提示词工程师会最终出现吗?
感觉不会,最终还是人来定义 benchmark ,任务的评分标准,至于 harness 、model 都靠 ai 来调优。可以关注一下我们的自进化 repo 啊,只要给一个 benchmark ,ai 就能自进化出最适合当前任务的 harness 。当前已经用 luna + dsh 在多个 benchmark 上超越 astra 了。
求 star ! https://github.com/rsi-gear/gear
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   940 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 21ms · UTC 21:46 · PVG 05:46 · LAX 14:46 · JFK 17:46
♥ Do have faith in what you're doing.