starwishzzgg
V2EX  ›  问与答

这两天总算是体感了一下 chatgpt(codex)和 workbuddy 之间的差别

  •  1
     
  •   starwishzzgg · 19h 24m ago · 1870 views
  •   You need to sign in to view this topic

    想做一个武侠游戏,准备先收集整理一下金庸相关的武侠作品内容,包括门派、人物、武功等,并且根据关联关系建立武侠知识图谱,为后面做游戏做些准备,于是先用 Chatgpt 来干,活又细又慢,耗掉了我 5 个 plus 的重置,基本形成了一个数据基础,基于此生成了一个网页来查看相关关系和具体细节,我把我最熟悉的相关门派、人物、武功都看了一遍,除了有缺失的,基本没有错误。

    忽然突发奇想,反正 workbuddy 也有之前薅羊毛来的几千积分,想对比一下区别,于是乎用同样的提示词输入 workbuddy ,惊喜的是速度比 chatgpt 快几倍,过程中观察发现比 chatgpt 少了不少交叉比对来验证数据结果的正确性,结束后也生成了一个网页来查看关系和细节描述,同样去看我最熟悉的相关门派、人物、武功,发现了近 10 处细节错误。

    从过程差异来看,感觉模型处理这样的任务差异不大,似乎主要就是缺在交叉验证数据结果这块,侧面思考一下,各个 agent app 的 harness 设计还是非常重要啊,

    14 replies    2026-07-26 02:28:53 +08:00
    calvinHxx
        1
    calvinHxx  
       18h 7m ago
    你来回核对 workbuddy 细节、修补漏洞的时间远比你等 gpt 生成慢 成本要高的多的多
    getadoggie
        2
    getadoggie  
       18h 2m ago via iPhone
    所以是不是还是 harness 流程设计很重要 可是现在有相关比较完善的开源项目吗,我感觉都找不到
    Solace202
        3
    Solace202  
       17h 31m ago
    我也觉得,其实大部分代码编写场景其实流程更重要,我觉得写的快了,那如何测试更重要,我甚至认为测试是最需要尽快处理的问题了。
    cnightmare
        4
    cnightmare  
       17h 18m ago
    模型能力差太多了,这些 agent 都是互相抄,大差不差
    bigdogbigpig
        5
    bigdogbigpig  
    PRO
       16h 52m ago
    应该让 codex 用便宜的模型,这样速度可能慢一点,准备用效果可能也还行
    ldy619354397
        6
    ldy619354397  
       16h 44m ago
    模型能力查很多
    leihaibo1992
        7
    leihaibo1992  
       16h 40m ago
    你确定你对比的是 codex 和 workbuddy 吗,你对比的明明是顶级模型和一个免费的垃圾模型
    leihaibo1992
        8
    leihaibo1992  
       16h 37m ago
    agent harness 不是什么高深的技术,现在市面上叫得上名字的 agent harness 不会有什么显著的差异,前提是得用相同的模型
    yidinghe
        9
    yidinghe  
    PRO
       16h 29m ago via Android
    这个场景重度依赖网度搜索工具,搜索质量差,模型再聪明也是白搭。
    yunpeng2015
        10
    yunpeng2015  
       16h 7m ago
    应该用 codex + 一个便宜模型, 然后对比 workbuddy + 一样的模型
    zhw2590582
        11
    zhw2590582  
       15h 10m ago
    workbuddy 现在可以控制电脑和浏览器吗
    kirbyzhu
        12
    kirbyzhu  
       10h 49m ago via iPhone
    workbuddy 根本不能用
    Deshun
        13
    Deshun  
       8h 53m ago
    WorkBuddy 有一些专家,比如深度研究专家或者专家团,可能会有交叉验证的逻辑。
    zerovoid
        14
    zerovoid  
       4h 48m ago
    你是想比较模型能力,还是 IDE/CLI 能力?
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1039 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 39ms · UTC 23:17 · PVG 07:17 · LAX 16:17 · JFK 19:17
    ♥ Do have faith in what you're doing.