• 请不要在回答技术问题时复制粘贴 AI 生成的内容
zhaoxin1943
V2EX  ›  程序员

Agent 工作流里的快速决策: Laya vs TypeSafe Jev

  •  
  •   zhaoxin1943 · 17h 13m ago · 967 views

    英文原文:Fast Decisions in Agent Workflows: Laya vs TypeSafe JevJevLab)。本文为独立、非官方评测视角,与 TypeSafe 、Convai Innovations 均无隶属或背书关系。

    一句话结论: 用 70B 级自回归大模型去做简单的 Agent 路由,越来越不划算。Convai Innovations 开源的 Laya( 421M ModernBERT-large )正在挑战 TypeSafe 托管的 Jev。公开数字里,Laya 大约 快 7.8 倍( 32.8 ms vs 236–276 ms ),温度校准后 ECE 更紧( 0.081 vs 0.246 ),多语言覆盖更广,自托管软件成本可视为 $0 。但在真正上线的 Agent 流水线里,裸准确率只是一半故事——置信度阈值 + fail-closed handoff (不足则移交),才决定错误路由会不会真的被执行。

    1. 「突破」之争,以及 System 1 决策引擎

    2026 年 9 月初,TypeSafe 推出专有引擎 Jev (例如 jev-1.13.0),把非自回归决策原语包装成 AI 工作流的新范式:不再生成变长文本,而是直接给出确定的 choiceconfidence

    随后,Convai Innovations 创始人 Nandha Kishor M 发了一篇传播很广的技术复盘(大意是:我一年前就在做非自回归决策模型,然后某前沿实验室管这叫「突破」)。同期开源了 Laya:Apache-2.0 ,权重在 Hugging Face (convaiinnovations/laya)。

    这背后是 Agent 工程的一次分叉:

    • System 1:快、非生成式分类 / 决策
    • System 2:慢、自回归推理
    用户请求进来
            │
    [System 1:快速决策引擎]
    (Laya 本地 ~33ms / Jev 托管 API)
            │
    置信度 >= 阈值?
       /              \
      是               否
      │                 │
    自动采纳路由      Fail-closed 移交
    (专职工具)       (人工 / 兜底)
    

    如果只是为了在五个工具里选一个,就拉起 GPT-4 / Claude 级别模型,常见代价是几百毫秒到数秒、吃掉 token ,还容易在 JSON / schema 上翻车。决策引擎的做法是:不做文本解码,一次前向传播直接出类别 log-probability 。

    2. 头对头数字(先说清楚前提)

    Convai 发布的多维对比,是把 Laya 和 第三方已公开的 TypeSafe Jev 数字放在一起(例如 AbdelStark 、nlbzard 等相关评测材料)。这有方向性参考价值,但 不等于 同一网络、同一运行时条件下的字节级对照实验。

    指标 TypeSafe Jev ( 1.13.0 公开) Laya ( Convai ) 差异
    P50 延迟(单题) 236–276 ms (托管 API ) 32.8 ms (本地 T4 ) 约 7.8× 更快
    批处理( 50 题) N/A (并发常受限) 7.2 ms / 题(合计 337 ms ) 本地吞吐优势
    校准(平均 ECE ) 0.246 0.081 (温度 refit ) 约 3× 更紧
    许可 / 价格 闭源 API (约 $0.042 / 1M tokens ) | Apache 2.0 (自托管软件 $0 ) 开源
    多语言 未明确 / 偏英语 51 语中约 45 语可用 覆盖更广
    隐私边界 出站到公网端点 可本地 / 气隙 零出站

    公开集准确率(据报道)

    • typed-decisions( 2000 次):Laya 0.766 vs Jev 0.727(+3.9%); Laya 甚至高于估计的 teacher 上限(~0.735 )
    • AG News( 4 类):0.950 vs 0.910(+4.0%)
    • DAIR Emotion( 6 类):0.595 vs 0.480(+11.5%)

    Laya 在若干工作流式 held-out 任务上的表现(多 checkpoint )

    • 钓鱼检测:0.940–0.993
    • 邮件垃圾分类:0.958–0.993
    • 主题分类:0.930–0.953
    • Guardrail / Jailbreak:0.708–0.762
    • RAG 段落相关性:0.625–0.657
    • 10 路客服分流:0.502–0.522

    3. 为什么 Laya 能到 ~33 ms:ModernBERT + 校准训练

    ModernBERT-large ( 421M )

    编码器路线( FlashAttention-2 、RoPE 、unpadding 、更大上下文)并行处理 token ,避开自回归路由的 O(N) 解码循环。

    面向校准的训练( RLCD 一类思路)

    经典分类器容易只优化 top-1 ,越训越「自信过头」。Laya 方向更强调 proper scoring (如 Brier 、log-loss ),让概率更适合当 策略输入,而不只是榜单装饰。

    多 checkpoint + preload

    from laya import Router
    
    router = Router(preload=True)
    
    decision = router.route({
        "task": "Review pull request #104 for potential race conditions",
        "context": "diff --git a/worker.go b/worker.go..."
    })
    

    混合语言场景下,如果每次动态加载权重,冷启动惩罚很大( Convai 提到约 7.4 秒)。预加载后,跨语言流量下的单次延迟会平稳很多。

    4. 真正决定能不能上线的部分:ECE + fail-closed

    在 Agent 里,校准往往比裸准确率更重要

    • 预测 code_search,置信度 0.98 → 自动采纳通常合理
    • 预测 code_search,置信度 0.52 → 基本是在猜;正确策略是 fail-closed handoff(人工复核,或追问澄清)
    ECE (越低越好)
    
    Laya (出厂原始):     ~0.466
    Jev (公开数字):      ~0.246
    Laya-Multi ( refit ):  ~0.106
    Laya (温度 refit ):   ~0.081
    

    未校准模型可以说「我 95% 确定」,但在它经常错的样本上,真实错误率可能接近 40%。温度 / 域内 refit 不是边角料——它决定阈值有没有物理意义

    5. JevLab 的视角:量的是 handoff 边界

    我们的工作假设是:

    没有阈值的准确率是幻觉。上线后,策略生死线是 handoff 边界。

    两条反复强调的 caveat:

    1. 第三方表格 ≠ 受控对照。 更可信的是:同一批 prompt 、同一网络/运行时假设、钉死的模型版本。
    2. 歧义才是生产税。
      • 「找到解析 auth token 的位置,并改测试去 mock 它」→ 多意图(code_search + test_runner
      • 「这个函数干什么?」却没贴代码 → 信息不足

    无约束路由器仍会吐出一个「看起来很自信」的标签,然后把下游状态搞脏。阈值的意义,是把「我在猜」变成 handoff,而不是变成一次错误工具调用。

    概念上的评测切分:

    • 清晰验证 / 测试集:看 auto-adopt 率,以及被自动采纳决策里的错误率
    • 对抗 / 歧义挑战集:置信度会不会塌下来,让例如 t = 0.80 的阈值干净触发 handoff

    6. 怎么选:生产决策矩阵

    更适合 Laya ,如果你需要:

    • 本地 P50 大约 <50 ms
    • 气隙 / 数据不出域
    • 已有 GPU ( T4 / L4 一类)且愿意运维
    • 多语言输入常见

    更适合 TypeSafe Jev ,如果你需要:

    • 无服务器、几乎零 GPU 运维
    • 纯 TypeScript / Edge 友好接入
    • 量小或突发,API 费用比常驻 GPU 更划算
    必须零出站 / 气隙?
            /                \
          是                  否
           │                  │
        选 LAYA          有 GPU 吗?
                         /          \
                       是            否
                        │             │
                  要 <50ms ?       选 JEV
                   /      \       (托管)
                 是        否
                  │         │
              LAYA      两边都评一遍
    

    7. 我们接下来做什么

    Laya 这类可上线的开源决策模型,强化了一个判断:System 1 路由是基础设施,不是演示。

    JevLab 正在评估把 Laya 基线加进公开 Lab ,让开发者可以:

    1. 同一套 Agent 路由任务上对比引擎
    2. 扫置信度阈值,观察 auto-adopt vs handoff 权衡
    3. 导出由这些曲线塑造的 TypeScript 向路由策略

    在正式 measured report 发布前,请把公开站点当成 非官方阈值实验室 / Preview:适合用「策略空间」思考问题,不等于每一张图都已是发版门禁。

    原文与 Lab: https://jevlab.dev/blog/laya-vs-jev · https://jevlab.dev


    独立非官方项目。与 TypeSafe AI 、Convai Innovations 无隶属、背书或维护关系。文中基准数字除非另有说明,均来自已公开的第三方 / 厂商材料。

    9 replies    2026-09-22 17:23:48 +08:00
    xiadengmaX1
        1
    xiadengmaX1  
       16h 26m ago   ❤️ 1
    纯 ai slop
    penisulaS
        2
    penisulaS  
       14h 47m ago
    其实只把一句话总结贴上来就够了
    SilencerL
        3
    SilencerL  
       14h 38m ago
    1. 本文是 AI Slop
    2. Laya 实测速度快但是准确率是目前测过的几个开源类 Jev 实现中最低的,更别说了 Jev 对比了
    yiranw09
        4
    yiranw09  
       13h 55m ago
    laya 上下文就 1k ,能干嘛?
    yelog
        5
    yelog  
       13h 13m ago
    昨天测试了把架构中的 agent 决策( mcp 、tools 、agent 编排)都换成 jev 之后,并没有体感的区别,因为 ReACT loop + Agent 编排中大模型决策本来就不是最耗时的,耗时的都是需要输出长文本流程,比如 SQL 生成,根据多方调用结果生成回答等。所以就将代码回退了,今天也还在研究有什么更好的使用场景😂。

    传统大模型输出主要分为两个阶段:prefill 和 decode ,由于 prefill 阶段可以并发处理一般都会比较快,所以使用传统大模型做决策(回答内容少)也是回答挺快的。
    yiranw09
        6
    yiranw09  
       13h 0m ago
    @yelog 我测试了在记忆召回中效果非常好,命中率极高,而且不需要向量分词
    yelog
        7
    yelog  
       12h 50m ago
    @yiranw09 #6 记忆召回怎么用 jev 实现的?求教?我现在的长期记忆还是放在向量库中,每次新建 session 都要做一次语义召回
    royalknight
        8
    royalknight  
       12h 25m ago
    头对头数字 , 你用的什么 ai ,这个也翻译不出来
    yiranw09
        9
    yiranw09  
       12h 20m ago   ❤️ 1
    @yelog #7 我是通过扫数据库,通过字符重叠给出每条记忆的相似度,返回 40 条候选,40 条打乱丢给 jev 进行打分,我测了本地 303 条记忆,原本向量库的召回准确率 40%左右,jev 的召回准确率 74%。当然也和我原本的记忆插件一般般有关吧 hhh ,你可以让 ai 去试试,现有的方案和 jev 的方案有什么差别
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   939 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 43ms · UTC 21:44 · PVG 05:44 · LAX 14:44 · JFK 17:44
    ♥ Do have faith in what you're doing.