• 请不要在回答技术问题时复制粘贴 AI 生成的内容
ashong
V2EX  ›  程序员

编程效果对比 本地 Qwen3.8-27B vs Deepseek

  •  
  •   ashong · 15h 2m ago · 2422 views

    提示词

    需要一个 svg 动画页面, 内容为一只鹈鹕骑自行车。要求:
    - 鹈鹕生动形象
    - 关节运动要自然、不生硬
    

    除了 Deepseek 网页版,其他都是用 Deepseek Harness.

    Qwen 模型均来自 unsloth

    模型 缓存量化(ctk:ctv) 耗时 轮数 平均输出速度 t/s 缓存命中率% 总输入 总输出 预览 费用(元)
    Deepseek 网页 - 12 分 32 秒 2 - - - - https://dspage.previewship.net/ 0
    Deepseek Flash - 38 分 27 秒 1 123 99 11.9M 266K https://dsflash.previewship.net/ 1.93
    Qwen3.8 27B Q5_K_M q8_0:q4_0 5 分 52 秒 1 77 98 95.5K 26.5K https://q5kmq8q4.previewship.net/ 0.02
    Qwen3.8 27B Q5_K_M q8_0:q8_0 23 分 20 秒 1 69 98 818K 111K https://q5kmq8q8.previewship.net/ 0.09
    Qwen3.8 27B Q4_K_M q8_0:q8_0 16 分 13 秒 1 63 94 631K 67.7K https://q4kmq8q8.previewship.net/ 0.06
    Qwe3.8 27B UD_Q4_K_XL q8_0:q8_0 16 分 59 秒 1 58 94 131K 57.8K https://udq4kxlq8q8.previewship.net/ 0.06

    电费按 0.5 元/度计算

    提示词语义比较模糊, 所以思考时长会多一些

    本地环境

    硬件:7900xtx

    系统:ubuntu 26.04

    软件: llama.cpp + vulkan

    更喜欢哪一个结果?

    30 replies    2026-08-22 02:07:01 +08:00
    woodfizky
        1
    woodfizky  
       14h 49m ago
    dsflash 怎么是倒着蹬啊(恼
    而且自作主张给你加了倍速调节。。
    towser
        2
    towser  
       14h 48m ago
    看起来 27b 运行的还可以,超过我的预期
    ashong
        3
    ashong  
    OP
       14h 47m ago
    @woodfizky 迷惑啊, 等谷期再用 Pro 版试一下
    sentinelK
        4
    sentinelK  
       14h 43m ago
    这种纯视觉效果的 deepseek 吃了没视觉能力的亏,没法重复验证。
    我的实际运行体验,确实 qwen3.8-27B 至少是能生产的。只是 256k 上下文稍短。

    如果不是要跑 Minimax H3 总是倒腾显存,我就让 sglang+27B-fp8 常驻显存了
    1258
        5
    1258  
       14h 42m ago
    flash 想的太多了吧
    ashong
        6
    ashong  
    OP
       14h 41m ago
    @towser 能力可以,配合 dsh 比 opencode 效果好一些
    yagamil
        7
    yagamil  
       14h 41m ago
    运行起来 A 卡和 N 卡去吧大吗?
    是不是只要显存大就行了?
    ashong
        8
    ashong  
    OP
       14h 37m ago
    @sentinelK 模型不支持,harness 自动下载安装了 pillow 截图,对比像素,其实之所以用了这么长时间就是验证耗时太长, 实际生成也就 10 分钟, 后续的验证修改了个寂寞
    ashong
        9
    ashong  
    OP
       14h 36m ago
    @yagamil 没 N 卡, 只有一张 7900xtx , 显存肯定越大越好
    sentinelK
        10
    sentinelK  
       14h 34m ago
    @ashong 有种说法是说,多模态模型对于视觉的理解,和第三方理解并文字化后输入,理解程度是指数级别的差距,但是不太懂这块,所以不敢下结论。

    我的体感上确实多模态模型对于图片的认知会更好。比如我用 qwen3.8-27B 去给 H3 理解图片素材并喂提示词,效果远强于纯文本模型。
    sentinelK
        11
    sentinelK  
       14h 30m ago
    @yagamil 可以参照我的经验帖: https://www.sunp.eu.org/t/1235518
    wjxd
        12
    wjxd  
       12h 56m ago
    @ashong 我的是 7900xt ,昨天也试了这个 qwen3.8 ud q4 k m 的版本,你是用什么加载模型?是 window 环境还是 linux 环境啊?
    wjxd
        13
    wjxd  
       12h 55m ago
    @ashong 忽略。我没仔细看帖子最后。。。
    Seanfuck
        14
    Seanfuck  
       12h 4m ago
    最后一个好。Qwen 明显比 Deepseek 强。
    honjow
        15
    honjow  
       11h 13m ago
    同 7900xtx 。op 感觉用哪个量化最均衡啊
    coefu
        16
    coefu  
       11h 7m ago
    鹈鹕很 Q 。
    xuhengjs
        17
    xuhengjs  
       9h 47m ago
    要不,用 deepseek 最新的 flash-vision-exp 试试?
    ashong
        18
    ashong  
    OP
       9h 28m ago
    @honjow Q5_K_M
    jhytxy
        19
    jhytxy  
       9h 23m ago
    建议量化模型至少还是用到 q6

    q5 离原版差的比较远
    honjow
        20
    honjow  
       8h 46m ago
    @ashong #18 上下文能开多少啊。我试了很多次都达不到 77tps 这个速度
    ByteZone
        21
    ByteZone  
       8h 35m ago
    48GB 的 mac mini 跑 QWen 3.6 27B 做 rag 慢的要是
    硅基流动一到两分钟 本地 ollama 要 10 到 60 分钟不等
    大佬知道问题出在哪里了吗
    ashong
        22
    ashong  
    OP
       8h 27m ago
    @honjow

    启动参数供参考:

    -t 10
    -b 512
    -ub 256
    --spec-draft-n-max 3
    --fit off
    --no-context-shift
    --metrics
    --kv-unified
    --jinja
    --cache-type-k q8_0
    --cache-type-v q8_0
    -fa on
    --spec-type draft-mtp
    --ctx-size 131072
    --parallel 1
    -ngl -1
    --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
    --no-mmap
    --temp 0.6
    --top-p 0.6
    --top-k 15
    --repeat-penalty 1
    --repeat-last-n 64
    --override-tensor blk\.\d+\.ffn_.*_exps\.=CPU
    --image-min-tokens 1024
    --no-warmup -
    -cache-ram 16384
    --alias qwen3.8-27b-q5km
    PopRain
        23
    PopRain  
       7h 28m ago
    这个测试太多了,应该换个鸟,譬如鸵鸟再看看效果
    pldxx
        24
    pldxx  
       7h 11m ago
    收藏一下
    C64NRD
        25
    C64NRD  
       6h 59m ago
    这个理解能力可以胜任很多 web 工作,就是耗时太久了
    SiWXie
        26
    SiWXie  
       6h 40m ago via iPhone
    上下文大概能到多少呢?
    L4Linux
        27
    L4Linux  
       6h 40m ago via Android
    niubee1
        28
    niubee1  
       5h 28m ago
    感觉可以用 GLM5.3 来驱动 qwen3.8 27B ,干起活来能杠杠的
    Maboroshii
        29
    Maboroshii  
       4h 49m ago
    我看 qwen-3.8 27B 在 openrouter 上比 deepseek-v4-flash 还要贵不少呢
    killadm
        30
    killadm  
       3h 51m ago
    你的 q5 和原版 fp8 生成的差不多,但是用破限版的 int8 模型测试生成的动画反而车轱辘乱飞
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   894 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 58ms · UTC 21:58 · PVG 05:58 · LAX 14:58 · JFK 17:58
    ♥ Do have faith in what you're doing.