dbow
V2EX  ›  Local LLM

两台 dgx-spark 部署满血 deepseek v4 flash 完全指南,稳定 60~70tok/s 单流

  •  
  •   dbow · 13h 11m ago · 2848 views
    前天看 x 上有人做成这事, 觉得很不错, 下单买了两台, 6 万 8, nvidia 原厂 dgx spark 带并连线
    实测两台刚好能拿捏 deepseek v4 flash 0731 ,vibe coding 单流 60–70 tok/s 的体验足以覆盖日常 ;不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。
    主要是为了本地化隐私部署, 经常会跟 ai 聊很多机密信息, 不放心, 靠硬件出 token 得好几年才能回本.
    欢迎交流
    github: https://github.com/maliubiao/dgx-spark-2-deepseek-flash-0731
    39 replies    2026-08-07 21:58:21 +08:00
    yoshiyuki
        1
    yoshiyuki  
       12h 22m ago
    但是你的 agent 说到底是联网的, 信息潜在的泄漏点太多了
    Lazymio
        2
    Lazymio  
       12h 10m ago
    6 万 8 是京东自营的?感觉买贵了。
    SayHelloHi
        3
    SayHelloHi  
       11h 14m ago
    @dbow

    老铁咨询下,DXG 使用 comfyui 体验如何?

    也想入手
    wyntalgeer
        4
    wyntalgeer  
       11h 12m ago
    感谢,已 star
    dbow
        5
    dbow  
    OP
       11h 1m ago
    @SayHelloHi 跑一个 deepseek v4 flash 90%计算资源就用光了, 暂时还没试过别的东西.
    Insolitude
        6
    Insolitude  
       10h 54m ago via Android
    可以帮忙用 llama-benchy ( https://github.com/eugr/llama-benchy )测一下吗?之前用两台 spark 测过预览版的 deepseekv4 flash ,当时跑起来还蛮吃力的,想看看现在性能怎么样


    """
    | model | test | t/s (total) | t/s (req) | peak t/s | peak t/s (req) | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
    |:------------------------------|------------:|----------------:|----------------:|-------------:|-----------------:|------------------:|------------------:|------------------:|
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c1) | 955.27 ± 193.11 | 955.27 ± 193.11 | | | 2257.64 ± 530.54 | 2251.15 ± 530.54 | 2257.64 ± 530.54 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c1) | 38.67 ± 1.58 | 38.67 ± 1.58 | 39.93 ± 1.63 | 39.93 ± 1.63 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c2) | 919.38 ± 159.59 | 586.78 ± 244.14 | | | 3948.41 ± 1160.98 | 3941.91 ± 1160.98 | 3948.41 ± 1160.98 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c2) | 39.08 ± 20.50 | 25.04 ± 9.26 | 58.67 ± 3.09 | 29.79 ± 3.35 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c4) | 924.07 ± 122.40 | 358.73 ± 142.02 | | | 6692.54 ± 2550.41 | 6686.05 ± 2550.41 | 6692.54 ± 2550.41 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c4) | 18.68 ± 2.40 | 10.41 ± 5.84 | 71.33 ± 4.03 | 19.42 ± 1.32 | | | |

    llama-benchy (0.3.7)
    date: 2026-05-18 16:43:49 | latency mode: api
    """
    mouyase
        7
    mouyase  
       10h 51m ago
    《不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。》

    您也 AI 化了。
    dbow
        8
    dbow  
    OP
       10h 42m ago
    @mouyase ai 写的文档, 我复制了一句过来, 哈哈
    Nasdaq
        9
    Nasdaq  
       10h 38m ago
    请教老哥,功耗/发热怎么样?我也想搞 2 台玩玩。
    defunct9
        10
    defunct9  
       10h 33m ago
    新模型发布这么快,花 6 万 8 ,合适么?
    Tink
        11
    Tink  
       10h 32m ago
    好像还不错啊
    ferch
        12
    ferch  
       10h 29m ago
    这很好呀,能自己本地玩了
    dbow
        13
    dbow  
    OP
       10h 27m ago   ❤️ 1
    @Nasdaq agent 跑起来 gpu 70 度左右
    asdjgfr
        14
    asdjgfr  
       10h 25m ago
    省着点用,10 年之后我要捡垃圾自己部署一个😆
    Nasdaq
        15
    Nasdaq  
       10h 25m ago
    @dbow #12 继续请教您,部署起来困难吗?还是说能让 cc/cx 直接托管一键部署?
    lizhenda
        16
    lizhenda  
       10h 16m ago
    等新模型发布了,硬件不够用了怎么办?
    ysz1121
        17
    ysz1121  
       10h 16m ago
    6.8w 充 deepseek 官方,是不是能用一年?
    shyrock2026
        18
    shyrock2026  
       10h 8m ago
    op 这个速度是开的 200k 上下文还是 1m 呢?
    dbow
        19
    dbow  
    OP
       9h 57m ago   ❤️ 1
    @Nasdaq 全交给 ai
    dbow
        20
    dbow  
    OP
       9h 57m ago   ❤️ 1
    Newb1e
        21
    Newb1e  
       9h 52m ago
    心动
    faker5276
        22
    faker5276  
       9h 47m ago
    deepseek 涨价以后,这方案就有性价比了
    op351
        23
    op351  
       9h 43m ago
    @ysz1121 按现在 ds 的 api 定价,一天 24 小时不停的用,保守点能用 10 年
    不过现阶段算力本地部署基本不是为了省钱,而是为了合规和数据隐私
    dbow
        24
    dbow  
    OP
       9h 35m ago   ❤️ 1
    @op351 大概三年能回本, 目前一个月 1k 的 v4 flash api 费用,假定涨价后价格翻倍, 则一年需要 2.4w 的 token 费用, 算上电费之后三年回本.
    yanhuqing666
        25
    yanhuqing666  
       9h 17m ago
    有点意思
    AEDaydreamer
        26
    AEDaydreamer  
       8h 53m ago
    没钱没需求, 但是看完有很心动的感觉.
    lhtdeg
        27
    lhtdeg  
       8h 41m ago
    速度这么快?那我也要搞一个了
    Lighfer
        28
    Lighfer  
       8h 34m ago via Android
    老哥,有试过能支撑多少并发和速度不?
    Lighfer
        29
    Lighfer  
       8h 32m ago via Android
    @Lighfer 看到了链接里有
    ziyeziye
        30
    ziyeziye  
       8h 20m ago
    看看 B 站有搭配教程
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows 下支持 agent ,龙虾,5999 元可跑原版非量化,无需 linux 操作
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows
    Nasdaq
        31
    Nasdaq  
       8h 18m ago
    @ziyeziye 我是 4090 ,部署过 qwen3.6-27B ,速度可以。但是蠢哭了~
    ziyeziye
        32
    ziyeziye  
       8h 17m ago
    @ziyeziye 都是满血版的
    seers
        33
    seers  
       8h 0m ago via iPhone
    模型也在进化,相同硬件也可以免费获取性能升级
    wsbqdyhm
        34
    wsbqdyhm  
       7h 29m ago
    @Nasdaq #31 20-30 的速度,经常任务中断
    Nasdaq
        35
    Nasdaq  
       7h 26m ago
    @wsbqdyhm 那还没有深入测,跑了个 30 分钟感觉不行就丢了。
    Yserver
        36
    Yserver  
       7h 21m ago
    感觉有点慢 ds 新的那个加速是不是没生效啊?
    dbow
        37
    dbow  
    OP
       5h 50m ago
    @Yserver 已经开启了 dspark 才有 60~70tok/s
    sillydaddy
        38
    sillydaddy  
       4h 2m ago
    这么估算回本时间呢:
    1. Deepseek ,1 次调用平均输出 420 token ,按官方 API 计价花费¥0.004 元。那么¥68000 元可以纯输出 7,140,000,000 个 token 。

    2. 现在驱使 DGX-Spark ,每秒输出 60 token 。

    回本需要 3.7 年=7,140,000,000÷60÷3,600÷24÷365 。(电费是零头)
    dbow
        39
    dbow  
    OP
       3h 57m ago
    @sillydaddy 这只算了输出, 实际并发能做到 200tok/s, 输入能做到 1000 tok/s,输入也是收费的
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1090 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 57ms · UTC 17:56 · PVG 01:56 · LAX 10:56 · JFK 13:56
    ♥ Do have faith in what you're doing.