sentinelK
V2EX  ›  Local LLM

mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

  •  
  •   sentinelK · 5h 34m ago · 2416 views
    编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
    信源会罗列在文章下方
    

    结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源 f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg

    然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)

    所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:

    prefill

    上下文 M3U ( v0.5.4rc2 )
    1K 531.0 ~1590 ~2120
    4K 486.5 ~1460 ~1950
    64K 468.5 ~1410 ~1870
    128K 438.6 ~1320 ~1750

    decode

    场景 M3 Ultra M5 Ultra 预计
    MTP 关,1K 27.6 ~40
    MTP 关,4K 25.8 ~38
    MTP 关,64K 22.8 ~33
    MTP 关,128K 21.3 ~31

    信息来源: https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2

    https://www.apple.com.cn/mac-studio/

    https://omlx.ai/compare

    13 replies    2026-08-26 14:27:38 +08:00
    sentinelK
        1
    sentinelK  
    OP
       5h 30m ago
    也就是说,结合实际场景,大概实际应用时打开 MTP ,prefill 也就是 1500 左右的水平,decode 大概在 60 左右。

    prefill 性能仍然偏低。

    但是结合非常大的统一内存,能实现非常高的多会话缓存命中能力,所以和多卡部署相比,有利有弊。
    FrankAdler
        2
    FrankAdler  
       5h 8m ago via Android
    NVIDIA 打下的江山,Apple 开始摘桃子了吗
    ReinXD
        3
    ReinXD  
       5h 4m ago
    这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
    xiaoyi123
        4
    xiaoyi123  
       4h 50m ago
    虽然比不上 nvidia ,但是便宜啊!!!!!
    octocatami
        5
    octocatami  
       4h 49m ago
    快囤 mac mini
    ila
        6
    ila  
       4h 21m ago
    可以使用 DeepSeek V4 Flash Vision Exp 吗
    Cruzz
        7
    Cruzz  
       4h 19m ago
    逼的哪天老黄给显卡加内存条。让你们胡搞
    scegg
        8
    scegg  
       4h 19m ago
    这速度适合一个人玩玩。甚至不适合一个人干活(并发 agent 的情况)。
    Nzelites
        9
    Nzelites  
       3h 55m ago
    dsf 什么时候个人部署可以比较简单的到 100tps 的话感觉比较可用
    sillydaddy
        10
    sillydaddy  
       3h 53m ago
    是不是比双 DGX Spark 要强?
    sentinelK
        11
    sentinelK  
    OP
       3h 50m ago
    @sillydaddy 从推论来讲,是。但是这个需要看实测。
    毕竟 GB10 跑的是 cuda ,mlx 环境不能直接横比。
    clemente
        12
    clemente  
       2h 16m ago
    @ReinXD 同配置 nv spark 只要 3w 啊
    OnEvent
        13
    OnEvent  
       52 mins ago via iPhone
    这玩意是不是还能多机并联增加性能来着
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5418 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 45ms · UTC 07:20 · PVG 15:20 · LAX 00:20 · JFK 03:20
    ♥ Do have faith in what you're doing.