Mac Studio M5 Ultra 對雙 DGX Spark:本機大模型,頻寬先過算力

Key takeaway

開發者 @jun_song(Building @0xSupergemma)於 2026 年 8 月 25 日在 X 發表一則對比圖,把剛發布的 Mac Studio M5 Ultra 256GB 直接對上 兩台 NVIDIA DGX Spark。數字只有三行:

Mac Studio M5 Ultra 對雙 DGX Spark:本機大模型,頻寬先過算力

開發者 @jun_song(Building @0xSupergemma)於 2026 年 8 月 25 日在 X 發表一則對比圖,把剛發布的 Mac Studio M5 Ultra 256GB 直接對上 兩台 NVIDIA DGX Spark。數字只有三行:

  • 售價:10,799 美元對約 10,000 美元
  • Prefill(提示詞預填充):幾乎打平(符合預期)
  • Decode(逐 token 解碼)頻寬:1,200 GB/s 對 273 GB/s

結論一句:「Mac Studio is definitely more worth the price。」帖文本身屬社群觀察,不是官方評測報告;但兩組硬體規格可在 Apple Newsroom(2026-08-25)與 NVIDIA DGX Spark 官方規格頁交叉對上。本文按官方數字拆開這場「同級價錢、不同架構」的本機 AI 對決,並指出帖文把雙機頻寬簡化後,容易被誤解的地方。

一、帖文講咗咩、數字點對

左側:Mac Studio M5 Ultra 256GB

Apple 於 2026 年 8 月 25 日正式推出新一代 Mac Studio。M5 Ultra 為首款四晶粒 UltraFusion 設計,官方峰值記憶體頻寬 1.2 TB/s(即帖文寫的 1,200 GB/s)。

帖文標示的 10,799 美元,對應美國官網配置器上的 36 核 CPU/80 核 GPU/256GB 統一記憶體/1TB SSD,並非 5,499 美元入門價(30 核/64 核/96GB)。作者其後補充:若升到 8TB SSD,還可再加約 3,500 美元。512GB 型號官方寫明 10 月下旬才到貨,現時不能預購。

右側:兩台 DGX Spark

NVIDIA DGX Spark(前稱 Project DIGITS)是桌面級 GB10 Grace Blackwell 超晶片機:

項目 單台官方規格
晶片 GB10(Grace CPU + Blackwell GPU)
CPU 20 核 Arm(10× Cortex-X925 + 10× Cortex-A725)
統一記憶體 128GB LPDDR5x
記憶體頻寬 273 GB/s(256-bit,官方寫死)
AI 峰值 最高約 1 PFLOP FP4(含稀疏)/約 1,000 AI TOPS
單機模型規模 推斷最高約 200B;雙機經 ConnectX-7 可到約 405B
體積/功耗 約 150×150×50.5 mm、外置約 240W 火牛,SoC TDP 約 140W
街價(2026 年中) Founders 由 3,999 美元上調至約 4,699 美元;渠道約 4,000–6,000 美元

兩台 Spark 的記憶體加起來是 256GB,價錢加起來大約落在 8,000–12,000 美元,視 SSD 與渠道而定。帖文取整為 10,000 美元,作為「同級預算」對比是合理的約數,但不是官方套裝價。

二、技術原理:點解 Decode 幾乎一定睇頻寬

大型語言模型推理可粗分為兩段:

  1. Prefill(提示詞預填充)
    一次過消化整段 context,屬算力密集。Blackwell Tensor Core 加 FP4/NVFP4,單台 Spark 喺長提示上通常快過 Apple Silicon。兩台 Spark 可用 ConnectX-7(最高 200 Gbps)把 prefill 拆開,所以帖文寫「almost tie」符合物理直覺:一邊係單晶片高頻寬、一邊係雙機高算力,長提示下兩者可以接近。

  2. Decode(逐粒 token 生成)
    每出一粒 token,幾乎都要重讀一次權重(或至少重讀活躍專家/KV)。上限近似:

    $$ \text{理論 tokens/s} \approx \frac{\text{有效記憶體頻寬}}{\text{每粒 token 讀取的權重位元組}} $$

    單台 Spark 官方只有 273 GB/s。兩台並聯唔等於 546 GB/s 的解碼頻寬——若模型按層或按專家切開、token 仍要串行穿過兩台,解碼速度仍被單箱 273 GB/s 卡住。社群亦指出 200GbE 互連在實務上會食掉理論上的 tensor parallelism 增益。

    M5 Ultra 把 256GB(最高 512GB)放在同一條 1.2 TB/s 匯流排上,單機解碼天花板大約是單台 Spark 的 四倍以上。這正是帖文把「Decode : 1,200GB/s vs 273GB/s」寫成勝負手的原因。

一句總結:容量決定「跑唔跑得起」;頻寬決定「出字快唔快」。 256GB 對 2×128GB 容量打平,但單箱頻寬一邊 1.2 TB/s、一邊 273 GB/s,日常對話、代理循環、長文生成會明顯感到分別。

三、不要把「兩台 Spark」當成一台 256GB 高頻寬卡

這是最容易誤讀的一點。

  • 容量可加:兩台 Spark 合共 256GB,官方亦宣傳雙機可推到約 405B 參數級推斷。
  • 解碼頻寬通常唔會線性相加:流水線/層切分下,生成速度接近「最慢嗰台」而非兩台相加。
  • Prefill 較易受惠於雙機:算力可疊,互連夠快時長提示優勢在 NVIDIA 一方。
  • 軟件棧完全唔同:Spark 行 CUDA、TensorRT-LLM、vLLM、DGX OS;Mac 行 MLX、Metal、llama.cpp。已有 CUDA 流水線、要對齊數據中心機架的團隊,雙 Spark 的遷移成本低得多。
  • 功耗與佔位:兩台 Spark 接近兩條牆插;Mac Studio 仍是單機靜音工作站。

回覆區有用戶表示自己有 M3 Ultra 256GB + 兩台 DGX,跑同一套 dsv4f 0731 時覺得 DGX「至少快兩至三倍」,並問 M3 到 M5 的代差是否真有帖文暗示咁大。這並不矛盾:對方比較的是 已優化的 CUDA/推測解碼堆疊,而且 M3 Ultra 官方頻寬只有約 819 GB/s,不是 M5 Ultra 的 1.2 TB/s。M5 Ultra 解碼 theoretically 會拉近甚至反超單流生成,但 prefill 同 CUDA 生態 仍可能令「感覺上」Spark 更快,尤其是長提示、批量、FP4 量化路徑。

四、日常應用場景

1. 開發者與本地模型實驗室

  • 主要跑單流對話、代理、代碼助手,模型 70B–200B 量化級:M5 Ultra 256GB 單機更乾淨,少一套互連同編排。
  • 要對齊生產 CUDA、做 LoRA/QLoRA 後直接上機架:兩台 Spark 較接近正式環境。
  • 混合打法已有先例:Spark 負責 prefill、Mac 負責 decode(EXO 等編排),長提示時可同時拿兩邊長處,但要額外網絡與運維。

2. 企業與隱私敏感行業

法律、醫療、金融若堅持「權重同上下文唔出房」,重點係 單一可信邊界。一部 Mac Studio 或一部已加固的 Linux 工作站,審計面比「兩台迷你機 + 200GbE」細。若團隊已標準化 NVIDIA AI Enterprise/DGX OS,則雙 Spark 較易納入既有資安基線。

香港企業若要把同類本機推理做成可交接的私有服務,重點通常唔係「邊張卡跑分最高」,而係數據唔離境、模型版本可追溯、權限同審計齊全。YSK Limited 的企業私有 LLM 全託管與遠端開發團隊,正是補這一段:由數據集、微調到私有 API,而唔係只買一箱硬件。

3. 一般進階用戶

兩條路價錢接近一萬美元級,都唔係「插張消費卡就算」。Mac Studio 同時係剪片、編譯、設計工作站;Spark 幾乎係專用 AI 盒,顯示器、桌面應用要另計。買之前先問清楚:日常 80% 時間係單流傾偈,定係長文件預填充 + 要對齊雲端同一套 CUDA。

4. 香港與亞洲市場視角

本地機房租貴、電力同噪音敏感,單機低功耗方案較易放進辦公室。同時,亞洲團隊大量工具鏈仍綁住 CUDA。務實做法往往係:推理前線用高頻寬統一記憶體,訓練/對齊用 NVIDIA,而唔係指望一箱打通所有場景。

五、專業評價與潛在考量

優勢(站 Mac Studio 一邊時)

  • 單機 256GB + 1.2 TB/s,解碼物理上限明顯高過單台或雙台 Spark 的串行生成
  • 完整電腦:顯示、儲存、創意軟件、靜音一體
  • 功耗與運維面較細

優勢(站雙 Spark 一邊時)

  • 原生 CUDA/FP4/TensorRT,同數據中心路徑一致
  • Prefill 與批量在 Blackwell 上通常更強
  • 可先買一台再加第二台,資本開支可分期
  • 官方雙機可挑戰更大參數(容量意義上的 405B 級)

需要留意的地方

  • 帖文用「1,200 vs 273」對比,技術上正確描述的是 單箱頻寬,不是「兩台 Spark 加起來只有 273」——但解碼亦確實經常加唔到
  • 10,799 美元係高配 Studio,唔係 5,499 美元入門價;Spark 10,000 美元亦視渠道浮動
  • 512GB Studio 10 月下旬才到;現貨決策應以 256GB 為準
  • 未有雙方用同一量化、同一 context、同一 batch 的公開第三方報告;社群數字只能當方向,不能當採購標書
  • 軟件成熟度差距短期不會消失:MLX 生態進步快,但企業既有 CUDA 資產遷移成本真實存在

結語

@jun_song 這則對比抓住了 2026 年本機大模型最核心的一條物理限制:同一價位買 256GB,買唔買到 1.2 TB/s 的單箱頻寬。 Mac Studio M5 Ultra 在解碼與單機整潔度上佔優;雙 DGX Spark 在 prefill、CUDA 生態與「先買一台再擴」上佔優。兩者不是互相取代,而係兩種本機策略。

若目標係香港辦公室內可審計的私有推理,硬件只係第一層。模型託管、權限、微調流水線與遠端維運,往往比再加 273 GB/s 更決定成敗。需要把本機大模型做成企業級私有 LLM 方案,可了解 YSK Limited 的全託管與遠端開發服務:https://ysk.hk/


參考來源

Related services & products