開發者 @jun_song(Building @0xSupergemma)於 2026 年 8 月 25 日在 X 發表一則對比圖,把剛發布的 Mac Studio M5 Ultra 256GB 直接對上 兩台 NVIDIA DGX Spark。數字只有三行:
- 售價:10,799 美元對約 10,000 美元
- Prefill(提示詞預填充):幾乎打平(符合預期)
- Decode(逐 token 解碼)頻寬:1,200 GB/s 對 273 GB/s
結論一句:「Mac Studio is definitely more worth the price。」帖文本身屬社群觀察,不是官方評測報告;但兩組硬體規格可在 Apple Newsroom(2026-08-25)與 NVIDIA DGX Spark 官方規格頁交叉對上。本文按官方數字拆開這場「同級價錢、不同架構」的本機 AI 對決,並指出帖文把雙機頻寬簡化後,容易被誤解的地方。
一、帖文講咗咩、數字點對
左側:Mac Studio M5 Ultra 256GB
Apple 於 2026 年 8 月 25 日正式推出新一代 Mac Studio。M5 Ultra 為首款四晶粒 UltraFusion 設計,官方峰值記憶體頻寬 1.2 TB/s(即帖文寫的 1,200 GB/s)。
帖文標示的 10,799 美元,對應美國官網配置器上的 36 核 CPU/80 核 GPU/256GB 統一記憶體/1TB SSD,並非 5,499 美元入門價(30 核/64 核/96GB)。作者其後補充:若升到 8TB SSD,還可再加約 3,500 美元。512GB 型號官方寫明 10 月下旬才到貨,現時不能預購。
右側:兩台 DGX Spark
NVIDIA DGX Spark(前稱 Project DIGITS)是桌面級 GB10 Grace Blackwell 超晶片機:
| 項目 | 單台官方規格 |
|---|---|
| 晶片 | GB10(Grace CPU + Blackwell GPU) |
| CPU | 20 核 Arm(10× Cortex-X925 + 10× Cortex-A725) |
| 統一記憶體 | 128GB LPDDR5x |
| 記憶體頻寬 | 273 GB/s(256-bit,官方寫死) |
| AI 峰值 | 最高約 1 PFLOP FP4(含稀疏)/約 1,000 AI TOPS |
| 單機模型規模 | 推斷最高約 200B;雙機經 ConnectX-7 可到約 405B |
| 體積/功耗 | 約 150×150×50.5 mm、外置約 240W 火牛,SoC TDP 約 140W |
| 街價(2026 年中) | Founders 由 3,999 美元上調至約 4,699 美元;渠道約 4,000–6,000 美元 |
兩台 Spark 的記憶體加起來是 256GB,價錢加起來大約落在 8,000–12,000 美元,視 SSD 與渠道而定。帖文取整為 10,000 美元,作為「同級預算」對比是合理的約數,但不是官方套裝價。
二、技術原理:點解 Decode 幾乎一定睇頻寬
大型語言模型推理可粗分為兩段:
-
Prefill(提示詞預填充)
一次過消化整段 context,屬算力密集。Blackwell Tensor Core 加 FP4/NVFP4,單台 Spark 喺長提示上通常快過 Apple Silicon。兩台 Spark 可用 ConnectX-7(最高 200 Gbps)把 prefill 拆開,所以帖文寫「almost tie」符合物理直覺:一邊係單晶片高頻寬、一邊係雙機高算力,長提示下兩者可以接近。 -
Decode(逐粒 token 生成)
每出一粒 token,幾乎都要重讀一次權重(或至少重讀活躍專家/KV)。上限近似:$$ \text{理論 tokens/s} \approx \frac{\text{有效記憶體頻寬}}{\text{每粒 token 讀取的權重位元組}} $$
單台 Spark 官方只有 273 GB/s。兩台並聯唔等於 546 GB/s 的解碼頻寬——若模型按層或按專家切開、token 仍要串行穿過兩台,解碼速度仍被單箱 273 GB/s 卡住。社群亦指出 200GbE 互連在實務上會食掉理論上的 tensor parallelism 增益。
M5 Ultra 把 256GB(最高 512GB)放在同一條 1.2 TB/s 匯流排上,單機解碼天花板大約是單台 Spark 的 四倍以上。這正是帖文把「Decode : 1,200GB/s vs 273GB/s」寫成勝負手的原因。
一句總結:容量決定「跑唔跑得起」;頻寬決定「出字快唔快」。 256GB 對 2×128GB 容量打平,但單箱頻寬一邊 1.2 TB/s、一邊 273 GB/s,日常對話、代理循環、長文生成會明顯感到分別。
三、不要把「兩台 Spark」當成一台 256GB 高頻寬卡
這是最容易誤讀的一點。
- 容量可加:兩台 Spark 合共 256GB,官方亦宣傳雙機可推到約 405B 參數級推斷。
- 解碼頻寬通常唔會線性相加:流水線/層切分下,生成速度接近「最慢嗰台」而非兩台相加。
- Prefill 較易受惠於雙機:算力可疊,互連夠快時長提示優勢在 NVIDIA 一方。
- 軟件棧完全唔同:Spark 行 CUDA、TensorRT-LLM、vLLM、DGX OS;Mac 行 MLX、Metal、llama.cpp。已有 CUDA 流水線、要對齊數據中心機架的團隊,雙 Spark 的遷移成本低得多。
- 功耗與佔位:兩台 Spark 接近兩條牆插;Mac Studio 仍是單機靜音工作站。
回覆區有用戶表示自己有 M3 Ultra 256GB + 兩台 DGX,跑同一套 dsv4f 0731 時覺得 DGX「至少快兩至三倍」,並問 M3 到 M5 的代差是否真有帖文暗示咁大。這並不矛盾:對方比較的是 已優化的 CUDA/推測解碼堆疊,而且 M3 Ultra 官方頻寬只有約 819 GB/s,不是 M5 Ultra 的 1.2 TB/s。M5 Ultra 解碼 theoretically 會拉近甚至反超單流生成,但 prefill 同 CUDA 生態 仍可能令「感覺上」Spark 更快,尤其是長提示、批量、FP4 量化路徑。
四、日常應用場景
1. 開發者與本地模型實驗室
- 主要跑單流對話、代理、代碼助手,模型 70B–200B 量化級:M5 Ultra 256GB 單機更乾淨,少一套互連同編排。
- 要對齊生產 CUDA、做 LoRA/QLoRA 後直接上機架:兩台 Spark 較接近正式環境。
- 混合打法已有先例:Spark 負責 prefill、Mac 負責 decode(EXO 等編排),長提示時可同時拿兩邊長處,但要額外網絡與運維。
2. 企業與隱私敏感行業
法律、醫療、金融若堅持「權重同上下文唔出房」,重點係 單一可信邊界。一部 Mac Studio 或一部已加固的 Linux 工作站,審計面比「兩台迷你機 + 200GbE」細。若團隊已標準化 NVIDIA AI Enterprise/DGX OS,則雙 Spark 較易納入既有資安基線。
香港企業若要把同類本機推理做成可交接的私有服務,重點通常唔係「邊張卡跑分最高」,而係數據唔離境、模型版本可追溯、權限同審計齊全。YSK Limited 的企業私有 LLM 全託管與遠端開發團隊,正是補這一段:由數據集、微調到私有 API,而唔係只買一箱硬件。
3. 一般進階用戶
兩條路價錢接近一萬美元級,都唔係「插張消費卡就算」。Mac Studio 同時係剪片、編譯、設計工作站;Spark 幾乎係專用 AI 盒,顯示器、桌面應用要另計。買之前先問清楚:日常 80% 時間係單流傾偈,定係長文件預填充 + 要對齊雲端同一套 CUDA。
4. 香港與亞洲市場視角
本地機房租貴、電力同噪音敏感,單機低功耗方案較易放進辦公室。同時,亞洲團隊大量工具鏈仍綁住 CUDA。務實做法往往係:推理前線用高頻寬統一記憶體,訓練/對齊用 NVIDIA,而唔係指望一箱打通所有場景。
五、專業評價與潛在考量
優勢(站 Mac Studio 一邊時)
- 單機 256GB + 1.2 TB/s,解碼物理上限明顯高過單台或雙台 Spark 的串行生成
- 完整電腦:顯示、儲存、創意軟件、靜音一體
- 功耗與運維面較細
優勢(站雙 Spark 一邊時)
- 原生 CUDA/FP4/TensorRT,同數據中心路徑一致
- Prefill 與批量在 Blackwell 上通常更強
- 可先買一台再加第二台,資本開支可分期
- 官方雙機可挑戰更大參數(容量意義上的 405B 級)
需要留意的地方
- 帖文用「1,200 vs 273」對比,技術上正確描述的是 單箱頻寬,不是「兩台 Spark 加起來只有 273」——但解碼亦確實經常加唔到
- 10,799 美元係高配 Studio,唔係 5,499 美元入門價;Spark 10,000 美元亦視渠道浮動
- 512GB Studio 10 月下旬才到;現貨決策應以 256GB 為準
- 未有雙方用同一量化、同一 context、同一 batch 的公開第三方報告;社群數字只能當方向,不能當採購標書
- 軟件成熟度差距短期不會消失:MLX 生態進步快,但企業既有 CUDA 資產遷移成本真實存在
結語
@jun_song 這則對比抓住了 2026 年本機大模型最核心的一條物理限制:同一價位買 256GB,買唔買到 1.2 TB/s 的單箱頻寬。 Mac Studio M5 Ultra 在解碼與單機整潔度上佔優;雙 DGX Spark 在 prefill、CUDA 生態與「先買一台再擴」上佔優。兩者不是互相取代,而係兩種本機策略。
若目標係香港辦公室內可審計的私有推理,硬件只係第一層。模型託管、權限、微調流水線與遠端維運,往往比再加 273 GB/s 更決定成敗。需要把本機大模型做成企業級私有 LLM 方案,可了解 YSK Limited 的全託管與遠端開發服務:https://ysk.hk/
參考來源
- 原帖:https://x.com/jun_song/status/2092247410525270047
- Apple Mac Studio / M5 Ultra 發布(2026-08-25)
- NVIDIA DGX Spark 官方規格:https://www.nvidia.com/en-us/products/workstations/dgx-spark/
- NVIDIA DGX Spark Hardware Overview:https://docs.nvidia.com/dgx/dgx-spark/hardware.html