五百萬買 35 臺 Mac,定係一臺 8 卡 H200?本地推理帳要分開計

重點摘要

AI 實戰帳號「實踐哥 MinLi」(@MinLiBuilds)於 8 月 26 日在 X 發文,延續前一日「土豪購物車」帖:把一部 512GB Mac Studio M5 Ultra 放到中國市場語境,問一句很具體的帳——

五百萬買 35 臺 Mac,定係一臺 8 卡 H200?本地推理帳要分開計

AI 實戰帳號「實踐哥 MinLi」(@MinLiBuilds)於 8 月 26 日在 X 發文,延續前一日「土豪購物車」帖:把一部 512GB Mac Studio M5 Ultra 放到中國市場語境,問一句很具體的帳——

如果你有 500 萬人民幣,買 35 臺 512GB M5 Ultra,還是買一臺 8 卡 H200 整機?

帖文核心數字:8×H200 合計約 1.13TB HBM3e;35×512GB Mac 合計約 17.9TB 統一記憶體,容量大約是前者的 16 倍。作者的結論是:要訓練,H200 沒得爭;若目標是 Agent 推理、每人一臺、每臺塞一份量化大 MoE,這筆帳「開始邪門」——尤其在中國,頂級 NVIDIA 數據中心 GPU 又貴、又受出口管制,而 Apple「只是在賣 Mac」。

來源真實性已驗證:帖文是社群觀察,不是官方基準。Apple 於 2026 年 8 月 25 日發布新一代 Mac Studio(M5 Max/M5 Ultra),512GB 統一記憶體型號官方寫明 10 月下旬才到貨,現時不能預購。H200 單卡 141GB HBM3e、4.8TB/s、NVLink 900GB/s 與 NVIDIA 規格一致。中國「8 卡整機 500 萬人民幣」屬當地通路/灰市報價量級,國際 OEM 8×H200 整機公開區間約 32–42 萬美元(約 230–300 萬人民幣,視匯率),溢價本身已反映管制與供應。

回覆區亦立刻出現反證:有用家指 128GB M5 Max 跑 35B 稀疏約 50 token/s、三路並發跌至 20–30,Qwen 27B 稠密單路約 10 token/s;另有工程師指出,張量並行時 NVLink 只交換激活而非整份權重,等效頻寬可被「放大」,多卡吞吐可以疊加,Thunderbolt 則遠不足以把 35 臺 Mac 當成一臺超級電腦。兩邊都不是空話,必須分開讀。

一、帖文在比什麼,官方規格實際是什麼

作者用的中國標價(未獲 Apple/NVIDIA 官方確認)

項目 帖文數字 核實結果
Mac Studio M5 Ultra 256GB/4TB 97,999 人民幣 屬中國通路/稅後街價量級,不是美元官網價
同上 512GB 再加約 3 萬,約 127,999 人民幣 512GB 10 月下旬才出貨,現時無官方標價
8 卡 H200 整機(中國) 約 500 萬人民幣 符合管制市場溢價傳聞;國際 OEM 整機約 32–42 萬美元
35×512GB 總記憶體 17.9TB 35×512GB=17,920GB,正確
8×H200 總顯存 1.13TB 8×141GB=1,128GB,正確
容量倍數 「多買 16 倍」 17.9÷1.13≈15.8 倍,約數成立

香港官網(2026-08-25):M5 Ultra HK$44,999 起(96GB/1TB 入門);256GB 高配需另行加購,最高可預購配置(36 核/80 核/256GB/16TB)美元約 18,299。512GB 香港同樣要等到 10 月下旬,價格未公布。

硬體規格對照(官方)

項目 單臺 Mac Studio M5 Ultra(512GB 規劃) 單卡 H200 SXM/NVL 8 卡 HGX/NVL 整機
記憶體 512GB 統一記憶體 141GB HBM3e 約 1.13TB HBM3e
記憶體頻寬 1.2TB/s(單一匯流排) 4.8TB/s 8×4.8TB/s(每卡獨立,不可直接加總成「38TB/s 給同一個 tensor」)
卡間互連 Thunderbolt 5(最高 120Gb/s,約 15GB/s 級) NVLink 900GB/s/卡 NVSwitch 全互連
生態 MLX、llama.cpp Metal、macOS CUDA、TensorRT、vLLM、Megatron 同上+InfiniBand 多機
功耗/形態 桌面一體機、辦公室插座可跑 單卡最高約 600–700W 機櫃、三相電、液冷或高風量
到貨 256GB:9 月 22 日起;512GB:10 月下旬 視配額與地區 中國受 NDRC/出口配額約束

前一日同一作者寫「256GB、1.2TB/s、97,999 元跑 DeepSeek Flash INT4 很好」,與 Apple 已公布的 256GB/1.2TB/s 規格相符;「再加 3 萬換 512GB」則是個人估價,官網尚未開賣。

二、技術原理:容量帳、頻寬帳、互連帳是三筆不同的數

這場對比最容易錯的地方,是把「記憶體加總」當成「推理吞吐加總」。

1. 容量:Mac 陣列贏在「整隻模型塞得進單機」

DeepSeek、GLM、Qwen 這類巨型 MoE,量化後權重加 KV cache,動輒數百 GB。512GB 統一記憶體的意義,是 一份完整量化模型 + 長上下文 + 工具呼叫,可以留在單一作業系統位址空間,不必做張量並行、不必切 expert、也不必在 RAM↔VRAM 之間搬權重。35 臺就是 35 份完整副本——適合「每人/每 Agent 一臺」,不是把 35 臺熔成一臺超大 GPU。

8 卡 H200 的 1.13TB 也可以放下更大的未量化或更高精度模型,但那是 一臺機器內的一份模型,服務的是高並發、低延遲的集中式推理,或小規模微調。兩者產品形態不同。

2. 頻寬:H200 單卡已經是 Mac 的四倍

Decode(逐 token 生成)幾乎總是記憶體頻寬綁定。H200 單卡 4.8TB/s,M5 Ultra 1.2TB/s,差距約四倍。把 35 臺 Mac 的 1.2TB/s「加總」沒有物理意義——除非工作負載是 35 個互不通訊的請求;一旦要把一層激活在機器之間同步,瓶頸立刻換成互連。

3. 互連:這才是回覆區打中的要害

NVLink 900GB/s 看起來低於 4.8TB/s 顯存頻寬,但張量並行時卡間只交換部分激活/reduction 結果,不是搬整份權重。工程上可以做到「單卡頻寬被吃滿、多卡 token/s 近似線性」。回覆所指「等效頻寬翻 4 到 8 倍」是這個意思,不是 NVLink 真的變成 4–8TB/s。

Mac 這邊,Thunderbolt 5 官方最高 120Gb/s(約 15GB/s),與 NVLink 差一個數量級以上。35 臺 Mac 不能當成一臺 17.9TB 的統一加速器;它們是 35 個獨立推理盒。帖文「每人發一臺」這句,其實已經把架構限制講清楚了——只是標題的「16 倍記憶體」容易讓人以為可以橫向擴展成一臺超算。

4. Prefill 與訓練:帳又反過來

長提示的 prefill 吃的是算力(TOPS/Tensor Core),不是容量。H200 的 FP8/稀疏 Tensor 峰值遠高於 M5 Ultra 的 GPU+Neural Accelerator 組合;反向傳播、AllReduce、優化器狀態,更是 CUDA+NVLink 的主場。作者自己也寫:「要訓練,H200 沒什麼好說。」這句成立。

三、對本地 AI 部署的實質影響

  1. 中國市場的溢價,本身就是論點的一部分
    國際 8×H200 整機約 32–42 萬美元;中國傳 500 萬人民幣,差的是出口管制、配額與中間商。2026 年 8 月已有小批量 H200 進入中國大陸,但 NDRC 仍卡住大部分配額。Apple 以消費桌面出貨,不受同一套 GPU 許可證約束——「黃仁勳的刀被磨鈍的,可能不是另一家 CUDA,是蘋果」這句,講的是 供應通道,不是單卡峰值。

  2. Agent 推理與「一人一盒」確實改變採購單位
    法律所、診所、家族辦公室、遊戲工作室,要的往往不是每秒八千 token 的集中閘道,而是「這份語料不出這張桌子」。35 臺互不連線的 512GB Mac,對這類場景的邊際成本,可能低過養一臺 8 卡機櫃(電、冷、噪音、專人運維、CUDA 版本鎖定)。

  3. 軟體生態仍是分水嶺
    生產級高並發服務、vLLM 連續批處理、既有 PyTorch 訓練管道,仍然在 NVIDIA。MLX/llama.cpp 在 Mac 上已能吃滿統一記憶體,但並發、量化核、監控與多租戶隔離,成熟度差一截。回覆區「27B 稠密 10 token/s 不能用」提醒:容量夠,不等於產品可用。

  4. 512GB 還沒開賣
    整套「35 臺 × 512GB」 dec 目前是紙上作業。現在能下單的是 96/256GB,9 月 22 日出貨。企業若把預算鎖在「年底前 17.9TB 到位」,時間風險不低於 GPU 配額。

四、日常應用場景

1. 開發者與技術團隊

典型分工會是:Mac Studio 做日常 IDE、本機 RAG、Agent 編排、長上下文試驗;要把同一份權重量化核跑滿、或做 LoRA/持續預訓練,再租或買 H200/B200 時段。不要用 35 臺 Mac 去模擬一臺 8 卡訓練機——互連不夠,調度成本會先把人拖垮。

2. 企業與隱私敏感行業

香港金融、法律、醫療最在意「權重與原文不出境」。一臺 256GB/未來 512GB 的 Studio,可以當單租戶推理盒:晚上拔網線就等於斷開公有 API。35 臺的想像,對應的是分行/律師樓多據點,而不是一個機櫃打全球流量。YSK Limited 為這類客戶做的,是把模型、資料管線與存取控制封在香港主權範圍內,硬體可以是 Mac、可以是自建 GPU 箱,重點是資料不出境,而不是跟風買哪一塊矽。

3. 一般專業用戶與工作室

影片、3D、多軌 ProRes 仍是 Studio 本業;本地大模型是附加能力。若工作是「一個人、一份私有知識庫、偶爾跑 70B–120B 量化」,256GB 已很夠,不必等 512GB,更不必幻想組 35 臺叢集。

4. 香港與亞洲市場視角

香港買得到官網 Mac,也買得到(或租得到)較接近國際價的 H200/B200 時段,不一定要付中國 500 萬溢價。真正要算的是:電費與機櫃(中環/葵涌差很遠)、資料駐留要求、以及團隊會不會寫 CUDA。出口管制改變的是內地供應曲線,不是物理頻寬。

五、專業評價與潛在考量

優勢(帖文成立的部分)

  • 單一使用者、單機塞進量化巨型 MoE,512GB 統一記憶體確實是桌面級前所未見的容量。
  • 「每人一臺」把互連問題取消,容量帳才變得有意義。
  • 在 GPU 管制市場,消費級 Apple 矽是一條合規、可發票、可維修的替代供應鏈。
  • 辦公室功耗與噪音,Mac 陣列通常優於 8 卡機櫃。

需要留意的地方

  • 500 萬對 8 卡是中國溢價,不是全球公允價;用國際價重算,能買到的 Mac 數量會少一截。
  • 512GB 未開賣、未公布港幣/人民幣官價。
  • 多卡 token/s 在 NVLink 上可以疊加;35 臺 Mac 不能。
  • 單機 token/s、首 token 延遲、長上下文 prefill,H200 仍明顯領先。
  • 回覆區已有「中端 Mac 跑中型稠密模型偏慢」的一手數據,不能用容量宣傳替代基準。
  • 35 臺 Mac 的軟體授權、MDM、備件、失竊與維修,是一筆常被忽略的運維帳。

結語

MinLi 這則帖不是跑分報告,而是一張採購思維圖:把「訓練叢集」和「Agent 推理盒」拆開。數字上,8×H200 的 1.13TB/4.8TB/s/NVLink,仍然是集中式訓練與高並發推理的正解;35×512GB Mac 的 17.9TB,贏在 副本數量與單機位址空間,前提是你真的要 35 個互不通訊的使用者,而不是一臺假想中的 17.9TB 超算。

「真正能讓老黃的刀變鈍的,可能不是另一家 CUDA,是蘋果」——作為供應政治判斷,在中國市場說得通;作為晶片對決,則過度延伸。競品會逼 NVIDIA 把更多記憶體塞進工作站卡,也會逼 Apple 把 Metal/MLX 的並發與量化核補齊。買家要做的不是選邊站,而是先寫清楚工作負載:訓練還是推理、單用戶還是閘道、資料能不能出境。

如需在香港把本機大模型做成可審計的私有推理盒——不論硬體最終是 Mac Studio 還是自建 GPU 節點——可了解 YSK Limited 的企業私有 LLM 全託管與遠端技術團隊服務:https://ysk.hk/


參考來源

延伸閱讀 · 相關服務與產品