AI 實戰帳號「實踐哥 MinLi」(@MinLiBuilds)於 8 月 26 日在 X 發文,延續前一日「土豪購物車」帖:把一部 512GB Mac Studio M5 Ultra 放到中國市場語境,問一句很具體的帳——
如果你有 500 萬人民幣,買 35 臺 512GB M5 Ultra,還是買一臺 8 卡 H200 整機?
帖文核心數字:8×H200 合計約 1.13TB HBM3e;35×512GB Mac 合計約 17.9TB 統一記憶體,容量大約是前者的 16 倍。作者的結論是:要訓練,H200 沒得爭;若目標是 Agent 推理、每人一臺、每臺塞一份量化大 MoE,這筆帳「開始邪門」——尤其在中國,頂級 NVIDIA 數據中心 GPU 又貴、又受出口管制,而 Apple「只是在賣 Mac」。
來源真實性已驗證:帖文是社群觀察,不是官方基準。Apple 於 2026 年 8 月 25 日發布新一代 Mac Studio(M5 Max/M5 Ultra),512GB 統一記憶體型號官方寫明 10 月下旬才到貨,現時不能預購。H200 單卡 141GB HBM3e、4.8TB/s、NVLink 900GB/s 與 NVIDIA 規格一致。中國「8 卡整機 500 萬人民幣」屬當地通路/灰市報價量級,國際 OEM 8×H200 整機公開區間約 32–42 萬美元(約 230–300 萬人民幣,視匯率),溢價本身已反映管制與供應。
回覆區亦立刻出現反證:有用家指 128GB M5 Max 跑 35B 稀疏約 50 token/s、三路並發跌至 20–30,Qwen 27B 稠密單路約 10 token/s;另有工程師指出,張量並行時 NVLink 只交換激活而非整份權重,等效頻寬可被「放大」,多卡吞吐可以疊加,Thunderbolt 則遠不足以把 35 臺 Mac 當成一臺超級電腦。兩邊都不是空話,必須分開讀。
一、帖文在比什麼,官方規格實際是什麼
作者用的中國標價(未獲 Apple/NVIDIA 官方確認)
| 項目 | 帖文數字 | 核實結果 |
|---|---|---|
| Mac Studio M5 Ultra 256GB/4TB | 97,999 人民幣 | 屬中國通路/稅後街價量級,不是美元官網價 |
| 同上 512GB | 再加約 3 萬,約 127,999 人民幣 | 512GB 10 月下旬才出貨,現時無官方標價 |
| 8 卡 H200 整機(中國) | 約 500 萬人民幣 | 符合管制市場溢價傳聞;國際 OEM 整機約 32–42 萬美元 |
| 35×512GB 總記憶體 | 17.9TB | 35×512GB=17,920GB,正確 |
| 8×H200 總顯存 | 1.13TB | 8×141GB=1,128GB,正確 |
| 容量倍數 | 「多買 16 倍」 | 17.9÷1.13≈15.8 倍,約數成立 |
香港官網(2026-08-25):M5 Ultra HK$44,999 起(96GB/1TB 入門);256GB 高配需另行加購,最高可預購配置(36 核/80 核/256GB/16TB)美元約 18,299。512GB 香港同樣要等到 10 月下旬,價格未公布。
硬體規格對照(官方)
| 項目 | 單臺 Mac Studio M5 Ultra(512GB 規劃) | 單卡 H200 SXM/NVL | 8 卡 HGX/NVL 整機 |
|---|---|---|---|
| 記憶體 | 512GB 統一記憶體 | 141GB HBM3e | 約 1.13TB HBM3e |
| 記憶體頻寬 | 1.2TB/s(單一匯流排) | 4.8TB/s | 8×4.8TB/s(每卡獨立,不可直接加總成「38TB/s 給同一個 tensor」) |
| 卡間互連 | Thunderbolt 5(最高 120Gb/s,約 15GB/s 級) | NVLink 900GB/s/卡 | NVSwitch 全互連 |
| 生態 | MLX、llama.cpp Metal、macOS | CUDA、TensorRT、vLLM、Megatron | 同上+InfiniBand 多機 |
| 功耗/形態 | 桌面一體機、辦公室插座可跑 | 單卡最高約 600–700W | 機櫃、三相電、液冷或高風量 |
| 到貨 | 256GB:9 月 22 日起;512GB:10 月下旬 | 視配額與地區 | 中國受 NDRC/出口配額約束 |
前一日同一作者寫「256GB、1.2TB/s、97,999 元跑 DeepSeek Flash INT4 很好」,與 Apple 已公布的 256GB/1.2TB/s 規格相符;「再加 3 萬換 512GB」則是個人估價,官網尚未開賣。
二、技術原理:容量帳、頻寬帳、互連帳是三筆不同的數
這場對比最容易錯的地方,是把「記憶體加總」當成「推理吞吐加總」。
1. 容量:Mac 陣列贏在「整隻模型塞得進單機」
DeepSeek、GLM、Qwen 這類巨型 MoE,量化後權重加 KV cache,動輒數百 GB。512GB 統一記憶體的意義,是 一份完整量化模型 + 長上下文 + 工具呼叫,可以留在單一作業系統位址空間,不必做張量並行、不必切 expert、也不必在 RAM↔VRAM 之間搬權重。35 臺就是 35 份完整副本——適合「每人/每 Agent 一臺」,不是把 35 臺熔成一臺超大 GPU。
8 卡 H200 的 1.13TB 也可以放下更大的未量化或更高精度模型,但那是 一臺機器內的一份模型,服務的是高並發、低延遲的集中式推理,或小規模微調。兩者產品形態不同。
2. 頻寬:H200 單卡已經是 Mac 的四倍
Decode(逐 token 生成)幾乎總是記憶體頻寬綁定。H200 單卡 4.8TB/s,M5 Ultra 1.2TB/s,差距約四倍。把 35 臺 Mac 的 1.2TB/s「加總」沒有物理意義——除非工作負載是 35 個互不通訊的請求;一旦要把一層激活在機器之間同步,瓶頸立刻換成互連。
3. 互連:這才是回覆區打中的要害
NVLink 900GB/s 看起來低於 4.8TB/s 顯存頻寬,但張量並行時卡間只交換部分激活/reduction 結果,不是搬整份權重。工程上可以做到「單卡頻寬被吃滿、多卡 token/s 近似線性」。回覆所指「等效頻寬翻 4 到 8 倍」是這個意思,不是 NVLink 真的變成 4–8TB/s。
Mac 這邊,Thunderbolt 5 官方最高 120Gb/s(約 15GB/s),與 NVLink 差一個數量級以上。35 臺 Mac 不能當成一臺 17.9TB 的統一加速器;它們是 35 個獨立推理盒。帖文「每人發一臺」這句,其實已經把架構限制講清楚了——只是標題的「16 倍記憶體」容易讓人以為可以橫向擴展成一臺超算。
4. Prefill 與訓練:帳又反過來
長提示的 prefill 吃的是算力(TOPS/Tensor Core),不是容量。H200 的 FP8/稀疏 Tensor 峰值遠高於 M5 Ultra 的 GPU+Neural Accelerator 組合;反向傳播、AllReduce、優化器狀態,更是 CUDA+NVLink 的主場。作者自己也寫:「要訓練,H200 沒什麼好說。」這句成立。
三、對本地 AI 部署的實質影響
-
中國市場的溢價,本身就是論點的一部分
國際 8×H200 整機約 32–42 萬美元;中國傳 500 萬人民幣,差的是出口管制、配額與中間商。2026 年 8 月已有小批量 H200 進入中國大陸,但 NDRC 仍卡住大部分配額。Apple 以消費桌面出貨,不受同一套 GPU 許可證約束——「黃仁勳的刀被磨鈍的,可能不是另一家 CUDA,是蘋果」這句,講的是 供應通道,不是單卡峰值。 -
Agent 推理與「一人一盒」確實改變採購單位
法律所、診所、家族辦公室、遊戲工作室,要的往往不是每秒八千 token 的集中閘道,而是「這份語料不出這張桌子」。35 臺互不連線的 512GB Mac,對這類場景的邊際成本,可能低過養一臺 8 卡機櫃(電、冷、噪音、專人運維、CUDA 版本鎖定)。 -
軟體生態仍是分水嶺
生產級高並發服務、vLLM 連續批處理、既有 PyTorch 訓練管道,仍然在 NVIDIA。MLX/llama.cpp 在 Mac 上已能吃滿統一記憶體,但並發、量化核、監控與多租戶隔離,成熟度差一截。回覆區「27B 稠密 10 token/s 不能用」提醒:容量夠,不等於產品可用。 -
512GB 還沒開賣
整套「35 臺 × 512GB」 dec 目前是紙上作業。現在能下單的是 96/256GB,9 月 22 日出貨。企業若把預算鎖在「年底前 17.9TB 到位」,時間風險不低於 GPU 配額。
四、日常應用場景
1. 開發者與技術團隊
典型分工會是:Mac Studio 做日常 IDE、本機 RAG、Agent 編排、長上下文試驗;要把同一份權重量化核跑滿、或做 LoRA/持續預訓練,再租或買 H200/B200 時段。不要用 35 臺 Mac 去模擬一臺 8 卡訓練機——互連不夠,調度成本會先把人拖垮。
2. 企業與隱私敏感行業
香港金融、法律、醫療最在意「權重與原文不出境」。一臺 256GB/未來 512GB 的 Studio,可以當單租戶推理盒:晚上拔網線就等於斷開公有 API。35 臺的想像,對應的是分行/律師樓多據點,而不是一個機櫃打全球流量。YSK Limited 為這類客戶做的,是把模型、資料管線與存取控制封在香港主權範圍內,硬體可以是 Mac、可以是自建 GPU 箱,重點是資料不出境,而不是跟風買哪一塊矽。
3. 一般專業用戶與工作室
影片、3D、多軌 ProRes 仍是 Studio 本業;本地大模型是附加能力。若工作是「一個人、一份私有知識庫、偶爾跑 70B–120B 量化」,256GB 已很夠,不必等 512GB,更不必幻想組 35 臺叢集。
4. 香港與亞洲市場視角
香港買得到官網 Mac,也買得到(或租得到)較接近國際價的 H200/B200 時段,不一定要付中國 500 萬溢價。真正要算的是:電費與機櫃(中環/葵涌差很遠)、資料駐留要求、以及團隊會不會寫 CUDA。出口管制改變的是內地供應曲線,不是物理頻寬。
五、專業評價與潛在考量
優勢(帖文成立的部分)
- 單一使用者、單機塞進量化巨型 MoE,512GB 統一記憶體確實是桌面級前所未見的容量。
- 「每人一臺」把互連問題取消,容量帳才變得有意義。
- 在 GPU 管制市場,消費級 Apple 矽是一條合規、可發票、可維修的替代供應鏈。
- 辦公室功耗與噪音,Mac 陣列通常優於 8 卡機櫃。
需要留意的地方
- 500 萬對 8 卡是中國溢價,不是全球公允價;用國際價重算,能買到的 Mac 數量會少一截。
- 512GB 未開賣、未公布港幣/人民幣官價。
- 多卡 token/s 在 NVLink 上可以疊加;35 臺 Mac 不能。
- 單機 token/s、首 token 延遲、長上下文 prefill,H200 仍明顯領先。
- 回覆區已有「中端 Mac 跑中型稠密模型偏慢」的一手數據,不能用容量宣傳替代基準。
- 35 臺 Mac 的軟體授權、MDM、備件、失竊與維修,是一筆常被忽略的運維帳。
結語
MinLi 這則帖不是跑分報告,而是一張採購思維圖:把「訓練叢集」和「Agent 推理盒」拆開。數字上,8×H200 的 1.13TB/4.8TB/s/NVLink,仍然是集中式訓練與高並發推理的正解;35×512GB Mac 的 17.9TB,贏在 副本數量與單機位址空間,前提是你真的要 35 個互不通訊的使用者,而不是一臺假想中的 17.9TB 超算。
「真正能讓老黃的刀變鈍的,可能不是另一家 CUDA,是蘋果」——作為供應政治判斷,在中國市場說得通;作為晶片對決,則過度延伸。競品會逼 NVIDIA 把更多記憶體塞進工作站卡,也會逼 Apple 把 Metal/MLX 的並發與量化核補齊。買家要做的不是選邊站,而是先寫清楚工作負載:訓練還是推理、單用戶還是閘道、資料能不能出境。
如需在香港把本機大模型做成可審計的私有推理盒——不論硬體最終是 Mac Studio 還是自建 GPU 節點——可了解 YSK Limited 的企業私有 LLM 全託管與遠端技術團隊服務:https://ysk.hk/
參考來源
- X 原帖:https://x.com/MinLiBuilds/status/2092421421444255973
- 前帖(256GB 購物車):https://x.com/MinLiBuilds/status/2092259063480697157
- Apple Newsroom(美):https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra/
- Apple Newsroom(港):https://www.apple.com/hk/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra/
- NVIDIA H200 規格與 2026 年整機/租用報價區間(公開分析綜合)
- 中國 H200 配額與小批量到貨報道(2026-08)