Ai2/Hugging Face/官方:以 GPU 時間預算與階層公平共享重排集群調度——三十日交付約九成八應付額度;除錯佇列 p90 由約兩小時降至三十秒;維修人工介入降約七成四

重點摘要

艾倫人工智慧研究所(Ai2)基礎設施團隊於二零二六年十月九日在 Hugging Face 官方企業網誌發表〈Impactful scheduling for GPU clusters〉,說明如何以 GPU 時間預算、階層公平共享與時間切片合約,取代傳統優先級排程。三十日測試期間,團隊獲付應付 GPU 時數約九成八;最大 H100 集群除錯工作負載 p90 佇列由約兩小時降至約三十秒;需人工介入的維修量亦降約七成四。來源真實性已對照 Hugging Face 原文核實。

Ai2/Hugging Face/官方:以 GPU 時間預算與階層公平共享重排集群調度——三十日交付約九成八應付額度;除錯佇列 p90 由約兩小時降至三十秒;維修人工介入降約七成四

艾倫人工智慧研究所(Ai2)基礎設施團隊於二零二六年十月九日在 Hugging Face 官方企業網誌發表〈Impactful scheduling for GPU clusters〉,說明如何以 GPU 時間預算、階層公平共享與時間切片合約,取代傳統優先級排程。三十日測試期間,團隊獲付應付 GPU 時數約九成八;最大 H100 集群除錯工作負載 p90 佇列由約兩小時降至約三十秒;需人工介入的維修量亦降約七成四。來源真實性已對照 Hugging Face 原文核實。

對香港與亞洲企業而言,這不是「再多買幾卡」的情緒文,而是把稀缺算力從搶優先級,改成可辯論、可審計的預算制——對正在擴私有訓練與代理實驗的 IT/AI 平台團隊,具有直接可抄作業價值。

Ai2/Hugging Face/官方:以 GPU 時間預算與階層公平共享重排集群調度——三十日交付約九成八應付額度;除錯佇列 p90 由約兩小時降至三十秒;維修人工介入降約七成四

Ai2 通訊帳號 Kyle Wiggers(Hugging Face 帳號 Ai2Comms)於二零二六年十月九日在 Hugging Face Blog 以 Enterprise Article 形式刊出上述長文。本文已核對文中硬體規模、排程機制、模擬器設定與上線後量度數字;一級來源為 Hugging Face 官方頁面。來源真實性已驗證。以下數字均屬 Ai2 公開自我報告,並非獨立第三方審計。

一、核心事件:把「影響力」寫進 GPU 排程金字塔

技術細節

按官方公開資訊,要點包括:

  • 問題定義:Ai2 基礎設施團隊以四層指標金字塔管理 GPU——底層可用性(availability)、其上佔用率(occupancy)、再上影響力(impact)、頂層利用率(utilization)。本文聚焦如何提升「影響力」,即最有價值的工作較容易拿到算力。
  • 硬體與用戶:管理數以千計的 NVIDIA H100、B200、B300;集群規模約 八十八至一千零二十四 卡;服務約 一百五十 名內部研究員,涵蓋大型語言模型/視覺語言模型訓練、機械人強化學習模擬,以及科學代理後訓練等。
  • 供需落差:依提交負載估算,任一時間點待處理 GPU 需求約為可用量的 兩至三倍——每小時可用 GPU 都有兩至三個研究任務在爭。
  • 舊制病理:優先級排程+可選免搶佔,導致 GPU「佔坑」(squatting,空轉佔位以便隨時除錯)、優先級通貨膨脹(最終約 百分之百 工作標 HIGH)、以及 on-call 大量時間花在協調停掉不可搶佔任務以便維修。
  • 新制三件套:以 GPU 時間預算 取代「發實體卡壟斷」;以 階層公平共享(hierarchical fair-share) 在計劃樹落地;以 排程合約(scheduling contract/時間切片) 強制最短受保護運行時間,之後可自動重排可續跑任務。
  • 上線節奏:七月底起逐集群 rollout;文中結果主要來自約 三十日 觀測窗。

二、技術原理深度解析

  1. 預算而非死板時程表
    研究需求無法精確預測,但「哪個項目更該被資助」屬於策略問題,可事先辯論。管理層像投資人一樣,先按計劃樹比例分配 GPU 時間;沒有預算資助的請求,即不受搶佔保護。佔坑、無限刷 HIGH,都會直接燒掉團隊額度,使「耍排程」比「誠實爭預算」更貴。

  2. 階層公平共享
    算法譜系可追溯至 Hadoop Fair Scheduler(約二零零九年)及今日 SLURM Fair Tree、YARN Fair Scheduler 等實務;Ai2 的新意在於輸入:樹狀結構對齊研究計劃,權重來自管理層預算而非靜態配額。預設以約 七日 滑動回看窗量度佔用,欠額配額的工作排在超額配額之前,使一周尺度內各組在有足夠需求時可逼近其應得時間。

  3. 已配置 vs 未配置佔用

    • Allocated occupancy:計入預算、在最短運行窗內受保護。
    • Unallocated occupancy:不計預算、隨時可被有預算請求搶佔,用來填滿「預算方暫時沒活」的空檔,維持高佔用。研究人員 Chris Clark 在文中形容:新制讓人感覺像多了約 三成 算力——舊制閒置額度等於浪費,新制可在之後 burst 並仍快速、免搶佔地排上。
  4. 排程合約與時間切片
    長訓可能跑數小時至數周。合約要求工作聲明 minimum runtime(為做出有意義進度所需的最短受保護時段);期滿後可自動重排可續跑任務,亦可把 minimum runtime 設為零以換取「免費但完全可搶佔」的未配置時間。模擬與上線配置將 minimum runtime 上限訂為約 八小時;短除錯工作常設 十五分鐘或以下。

  5. 先模擬再上線
    團隊以歷史提交與構造情境做模擬器,預測佇列等待、搶佔與跨項目時間分佈;除錯工作負載是重點假設之一。

  6. 上線後量度(均為原文聲明)

    • 額度兌現:以「每小時分配額與實際需求取較低」定義應付時數;三十日內團隊獲付約 百分之九十八 應付 GPU 時數;十五 個團隊額度中有 十三 個達 百分之九十五 或以上,最差約 百分之九十。
    • 佔用:變更前後集群佔用均約 百分之九十八;需求仍超容量約兩至三倍。約 百分之十八 的已交付 GPU 時間屬未配置佔用,靠它維持高佔用。
    • 佇列:除錯工作 p90 等待由約 兩小時 降至約 三十秒(模擬器對手造情境曾預測由約六小時降至約五分鐘,實測更佳)。最大 H100 集群:中位等待由約 五分鐘 降至約 二十四秒;p90 由約 二點八小時 降至約 一點八小時(約降三分一)。
    • 維修:不健康主機可在任務達 minimum runtime 後自動排乾;需人工介入的維修降約 百分之七十四。

四、日常應用場景

1. 開發者與技術團隊

若自管 Slurm/Kubernetes/雲上訓練叢集,可把「優先級標籤」改成可對帳的時間預算:除錯與互動工作用短 minimum runtime;長訓必須可 checkpoint/可續跑;儀表板直接暴露公平共享排序指標,減少「為什麼被搶」的民間傳說。

2. 企業與隱私敏感行業

金融、醫療、政府與受規管行業若在境內私有環境訓練領域模型,算力往往比公有雲更緊。預算制把資源爭議上移到計劃治理(誰該多拿一個季度),而不是半夜搶 HIGH;同時保留未配置佔用填空檔,避免「分完卡卻有卡閒置」。

3. 一般用戶/業務營運

業務方未必碰排程器,但會感受到「實驗輪次能不能在當周跑完」。可要求平台團隊公開各產品線的 GPU 時間份額與兌現率(類似 Ai2 的百分之九十八目標),並把除錯延遲列為服務等級指標——p90 由小時級到秒級,往往比再買一批卡更快見效。

4. 香港與亞洲市場視角

香港數據中心電力與機架成本高,企業私有 LLM/內部代理平台更常面對「卡永遠不夠」而非「卡永遠閒着」。把佔用率與影響力拆開管理,有助避免只追求滿載、卻讓高價值專案排不到隊。若團隊需要在香港落地可審計的私有模型與自動化管線(資料不出境、自管 API),可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境):https://ysk.hk/services/ai-automation

五、專業評價與潛在考量

優勢

  • 一級來源為 Hugging Face 官方企業文,附具體硬體世代、集群規模、三十日兌現率與佇列百分位,企業可對照自身 Slurm/雲隊列做差距分析。
  • 把公共資源悲劇(佔坑、優先級通脹)轉成預算成本,比單純「再加優先級層」更貼近治理。
  • 時間切片同時服務公平性與自動維修排乾,on-call 人工介入降約七成四,屬少見的可操作維運收益。

需要留意的地方

  • 數字來自單一研究所自我報告;換工作負載、檢查點策略或不可續跑任務比例後,佇列改善不可直接外推。
  • 互動分析工作階段在舊制可佔用長達約一周;新制受約八小時受保護上限約束,超出額度後可變可搶佔——長互動工作流需另行產品化(例如專用互動池)。
  • 學習曲線陡:術語殘留(仍可見 priority 但只在隊內排序)曾造成混亂;文件不足,現場講解與可視化才扭轉「民間理論」。
  • 文末展望指向金字塔頂層「利用率」(開機、檢查點與訓練程式本身效率);排程再公平,若單卡/多卡效率低,影響力仍會被吃掉。

結語

Ai2 這篇排程實錄的核心訊息很務實:在算力長期短缺時,先用預算把「誰值得跑」說清楚,再用公平共享與時間切片把「怎麼輪流跑」自動化,比繼續堆優先級更接近可治理的 AI 工廠。對香港企業而言,下一步往往不是再下一張 GPU 採購單,而是把私有訓練與代理平台的資源契約寫進可審計流程。若你正評估境內私有模型與自動化落地,可由此對照 YSK Limited 的企業私有 LLM 全託管服務頁:https://ysk.hk/services/ai-automation


參考來源

延伸閱讀 · 相關服務與產品