Perplexity 開源 Lily:Apple 晶片本機推理引擎,Hybrid Compute 不再卡瓶頸

重點摘要

Perplexity 於 2026 年 9 月 2 日宣布開源 Lily——專為 Apple 晶片打造的本機推理引擎,服務其 Hybrid Compute(混合運算)架構:敏感資料留在裝置上,雲端模型只負責需要規模的推理。本文已核對 Perplexity 官方 X 公告、開源倉庫 perplexityai/pplx-garden 內 Lily 目錄與效能報告;來源真實性已驗證。重點包括:Lily 鎖定 Qwen3.6-35B-A3B 的 MLX affine 4-bit 權重、提供精簡 OpenAI 相容 Chat Completions API,以及在 M5 Max 上相對 MLX-LM 的 decode/prefill 吞吐提升。

Perplexity 開源 Lily:Apple 晶片本機推理引擎,Hybrid Compute 不再卡瓶頸

Perplexity 開源 Lily:Apple 晶片本機推理引擎,Hybrid Compute 不再卡瓶頸

Perplexity 於 2026 年 9 月 2 日宣布開源 Lily——專為 Apple 晶片打造的本機推理引擎,服務其 Hybrid Compute(混合運算)架構:敏感資料留在裝置上,雲端模型只負責需要規模的推理。本文已核對 Perplexity 官方 X 公告、開源倉庫 perplexityai/pplx-garden 內 Lily 目錄與效能報告;來源真實性已驗證。重點包括:Lily 鎖定 Qwen3.6-35B-A3B 的 MLX affine 4-bit 權重、提供精簡 OpenAI 相容 Chat Completions API,以及在 M5 Max 上相對 MLX-LM 的 decode/prefill 吞吐提升。

一、核心事件:本機引擎開源,補上 Hybrid Compute 的最後一環

技術細節

Hybrid Compute 的構想是把工作切開:本機模型處理個人可識別資訊(PII)與需要離線完成的步驟,雲端 frontier 模型負責需要更大參數量的推理。瓶頸往往不在雲端,而在本機是否跟得上。Perplexity 指出,通用框架 MLX-LM 適合廣泛場景,但 Hybrid Compute 的負載形態更固定,因此他們打造專用引擎 Lily,並以 Apache-2.0 授權公開。

官方倉庫說明 Lily 是小型 Metal 推理伺服器,只服務一個檢查點:轉換為 MLX affine 4-bit、group size 64 的 Qwen3.6-35B-A3B。執行時以 Rust 編譯 Metal kernel,無需離線 shader 建置。硬體門檻明確:Apple GPU family 10 或更新(M5 起)、macOS 26 或更新。伺服器預設暴露:

  • POST /v1/chat/completions
  • GET /v1/models
  • GET /health

請求面刻意收窄:只接受文字 system/user/assistant 訊息、max_tokens、關閉串流,以及可選的 prompt_cache_key;不支援取樣參數、工具呼叫、多模態與 speculative decoding。解碼一律 greedy。Session 使用固定兩槽 LRU 前綴快取,只有 token 序列為嚴格前綴時才重用狀態。

二、技術原理深度解析

Lily 把 prefill 與 decode 視為兩種不同負載。Prefill 一次處理大量 prompt token,權重可跨 token 重用;decode 則逐 token 產生,重用機會少,記憶體頻寬更關鍵。專用 kernel 與深度為 2 的 command buffer 排程,讓下一顆 token 的工作可在等待當前結果前先提交,縮短生產環境的空轉。

2026-09-02 效能報告(相對 MLX 0.32.2/mlx-lm 0.31.3,同一不可變檢查點,M5 Max 40-core GPU/128 GB)量度的是生產引擎吞吐,而非完全相同的孤立圖。表格顯示:在 256–131,072 token 語境下,Lily decode 相對 MLX 約為 1.24×–1.32×;短語境 prefill 亦可高於 MLX,長語境(例如 65K、131K)prefill 則可能落後。X 公告亦摘要:十組 prompt 長度與十組 decode 語境平均,Lily prefill 約高 1.23×、decode 約高 1.35×,輸出品質實質不變。報告同時提醒:兩邊 greedy 軌跡不同,且 mlx-lm 會計算完整詞表 logprob,Lily 的最小 API 則不做 logprob 暴露,因此主張是「生產吞吐」而非「同一圖更高效」。

對企業而言,意義不只是「跑得快」,而是本機路徑穩定到足以撐起混合工作流——否則敏感步驟仍會被迫上雲,抵消資料主權設計。

四、日常應用場景

1. 開發者與技術團隊

開發者可在本機以 OpenAI 相容端點試驗 35B-class MoE 代理流程,不必把 prompt 整段送出。嚴格 API 面有助減少意外工具呼叫與串流差異,適合做回歸測試與離線原型。限制是硬體門檻(M5+)與單一檢查點架構,無法直接套用其他量化格式或稠密 Qwen 變體。

2. 企業與隱私敏感行業

金融、法律、醫療與受 NDA 約束的團隊,可把含客戶識別資料的草稿、摘要、內部知識檢索留在裝置側,只把去識別後的子任務送到雲端。這與香港《個人資料(私隱)條例》(PDPO)下「收集目的、最少披露、跨境轉移審慎」的合規思路一致:能不出境就不出境。

3. 一般用戶

對一般 Mac 用戶,Lily 代表 Hybrid Compute 不再只是產品口號:本機推理若跟不上,整段體驗仍會感覺「卡在雲端」。開源後社群可審計、复現與改進 Metal 路徑,但日常使用仍取決於是否已有相容檢查點與足夠統一記憶體。

4. 香港與亞洲市場視角

香港企業常同時面對跨境雲服務便利與資料本地化壓力。Apple 裝置在本地辦公場景普及,專為 Apple 晶片優化的本機引擎,提供一條「不把全量語料送出香港」的技術選項。亞洲同樣關注主權 AI 與邊緣推理;開源授權降低試點成本,但生產部署仍需配對身份、審計日誌與模型更新流程。

五、專業評價與潛在考量

優勢

  • 官方開源(Apache-2.0)並附可复現效能契約,透明度高。
  • 針對 Hybrid Compute 的固定負載優化,decode 吞吐在報告語境下明顯優於通用 MLX-LM。
  • OpenAI 相容最小 API,方便接入既有代理/應用骨架。
  • 嚴格驗證檢查點形狀,降低錯載權重的風險。

需要留意的地方

  • 硬體鎖 M5 起、系統要求新,存量 M1–M4 裝置不在支援面。
  • 只服務特定 35B-A3B 4-bit 檢查點,擴展性刻意收窄。
  • 無工具、無串流、無取樣,代理能力需在上層另建。
  • 長語境 prefill 未必全面領先;混合雲仍依賴雲端模型的可用性與合約條款。

結語

Lily 把 Perplexity Hybrid Compute 的本機一側從「通用框架湊合用」推進到「可審計、可复現的專用引擎」。對重視資料主權的團隊,這類設計說明:真正的私隱邊界,往往取決於本機是否夠快、夠穩,而不只是雲端 SLA 寫了什麼。若香港企業需要把 Dataset、微調到私有 API 全流程留在境內,可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,100% 數據不出境)。


參考來源

  1. Perplexity 官方 X 公告:開源 Lily(發現來源)
  2. perplexityai/pplx-garden — lily(GitHub)
  3. Lily README(官方倉庫)
  4. 2026-09-02 Lily vs MLX 0.32.2 效能報告
  5. Perplexity Hub:Optimizing On-Device Inference for Apple Silicon

延伸閱讀 · 相關服務與產品