llama-server/vLLM 雙引擎:YSK Omni 把本機 Hugging Face 權重接到 OpenAI 相容閘道

重點摘要

YSK Omni 以 llama-server 與 vLLM 雙引擎,把本機 Hugging Face 權重接到 OpenAI 相容 HTTP 閘道。GGUF 走 llama-server、safetensors 走 vLLM,現有 SDK、curl 與 Open WebUI 只需改指向本機埠 3850,即可在香港辦公室或機房內跑文字推論,權重留在您的機器。

llama-server/vLLM 雙引擎:YSK Omni 把本機 Hugging Face 權重接到 OpenAI 相容閘道

YSK Omni 以 llama-server 與 vLLM 雙引擎,把本機 Hugging Face 權重接到 OpenAI 相容 HTTP 閘道。GGUF 走 llama-server、safetensors 走 vLLM,現有 SDK、curl 與 Open WebUI 只需改指向本機埠 3850,即可在香港辦公室或機房內跑文字推論,權重留在您的機器。

llama-server/vLLM 雙引擎:YSK Omni 把本機 Hugging Face 權重接到 OpenAI 相容閘道

香港團隊若要把開源權重做成可呼叫的服務,常面對格式分裂:有人慣用 GGUF,有人部署 safetensors;若每種格式各起一套自訂介面,客戶端與內部腳本就要維護兩套。YSK Omni 把兩條文字引擎收進同一閘道——llama-server 對應 GGUF,vLLM 對應 safetensors——對外仍是熟悉的 OpenAI 形狀介面,讓「選引擎」留在伺服器端,「呼叫方式」維持一致。

一、這個特點解決什麼痛點

開發與產品團隊往往已有 OpenAI SDK、內部 agent 腳本或 Open WebUI,卻希望推論與權重留在本機。雙引擎設計的價值在於:不必為兩種權重格式各寫一層轉接,也不必迫全員改用同一種檔案格式。管理台支援 Hub 搜尋、下載佇列與 Load/Unload;GGUF 載入後由 llama-server 持久提供對話,safetensors 文字模型則交由 vLLM 處理,客戶端改 base URL 即可接上。

對香港創科與企業 IT 來說,這代表可以先以本機 GPU 或工作站驗證流程,再按合約決定是否由 YSK Limited 代裝或訂造,縮短從權重到可演示 API 的時間。

二、特點背後的完整方案

在雙引擎之外,YSK Omni 把本機模型閘道收成同一產品體驗,官方已發布事實包括:

  • OpenAI 相容 HTTP 閘道:現有 OpenAI 開發套件、curl、Open WebUI 等可改指向閘道。
  • 本機 Hugging Face 權重:權重存放於本機目錄(例如 ~/.ysk-omni/models/),Hub 搜尋與下載佇列在管理台完成。
  • llama-server/vLLM 雙引擎:GGUF 走 llama-server;safetensors 走 vLLM;另有內建 echo,媒體則可接獨立 worker。
  • 預設埠 3850:管理台位於 /admin/,以一次性登入碼開啟;CLI 為 ysk-omni(短名 ysko)。
  • AES-256-GCM 對話加密:對話寫入本機 SQLite(~/.ysk-omni)。
  • MIT 開源 v1.0.1:npm install -g ysk-omni 後執行 ysk-omni setup、ysk-omni start;需 Node.js 20+。

產品頁:https://ysk.hk/products/ysk-omni

三、誰最適合用/香港應用場景

  • 香港創科與 AI 新創:已有 OpenAI 相容客戶端,想改接本機 GGUF 或 safetensors 權重做 PoC 與內部演示。
  • 金融、法律、醫療等重視數據駐留的團隊:推論與權重留在自有機器或合約指定主機,介面仍沿用熟悉 SDK。
  • 研發與 MLOps:同一閘道切換 llama-server 與 vLLM,方便比較格式與效能,不必重寫呼叫層。
  • 系統整合商:替客戶代裝閘道、接文字引擎與後續媒體 worker,交付清單可對照官方版本 v1.0.1。

在香港寫字樓或機房內,團隊可先用單機 GPU 工作站跑通雙引擎,再視需要擴充 worker 或請 YSK Limited 書面報價代裝與訂造。

四、如何開始

  1. 開啟產品說明 https://ysk.hk/products/ysk-omni (亦提供 Markdown:https://ysk.hk/products/ysk-omni.md )。
  2. 本機安裝:npm install -g ysk-omni → ysk-omni setup → ysk-omni start;管理台一次密碼:ysk-omni admin otp,瀏覽器開啟 http://127.0.0.1:3850/admin/ 。
  3. 在管理台載入 GGUF(llama-server)或 safetensors(vLLM)文字模型,把現有 OpenAI 相容客戶端的 base URL 指向本機埠 3850。
  4. 需要代裝、接媒體 worker 或以 ysk-omni 為基底訂造,歡迎 WhatsApp +852 6160 4242 或 [email protected] 聯絡,書面報價。

結語

llama-server/vLLM 雙引擎讓 YSK Omni 用同一套 OpenAI 相容閘道,同時承接 GGUF 與 safetensors 兩條本機文字產線。想把 Hugging Face 權重留在自己機器、又希望客戶端改址即可上線,請由 https://ysk.hk/products/ysk-omni 開始;需要落地支援,WhatsApp +852 6160 4242/[email protected] 即可接洽。


參考來源

延伸閱讀 · 相關服務與產品