OpenAI/官方:GPT-6 Prompt Caching 升級——三十分鐘共用前綴折扣、儀表板與診斷;快取輸入最高約九成優惠

Key takeaway

OpenAI 於二〇二六年九月二十二日發布官方說明,宣布 GPT-6 系列導入改良版 prompt caching(提示快取):預設提高快取命中率,對三十分鐘內重用的合資格共用前綴提供快取折扣,並上線儀表板與診斷工具,協助持久代理(persistent agents)降低延遲與推理成本。來源真實性已核對 OpenAI 官方新聞頁與平台 Prompt Caching 開發文件;本文整理機制、開發者控制項,以及對香港與亞洲團隊以 API 長跑代理的含義。

OpenAI/官方:GPT-6 Prompt Caching 升級——三十分鐘共用前綴折扣、儀表板與診斷;快取輸入最高約九成優惠

OpenAI 於二〇二六年九月二十二日發布官方說明,宣布 GPT-6 系列導入改良版 prompt caching(提示快取):預設提高快取命中率,對三十分鐘內重用的合資格共用前綴提供快取折扣,並上線儀表板與診斷工具,協助持久代理(persistent agents)降低延遲與推理成本。來源真實性已核對 OpenAI 官方新聞頁與平台 Prompt Caching 開發文件;本文整理機制、開發者控制項,以及對香港與亞洲團隊以 API 長跑代理的含義。

官方指,快取可把共用系統指令、工具定義與先前輪次上下文的計算結果重用,從而縮短回應時間,並對已快取輸入 token 提供最高約九成折扣(約以一折價計)。GitHub Copilot、Manus 等客戶個案亦見於同一官方頁,數字均來自該頁引述,並非本站推算。

OpenAI/官方:GPT-6 Prompt Caching 升級——三十分鐘共用前綴折扣、儀表板與診斷;快取輸入最高約九成優惠

引言

長跑代理會把同一套指令、工具結構與對話前綴反覆送進模型。若每次都由頭計算,輸入成本與首 token 延遲都會被放大。OpenAI 這次把「預設更高命中」與「可觀測、可診斷、可顯式控制」捆在一起,對已經把工作流押在 Responses/Agents API 上的產品與企業團隊,屬直接可落地的成本工程更新,而非單純行銷口徑。

來源真實性已驗證:核心產品聲明與日期核對自 OpenAI 官方新聞《Better prompt caching for GPT-6》(二〇二六年九月二十二日);快取定價倍率、最短可快取長度與存活窗口等實作細節,交叉核對平台 Prompt Caching 指南。本文改寫整理,非全文轉載。

一、核心更新:預設更高命中,並配齊觀測工具

技術細節

依官方說明,GPT-6 系列改進後的 prompt caching 具備以下重點:

  1. 預設更高命中率:引擎端提升合資格共用前綴的重用機會,開發者毋須先改架構也能受惠。
  2. 三十分鐘折扣窗口:對在約三十分鐘內重用的合資格共用前綴給予快取折扣;平台文件補充,預設在最近一次寫入或重用後約三十分鐘內仍可命中,系統亦可能保留更久(文件舉例可至約二十四小時),惟商業口徑仍以官方新聞的三十分鐘窗口為準。
  3. 最高約九成輸入折扣:官方寫明對已快取輸入 token 可享最高約 90% 折扣。平台文件進一步說明(以 GPT-5.6 及之後模型為例):快取寫入約為一般未快取輸入價的 1.25 倍,後續讀取約為 0.1 倍;寫入並非額外疊加費,而是該批 token 套用寫入/讀取/未快取其中一種費率。實際價目以當日 API pricing 為準。
  4. Prompt Caching Dashboard:顯示應用有多少輸入由快取供應、命中率走勢,以及已快取與未快取 token 的組成,方便對照改動前後。
  5. 診斷工具:遇意外未命中時,可比對近期請求,標示模型、工具、設定或輸入哪一環破壞了前綴重用;官方示例回傳可含 tools_changed 等原因與受影響 token 估算。

官方亦解釋原理:模型處理輸入時會產生中間鍵值(KV)狀態;快取保存的是這些狀態而非明文 token。後續請求只要「完整渲染後的前綴」一致並找到合資格斷點,即可跳過重複計算。

二、技術原理與開發者控制項

對代理型產品而言,前綴常由「隱藏系統內容+開發者訊息+工具定義+對話歷史」組成。任一位置在斷點之前變動,其後前綴都可能無法命中既有快取。OpenAI 因此提供一組可選控制:

  • 顯式快取斷點(cache breakpoints):自行指定哪些前綴值得寫入並重用;可與自動斷點並用。平台文件指,GPT-5.6 及之後模型最短可快取長度為 1,024 個客戶可見 token(不含隱藏系統內容)。
  • 調整推理力度而不破快取:在 GPT-6 上,可透過附加 configuration_update 調整 reasoning effort,無需重寫整段前綴。
  • 工具變更時保命中:盡量維持工具定義、schema 與順序穩定;要以 allowed_tools 收窄可呼叫工具,或以 tool_choice: none 暫停工具,而不是直接刪除定義。新指令宜用新的 developer message 附加在對話較後段。
  • 預熱(prewarming):在使用者發問前,先把共用指令、工具定義或參考資料寫入快取,把計算移出互動等待時間。

這些控制建立在「預設已較佳」的引擎行為之上,方便依工作負載微調,而不是強迫全面重寫提示。

三、官方引述的落地數字(非本站推算)

OpenAI 新聞頁同時刊登客戶說法,重點如下(數字均來自該頁原文):

  • GitHub Copilot(首席產品官 Mario Rodriguez):相對舊基線,過去數月在對 OpenAI 模型的海量請求中,需要「重新新鮮處理」的提示 token 佔比已減少逾五成,並改善首回應時間。
  • Manus(Agent Team Lead Bin Fan):長跑代理經濟模型高度依賴穩定快取;與 OpenAI 工程協作調整斷點、結合顯式與自動快取後,不到一週把 OpenAI 模型快取命中率由約 85% 拉穩至持續高於 90%。
  • 同頁另引述合作方工程主管:儀表板與診斷協助把命中率再抬數個百分點、成本約降 20%;亦有團隊改用顯式斷點後,評測命中由 83% 升至 91%,快取寫入約減三分二、推理成本約降 36%。

上述屬個案結果,實際命中與節省取決於提示結構、工具穩定度與流量型態,不應直接外推為所有應用的保證值。

四、日常應用場景

1. 開發者與技術團隊

適合已把系統提示、工具 schema 與檢索片段固定在請求前段的 Coding Agent、客服 Agent、文件研究代理。優先動作:開 Dashboard 看命中率→用診斷抓 tools_changed 類破壞→把常變內容移到斷點之後→對啟動路徑做 prewarm。

2. 企業與隱私敏感行業

金融、法律、醫療等行業常跑「長系統提示+內部知識+多輪工具」。快取降低的是重複前綴的計價與延遲,並不改變資料是否出境、是否寫入供應商日誌等合規邊界。若合約要求數據不出境或專屬部署,仍須另審私有模型或專屬租戶方案,不能只靠雲端 API 快取折扣替代治理。

3. 一般用戶

一般 ChatGPT 對話使用者通常毋須手動設定斷點;受惠面主要在背後以 GPT-6 API 驅動的產品體驗(更快、更穩的代理步進)。終端用戶較會感受到首字延遲與長任務是否「愈跑愈貴」。

4. 香港與亞洲市場視角

香港與亞太許多團隊以 OpenAI API/代理編排(含客服、內部知識問答、研發助手)做生產流量,輸入 token 往往佔帳單大宗。三十分鐘窗口意味著:排班密集的客服班次、CI 內連續代理步驟、同一工作階段內的多跳工具呼叫,較容易累積命中;若流量稀疏、前綴每分鐘大改,折扣會明顯收縮。對同時評估「公有 API 降本」與「私有 LLM 託管」的企業,這次更新提供了可量化的對照軸:先用官方儀表板量現況命中,再決定要優化提示結構,或把高敏感工作負載拆到本地/專屬環境。

五、專業評價與潛在考量

優勢

  • 把成本優化從「靠經驗調提示」推進到「可觀測+可診斷」的工程迴路。
  • 與持久代理場景對齊:長任務、多工具、多輪前綴重用正是快取收益最大的區間。
  • 官方同時更新指南與 Codex 輔助檢查路徑,降低落地門檻。

需要留意的地方

  • 命中取決於完整前綴一致;工具定義微調、隱藏系統內容變更、模型切換都可能整段失效。
  • 快取寫入有倍率成本,只對「確定會重用」的前綴才划算;把高頻變動段落寫進快取反而可能更貴。
  • 窗口與保留屬平台行為,尖峰或容量壓力下實際可用時間可能短於文件上限。
  • 個案百分比來自特定客戶工作負載,報價與架構審查時應以自身 Dashboard 數據為準。

結語

GPT-6 的 prompt caching 升級,本質是把「代理愈跑愈長」的帳單結構,拉回可用工程手段管理的範圍:預設更高命中、三十分鐘重用折扣、儀表板與診斷,再加上斷點、推理力度熱更新與預熱。對香港團隊而言,值得先量測現有 API 代理的命中率與未快取輸入佔比,再決定優化順序。

若企業需要把高敏感知識留在本地、又以私有 API 對外提供類似代理能力,可參考 YSK Limited 的企業私有 LLM 全託管(Dataset → QLoRA/LoRA → 私有 API,年費 HK$88,000 起,100% 數據不出境):https://ysk.hk/services/ai-automation


參考來源

  1. OpenAI 官方新聞:Better prompt caching for GPT-6(2026-09-22)— https://openai.com/index/better-prompt-caching-for-gpt-6
  2. OpenAI Platform Docs:Prompt caching — https://platform.openai.com/docs/guides/prompt-caching
  3. 發現來源:OpenAI News RSS — https://openai.com/news/rss.xml

Related services & products