ChatGPT 發明者推非語言模型 Jev:結構化決策免幻覺,成本降兩個數量級

重點摘要

科技媒體 TechCrunch 於 2026 年 9 月 18 日報道,前 OpenAI 研究員、強化學習人類回饋(RLHF)重要貢獻者 Diogo Almeida 創辦的 TypeSafe AI,公開首款「System One」模型 Jev:不以生成文字為目標,改輸出預先定義的結構化決策與校準機率。官方稱相對前沿語言模型,在同類決策任務上可達約四十至二百倍加速、成本下降約兩個數量級;輸出權杖免費、輸入約每百萬權杖 0.042 美元。本文已核對 TechCrunch 報道與 TypeSafe 官方部落格,來源真實性已驗證。

ChatGPT 發明者推非語言模型 Jev:結構化決策免幻覺,成本降兩個數量級

ChatGPT 發明者推非語言模型 Jev:結構化決策免幻覺,成本降兩個數量級

重點摘要

科技媒體 TechCrunch 於 2026 年 9 月 18 日報道,前 OpenAI 研究員、強化學習人類回饋(RLHF)重要貢獻者 Diogo Almeida 創辦的 TypeSafe AI,公開首款「System One」模型 Jev:不以生成文字為目標,改輸出預先定義的結構化決策與校準機率。官方稱相對前沿語言模型,在同類決策任務上可達約四十至二百倍加速、成本下降約兩個數量級;輸出權杖免費、輸入約每百萬權杖 0.042 美元。本文已核對 TechCrunch 報道與 TypeSafe 官方部落格,來源真實性已驗證。

2026 年 9 月中旬,TypeSafe AI 正式對外介紹「System One Models」與首款公開模型 Jev;9 月 18 日 TechCrunch 以開發者熱度為主軸跟進,指公司 API 曾因需求過高短暫無法服務。創辦人 Diogo Almeida 曾參與打造 ChatGPT 背後的指令跟隨與 RLHF 方法,卻認為「優化人類語言」並未自動帶來可靠軟體自動化——電腦需要的是可解析、可機率閘控的決策,而不是再一段可能幻覺的散文。本文以 TypeSafe 官方說明與 TechCrunch 訪談/開發者用例交叉核對;X 上 TechCrunch 官方帳號同日亦轉發相關連結。來源真實性已驗證。

對香港企業與產品團隊而言,這不是又一次「更大聊天模型」軍備競賽,而是把 AI 嵌進工作流、路由、審核與護欄時,如何用更便宜、更快、可預期的介面取代昂貴的全文生成迴路。

一、核心事件:從聊天到「可呼叫的決策函數」

技術細節

綜合 TypeSafe 官方部落格與 TechCrunch 報道,Jev 的定位可拆成幾點:

  1. 不是 LLM,而是 System One 模型 名稱借自丹尼爾·康納曼《快思慢想》的系統一(直覺、快速)與系統二(緩慢、深思)對照。TypeSafe 強調 Jev 放棄字串生成,改為在呼叫端預先定義可選答案與結構,輸出「類型安全」的結構化值,並附帶校準機率與信心分數。
  2. 訓練與取樣不同於 RLHF/逐權杖解碼 官方稱採用自研「Reinforcement Learning for Calibrated Decisions」(RLCD),並以平行取樣一次產出全部決策欄位,而非自回歸逐權杖生成。這是其宣稱低延遲與「輸出幾乎免費」的工程基礎。
  3. 定價與延遲(以官方數字為準) TypeSafe 刊出輸入約 每百萬權杖 0.042 美元(即約每十億權杖 42 美元),輸出權杖標為免費;端到端回應時間約 70–500 毫秒。官網/說明中亦出現相對前沿模型約 40x–200x 速度、工作流評測上更高倍數成本差的敘事;TechCrunch 則引述開發者實測(見下文),並提醒架構細節公司仍相對保密。
  4. 早期採用訊號 TechCrunch 指 Vercel 工程師以 Jev 取代某 OpenAI 模型做指令安全分類,速度提升約五至十八倍且準確率更高;另一開發者以 Jev 對比 Gemini 做商務電郵分類,指 Gemini 略準、但 Jev 貴約一至二十分之一,且「會回傳真實機率」利於自動化閘值。公司亦稱早期存取開放後,API 曾因流量過大短暫中斷——屬熱度訊號,而非長期容量承諾。

官方同時坦言:工作流評測由內部能力團隊設計、參考答案偏向大型實驗室模型平均,可能存在偏差;長期定價是否可持續,仍需時間驗證。本文不把行銷頁上的最大倍數寫成「已驗證業界標準」。

二、技術原理深度解析

Jev 想解決的,是「語言模型很會說話,卻很難當可靠函式」的結構矛盾:

  1. 介面契約先於智慧 軟體自動化需要的是:狀態進、枚舉/分數/路由出。字串輸出再怎麼聰明,都要解析、驗證、防幻覺工具呼叫。把輸出空間鎖死,等於把幻覺問題部分「外包」給呼叫端的 schema 與機率門檻。
  2. 校準機率是自動化的閘 若模型在 95% 信心時才自動執行、50% 時交回人類,系統才能在成本與風險之間滑動。TypeSafe 強調輸出機率「校準」——信心高時準確率也較高——這比「再問一次模型自報信心」更可工程化。
  3. 與代理(agent)生態的互補 TechCrunch 引述開發者指出:用 LLM 監督 LLM 很快變貴;用廉價決策模型做軌跡審核、越獄偵測、模型路由,才符合經濟直覺。這與香港企業常見的「多模型閘道+內部審批」架構同向。
  4. Jevons 悖論式命名 模型以十九世紀經濟學家 William Stanley Jevons 命名:效率提升往往推高總用量。Almeida 的願景是「智慧變便宜之後,會像早期互聯網一樣到處擴散」,而不是只堆幾個巨型聊天應用。

需要分開看的是:Jev 不取代 寫程式、長文推理或開放式對話;它瞄準的是分類、路由、評分、抽取、護欄——也就是大量「原本想寫 if-else、但規則太脆」的位置。

三、日常應用場景

1. 開發者與技術團隊

  • 把代理工具呼叫前的安全分類、提示注入偵測、輸出 schema 驗證,從「再打一輪大模型」改成低延遲決策呼叫。
  • 做模型路由:先以 Jev 判斷任務難度/領域,再決定是否升級到昂貴推理模型。
  • 在 CI 或客戶支援流水線中,對日誌、工單、電郵做多問題並行評分(官方強調可一次問多個分解問題)。

2. 企業與隱私敏感行業

  • 金融、法律、醫療若已有私有或專線大模型,仍可用決策層做「是否外傳/是否人工覆核/風險等級」的結構化閘控,減少把完整客戶語料反覆送進聊天 API。
  • 合規與營運團隊可把「信心低於門檻即升級人工」寫進流程,而不是依賴模型自行決定何時拒絕。

3. 一般用戶

一般消費者不會直接呼叫 Jev;但會間接受惠於更快的審核、推薦過濾與客服分流。重點仍是:自動化背後若缺少機率閘與可觀測性,便宜也可能放大錯誤。

4. 香港與亞洲市場視角

香港金融科技、電商與專業服務高度依賴工作流自動化,又同時受個人資料私隱、跨境數據與模型供應商集中風險約束。Jev 這類「結構化決策 API」降低的是單位決策成本,但企業仍須處理:資料是否出境、供應商早期存取條款、以及評估是否可在本地/專用環境複現類似能力。

若貴司希望把領域知識與敏感語料留在可控環境、以 OpenAI 相容 API 對外,而不是把分類與路由邏輯全部押在公有聊天模型上,可參考 YSK Limited 的企業私有 LLM 全託管(年費由 HK$88,000 起;資料不出境的託管方案見 https://ysk.hk/services/ai-automation)。

四、專業評價與潛在考量

優勢

  • 問題定義清楚:針對自動化介面,而不是再做一個聊天機器人。
  • 有可核對的官方定價/延遲區間,以及 TechCrunch 引述的具名開發者用例(Vercel、Bryo AI 等)。
  • 與代理熱潮互補:護欄與路由正是企業落地時最貴、最吵的一層。

需要留意的地方

  • 架構與訓練資料細節公開有限;外間推測可能建基於開權重模型之上,官方未完全攤開。
  • 「不能幻覺」指的是不偏離預定義輸出類型,不是保證世界知識永遠正確;錯誤的高信心決策仍可能造成自動化事故。
  • 早期存取與 API 容量、區域延遲(官方評測多在美西)對亞洲呼叫端未必相同。
  • 工作流評測設計者來自公司內部,獨立複現仍有限;宜以自身 A/B 與影子流量驗證。

結語

Jev 的出現,把 2026 年的 AI 敘事從「更大的對話模型」拉回一個更工程的問題:軟體到底需要什麼樣的智慧介面。當決策可以類型安全、帶校準機率、又以毫秒級與極低權杖成本嵌入程式,自動化才比較像可維運的產品,而不是示範影片。

香港團隊若正把代理、審核與多模型路由寫進生產,不妨同步檢視:哪些步驟其實不需要生成長文,只需要可靠的結構化判斷。若要在本地治理資料與模型生命週期,可從 YSK Limited 的企業私有 LLM 全託管了解 Dataset → 微調 → 私有 API 的完整路徑(https://ysk.hk/services/ai-automation)。


參考來源

  1. TechCrunch:A new kind of AI model from a ChatGPT inventor is thrilling developers(2026-09-18)— https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
  2. TypeSafe AI 官方:Introducing System One Models & Jev(2026-09-15)— https://typesafe.ai/blog/introducing-system-one-models-and-jev
  3. X 發現來源:TechCrunch — https://x.com/TechCrunch/status/2101022221774856412

延伸閱讀 · 相關服務與產品