Saturn《Artificial Authority》:主流 AI 財務問答平均錯逾半——複雜題錯誤率達八成八,部分模型高達九成九

重點摘要

重點摘要

Saturn《Artificial Authority》:主流 AI 財務問答平均錯逾半——複雜題錯誤率達八成八,部分模型高達九成九

Saturn《Artificial Authority》:主流 AI 財務問答平均錯逾半——複雜題錯誤率達八成八,部分模型高達九成九

重點摘要

英國金融科技公司 Saturn 九月發布報告《Artificial Authority》,以一百二十一條財務題、十八款主流模型、每題重複五次、合共逾一萬次回答做一致性測試:平均錯誤率約百分之五十七,複雜題升至約百分之八十八,部分模型在最難題上錯至約百分之九十九。金融時報及多家業界媒體跟進報道。對香港金融、保險與合規團隊,重點不是「要不要用 AI」,而是通用聊天產品能否承擔受規管後果——以及何時必須改走可審計、可微調的私有模型棧。

英國金融科技公司 Saturn 於二零二六年九月發布報告 《Artificial Authority: Should you trust AI to deliver financial advice?》,系統測試通用大語言模型在退休金、稅務、債務、按揭與儲蓄等題目上的表現。來源真實性已驗證:以 Saturn 官方報告頁為主;交叉對照 Financial Reporter、IFA Magazine 等業界轉述,以及金融時報對同一研究的跟進標題與摘要。X 鎖定名單上 Cointelegraph 帖文僅作發現線索,不以社交摘要為準。本文說明方法與關鍵數字、錯誤類型、監管語境,以及香港企業採購與私有部署視角。須註明:Saturn 對金融行為監管局(FCA)是否規管「AI 財務建議」有商業利害,分數標準屬該公司自訂方法,不應視為獨立實驗室認證。

一、核心事件:通用模型在財務域「多數時候答錯」

技術細節

據 Saturn 報告及經交叉核對的業界轉述(題庫與評分由 Saturn 設計):

  1. 樣本規模:測試 18 款流行模型(報道列舉範疇涵蓋 ChatGPT、Claude、Copilot、Grok、Gemini 等系列);121 條財務問題;每題重複 5 次以測一致性;合計逾 10,000 次回答。
  2. 總體錯誤率:平均約 57% 的回答被評為錯誤(正確約 43%)。「錯誤」標準包括事實錯誤、遺漏關鍵點,或略去重要風險提示。
  3. 複雜題崩潰:涉及多步計算或交叉規則的較難題,平均錯誤率約 88%;部分模型在最難題上錯至約 99%(報道點名 Gemini 3.5 Flash、Claude Haiku 4.5 等在最難題接近全錯)。
  4. 免費 vs 付費:免費模型錯誤約 63%,付費模型約 49%;最難題上免費模型約 93% 出錯。
  5. 單模表現(報道摘錄):最差一例 Claude Haiku 4.5 約 82% 錯;Gemini 3.1 Pro 約 73%;Grok 4.5 約 59%;ChatGPT 5.6 Luna 約 58%。整體最好一例 Claude Opus 5(reasoning)仍約 39% 錯——即使「相對最佳」亦遠未達受規管建議水準。
  6. 高代價幻覺案例(報告舉例)
    • 退休金稅務規則出錯,可能導致約 £17,500 的稅務機關追討情境;
    • 債務建議優先清「最高利率」而非租金/市政稅等優先債項,可能把已陷財困者推向逼遷或法律程序;
    • 學生貸款場景中模型「發明」出國可停還款的規則,實務可能令月供升高;
    • 按揭假期被錯誤安撫為「不影響信用評分」。
  7. 監管語境:報道指 FCA《Mills Review》顯示約 26% 消費者信任通用 AI 作財務建議;FCA 正考慮是否規管 AI 產生的財務建議。Saturn 行政總裁 Amal Jolly 公開呼籲 FCA 加快規管,並指出通用 AI 建議目前不受與持牌顧問同等的補償與盡職保護。

重點不在「某一品牌特別差」,而在:把未針對司法管轄區稅法、優先債與風險披露微調的通用聊天產品,直接當「顧問」用,在受測題庫上多數時候不過關。

二、技術原理深度解析:為何財務域特別容易翻車

通用模型在財務問答上的失敗,通常不是單一「算錯數」,而是三層機制疊加:

  1. 知識切面與法規時效:稅率、寬免額、學生貸款門檻會按預算案與實施日變更。預訓練語料與對齊策略若未鎖定「當期有效規則+出處」,模型會用過期或虛構規則填洞。
  2. 多約束優化 vs 單目標捷徑:債務題同時涉及利息最小化、法定優先債、信用評分與逼遷風險。模型常優化「看起來合理的理財口號」(先還高息),卻忽略管轄區內「優先債」的法律後果——這是目標函數錯位,不是單純算術。
  3. 風險披露與合規語氣:受規管建議須標示不確定性、適用條件與「何時應見真人」。Saturn 把「漏警告」亦計為失敗,等於用合規視角評聊天產品——通用助手本來不是按此契約訓練。

對架構師而言,攻擊面是「員工用個人 ChatGPT/Claude 帳戶處理客戶資產與稅務問題」;系統約束是日誌出境、模型版本漂移與無法追溯責任;回擊是把題庫、合規清單與司法管轄區規則做成可版本控制的檢索/微調資料,並強制人工覆核高後果輸出。

四、日常應用場景

1. 開發者與技術團隊

為財務、客服與內部知識庫助手建立評測集:稅務、產品說明書、拒賠條款各備黃金答案與必備警告句。上線前對候選模型跑固定重覆測試;任何「發明規則」直接紅燈。把高後果路由與低風險 FAQ 分開——後者可用通用 API,前者必須鎖模型版本並留審計軌跡。

2. 企業與隱私敏感行業

銀行、券商、保險與持牌顧問應假設:員工已在用通用聊天產品問「客戶能不能這樣報稅」。政策層面禁止把客戶識別資料貼進公有產品;工程層面提供內網助手,並明確標示「非受規管建議、須合規覆核」。採購問卷可要求:訓練資料是否含客戶對話、能否關閉人類覆核外傳、能否在香港/指定區域託管。

3. 一般用戶

把通用 AI 當「解釋名詞與整理文件」可以,當「替你決定供款、停供或報稅」則必須交叉核對官方稅務局/持牌顧問。看到斬釘截鐵的法規口吻卻無出處連結,應視為高風險訊號。

4. 香港與亞洲市場視角

香港同時受證監會、金管局與私隱條例約束,稅務與強積金規則亦與英國題庫不同——英國測得的錯誤率不能直接外推港元產品,但「通用模型+本地法規=高幻覺風險」的機制同樣成立。若金融或專業服務機構要把內部手冊、合規 FAQ 與客戶溝通草稿交 AI 處理,較穩妥的路徑是領域資料微調+私有託管+人工覆核,而不是把問題丟進公有聊天框。YSK Limited 的企業私有 LLM 全託管(https://ysk.hk/services/ai-automation)以 Dataset → QLoRA/LoRA → 私有 OpenAI 相容 API 為路徑,年費由 HK$88,000 起,強調數據不出境;若還需把現有公有雲工作負載收進可驗證邊界,可搭配雲端遷移與網絡安全(https://ysk.hk/services/cloud-security)。

五、專業評價與潛在考量

優勢(就資訊價值而言)

  • 題量大、有重覆測試,比單次「試用心得」更接近可引用的壓力測試。
  • 同時給出總體、複雜題、免費/付費分層與具體高代價案例,方便企業寫風險說明。
  • 把討論從「AI 聰不聰明」拉回「受規管建議的契約與補償」——對金融業採購有用。

需要留意的地方

  • 利益衝突:Saturn 呼籲 FCA 規管 AI 財務建議,自身屬金融科技公司,對規管結果有商業利害;評分標準為其自訂,非監管機構認證。
  • 題庫偏英國:退休金稅、市政稅、學生貸款等情境以英國為主,香港/亞洲團隊須自建本地題庫複測,不可照抄百分比當本地合規結論。
  • 模型版本快速迭代:報道中的型號代號會被供應商很快替換;應把 Saturn 結果當作「方法示範」,定期重跑自己的回歸集。
  • 「錯」的定義含漏警告:這對合規合理,但與純事實 benchmark 不可直接橫向比較。

結語

Saturn《Artificial Authority》用逾一萬次財務問答,把一個市場直覺寫成可引用數字:主流通用模型平均錯逾半,複雜題接近九成失手,即使相對最佳者仍遠未達受規管建議的可靠度。金融時報與業界媒體的跟進,顯示監管與消費者保護討論已進入「要不要把聊天產品當顧問管」的階段。對香港技術與合規決策者,下一步不是全面禁用 AI,而是分級——低後果解釋可輔助,高後果決策必須可審計、可微調、可留在境內。若你的團隊正把內部知識與合規語料從公共聊天產品遷到可控棧,可從 YSK Limited 的企業私有 LLM 全託管(https://ysk.hk/services/ai-automation)開始評估。


參考來源

  1. Saturn(2026-09):Artificial Authority — Should you trust AI to deliver financial advice? — https://www.saturnos.com/report/artificial-authority
  2. Financial Reporter:AI models give wrong financial advice 57% of the time, Saturn research finds — https://www.financialreporter.co.uk/ai-models-give-wrong-financial-advice-57-of-the-time-saturn-research-finds.html
  3. IFA Magazine(2026-09-14):ChatGPT and Claude get financial advice wrong 57% of the time… — https://ifamagazine.com/chatgpt-and-claude-get-financial-advice-wrong-57-of-the-time-potentially-costing-tens-of-thousands-of-pounds/
  4. ResearchBuzz/金融時報標題轉述(2026-09-19):AI chatbots give wrong answers to financial queries ‘most of the time’ — https://rbfirehose.com/2026/09/19/financial-times-ai-chatbots-give-wrong-answers-to-financial-queries-most-of-the-time/
  5. 發現來源(X,非準據):Cointelegraph 提及 FT/Saturn 財務問答錯誤率數字 — https://x.com/Cointelegraph/status/2101272623799804240

延伸閱讀 · 相關服務與產品