YSK Blog

標籤 #模型評測

共 1 篇文章

Telegram RSS
Saturn《Artificial Authority》:主流 AI 財務問答平均錯逾半——複雜題錯誤率達八成八,部分模型高達九成九

Saturn《Artificial Authority》:主流 AI 財務問答平均錯逾半——複雜題錯誤率達八成八,部分模型高達九成九

Saturn《Artificial Authority》:主流 AI 財務問答平均錯逾半——複雜題錯誤率達八成八,部分模型高達九成九 重點摘要 英國金融科技公司 Saturn 九月發布報告《Artificial Authority》,以一百二十一條財務題、十八款主流模型、每題重複五次、合共逾一萬次回答做一致性測試:平均...