Skip to content
Back to Archive
AIAI 撰稿2 min read

OpenAI GPT-5.5 Instant 將幻覺減少 52.5%,數學得分 81.2

OpenAI 新的預設 ChatGPT 模型在高風險領域中將錯誤陳述減少逾半,並導入記憶體來源以提供個人化回應,率先開放給 Plus 與 Pro 使用者使用。

OpenAI GPT-5.5 Instant 將幻覺減少 52.5%,數學得分 81.2

OpenAI 週二將 GPT-5.3 Instant 替換為 GPT-5.5 Instant,作為驅動 ChatGPT 的預設模型,一夜之間將可量測的幻覺減少功能推向超過 3 億月活躍使用者。該公司表示,新模型在醫學、法律與金融等高風險提示中,產生的幻覺陳述比前一代減少 52.5%——此一指標直接回應企業買家的需求,而這些買家貢獻了 OpenAI 年化營收逾 50 億美元的大宗。同時,新的記憶體來源功能讓使用者能精細控制哪些個人背景脈絡會影響其答案,此一設計選擇承認了隱私責任,而這正是人工智慧個人化藍圖的核心所在。

此次調升評等發布之際,大型語言模型市場正進入競爭更為激烈的階段。Google DeepMind、Anthropic 與 DeepSeek 均已於 2026 年推出具競爭力的模型,差異化競爭已從原始能力轉向可靠性與無縫使用者體驗。在高風險領域減少幻覺,正是受監管產業——最具價值的企業垂直領域——仍不願大規模部署人工智慧的確切痛點。週二的發布是 OpenAI 迄今最明確的訊號,表明其正直接鎖定此一猶豫心態。

GPT-5.5 Instant 自週二起向所有 ChatGPT 使用者推出,並同步透過 OpenAI API 以 chat-latest 別名提供。付費訂閱使用者立即取得新預設模型;Plus 與 Pro 使用者在網頁版立即獲得較深層的個人化功能——Gmail 整合、檔案連結記憶體——而 Free、Go、Business 與企業等級使用者則在未來數週內陸續取得這些進階功能。分階段推出反映基礎設施的排序,以及企業買家的法遵審查週期,他們需要時間評估資料處理實務,才能為員工啟用信箱存取。

GPT-5.5 Instant 精確度架構下的改變

Google 的 TPU 晶片助其避免興建數十座新資料中心 ...

OpenAI 內部評估顯示,GPT-5.5 Instant 在 AIME 2025 競賽數學指標中得分 81.2,高於 GPT-5.3 Instant 的 65.4——在測試多步驟推理而非模式檢索的測驗中提升 24%。在衡量研究所等級科學推理的 GPQA 中,新模型達到 85.6%,前一代為 78.5%。多模態推理亦有所進展:圖表理解指標 CharXiv 從 75.0% 升至 81.6%,MMMU-Pro 從 69.2 改善至 76.0。OmniDocBench 文件錯誤率從 14.6% 降至 12.5%。

高風險提示詞中虛構內容減少 52.5%,以及使用者已標記事實錯誤的對話中不實陳述下降 37.3%,這些並非指標數據——它們來自 OpenAI 的紅隊測試與使用者回饋機制,代表的是真實使用模式,而非精心設計的測試集。此區別至關重要:在合成指標上表現優異、但在實際法律或臨床查詢中表現衰退的模型,一直是企業採購團隊持續失望的來源。

GPT-5.5 Instant 亦經過校準,使回應風格與任務複雜度相匹配:簡單查詢給出較短答案,研究任務提供更深層的多步驟回覆,減少不必要的項目符號清單與表情符號。OpenAI 將此定位為溝通品質的改善,但這同時也是延遲與運算資源的優化——產生較少非必要輸出的模型,每個代幣的運作成本更低。

52.5% 虛構內容削減及其通往企業營收的直接路徑

英特爾實驗以油浸方式為伺服器散熱 - The Verge

OpenAI 決定以虛構內容指標而非能力宣稱作為主打,反映了一個商業現實:願意支付企業級費率的買家——醫院、律師事務所、金融服務公司——正是那些虛構的藥物互動作用或捏造的先例會帶來法律責任的客戶。根據 OpenAI 的定價頁面,GPT-5.5 Instant 在 API 中每百萬輸入代幣收費 5 美元,每百萬輸出代幣收費 30 美元,為前一代每代幣費率的兩倍。此漲價於 4 月隨 GPT-5.5 推出,而週二的 Instant 版本沿用了相同結構。

對一家每天處理 1,000 萬個法律審查提示詞代幣的企業律師事務所而言,每日 API 支出將達 50,000 美元——這個數字只有在模型錯誤率低到足以避免昂貴的人力修正循環時,才能換來快速採用。在虛構內容減少 52.5% 的情況下,OpenAI 的主張是審查成本將縮減至足以讓每代幣價格上漲站得住腳。企業買家是否接受此論點,將決定 GPT-5.5 Instant 在生產管線中取代舊版模型的速度。

OpenAI 亦提供批次與彈性定價,為標準 API 費率的一半,這項讓步使價格敏感的工作負載得以留在平台上,同時 OpenAI 可從對延遲敏感的企業應用中獲取利潤率。快取輸入代幣定價為每百萬 0.50 美元,大幅降低具有重複上下文字首的應用有效成本——這是法律與金融文件審查中的常見模式。

GPT-5.5 Instant 對決 Claude Opus 與 Gemini 2.5:指標領先何處具商業實質意義

截至 2026 年 5 月的競爭態勢中,OpenAI、Anthropic、Google DeepMind 與 DeepSeek 均在數週內相繼推出具競爭力的模型。Anthropic 的 Opus 4.7 定位為更安全、更貼近字面解讀的選擇;DeepSeek V4 Pro 與 V4 Flash 則在價格與開放權重取用上積極競爭。Google 的 Gemini 2.5 Pro 在多模態任務上取得高分。

GPT-5.5 Instant 在 AIME 2025 上取得 81.2 分,領先 Opus 4.7 與 DeepSeek V4 Pro 在同一指標上的公開成績。對商業部署更重要的是,ChatGPT 的既有使用者基礎——3 億月活躍使用者,加上建構於 OpenAI API 之上的開發者生態系——意味著指標改善轉化為營收的速度,OpenAI 優於必須先爭取通路佈局的競爭對手。即便 Anthropic 的模型在準確度上追平 GPT-5.5 Instant,仍須取代既有整合才能爭取企業支出。

Plus 與 Pro 使用者的 Gmail 與檔案整合,構築了一道純模型競爭對手難以複製的通路護城河。當使用者的 AI 助理已掌握其收件匣、上傳合約與過往對話的脈絡時,轉換成本隨之提高。OpenAI 並非唯一建構此類脈絡飛輪的公司——Gemini 與 Google Workspace 的整合即為直接對應——但 OpenAI 是首家在此使用者規模上部署此功能的業者。

記憶來源、Gmail 存取,與企業必須查核的隱私架構

GPT-5.5 Instant 的記憶來源功能旨在呈現影響特定回應的個人脈絡具體片段:過往對話、上傳文件、Gmail 郵件串(適用於 Plus 與 Pro 訂閱使用者)。使用者可檢視每個來源、修正錯誤歸因,或刪除個別記憶條目。臨時聊天模式適用於不應留下持久記憶軌跡的會話。

此功能是對企業法務與法遵部門針對缺乏可查核性、運作於使用者資料之上的 AI 助理所提出異議的直接回應。醫療照護機構與律師事務所之所以抗拒部署大型語言模型助理,部分原因在於無法向監管機關或客戶說明模型針對特定建議所引用的資料來源。記憶來源創造了一份紙本軌跡——或者說,一份可刪除的數位軌跡——使模型的推理過程得以部分檢視。

OpenAI 的推出順序也透露其優先對象:Plus 與 Pro 使用者率先在網頁版取得 Gmail 與檔案整合功能;Free、Go、Business 與企業方案則在隨後數週陸續開放。Business 與企業訂閱使用者對法遵要求最為嚴格,但同時也須經過企業內部 IT 審查流程,即使功能在第一天就上線,也無法立即採用。分階段推出讓 OpenAI 有時間在這些方案上線前,先完成資料處理架構的相關文件紀錄。

對企業買家而言,關鍵的查核問題不在於記憶體來源是否存在,而在於 OpenAI 如何處理背後的資料保留機制。該功能會顯示模型使用了哪些資料,但本身並不保證 OpenAI 的基礎設施會在使用者刪除記憶體項目時,一併刪除原始資料。這項區別將主導受監管產業在 2026 年剩餘時間內的採購討論。

停用作為強制手段:OpenAI 的調升評等策略與其風險

GPT-5.3 Instant 仍對付費使用者開放三個月,之後將停用。GPT-4o 在 2026 年 2 月停用,儘管使用者強烈反彈,OpenAI 仍堅持該時間表——包括面對開發者請願與負面報導——這顯示其將強制升級視為維持產品一致性所必需的工具。

其商業邏輯很直接:同時執行多個世代模型會使基礎設施成本倍增,並使安全監控更加複雜。OpenAI 的運算資源預算已因 Stargate 的資本適足要求而承壓,與其維持對偏好舊版回應風格使用者的向下相容,不如將資源投入 GPT-5.5 等級的推論運算。

風險在於,強制遷移可能疏離那些在特定模型版本上建置穩定生產應用的開發者族群。企業合約常為確保可重現性而指定模型版本。三個月的停用窗口以採購標準而言偏短,而 OpenAI 加速停用時間表的模式——GPT-4o 在積極支援下僅維持不到 18 個月——已開始被企業 RFP 視為供應商風險因素。包括 Anthropic 在內的競爭對手,則以更長的模型支援承諾作為差異化優勢。

週二的發布也透露 OpenAI 打算輪替 Instant 方案的速度。從 GPT-5.3 到 GPT-5.5 Instant 的轉換,在 GPT-5.5 於 4 月首次發布後約六週即完成,比 GPT-4 到 GPT-4o 的遷移週期更快。若此節奏持續,企業 IT 團隊應預期每季進行模型審查,而非每年一次。

GPT-5.5 Instant 背後的數據——幻覺減少 52.5%、在 AIME 與 GPQA 上領先公開領域的指標分數,以及由 Gmail 支援的個人化層——使週二的發布成為 OpenAI 捍衛其價格溢價最有力的近期論據。這項論據能維持多久,取決於 Anthropic 的 Opus 4.7、Google 的 Gemini 2.5 與 DeepSeek V4 Pro 多快縮小準確度差距,也取決於 OpenAI 的記憶體來源架構是否夠穩健,足以滿足法遵主管與總法律顧問——他們如今是六位數企業交易的關鍵路徑。在法律與醫療領域勝出的模型,未必是最有能力者;而是其錯誤軌跡最容易向監管機關解釋的那一個。OpenAI 剛把證據推向更接近表面之處。

Share:XLinkedIn
每日簡報

BossBlog 每日快報

一封信講完當天的 AI 與市場重點——13F 機構持股的異動、國會議員申報的交易,以及有什麼變了。沒有固定的發送時間,也不寫廢話:有值得寄的內容才寄。

隨時可退訂。名單不會外流或販售。

Cite this article

Bossblog. (2026). OpenAI GPT-5.5 Instant 將幻覺減少 52.5%,數學得分 81.2. Bossblog. https://ai-bossblog.com/blog/2026-05-06-openai-gpt-5-5-instant-hallucination-reduction

More in this section
AIJun 3, 2026
Anthropic 的 Claude Mythos 擴展至 150 家機構,與 OpenAI 的 GPT-5.5-Cyber 相抗衡。

Anthropic 正將其網路安全人工智慧 Claude Mythos 擴展至 15 個以上國家、約 150 家機構,其中包括關鍵基礎設施。此舉加劇了與 OpenAI GPT-5.5-Cyber 的競爭。

AIMay 31, 2026
Anthropic 以 9650 億美元估值籌集 650 億美元,超越 OpenAI

Anthropic 完成 650 億美元 H 輪募資,估值達 9,650 億美元,超越 OpenAI 的 8,520 億美元。這家人工智慧新創公司亦公布 470 億美元的營收年化率,並推出 Claude Opus 4.8。

AIMay 30, 2026
DeepSeek 大幅調降價格 75%,以低於 Anthropic 和 OpenAI 最多 17 倍的價格搶市。

DeepSeek 將 V4 Pro 的 75% 降價永久化,使其輸入成本比 Anthropic 的 Claude Sonnet 或 OpenAI 的 GPT 5.5-Med 便宜 7 倍,輸出成本便宜 17 倍。與此同時,Anthropic 籌集了 650 億美元,金額幾乎增加兩倍。