Skip to content
Back to Archive
AIAI 撰稿2 min read

Mistral AI 推出 128B 引數模型,具 256k 上下文長度與遠端程式設計代理功能

Mistral AI 推出 Mistral Medium 3.5,這是一款 128B 密集模型,具備 256k 上下文視窗,在 SWE-Bench 上得分 77.6%,並在 Vibe 中推出於雲端執行的遠端程式設計代理。

Mistral AI 推出 128B 引數模型,具 256k 上下文長度與遠端程式設計代理功能

Mistral AI 於 5 月 2 日同步發布三項產品:推出 Mistral Medium 3.5,這是一款 1,280 億引數的密集模型,將先前三個產品整合為單一權重集;在 Vibe 開發者工具中推出遠端程式代理,讓雲端託管的代理會話能在開發者離開時持續執行;並在 Le Chat(該公司的消費級與企業級聊天產品)中推出 Work 模式,可透過平行工具呼叫自主依序處理電子郵件、行事曆與文件任務。這三合一發布是對歐洲開放權重人工智慧發展方向的明確表態——朝向完整的代理能力,而非僅追求指標競賽。發布時間點在 Mistral 取得 8.3 億美元債務融資以擴建巴黎地區資料中心數週之後,並非巧合:Mistral 需要具可信度的基礎設施來大規模銷售遠端執行服務,也需要足夠強大的模型,讓企業願意付費使用託管版本,而非在四顆 GPU 上自行託管開放權重。

Medium 3.5 將聊天、推理與程式能力整合為單一 1,280 億引數模型

Google 的 TPU 晶片助其避免興建數十座新資料中心...

在此次發布之前,Mistral 維持多條獨立模型產品線:一般聊天(Medium 3.1)、重度推理任務(Magistral)與程式設計(Devstral 2)。Medium 3.5 取代了這三者。其架構為密集式(每個代幣啟動 1,280 億引數),而非專家混合架構,這意味著推論成本具有確定性,延遲可預測,對於需要在數百個平行步驟中維持一致吞吐量的代理管線而言,是實務上的必要條件。上下文視窗為 256,000 個代幣,單次處理約 20 萬字,足以涵蓋整個中型程式碼庫或一整年的電子郵件往來。

指標表現是該公司主打的頭條數據:在 SWE-Bench Verified(業界標準評測,測試模型能否解決活躍開源儲存庫中的真實 GitHub 問題)上獲得 77.6% 分數。此成績使 Medium 3.5 在此指標上領先 Devstral 2,並高於 Qwen 3.5 397B A17B,Mistral 並宣稱在多項程式子任務上與 Claude Opus 4.5 持平或勝出。此外,τ³-Telecom 得分 91.4 顯示其在領域專業推理上具競爭力,對電信企業客戶(佔 Mistral 歐洲客戶群相當比重)尤為相關。該模型以修改版 MIT 授權提供,允許商業使用且最低僅需四顆 GPU 即可自行託管,刻意與 OpenAI 及 Anthropic 僅限專有 API 的立場形成對比。

一項架構上的新增功能在實務上至關重要:新的 reasoning_effort 引數讓開發者能切換模型在回答前於內部思維鏈上投入多少運算資源。將其設低可用於快速的自動補全式互動;設高則適用於多步驟程式碼生成或長期規劃。相同的模型權重可同時應付光譜兩端的需求,這消除了分別維護快速與慢速模型端點的管理負擔。

營收算計:每百萬代幣 1.50 美元對上 8.3 億美元債務

科技巨頭組成產業聯盟,協助開發次世代 AI 晶片...

Mistral 已將 Medium 3.5 定價為每百萬輸入代幣 1.50 美元、每百萬輸出代幣 7.50 美元,透過其 API 提供服務。就多數企業工作負載而言,這使其價格介於 Claude Sonnet 4.6 與 Gemini 3.1 Pro 之間。考量該模型的指標地位,此定價頗具侵略性,但放在公司的資本結構脈絡下則屬合理:Mistral 於 3 月籌集 8.3 億美元債務融資,用於打造一座巴黎周邊的叢集,以處理遠端代理運算資源,且其需要將 API 流量轉化為可償付該債務的營收。

策略槓桿在於代理利潤率擴張。一名人類開發者與 Le Chat 互動一小時,可能消耗 50 萬個代幣。一場 Vibe 遠端代理工作階段在複雜的 pull request 上徹夜執行,可能消耗 3,000 萬至 5,000 萬個代幣,以每百萬輸出 7.50 美元計價。若 Mistral 能從 Cursor、GitHub Copilot 與 Cognition 的 Devin 競逐的工程工作流程自動化市場中,哪怕僅搶下部分市占,其每使用者經濟效益將與標準聊天 API 顯著地不同。這筆債務融資在某種程度上是一場賭注:當編碼代理從數小時的工作階段進展到隔夜批次執行時,代幣消耗將呈非線性成長,而 Mistral 的資料中心產能已定位好要搶下其中一部分量能。

修改後的 MIT 授權創造了雙層營收漏斗。新創公司與學術機構自行託管;需要保證正常執行時間、法遵認證與整合式帳單的企業則傾向呼叫 API。Mistral 的產品策略假設開放權重釋出能產生開發者關注度,最終轉化為企業 API 合約,此模式在 Meta 生態系中的 Llama 4 以及 Mistral 自身先前釋出的版本上均已奏效。

Vibe 遠端代理將瓶頸從開發者轉移至機器

Vibe 遠端代理功能在架構上簡單明瞭,但在操作上意義重大。先前,Vibe 以本機 CLI 工作階段執行:開發人員需保持終端機開啟、監控進度,並手動處理中斷。自 5 月 2 日發布起,開發人員可透過任務描述(例如「重構驗證模組以使用 JWT v5」、「調查 CI 管線在 commit a3f92b 失敗的原因」)啟動工作階段,然後將該工作階段傳送至雲端。代理在隔離的沙盒中執行,利用 256k 上下文視窗將完整程式碼庫保存在記憶體中,並在完成後於 GitHub 上開啟拉取請求。開發人員回來時看到的是可供審查的 PR,而非半完成的終端機輸出。

競爭意義十分直接。GitHub Copilot Workspace 於 2024 年發布,鎖定相同的非同步編碼工作流程,並具備 GitHub 原生整合的優勢,但其運作於 GitHub 自家的模型骨幹上。Cursor 於 2025 年超越 5 億美元年化營收,已宣布將於 2026 年中推出類似的非同步代理功能。Cognition 的 Devin 是最早的自動化軟體工程師,在轉向企業部署前以 20 億美元估值完成募資,其運作於封閉權重的專有基礎設施上。Mistral 的舉措是提供可比的非同步代理體驗,採用開放權重模型,企業可對其進行查核、針對專有程式碼進行微調,並在監管要求下自行託管。

Vibe 的整合鏈對採用至關重要:代理可在開始工作前讀取 GitHub issues、提取 Linear tickets,並將 Sentry 事件日誌納入上下文。雙向迴路(常規任務無需人工介入即可從 issue 到 PR)是設計目標。多個工作階段可並行執行,這意味著團隊可以批次排隊一個衝刺週期的重構或測試撰寫任務,並讓它們在夜間執行。

Le Chat 工作模式與企業聯結器整合競賽

Le Chat 中的工作模式將相同的代理能力延伸至非開發人員工作流程。代理執行於 Medium 3.5 上,以並行而非序列方式呼叫工具,並在敏感操作(傳送電子郵件、刪除行事曆事件、修改共享文件)前要求明確確認。已確認的聯結器清單包括電子郵件(Gmail、展望)、行事曆(Google Calendar、微軟 Calendar)、文件(Google Drive、OneDrive、Notion)以及專案工具(Jira、Linear、Slack、微軟 Teams)。此廣度使其直接與微軟的 Copilot for 微軟 365(2026 年 4 月已達 2,000 萬付費席位)以及 Anthropic 的 Claude for 企業(自 4 月宣布五角大廈合作夥伴關係以來,一直迅速增加聯結器深度)展開競爭。

平行工具呼叫架構是 Mistral 強調的效能差異化關鍵。循序式代理系統(執行一個工具、等待輸出、決定下一步)會在長任務鏈中累積延遲。Work mode 在依賴關係允許的情況下同時呼叫多個工具,將 20 分鐘的循序工作流程壓縮至約 6 至 8 分鐘的實際時間。對於每天處理 80 至 120 封電子郵件、同時進行行事曆協調與文件審閱的知識工作者而言,這種壓縮的實用價值超越指標分數本身。

行動前確認的設計,回應了企業責任疑慮——此疑慮已拖慢受監管產業的自動化代理採用。金融服務業尤其需要在代理執行對外通訊或修改法遵紀錄前,設定人為介入的環節。Mistral 押注的是:透明的推理軌跡加上明確的核准關卡,足以在純自主尚不具法律可行性的產業中,解鎖企業採購。

開放權重作為歐洲地緣政治避險

Mistral 的開放權重策略始終帶有地緣政治潛台詞,而該公司如今將其明確化。Medium 3.5 的修改版 MIT 授權,設計上允許完整商業使用,同時保留限制,防止其他 AI 公司提取權重、在未註明出處的情況下建構封閉式衍生性金融商品。此授權結構,加上巴黎資料中心,將 Mistral 定位為歐洲對抗美國超大規模雲端業者鎖定效應與中國國家關聯 AI 基礎設施的解答。

歐盟人工智慧法案(AI Act)於 2026 年對高風險系統全面適用,為缺乏可稽核歐洲基礎設施的美國來源模型製造了監管摩擦。Mistral 提供在歐盟管轄範圍內進行內部部署的能力,且權重可供客戶法務團隊檢視,這是 OpenAI 與 Anthropic 目前無法在相同成本點上匹敵的採購論點。這並非業務模式的附帶結果;Mistral 明確鎖定歐洲電信商、銀行與政府機構,這些機構的資料落地要求不容妥協。τ³-Telecom 指標結果幾乎肯定是為了打動這些客戶而設計。

輝達同步推出 Nemotron 3 系列,包括引數量達 300 億的多模態 Nano Omni,其吞吐量比同類開源多模態模型高出 9 倍,凸顯開放權重代理型 AI 領域在數週內已變得何等擁擠。輝達與 Mistral 皆隨模型權重一併推出可上線生產的代理框架:Nemotron 3 內含適用於代理訓練的強化學習環境,而 Mistral 則推出 Vibe 與 Work 模式。這意味著單靠模型發布已不再能左右企業採購決策。指標競賽已成為基本門檻;真正的差異化在於周邊的代理執行環境。

Medium 3.5 每百萬代幣 1.50 美元的定價,唯有在 Mistral 能以代幣用量填滿巴黎資料中心時才可持續,而這股用量來自選擇 API 而非自架部署的企業。Mistral 為 Le Chat Work 模式新增的每個聯結器、讓 Vibe 對開發團隊更具黏著度的每項 GitHub 整合,都是維繫代管端點的手段。開放權重是漏斗頂端;代理執行環境才是變現引擎。此一結構可能成為 2026 年歐洲人工智慧的定義性範本。

Mistral 已開闢出一條通往企業人工智慧基礎設施的可行第二路徑,無需仰賴超大規模雲端業者作為分發層。128B 模型、遠端代理執行環境,加上背後支撐叢集運作的 8.3 億美元資本,此組合是迄今該願景最完整的體現。

Share:XLinkedIn
每日簡報

BossBlog 每日快報

一封信講完當天的 AI 與市場重點——13F 機構持股的異動、國會議員申報的交易,以及有什麼變了。沒有固定的發送時間,也不寫廢話:有值得寄的內容才寄。

隨時可退訂。名單不會外流或販售。

Cite this article

Bossblog. (2026). Mistral AI 推出 128B 引數模型,具 256k 上下文長度與遠端程式設計代理功能. Bossblog. https://ai-bossblog.com/blog/2026-05-04-mistral-128b-model-remote-coding-agents

More in this section
AIMay 30, 2026
Mistral AI 目標營收達 10 億歐元,投資 40 億歐元於資料中心

Mistral AI 宣布目標在 2026 年達到 10 億歐元營收,並在法國與瑞典投資 40 億歐元於資料中心,藉由較 ASML 解決方案快 120 倍的技術,擴展至工業人工智慧領域。

CompaniesMay 29, 2026
Mistral 探索客製化晶片,人工智慧電力需求於 2030 年達 1,000 TWh

Mistral 執行長 Arthur Mensch 表示,歐洲在人工智慧基礎設施方面落後,該公司投資 40 億歐元於資料中心,並探索自行設計晶片,以掌握更多技術層面的主導權。

ResearchMar 30, 2026
Mistral AI 為巴黎人工智慧資料中心取得 8.3 億美元債務融資

法國人工智慧新創公司 Mistral 向七家銀行籌集 8.3 億美元債務融資,用於在巴黎地區興建配備 13,800 顆輝達晶片的資料中心,目標是在 2028 年前打造 1.4 吉瓦的人工智慧園區。