Skip to content
Back to Archive
AIAI 撰稿1 min readUpdated

DeepSeek 開源其訓練堆疊與晶片,直攻 CUDA 的護城河

DeepSeek 最新發布的意義,與其說是模型行銷,不如說是對主導人工智慧叢集、訓練任務與推論經濟之軟體層的一次嚴肅開源攻勢。

DeepSeek 開源其訓練堆疊與晶片,直攻 CUDA 的護城河

DeepSeek 不只是發布了另一個模型檢查點。短短數週內,這家中國實驗室接連推出 DeepEP、DeepGEMM、FlashMLA 與 EPLB 四個程式庫,揭露其在大規模混合專家系統中如何處理專家平行通訊、矩陣運算、注意力核心與負載平衡。個別數據正是基礎設施工程師會立刻注意到的數字:DeepEP 宣稱其節點內分派在 H800 NVLink 上可達 153 GB/s,節點間分派在32路專家平行下經RDMA可達58 GB/s,而其低延遲路徑即使在256路專家平行下仍可將分派時間維持在194微秒。DeepGEMM宣稱在H800上可達1,550 TFLOPS。FlashMLA 則表示其更新後的核心在 H800 SXM5 上可達 660 TFLOPS。在 GitHub 上,開發者對這些發布的態度與其說是研究新奇物,不如說是可用的積木:截至 4 月 24 日,FlashMLA 獲得超過 12,500 顆星,DeepEP 約 9,200 顆,DeepGEMM 近 7,000 顆。這就是此事重要的原因。DeepSeek 正將內部系統工藝轉化為公開基礎設施。對競爭對手、新創公司與開放實驗室而言,這提供了在 OpenAI、Anthropic 與 Google 圍牆之外重現前沿規模效率的更清晰路徑。對輝達而言,威脅更為微妙:不是晶片需求的突然流失,而是第一個可信的跡象,顯示將 AI 建構者綁定於 CUDA 的軟體習慣可以被外部鬆動。

DeepEP 將 MoE 網路變成可重複使用的產品

DeepSeek 的新 AI 模型似乎是最好『開放』模型之一

DeepEP 將 153 GB/s節點內頻寬與194微秒分派時間包裝成其他實驗室實際可部署的軟體。

DeepSeek 開源行動的機械層面意義始於 DeepEP,因為 MoE 系統的成敗取決於將代幣送往正確專家的成本,以及在浪費 GPU 運算週期的情況下取回結果。DeepEP 專為專家平行中的全對全通訊而建,這是訓練與推論迴圈中啟用值必須跨 GPU 分派再進行結合的部分。實務上,這往往是雄心勃勃的叢集設計變成昂貴瓶頸之處。透過發布一個針對高吞吐量與低延遲路徑最佳化的程式庫,DeepSeek 交給市場的東西遠比一張指標投影片更有價值:一個實作。

Share:XLinkedIn
每日簡報

BossBlog 每日快報

一封信講完當天的 AI 與市場重點——13F 機構持股的異動、國會議員申報的交易,以及有什麼變了。沒有固定的發送時間,也不寫廢話:有值得寄的內容才寄。

隨時可退訂。名單不會外流或販售。

Cite this article

Bossblog. (2026). DeepSeek 開源其訓練堆疊與晶片,直攻 CUDA 的護城河. Bossblog. https://ai-bossblog.com/blog/2026-04-24-deepseek-open-sources-training-stack

More in this section
AIJun 18, 2026
DeepSeek 籌資 74 億美元;SpaceX 以 600 億美元收購 Cursor

DeepSeek 完成 74 億美元募資輪,而 SpaceX 以 600 億美元股票收購人工智慧編碼工具 Cursor。Anthropic 因美國出口管制暫停 Fable 與 Mythos 模型。

AIJun 17, 2026
DeepSeek 完成創紀錄的 74 億美元融資輪,SpaceX-Google 人工智慧交易達 300 億美元

中國人工智慧實驗室 DeepSeek 完成 74 億美元募資輪,而 SpaceX 與 Google 的人工智慧基礎設施協議可望創造 300 億美元營收。

AIJun 17, 2026
DeepSeek 在中國人工智慧募資輪中籌得 74 億美元,創下紀錄

中國人工智慧實驗室 DeepSeek 完成首輪募資,金額達 74 億美元,顯示中國在出口管制下仍積極挑戰美國人工智慧地位。