DeepSeek 不只是發布了另一個模型檢查點。短短數週內,這家中國實驗室接連推出 DeepEP、DeepGEMM、FlashMLA 與 EPLB 四個程式庫,揭露其在大規模混合專家系統中如何處理專家平行通訊、矩陣運算、注意力核心與負載平衡。個別數據正是基礎設施工程師會立刻注意到的數字:DeepEP 宣稱其節點內分派在 H800 NVLink 上可達 153 GB/s,節點間分派在32路專家平行下經RDMA可達58 GB/s,而其低延遲路徑即使在256路專家平行下仍可將分派時間維持在194微秒。DeepGEMM宣稱在H800上可達1,550 TFLOPS。FlashMLA 則表示其更新後的核心在 H800 SXM5 上可達 660 TFLOPS。在 GitHub 上,開發者對這些發布的態度與其說是研究新奇物,不如說是可用的積木:截至 4 月 24 日,FlashMLA 獲得超過 12,500 顆星,DeepEP 約 9,200 顆,DeepGEMM 近 7,000 顆。這就是此事重要的原因。DeepSeek 正將內部系統工藝轉化為公開基礎設施。對競爭對手、新創公司與開放實驗室而言,這提供了在 OpenAI、Anthropic 與 Google 圍牆之外重現前沿規模效率的更清晰路徑。對輝達而言,威脅更為微妙:不是晶片需求的突然流失,而是第一個可信的跡象,顯示將 AI 建構者綁定於 CUDA 的軟體習慣可以被外部鬆動。
DeepEP 將 MoE 網路變成可重複使用的產品

DeepEP 將 153 GB/s節點內頻寬與194微秒分派時間包裝成其他實驗室實際可部署的軟體。
DeepSeek 開源行動的機械層面意義始於 DeepEP,因為 MoE 系統的成敗取決於將代幣送往正確專家的成本,以及在浪費 GPU 運算週期的情況下取回結果。DeepEP 專為專家平行中的全對全通訊而建,這是訓練與推論迴圈中啟用值必須跨 GPU 分派再進行結合的部分。實務上,這往往是雄心勃勃的叢集設計變成昂貴瓶頸之處。透過發布一個針對高吞吐量與低延遲路徑最佳化的程式庫,DeepSeek 交給市場的東西遠比一張指標投影片更有價值:一個實作。
BossBlog 每日快報
一封信講完當天的 AI 與市場重點——13F 機構持股的異動、國會議員申報的交易,以及有什麼變了。沒有固定的發送時間,也不寫廢話:有值得寄的內容才寄。
隨時可退訂。名單不會外流或販售。