XDOF 是一家新創公司,在全球招募並訓練遠端操作員及以自我為中心的資料操作員,以收集機器人訓練資料,該公司已從 Thrive Capital、Spark Capital、a16z、Lux 和 WndrCo 募得 7000 萬美元。共同創辦人兼執行長 Philipp Wu 透露,公司目前約有 60 名員工,服務 20 家客戶,其中包括未具名的前沿人工智慧實驗室,這些實驗室對高品質的實體世界訓練資料需求日益迫切。XDOF 為這些實驗室和機器人公司打造完整的資料管線,涵蓋收集工具、標註系統和品質控制基礎設施。這輪募資顯示,收集真實世界機器人資料這項骯髒且不討好的工作,已成為人工智慧產業的關鍵瓶頸,即便最大的實驗室正投入數十億美元於運算資源和模型架構。為何此事現在重要:隨著七大工業國集團(G7)領袖協調前沿人工智慧風險,且歐盟規劃人工智慧超級工廠,訓練具身人工智慧模型的競賽正將瓶頸從運算資源轉向資料,而 XDOF 正將自身定位為該資料的關鍵勞動力仲介。
這 7000 萬美元的用途

XDOF 的核心商業模式看似簡單,但營運上相當複雜:在多元地理區域僱用真人操作員,執行可產生機器人與人工智慧系統訓練資料的任務。該公司的遠端操作員透過遙控機器人示範任務,而第一人稱視角資料操作員則配戴攝影機,錄製組裝、烹飪或導航等活動的第一人稱示範。這些資料隨後經過清理、標註,並結構化為前沿人工智慧實驗室的訓練流程。這輪 7,000 萬美元募資由 Thrive Capital 與 Spark Capital 領投,a16z、Lux 及 WndrCo 參投,資金將用於擴張 XDOF 的全球操作員人力、開發更精密的資料收集工具,並擴大其標註基礎設施。與合成資料生成或模擬為基礎的方法不同,XDOF 的做法產出的是真實世界資料,捕捉實體環境中混亂多變的變異性,包括光線變化、物體形變以及人類行為的不可預測性。這正是前沿實驗室訓練機器人、使其能超越受控環境進行泛化所需的資料。該公司 20 家客戶(包括未具名的前沿人工智慧實驗室)正為這些資料支付溢價,因為其內部模擬流程已遭遇報酬遞減。XDOF 的募資反映了一項經過深思的押注:實體世界訓練資料的需求將超越合格真人操作員的供給,從而建立持久的競爭護城河,並對難以輕易複製其全球操作員網路的前沿實驗室擁有直接定價能力。
資金如何流經損益表

這筆 7,000 萬美元的注資將直接投入 XDOF 兩大成本中心:人力與基礎設施。在多個地區招募及訓練遠端操作員,需要在招募、訓練計畫與品質保證系統上投入大量前期資金。每位操作員都必須經過一致性、可靠性及遵循精確任務規範能力的審核。XDOF 的利潤率取決於其能否標準化操作員訓練,並在規模擴大時降低每項任務的成本。該公司亦重金投資其專有資料收集工具與標註平台,這使其有別於更便宜、品質較低的資料標註服務。對 XDOF 的客戶——那些在運算資源與人才上花費數十億美元的前沿人工智慧實驗室而言,高品質訓練資料的成本僅佔總研發支出的一小部分,但卻是決定模型表現的關鍵因素。若 XDOF 能證明其資料能將機器人成功率提升即便僅數個百分點,其定價能力將相當可觀。該公司的營收模式採用每項任務收費、訂閱制取得精選資料集,或客製化流程合約。XDOF 目前僅有 60 名員工與 20 家客戶,仍處於早期擴張階段,但這輪 7,000 萬美元募資(消息人士指出估值超過 3 億美元)意味著投資人預期,隨著前沿實驗室擴大機器人計畫,營收將快速成長。淡馬錫 75 億美元的人工智慧基礎設施押注及歐盟超級工廠計畫,進一步驗證了流入人工智慧的資本最終將觸及像 XDOF 這樣的資料供給鏈。
訓練資料市場的競爭重組
XDOF 的募資案重塑了人工智慧訓練資料的競爭格局,此領域傳統上由規模 AI 與 Appen 等低成本標註平台主導。這些公司專注於靜態資料,包括影像、文字與影片,用於感知與語言模型。XDOF 則鎖定新興的具身人工智慧訓練資料市場,此市場需要動態的真實世界示範,而非靜態標註。這是一門本質上不同的生意:它需要能實際執行任務的人力操作員,而非僅在螢幕上點選方框。進入門檻較高,因為 XDOF 必須招募、訓練並管理一個能一致執行任務的分散式勞動力。Physical Intelligence 與 Covariant 等競爭對手已建立自家內部資料蒐集作業,但它們服務的是自身模型,而非向第三方出售資料。XDOF 的賭注在於,前沿實驗室會傾向於向中立供應商購買資料,而非自行建立昂貴且難以快速規模化的操作員網路。該公司的 20 家客戶包括未具名的前沿人工智慧實驗室,涵蓋該領域最知名的參與者,包括 Anthropic、OpenAI 與 Google,這些公司均出席了 G7 人工智慧風險工作午餐會。這些實驗室正競相開發通用型機器人,且需要來自多種環境與任務的多樣化訓練資料。XDOF 的全球操作員網路賦予其資料多樣性優勢,這是單一實驗室自行蒐集資料所無法比擬的。此次募資也對規模 AI 等既有業者形成壓力,迫使它們開發自身的具身資料能力,否則恐錯失下一波人工智慧基礎設施支出浪潮。
對超大規模雲端業者與企業買家的下游影響
XDOF 的成長將對更廣泛的人工智慧基礎設施生態系產生二階效應。隨著前沿實驗室訓練出能力更強的機器人,對運算資源、網路及資料中心產能的需求將隨之增加。亞馬遜網路服務、微軟 Azure 及 Google 雲端等超大規模雲端業者,將需要為機器人訓練工作負載配置繪圖處理器叢集,此類工作負載較語言模型訓練更具延遲敏感性且資料密集度更高。F5 與 Equinix 的合作,結合 F5 AI Guardrails 與 Equinix 分散式人工智慧中心,涵蓋 280 多座資料中心及 10,000 多家客戶,凸顯企業對跨混合雲及多雲環境中安全、受治理的人工智慧部署之需求。隨著機器人從實驗室走向工廠與倉庫,企業買家將要求機器人人工智慧具備與語言模型同等級的安全與治理控管。XDOF 的資料管線需與這些分散式基礎設施平台整合,確保訓練資料能跨地域安全地收集、傳輸及處理。歐盟的人工智慧超級工廠計畫及淡馬錫 750 億美元的人工智慧基礎設施投資,將為機器人訓練創造更多運算產能,但若缺乏高品質訓練資料,此類產能將形同虛設。XDOF 作為資料供應商的角色,使其位居勞動密集的資料收集與資本密集的運算基礎設施之交匯點。該公司的成功將取決於其能否以比超大規模雲端業者建置運算產能更快的速度擴展操作員網路,為實體人工智慧打造均衡的供應鏈。
七大工業國集團與歐盟的政策及策略訊號
XDOF 的加薪時機,正值全球政策制定者應對前沿人工智慧影響之際。在七大工業國集團(G7)峰會上,各國領袖承諾就人工智慧風險加強協調,並責成財政官員、監管機構及網路安全專家評估前沿模型可能對金融穩定、生產力及勞動市場造成的衝擊。來自 Anthropic、OpenAI 及 Google 的人工智慧高層出席了工作午餐,顯示大型實驗室正主導政策討論。法國總統馬克宏(Emmanuel Macron)特別推動透過「可信賴夥伴」計畫擴大 Anthropic Mythos 模型的取用管道,暗示各國政府希望掌控哪些實體能取得最先進的人工智慧系統。對 XDOF 而言,此政策環境既是機會也是風險。一方面,政府對人工智慧安全與穩健性的關注,將提升對高品質訓練資料的需求,以減少模型失誤與偏誤;另一方面,針對人工智慧訓練資料的監管,尤其是隱私、同意權及勞動實務方面,將對跨司法管轄區營運的資料蒐集新創公司帶來沉重的法遵成本。歐洲執委會規劃的人工智慧超級工廠及大規模運算基礎設施,將提供集中化的運算資源,XDOF 客戶可直接取用,加速機器人訓練週期並降低每次實驗的延遲。G7 對勞動市場影響的關注,對 XDOF 尤為切身,因其商業模式依賴人類操作員執行機器人最終將自動化的任務。這種矛盾——訓練機器人來取代那些訓練它們的工人——將隨著實體人工智慧規模擴大,成為核心政策辯論焦點。
這筆 7,000 萬美元的募資使 XDOF 定位為下一波人工智慧發展的關鍵基礎設施供應商,但公司面臨重大的執行風險。在維持資料品質與一致性的同時,擴張全球營運人員規模的難度眾所周知,先前以人機協作方式進行資料收集的嘗試已證明這一點。公司還必須應對地緣政治風險:其營運人員可能位於勞動法規或資料隱私監管不穩定的司法管轄區。隨著前沿實驗室推進通用型機器人的發展,對多元、真實世界訓練資料的需求只會更加強烈,但來自合成資料生成器與快速進步的模擬平台的競爭也將隨之加劇。XDOF 的賭注在於,對於最困難的機器人問題——包括可變形物體的操作、非結構化環境中的導航以及人機互動——真實世界資料仍將無可取代。如果公司能透過營運人員網路效應與專有工具建立持久的護城河,它可能成為具身人工智慧產業事實上的資料供應商。七大工業國集團(G7)對人工智慧風險的協調,以及歐盟的巨型工廠投資,顯示各國政府將日益把訓練資料視為戰略性基礎設施,可能創造出有利於 XDOF 等既有參與者的新監管框架。對投資人而言,問題在於 XDOF 能否以足夠快的速度擴張其勞動密集型模式,在合成資料縮小差距之前搶佔市場。該公司的營運人員網路已橫跨多個大洲,其專有註記平台每週處理數千個任務示範。這些營運指標雖然仍屬初期規模,但已讓投資人對 XDOF 能提供前沿實驗室所需的量能與一致性抱持信心。
BossBlog 每日快報
一封信講完當天的 AI 與市場重點——13F 機構持股的異動、國會議員申報的交易,以及有什麼變了。沒有固定的發送時間,也不寫廢話:有值得寄的內容才寄。
隨時可退訂。名單不會外流或販售。