專訪Axis Robotics創始人Chris,為什麼數據是機器人的「紫蘇葉」

新聞推薦
2026/08/03 上午11:37

這家Physical AI資料引擎公司,宣布完成1200萬美元種子輪融資,Hack VC領投

專訪Axis Robotics創始人Chris,為什麼數據是機器人的「紫蘇葉」

如今談到 AI,大家對上下游已經很熟了。炒存儲的時候知道看光模組、看材料、看設備;炒算力的時候知道看英偉達、看電力、看散熱。

但一說到機器人,大部分人的認知還停留在春晚上那幾台能走兩步的人形機器人,覺得很酷,但除此之外機器人的上下游有哪些、機器人行業的「紫蘇葉」是什麼、大多數人都說不上來。

其實機器人產業也有自己的供應鏈,也在分化出越來越多的細分賽道。硬體有人做,模型有人做,但還有一個很少被普通人注意到、卻可能影響機器人能力上限的環節:數據。更準確地說,是給機器人生產「動手經驗」的數據。

大模型的崛起有一個很樸素的前提:互聯網上已經沉澱了巨量文本、圖片、代碼和視頻。模型公司一開始要解決的是怎麼把這些數據吃進去,怎麼擴算力,怎麼訓練更大的模型。

機器人不一樣。

機器人沒有天然的互聯網語料庫。對於可直接用於機器人控制學習的軌跡,通常會包含觀察、動作和機器人狀態;根據任務不同,還可能包含物體狀態、接觸信息、成功條件、任務語義和控制頻率。真實採集慢、貴、危險,還高度依賴具體機器人。

而這,正是 Axis Robotics 誕生的背景。7 月 27 日,這家 Physical AI 數據引擎公司宣布完成 1200 萬美元種子輪融資,由 Hack VC 領投,Nomad Capital、Pi Network Ventures、10K Ventures 及多名天使投資者參投。這筆錢押注的不是又一個造機器人的團隊,而是一個專門給機器人「餵經驗」的團隊。

在這樣的背景下,律動 BlockBeats 採訪了 Axis Robotics 創始人 Chris,Chris 曾任 Chainbase 首席運營官,曾共同領導 Theia 項目,這是 Hugging Face(人工智能模型社區)上首個加密原生基礎模型;此前 Chris 還曾任經緯創投風險投資人,以及貝恩公司管理顧問。

從數據生意到機器人數據缺口

BlockBeats 問:在做 Axis 之前,您過去主要的創業和職業經歷是什麼?您是怎樣接觸到機器人、Physical AI 和機器人數據這個方向的?有沒有一個具體契機,讓您意識到這裡存在一個可以創業的機會?

Chris:在加入 Axis 之前,我之前的创业经历是在数据基础设施领域,有些类似于 Databricks 的方向,帮助企业整理数据、挖掘数据的价值。那段经历让我深刻体会到:数据虽然不起眼,却经常是影响一个公司潜力的关键变量,可以决定一家公司能够达到的高度。

对我来说,2024 年初是一个关键的时间点。当时人工智能非常热门,所有人都在讨论模型、参数和算力,但我越来越意识到,行业正在从「模型驱动」转向「数据驱动」。模型当然很重要,但决定模型能否取得进展的常常是数据。

最让我振奋的是 Surge AI 这家公司。他们成立于2020年,四年内营收就突破了10亿美元,比 Scale AI 还要强劲,而且几乎没有怎么融资。我一直在思考:为什么一家专注于数据的公司能如此迅速发展?我们是不是低估了数据在智能时代的价值?

那段时间,我经常与新加坡南洋理工大学、加州大学伯克利分校、英伟达等朋友交流,听他们讨论学术界和产业前沿的变化。大家逐渐形成了一个清晰的共识:模型迭代速度很快,但数据是基础,而且是最难处理、最不标准、最容易被忽视的层面。从大型语言模型的预训练到后续训练,再到智能体出现后对高质量数据的需求,数据并没有变得不重要,相反,它变得越来越复杂。

于是我开始思考,Physical AI 是否也会走同样的道路?物理世界比文本世界复杂得多。真实环境的变化、传感器噪声、各种边缘案例操作、不同用户习惯,都会极大地增加数据需求。Physical AI 所需的数据量,以及用于后续训练纠错的场景,可能是当今人工智能的数倍,甚至更多。

但当时你去问关于「谁在做 Physical AI 数据」,几乎没有哪个名字能立即被提出。这是一个未来可能催生百亿美元公司的领域,却还没有真正的领头羊。对于创业者来说,这个信号已经非常明显:这值得创业者全力投入。

因此,从2025年夏季开始,我与新加坡南洋理工大学、加州大学伯克利分校的朋友一起系统地讨论技术路线和产品形态,Axis Robotics 也正式启动。

BlockBeats 问:外界在讨论机器人行业时,通常首先关注硬件和模型。但为什么 Axis 团队认为,数据才是这一轮 Physical AI 最可能限制规模化落地的「瓶颈」?

Chris:這是個很好的問題。大模型的發展給我們一個很直接的啟發:一條技術路線被驗證以後,下一階段的能力提升,往往來自數據、算力和模型規模的共同擴大。從 GPT-1 到 GPT-3,我們看到大規模預訓練可以帶來明顯的能力躍遷。

但機器人行業目前還處在更早的階段。今天的硬件和算法其實已經走得不慢了,各種機械臂、人形機器人不斷出現。模型路線也在逐漸收斂,比如 VLA 把視覺、語言和機器人動作連接起來;世界模型學習一個動作發生後,環境可能怎樣變化;WAM 則進一步把對未來狀態的預測和動作生成結合起來。這些方向都有人在做。

問題在於,想讓一個機器人不是只在實驗室裡表演,而是真正在真實環境也能幹活,也就是達到接近語言模型當年「GPT-1 時刻」的那種躍遷,那就需要量級大得多的真實世界交互數據。

打個比方,今天的機器人有點像一個只在教科書上學過游泳的人,理論都懂,但沒下過水。你要讓它真正會游,就得讓它在不同的泳池、不同的水溫、不同的浪裡反復練。這些「下水經驗」就是數據。

但現在公開數據的規模還非常小。

Open X-Embodiment 算是代表性的開放數據集之一了,整合了 21 家機構、22 種機器人、超過 100 萬條軌跡,聽著很多,但跟互聯網級別的數據量比,連零頭都算不上。其他公開數據集很多還停留在幾百小時這個級別。

所以我們判斷,現在卡住機器人基礎模型的,未必是模型結構本身,而是數據的規模和多樣性遠遠沒跟上。如果沒有足夠多跨場景、跨行業的真實數據,再好的模型和硬件也只能在實驗室裡轉圈。數據在這個階段不是錦上添花,而是決定 Physical AI 能不能跨過拐點的關鍵變數。

BlockBeats 問:能不能用最簡單、最直白、最不繞彎子的方法告訴普通人,Axis 是做什麼的?

Chris:如果用最直白的話說,Axis 就是在幫機器人持續積累「動手經驗」。

你可以把機器人想像成一個剛入職的實習生。它腦子不笨,但什麼都沒幹過。你要讓它變成熟手,光給它看操作手冊沒用,它得自己上手做,做完了犯錯,有人糾正,再做一遍,反覆練習。我們做的,就是把這些經驗系統化地生產出來。

從訓練前的準備、任務設計、仿真練習,到真實世界的數據採集,再到數據清洗、模型訓練後的糾錯和持續優化,整條鏈路我們都打通了。我們還搭了網頁端的仿真平台和手機端的採集工具,讓普通人也能參與進來,你在家裡疊衣服、整理桌子,這些日常動作都可以變成機器人的學習素材。

簡單一句話概括就是:Axis 是一台持續給 Physical AI 供給訓練數據、也持續幫它糾錯的數據發動機,讓機器人學得更快、犯錯更少。

把「動手經驗」變成機器人的訓練燃料

BlockBeats 問:你認為針對目前的具身智能數據鴻溝,終局的解法是什麼?第一視角數據、遙操數據和仿真數據,哪一種更好?

Chris:今天行業最大的難題,是數據規模、場景多樣性和真實物理對齊這三件事,很難同時做到。所謂真實物理對齊,就是你數據裡的動作規律得跟真實世界一致,不能虛擬環境裡練得很溜,一到真機就「手生」。

我打個比方。仿真遙操作數據,就像在駕校模擬器上練車。門檻低,不用真車,全球各地的人通過網頁遠程操控虛擬機器人就能產出大量訓練數據。我們再把機器人形態、物體、場景、任務隨機組合,多樣性很快就能鋪開。缺點也很明顯:模擬器再好,也不是真實路況。現實裡的顛簸、突發狀況、不規則的路面,模擬器很難完全還原。模型在虛擬環境裡學會了,上了真機可能還是不行,這就是大家說的「虛實差異」。

第一視角真人數據,就像給老司機裝個行車記錄儀。普通人用手機就能在家裡、辦公室採集真實操作,畫面裡自帶視覺和語言信息,能幫模型理解人類到底是怎麼幹活的。但缺點是畫面裡沒有機器人的精確關節數據,直接拿來訓練精細動作不太夠。

真機遙操作數據,就是真正上路練車了。軌跡精度最高,最貼近真實的物理交互。特別是模型自己操作失敗後,人接管糾正留下的軌跡,對模型改進來說特別有價值。但代價也最高,要真機、要人力,產能有限,沒法無限鋪開。

Axis 實際部署的樣式

所以答案不是哪種更好,而是三種數據各幹各的活:仿真把量鋪起來,第一視角幫模型理解真實世界的常識,真機遙操做精度校準和閉環糾錯。把三種數據接進同一套系統,才有可能真正補上這個缺口。

這也是我們做「混合數據源、雙向閉環引擎」的原因。我們用仿真遙操作數據和第一視角真人數據做雙輪供給,再結合 Human-Gated DAgger。它的做法很直接:模型失敗後由人介入糾正,再把糾正結果送回訓練。這樣,數據經過採集、清洗和增強,進入統一的視覺、語言、動作模型訓練,再到虛實部署、失敗反饋回流和補數據,就形成了一個會自己往前轉的循環。

BlockBeats 問:Axis 最初為什麼選擇從仿真數據做起,現在又開始佈局第一視角數據?這是戰略方向發生了變化嗎?

Chris:這是同一套數據策略的擴展。Physical AI 一定是數據驅動的,而數據的核心指標不是量,而是多樣性,因為多樣性決定泛化能力和魯棒性。我們先做仿真,是因為它可控、可重複,也容易評估。我們可以設計任務、調整場景和機器人形態,採集完成後還能重放、驗證、訓練和測試。它本身就像是一個“世界模型”,是現實世界的虛擬化。

第一視角數據能夠補充真實世界的廣度。最近包括 DreamDojo 在內的研究,讓行業進一步看到了大規模第一視角視頻在學習人類行為和世界規律方面的潛力。這類數據記錄了人怎樣使用工具、處理物體和完成任務,而這些行為分散在不同國家、行業和生活場景中,靠少數實驗室很難覆蓋。

仿真數據更容易由少數平台集中生產,但第一視角數據天然是分散的,需要全球貢獻者共同參與。隨著 NVIDIA、DeepMind 等頭部模型公司對這類數據的需求增加,能否持續地在全球獲取、處理和驗證第一視角數據,會成為一項重要能力。

更重要的是,对 Axis 來說,貢獻者網路、任務分發和數據處理與驗證管線是可以複用的。從仿真擴展到第一視角數據,不是換方向,而是在補齊一套更完整的機器人數據基礎設施。

BlockBeats 問:能帶我們走一遍 Axis 裡的具身智能數據蒐集、加工、訓練的整個過程嗎?

Chris:在 Axis 裡,數據蒐集和處理不是一段一段割裂開的,整個流程是一套端到端的閉環。近期發布的 Axis V2 對我們來說是一次很關鍵的升級:以前 Axis 更像一個單向的數據蒐集站,現在我們把任務生成、數據蒐集、模型訓練、評估優化全接成了一套系統。

第一步是出題。我們會在仿真環境裡,用演算法把機器人本體、目標物體、位置、視覺條件等變量組合起來。比如 10 種動作、10 種物體、10 種擺放方式一組合,任務的多樣性就能很快被指數級地放大。

第二步是做題。全球貢獻者可以通過簡單的網頁或手機端界面完成仿真任務,也可以用移動端的第一視角應用蒐集真實世界裡的操作過程。

第三步是閱卷和加工,這也是最核心的環節。原始數據裡經常有抖動、無效動作、不自然的操作,我們先清洗、平滑、重採樣。然後借助 RoboVerse 把同一批數據在不同仿真環境間流轉,先從輕量級的網頁端蒐集的仿真數據遷移至 Isaac Sim 裡做重放和數據增強,一邊重放一邊改場景材質、光照、攝影機角度、物理參數。就像拿同一道菜譜,換不同的鍋、不同的火、不同的食材再做一遍,一條原始數據就能擴展出很多訓練樣本。

加工完也不是直接一股腦餵給大模型,還要經過成功條件檢查、異常過濾和格式統一,才能進入模型訓練。一輪訓練完成後,我們會讓模型在仿真和評測環境中執行任務,觀察它在哪些場景和狀態下容易失敗,再把這些脆弱環節轉化成新的定向蒐集任務。

模型先自主执行任务,一旦偏离正确路径,贡献者就接管并提供纠正动作。这些纠错数据会重新进入训练,让模型逐步学会处理原来不会的情况。这个飛輪不斷轉,數據、模型和機器人的能力就一起往上走。

所以 V2 的意義不只是多了幾個功能,而是讓 Axis 從一個「收數據的」變成了一套「能幫模型變聰明」的完整系統。

BlockBeats 問:Axis 最近發布了 Dataset V1,這個數據集為什麼重要,它具體證明了什麼?

Chris: Dataset V1 最重要的地方,不是它單純增加了一批數據,而是它初步驗證了一件事:來自大量普通貢獻者的仿真操作,在經過任務設計、成功檢查、過濾、平滑和數擴之後,可以形成對機器人預訓練有用的信號。

V1 包含 207 個操作任務、超過 5 萬條軌跡和 6 萬多個任務及場景變體。在公開的 LIBERO-Plus 評測中,用完整 AXIS 數據繼續預訓練後,π0.5 的總體成功率從 83.9 提升到 88.8,提高了 4.9 個百分點。相同數據量的 RoboCasa 對照組是 57.5。這至少說明,在這套評測條件下,模型提升不只取決於單條數據數量,更和任務、場景、視角以及扰動條件是否足夠多樣有關。

今年我們會發布 Dataset V2,會繼續擴大規模,並覆蓋更多機器人形態、任務和場景。

BlockBeats 問:Axis 如何判斷一條數據是否有價值?評判標準大概有哪些?

Chris:我們不會只看一條數據「有沒有採到」,而是會連續問幾個問題:它乾不乾淨、是不是帶來了新東西、能不能在真實世界裡派上用場,以及它有沒有幫模型補上真正的短板。

第一關看能不能用。操作有沒有做完?中間有沒有卡死、掉線?動作重放能不能複現?有沒有設備卡頓、操作飄移,或者物體穿過去了這種不符合物理規律的情況?我們還會拿這批數據訓練一個輕量模型做快速體檢,如果連這一關都過不了,這批數據就不會進入訓練池。

第二關看有沒有新資訊。機器人最怕的就是反复刷已經會的題。我們會看這條軌跡的場景、物體、互動方式,跟已有數據到底有多不一樣。出現了少見的場景佈局、特殊材質、罕見的操作方式,價值就高。大量重複的「拿起來放下去」當然也有用,但更多是補基數。真正值得重點投入的,是那種多個物體互相擋著、需要連續好幾步才能搞定的複合任務,這類數據才能逼著模型學會舉一反三。

第三關看能不能從仿真走到現實。仿真數據不是越多越好,關鍵是有沒有把真實世界的變化考慮進去,光線換了行不行?材質變了呢?摩擦力不一樣呢?相機角度歪了呢?這些變量擾動得越充分,模型上了真機就越不容易「見光死」。如果一段仿真數據永遠發生在同一種理想條件下,它只能做基礎預訓練的墊底素材,遷移到真實世界的價值很有限。

最後看對長期迭代的貢獻。模型在真機上翻車了,人接管糾正出來的那一小段軌跡,往往特別值錢——它精準告訴我們模型到底哪裡不會。新任務、新機型帶來的全新軌跡也一樣,能幫模型快速擴大能力邊界。反過來,如果某個簡單任務模型已經做得很穩了,再堆類似數據,收益就遞減了。

所以一條好數據不只是「格式正確」。它要乾淨、有新意、能落到真實世界裡,還要能推動模型繼續進步。我們希望把有限的採集資源花在真正能讓機器人變聰明的數據上。

BlockBeats 問:既然 Axis 是機器人公司,為什麼還需要區塊鏈技術?Axis 選擇了 Base 鏈,能不能具體講講原因?

Chris:這是個很犀利、也很重要的問題。我們的邏輯很簡單:Axis 首先是在解決 Physical AI 的數據瓶頸,而要解決這件事,需要全球大量普通貢獻者參與。區塊鏈技術不是主角,它更像一套高效的基礎工具,用來做溯源、驗證、激勵和分配。

在大語言模型時代,訓練數據在很大程度上是一個「黑箱」:數據從哪來、怎麼被處理、貢獻者的價值怎麼被確認,外界很難看清。但 Physical AI 直接關係到機器人在真實世界裡的動作,數據質量會影響安全性,所以這種黑箱不能被簡單接受。

我們將 Physical AI 的部分資料生產過程放到 Base 上,是希望把這件事做得更透明。Base 是建立在以太坊上的低成本區塊鏈網路。具體來說,任務編號、數據軌跡編號、用戶編號以及它們之間的關聯都會被記錄下來。這樣,每一條動作軌跡、每一位貢獻者都可以追踪、稽核,也可以獲得對應激勵。

此外,我們需要一個社區覆蓋廣、參與門檻低的網路。Base 的社區非常全球化,且 Base 鏈使用成本較低、交易確認快,也便於我們記錄貢獻和發放激勵。

更重要的是,我們獎勵的不是單純的數量,而是高品質貢獻。對於機器人模型,垃圾數據不只是沒用,甚至可能有害。我們通過雙層評分和積分體系來判斷一條數據到底有沒有幫到模型,貢獻越好、評分越高、獎勵越多。Base 鏈的高效和低成本,完美契合了我們這種高頻、微小激勵的全球協作需求。

誰會為機器人數據閉環買單

BlockBeats 問:Axis 目前的商業化路徑是怎樣的?圍繞機器人數據采集、模型訓練和實際部署,你們主要為客戶提供哪些產品或服務?現有的客戶對這套模式給出了怎樣的反饋?

Chris:我們的商業化路徑比較清晰,核心是服務三類客戶,並按他們各自的問題提供端到端方案。

第一類是機器人硬體和具身公司,比如 Booster Robotics、Feagine Robotics 和 AgiBot。他們有自己的硬體,但往往還需要更定制化的數據和能直接部署的模型,才能把操作能力補齊。我們可以從任務設計開始,幫他們做數據采集、模型訓練和部署,也會為他們的下游客戶提供數據解決方案。

第二類是做視覺—語言—動作模型或世界模型的模型公司,比如 Manycore Tech 和 SomaStacks。世界模型的作用,是讓機器學習理解環境會怎樣變化。他們需要大量高品質的操作數據來訓練通用模型,我們為他們提供高品質的任務集和數據集,也可以一起做聯合訓練。

第三類是垂直行業企業,比如蓮花跑車(Lotus)和吉利汽車。他們關心的不是模型多先進,而是怎麼把機器人真正用進生產線,所以我們提供的是以機器學習方法為基礎的端到端自動化方案。

我們比較看重系統能力,因此交付不只是一包數據。客戶需要什麼、內部能力邊界在哪裡,我們就可以相應調整:既能提供數據,也能把基於數據的解決方案一起交付。這樣既能提高我們服務客戶的競爭力,也更能直接幫助客戶提效和提質。

BlockBeats 問:Axis 的合作夥伴、客戶都有哪些?不同客戶來到 Axis 時,他們的需求一般是什麼?

Chris:剛才提到的幾類公司,都是我們的代表性客戶。他們表面上都在說「缺數據」,但實際缺的東西並不一樣。

比如一家硬件廠商,可能剛做出一款很不錯的機械臂,可一到客戶現場,只要光線變了,或者物品擺放換了個位置,機器人就抓不準了。他們來找 Axis,真正想解決的是:怎麼讓機器人在更多環境下都能穩定工作。

我們給他們的不是一堆雜亂的視頻,而是經過多維度多樣性生成、清洗和語義標註的結構化數據。必要時,我們也會直接幫他們訓練策略。最終要交付的結果,是讓他們的硬件在非結構化環境裡更穩、更有泛化能力。

BlockBeats 問:從平臺上線至今,你們能不能分享一些還沒有公開過的真實運營數據,比如有效註冊貢獻者數量、任務發布數量、累計軌跡,以及高質量用戶的活躍和貢獻情況?

Chris:平臺上線至今 15 週,我們累計註冊貢獻者已經超過 8 萬。這個數字已經剔除了機器人帳號等無效地址,是真實有效的數據。我們一共發布了 1600 個用於預訓練的機器學習任務,累計收集了超過 200 萬條數據軌跡,換算下來大約是 3500 小時的高質量數據。

但我們更看重的是用戶質量和黏性。目前,高質量貢獻者大約有 2 萬人,佔比約 30%。過去 30 天,這批用戶裡有 7800 人保持活躍;過去 7 天活躍的有 5300 人,周活和月活的比率達到 68%。他們在過去 30 天和過去 7 天分別貢獻了 68 萬條和 16 萬條軌跡。

這種活躍度和參與深度,讓我們看到用戶對「訓練即貢獻、貢獻可獲得激勵」模式的興趣,也說明我們的社區正在形成一個相對成熟、穩定的機器人智能貢獻者網絡。

四、行業真正的拐點,和 Axis 的位置

BlockBeats 問:過去兩年,各種人形機器人、VLA、Physical AI 都很熱,但大多數普通人還沒有真正用上機器人。你覺得機器人距離大規模爆發還要多久?真正的拐點會是什麼,是硬件成本下降、模型能力躍遷,還是數據基礎設施成熟?

Chris:我們認為,真正的拐點還是數據基礎設施成熟。

硬件成本其實已經在快速下降。中國供應鏈的優勢,讓機器人的製造成本不再是遙不可及的天堑。但普通人為什麼還沒大規模用上機器人?核心原因是機器人還不夠聰明,它們對真實世界的物理規律和人類意圖,缺少足夠的常識理解。

這就好比你有了一輛造價很低的車,發動機也不錯,但沒有駕照、沒上過路——光有硬件和算法,沒有足夠的「路上經驗」,車還是開不好。只有當我們能像今天抓取網頁一樣,低成本、規模化地獲得物理世界的互動數據,並把它變成模型能消化的養料,機器人才會真正爆發。

我們覺得這個拐點越來越近了,Axis 想做的就是把它再往前推一把。

BlockBeats 問:機器人行業裡,大模型公司和整機公司未來可能都會自建數據。面對這些數據自建團隊,以及 Axis 目前的同賽道友商,Axis 的長期護城河是什麼?是貢獻者網路、任務生成能力、數據質量控制、客戶場景,還是閉環訓練效果?

Chris:這是一個非常關鍵、也非常現實的問題。大模型公司和整機廠商未來一定會自建數據團隊,這幾乎是行業發展的必然結果。但真正的競爭,不是誰能不能自己採數據,而是誰能搭出一套跨場景、能規模化、還能持續優化的數據基礎設施。

短期大家拼的是數據覆蓋度和多樣性;中期拼的是把數據轉成模型能力的效率;長期拼的是誰能真正嵌入客戶的智能生產體系,成為不容易被替換的一環。

Axis 的護城河不會只是某一個單點,比如貢獻者網路、採集效率或數據處理能力。單點能力都可能被複製,我們更在意的是把這些能力連成一個不斷增強的閉環,並慢慢嵌進客戶的訓練流程。

對客戶來說,接入 Axis 應該很輕,不需要複雜許可,可以很快發布任務、拿到數據。但一旦客戶開始使用我們的仿真資產體系、分佈式採集網絡和模型錯誤閉環,雙方的訓練流程就會逐漸耦合。要換掉我們,客戶不只是換一家數據供應商,而是要重新搭仿真基礎設施、重建貢獻者網絡、數據處理管線和後訓練錯誤流程。我們的護城河不是封閉,而是這種結構性的嵌入。

我們也特別看重和模型一起進化的能力。如果只是賣數據,當然隨時可能被替代;但如果我們能持續發現模型短板、設計針對性任務、提供後訓練的錯誤數據,並實實在在幫客戶提升成功率和魯棒性,我們就成了模型優化閉環的一部分。那時,我們和客戶的關係不再只是供應商和採購方,而更像共同建設者。

未來 18 個月,行業會很缺大規模、高覆蓋的數據,量和多樣性仍是核心。再往後三年,行業可能更需要特定領域、特定場景的專業數據。我們真正想積累的資產不是某一類數據,而是一套可編程的任務生成系統、可調度的分佈式貢獻網絡和持續優化的訓練閉環。它既能橫向擴展到更多行業,也能縱向深入一個垂直領域。

如果用一句話總結,短期拼規模,中期拼效率,長期拼嵌入。Axis 的目標是成為 Physical AI 智能生產體系的一部分,而不是一家可以被輕易替換的數據供應商。

BlockBeats 問:融資之後的 6—12 個月,Axis 最主要的任務和目標是什麼?是繼續擴大數據規模,驗證更多真實機器人任務,還是拿下更多付費客戶?如果一年後回看,你們希望外界用什麼關鍵詞描述 Axis?

Chris:接下來的 6 到 12 個月,我們會同時推進產品、生態和商業化。

產品上,V2 已經把我們從單向採集平台推進成了完整的訓練閉環,接下來要做的是把這套系統真正跑起來、跑出規模。9 月進一步鋪開第一視角數據採集管線,目前已經積累了數萬小時數據,也在和北美前沿模型實驗室對需求。10 月前後我們計劃發布數據集的 V2 版本,覆蓋更多機器人形態和原子能力。年底之前發布首個大規模 Human-Gated DAgger 後訓練數據集。

生態上,我們會繼續擴張全球網路,進入拉美和歐洲市場,未來 6 到 12 個月,我們希望將第一視角數據的穩定日產能保持在 500 小時以上,將仿真數據的日產能提升至 50 小時以上,並逐步擴大 DAgger 後訓練數據的生產能力。

商業化上,我們的目標是在年底完成 2 到 3 個新的付費試點項目,並在明年初進入基礎模型公司的優選供應商名單。

如果一年後回看,我們希望大家會用「規模、多樣性、閉環」這三個詞來描述 Axis。規模是我們能持續提供行業級的數據供給;多樣性是我們真正覆蓋到了現實世界的複雜度;閉環是我們不只生成數據,還能圍繞模型短板持續優化。

更重要的是,我們希望行業提到 Axis 時,會說:「這是一個讓機器人模型進化更快的系統。」我們解決的不只是數據數量問題,更是模型進化效率問題。只要客戶接入 Axis 後,模型迭代更快、成功率更高、場景覆蓋更廣,那就是我們的價值所在。

QQlink

無加密後門,無妥協。基於區塊鏈技術的去中心化社交與金融平台,讓隱私與自由回歸用戶手中。

© 2024 QQlink 研發團隊. 保留所有權利.