一個新的國產(chǎn)VLA模型誕生了,而且只有1.5B。
(相關(guān)資料圖)
Size這么小,能好用嗎?
來,話不多說,我們直接看效果:
視頻地址:https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw
在上面這個真機演示里,兩只機械臂圍著桌面開始做三明治。它們分工合作,先取面包,再夾起生菜、火腿和雞蛋,一層層疊到一起。
再來看下另一段演示:
視頻地址:https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw
一只宇樹機器狗收到“跟隨前面的人”這條指令后,開始一路跟在目標(biāo)身后。
從室外走進(jìn)辦公樓,再進(jìn)入電梯、地下停車場,機器狗始終沒有跟丟。就算周圍不斷有人經(jīng)過,環(huán)境和光線也在變化,它還是能認(rèn)準(zhǔn)一開始指定的那個人。
更關(guān)鍵的是,這套能力直接跑在機器狗本地!
電梯和地下停車場往往是網(wǎng)絡(luò)信號比較差的地方。即使進(jìn)入弱網(wǎng)甚至無網(wǎng)環(huán)境,機器狗依然能繼續(xù)識別目標(biāo)、規(guī)劃動作,保持跟隨。
而在這兩段Demo背后,則是面壁智能在WAIC期間正式發(fā)布并開源的MiniCPM-Robot系列模型。
目前包含兩個模型:
- MiniCPM-RobotManip:也就是開頭控制機械臂做三明治的通用VLA模型,參數(shù)量只有1.5B。
- MiniCPM-RobotTrack:主要負(fù)責(zé)機器人的跟蹤與導(dǎo)航,讓機器人能夠根據(jù)自然語言指令,在動態(tài)環(huán)境里持續(xù)跟住指定目標(biāo)。
和它們一起出現(xiàn)的,還有開源具身智能推理框架PhyAI,負(fù)責(zé)讓這些模型更快地適配硬件、跑到真實機器人上。
簡單來說,一個負(fù)責(zé)讓機器人“動手干活”,一個負(fù)責(zé)讓機器人“認(rèn)準(zhǔn)人、跟著走”,再配上一套負(fù)責(zé)高效推理的底座。
面壁這次端出來的,已經(jīng)是一套逐漸成形的具身智能組合。
躋身第一梯隊,延遲接近一半
先來看MiniCPM-RobotManip。
雖然參數(shù)量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA評測里,它的整體表現(xiàn)已經(jīng)進(jìn)入第一梯隊,與π0.5等模型處在相近水平。
真正把差距拉開的,是對機器人記憶力的考驗。
很多VLA模型在執(zhí)行動作時,主要根據(jù)當(dāng)前這一幀畫面做判斷。
比如讓機器人點擊畫面里的第二個按鈕5次。
如果它看不到前面的畫面,也記不住自己已經(jīng)按過幾次,就很容易按一下便停,或者一直按下去。
MiniCPM-RobotManip會把歷史觀測和此前執(zhí)行過的動作一起納入判斷。它知道任務(wù)已經(jīng)進(jìn)行到哪一步,也知道什么時候應(yīng)該停下來。
在專門考察上下文記憶的RMBench中,π0.5的成績約為10分,接近隨機水平,MiniCPM-RobotManip則達(dá)到約53分。
這項能力對真實機器人很重要。
疊衣服、收拾桌面、做三明治,看起來都是日常小事,拆開后卻包含一連串動作。機器人只看眼前,很容易做到一半便“失憶”;能記住此前的狀態(tài),才有機會把長任務(wù)完整做完。
除了記得住,機器人還得反應(yīng)快。
面壁給出的單幀推理對比中,在H100顯卡、bf16精度下,MiniCPM-RobotManip單次決策延遲約為120毫秒,π0.5約為234毫秒,前者接近后者的一半。
這里的“成本減半”,主要是體現(xiàn)在推理延遲和計算量上。
聊天模型多想一秒,用戶通常還能等。機械臂每做一步都停頓一秒,動作馬上就會變得僵硬,整個任務(wù)的完成時間也會被拉長。
對VLA來說,能不能在有限算力下快速輸出下一步動作,和榜單分?jǐn)?shù)一樣重要。
MiniCPM-RobotTrack也走了類似的小尺寸模型路線。
它以MiniCPM4-0.5B為基礎(chǔ),整體參數(shù)規(guī)模為0.9B,主要測試三種真實場景。
第一種是單目標(biāo)跟蹤。給它一句明確指令,機器狗持續(xù)跟著指定的人。
第二種是多人干擾。周圍幾個人同時移動、交叉甚至交換位置,模型依然要認(rèn)準(zhǔn)最初的目標(biāo)。
第三種更難,指令本身可能比較模糊。比如只說“跟著穿黑衣服的人”,現(xiàn)場又恰好有多個穿著相近的人,模型需要結(jié)合畫面理解人類到底指的是誰。
在沒有進(jìn)行下游強化學(xué)習(xí)優(yōu)化的情況下,MiniCPM-RobotTrack在三類任務(wù)上的追蹤率分別達(dá)到89.8%、73.4%和80.4%,均取得開源方案中的最優(yōu)結(jié)果。
相比OpenTrackVLA,三項追蹤率分別提高7.0、14.6和6.5個百分點。
在相同的單視角、純SFT設(shè)定下,與閉源模型TrackVLA++相比,它在單目標(biāo)跟蹤和模糊目標(biāo)跟蹤上的追蹤率分別高出8.8和17.0個百分點,模糊目標(biāo)跟蹤的成功率達(dá)到58.0%。
參數(shù)小,表現(xiàn)卻沒有明顯掉隊。
機器人模型的競爭,也開始從單純拼規(guī)模,轉(zhuǎn)向拼單位算力到底能換來多少能力。
把機器人看到的世界壓縮一下
MiniCPM-RobotManip能把尺寸壓到1.5B,背后離不開面壁過去在多模態(tài)模型上的積累。
它基于MiniCPM-V 4.6訓(xùn)練而來(開源不到2個月,下載量已突破200萬)。
面壁的MiniCPM-V/O系列已經(jīng)持續(xù)迭代兩年多,開源總下載量超過2500萬。過去積累的圖像理解、視頻理解和多模態(tài)信息處理能力,如今被進(jìn)一步搬到了機器人身上。
機器人執(zhí)行一次動作,需要處理的信息其實很多。
一臺雙臂機器人通常會同時接收三個攝像頭的畫面,包括兩個腕部相機和一個主視角相機,再加上一段文字指令,最后輸出一個可以執(zhí)行的動作。
而且,這個過程一秒要重復(fù)好幾次。
如果每一張圖片都被轉(zhuǎn)換成大量視覺Token,機器人運行得越久,需要處理的歷史信息就越多,計算量很快就會堆起來。
MiniCPM-RobotManip采用的辦法,是盡量壓縮視覺Token。
桌面紋理、墻面圖案等和當(dāng)前任務(wù)關(guān)系不大的信息,不必占用太多Token。模型用更短的數(shù)據(jù)表示保留關(guān)鍵內(nèi)容,單次推理需要處理的信息量也隨之下降。
信息少了,推理自然更快。對應(yīng)到機械臂上,就是等待時間更短,動作銜接更順。
視覺Token壓縮還有一個更大的用處,可以幫助機器人以更低成本保留歷史記憶。
常規(guī)方法每獲得一張新畫面,都要把此前的歷史重新計算一遍。任務(wù)越長,計算量增長得越快。
MiniCPM-RobotManip采用流式計算,前面已經(jīng)處理過的信息可以繼續(xù)復(fù)用,新畫面進(jìn)來后,只需要接著往下計算。
這就有點像看連續(xù)劇的感覺了。
普通做法每更新一集,都要從第一集重新看起;流式計算則會記住之前的劇情,直接從最新一集接著看。
機器人因此可以帶著更長的歷史繼續(xù)執(zhí)行任務(wù),同時避免計算量一路暴漲。
1.5B的尺寸,也和機器人的實際運行需求有關(guān)。
面壁在將約200毫秒視為機器人操作體驗的一道臨界線。再慢下去,機械臂和機器狗的卡頓感就會明顯增加。
當(dāng)前多數(shù)VLA基礎(chǔ)模型都控制在4B以內(nèi)。模型繼續(xù)做大能帶來多少真實操作收益,行業(yè)仍在驗證。
到了MiniCPM-RobotTrack這里,輕量化的思路又換了一種實現(xiàn)方式。
它把視覺畫面、自然語言指令和機器人的控制決策放進(jìn)同一個模型里統(tǒng)一處理。
用戶說一句“跟著前面穿黑衣服的人”,模型會直接結(jié)合攝像頭畫面理解指令,再把判斷轉(zhuǎn)換成機器狗的運動控制。
整個過程不需要額外安裝一套目標(biāo)檢測模塊、一套識別模塊,再接一套跟蹤系統(tǒng)。也不用外接開發(fā)板,只靠宇樹Go2 Edu原裝攝像頭和本地算力,就能完成單目標(biāo)跟蹤、多人干擾跟蹤和模糊目標(biāo)跟蹤。
不過,真實世界總會出現(xiàn)訓(xùn)練集里很少見的情況。
目標(biāo)可能突然從鏡頭前橫穿過去,也可能快速轉(zhuǎn)彎,被其他人短暫擋住。幾個人同時交叉走動時,機器狗還要避免跟錯人。
這類場景數(shù)量少,卻最容易讓模型翻車。所以,面壁為此搭建了一套自進(jìn)化數(shù)據(jù)管線。
團(tuán)隊先對原始數(shù)據(jù)進(jìn)行檢查和清洗,把異常軌跡、錯誤動作和無效交互剔除掉。隨后讓模型進(jìn)入仿真和真實機器人環(huán)境,在持續(xù)運行中主動暴露自己的薄弱環(huán)節(jié)。
系統(tǒng)再把這些容易出錯的場景集中收集起來,通過專家策略進(jìn)行糾偏,放回下一輪訓(xùn)練。
說得通俗一點,這就像給機器狗準(zhǔn)備了一本會自動更新的錯題本。
經(jīng)過一輪輪閉環(huán)訓(xùn)練,目標(biāo)橫穿、快速轉(zhuǎn)向、短時遮擋、多人交叉這些長尾問題,也能不斷得到加強。
模型訓(xùn)好了,裝到真機上仍然有一道關(guān)。
攝像頭采集、畫面編碼、模型推理、動作生成、指令傳輸,任何一個環(huán)節(jié)慢下來,最終都會反映在機器狗的動作上。
面壁圍繞宇樹Go2的完整運行鏈路做了系統(tǒng)級優(yōu)化。目前MiniCPM-RobotTrack在機器狗原生本地算力上可以穩(wěn)定達(dá)到5Hz以上,端到端響應(yīng)延遲約180毫秒。
這次開源的內(nèi)容也不只有模型權(quán)重,還包括環(huán)境安裝、模型加載、攝像頭接入、文本指令輸入、控制接口和一鍵啟動腳本。
準(zhǔn)備一臺Go2 Edu,就能按照開源流程把模型部署起來。
本地部署的好處,在電梯和停車場的演示里體現(xiàn)得很直接。
機器人不用等待畫面上傳云端,也不用等遠(yuǎn)程服務(wù)器返回結(jié)果。攝像頭數(shù)據(jù)和用戶指令留在本地,網(wǎng)絡(luò)信號變差后,完整功能依然可以繼續(xù)運行。
直接拔掉網(wǎng)卡,機器狗照樣能根據(jù)攝像頭畫面和文字指令,完成目標(biāo)識別、持續(xù)跟蹤和運動控制。
除了MiniCPM-Robot系列之外,這次還有一項容易被忽略的發(fā)布——PhyAI。
它是一款面向Physical AI的開源推理框架,由明體科技聯(lián)合北京郵電大學(xué)、北京大學(xué)研發(fā)。
具身模型想從實驗室跑到真實機器人上,中間還要經(jīng)過硬件適配、量化、算子優(yōu)化和部署。
不同VLA、世界模型的結(jié)構(gòu)差異很大。每發(fā)布一個新模型,再從頭適配一次,時間和工程成本都不低。
PhyAI想做的,就是把這段路縮短。
在RTX 5090上運行π0、π0.5和GR00T時,PhyAI相較模型官方倉庫分別實現(xiàn)約2.85倍、1.82倍和2.28倍加速。
適配MiniCPMRobot系列模型時,PhyAI先通過CUDA Graph把推理幀率從10.12Hz提高到33.28Hz,再加入為模型定制的融合算子,在NVIDIA H20上進(jìn)一步提高到36.77Hz。
前面是模型效果,這里解決的是工程效率。
模型能干活,還得盡快跑上硬件,跑得足夠快,才能真正進(jìn)入更多機器人。
機器人需要又好又便宜的大腦
具身智能行業(yè)從來不缺精彩Demo。真正難的是離開展臺之后,機器人還能不能穩(wěn)定工作。
清華大學(xué)人工智能學(xué)院助理教授、面壁智能多模態(tài)首席科學(xué)家姚遠(yuǎn)在訪談中也提到:
展館、園區(qū)和工廠里,網(wǎng)絡(luò)信號不會一直滿格。機器人還要面對隱私、數(shù)據(jù)合規(guī)、任務(wù)失敗和異常恢復(fù)等一連串現(xiàn)實問題。
榜單分?jǐn)?shù)再高,走到地下停車場便停擺,落地空間依然有限。
這也是面壁把端側(cè)能力放在重要位置的原因。
在與樂聚機器人的合作中,面壁把端側(cè)多模態(tài)大模型、夸父機器人本體和導(dǎo)航系統(tǒng)組合到了一起,推出展廳導(dǎo)覽Agent和園區(qū)巡檢Agent。
展廳導(dǎo)覽機器人在無網(wǎng)環(huán)境下,也能基于本地知識庫完成離線講解和自由問答。它可以理解展廳環(huán)境和人的指令,規(guī)劃導(dǎo)覽路線,同時完成避障。
園區(qū)巡檢機器人則可以識別車輛違停、路面異常和公共設(shè)施問題。敏感畫面直接在本地處理,數(shù)據(jù)留在客戶側(cè)。
與吉利汽車的合作,則進(jìn)一步走進(jìn)了生產(chǎn)倉儲場景。
面壁和吉利共同訓(xùn)練VLA模型,再通過RoboHarness把VLM、VLA、機器人本體和導(dǎo)航系統(tǒng)接到一起,讓機器人執(zhí)行倉儲中的長程任務(wù)。
RoboHarness可以理解成物理世界里的Agent執(zhí)行框架。
上層VLM負(fù)責(zé)規(guī)劃任務(wù),VLA和導(dǎo)航系統(tǒng)作為可以調(diào)用的工具。框架還會管理長任務(wù)的上下文和記憶,遇到失敗時進(jìn)行重試和恢復(fù)。
機器人每完成一次任務(wù),運行數(shù)據(jù)還會進(jìn)入可治理的數(shù)據(jù)閉環(huán),繼續(xù)幫助模型進(jìn)化。
到這里,面壁此次在WAIC帶來的具身智能路線已經(jīng)比較清楚了。
- MiniCPM-RobotManip負(fù)責(zé)操作,讓機械臂理解任務(wù)、記住過程,再把事情做完。
- MiniCPM-RobotTrack負(fù)責(zé)跟蹤導(dǎo)航,讓機器狗在復(fù)雜環(huán)境里認(rèn)準(zhǔn)目標(biāo),斷網(wǎng)也能繼續(xù)走。
- PhyAI負(fù)責(zé)把模型更快地部署到真實硬件上。
再往外,樂聚和吉利的合作開始把模型、本體、導(dǎo)航和具體業(yè)務(wù)流程接起來。
大語言模型時代,人們習(xí)慣用參數(shù)量判斷能力。但機器人真正走進(jìn)物理世界后,參數(shù)只是其中一個數(shù)字。
它還得反應(yīng)夠快、記得住、斷網(wǎng)能跑,數(shù)據(jù)留得下來,遇到意外能夠恢復(fù),成本也要控制在企業(yè)愿意長期使用的范圍內(nèi)。
從這個角度看,1.5B和0.9B的意義,也就不止是“小”。它們更像是在回答一個很現(xiàn)實的問題:
當(dāng)AI真正長出手腳,除了聰明,還得跑得動、用得起,最后把活干完。
GitHub鏈接:https://github.com/OpenBMB/MiniCPM-Robot
HuggingFace鏈接:https://huggingface.co/openbmb/MiniCPM-RobotManiphttps://huggingface.co/openbmb/MiniCPM-RobotTrack







