騰訊機(jī)器人X團(tuán)隊打造“會思考也會想象“的機(jī)器人大腦——RxBrain
這項(xiàng)由騰訊機(jī)器人X團(tuán)隊、富田實(shí)驗(yàn)室與騰訊混元團(tuán)隊聯(lián)合發(fā)布的研究于2026年7月15日以預(yù)印本形式公開論文編號為arXiv:2607.14187。感興趣的讀者可以通過該編號在arXiv平臺查閱完整論文。**研究概要**教一個機(jī)器人完成任務(wù)遠(yuǎn)比教一個孩子學(xué)騎自行車難得多。孩子看幾次示范就能理解要向前踏、要保持平衡而機(jī)器人往往需要被明確告知每一個步驟甚至需要提前想象自己完成任務(wù)之后周圍世界會變成什么樣子。這種既能規(guī)劃步驟、又能在腦海中預(yù)見結(jié)果的能力正是人類與目前大多數(shù)機(jī)器人之間最本質(zhì)的差距之一。騰訊這支聯(lián)合團(tuán)隊提出了一個名為**Hy-Embodied-RxBrain**簡稱RxBrain的具身認(rèn)知基礎(chǔ)模型目標(biāo)是讓機(jī)器人在制定行動計劃時不僅能用語言描述第一步做什么、第二步做什么還能同時在腦海中生成每一步執(zhí)行完成后世界應(yīng)該是什么樣子的畫面——就像一個有經(jīng)驗(yàn)的廚師不僅知道菜譜上寫著先把洋蔥炒軟還能在動手之前就清晰地預(yù)見到鍋里金黃透明的洋蔥應(yīng)該呈現(xiàn)出什么狀態(tài)。這項(xiàng)研究的核心突破在于它是業(yè)界首次將語言推理與視覺想象真正耦合在同一個規(guī)劃序列中的具身認(rèn)知模型而非讓兩者分別工作后再拼合結(jié)果。---**一、為什么機(jī)器人既要說也要想**現(xiàn)有的機(jī)器人智能系統(tǒng)大致分成兩個陣營。一類是視覺語言模型它們擅長理解眼前的畫面、聽懂人類指令、分解任務(wù)步驟能用語言告訴機(jī)器人先拿起杯子再把杯子放到托盤上。這類模型的短板是它們描述計劃時完全停留在語言層面對于拿起杯子之后世界應(yīng)該長什么樣缺乏明確的視覺預(yù)見就像一個從未下過廚房的人照著菜譜念步驟卻沒見過食物完成時應(yīng)有的樣子。另一類是生成式世界模型它們善于預(yù)測動作執(zhí)行后的畫面能生成機(jī)器手臂伸過去抓住杯子后的視頻片段。但這類模型通常不擅長進(jìn)行因果推理、理解約束條件或進(jìn)行長程的邏輯規(guī)劃更像是一臺擅長渲染畫面的攝影機(jī)卻沒有導(dǎo)演的腳本意識。RxBrain的思路是讓語言和視覺像樂隊里的指揮和樂手一樣配合工作。語言負(fù)責(zé)告訴機(jī)器人整首曲子的結(jié)構(gòu)——哪一段先演奏、哪里要停頓、整體節(jié)奏是什么視覺想象則負(fù)責(zé)把每一段旋律奏出來讓抽象的樂譜變成實(shí)實(shí)在在的聲音。在RxBrain的規(guī)劃序列中語言描述行動步驟、約束條件和決策邏輯而視覺想象則為每一個步驟生成對應(yīng)的世界狀態(tài)圖——執(zhí)行完這步之后眼前的場景應(yīng)該是什么樣子。兩者互為補(bǔ)充缺一不可。---**二、RxBrain的大腦結(jié)構(gòu)是怎么搭建的**RxBrain建立在一種叫做**混合變換器架構(gòu)**Mixture-of-Transformers簡稱MoT的技術(shù)框架上。普通讀者可以把這個架構(gòu)理解為一座分工明確的大型辦公樓樓里有專門處理文字的部門、專門理解圖片的部門、專門生成圖片的部門但這三個部門共享同一套會議室——也就是說不同部門之間可以充分交流信息但各自的專業(yè)工作又不會相互干擾。具體來說RxBrain包含三類主要工作單元。語言變換器負(fù)責(zé)處理所有文字包括理解人類指令和生成規(guī)劃步驟的文字描述視覺變換器負(fù)責(zé)理解輸入的圖像和視頻理解和生成的視覺內(nèi)容共享同一套注意力機(jī)制可以理解為它們看同一套信息但用不同的方式處理同時各自有獨(dú)立的前饋網(wǎng)絡(luò)相當(dāng)于各自的專屬處理流水線此外還有一個專門負(fù)責(zé)視覺生成的模塊它的處理容量特意做得更大——中間層寬度從6144擴(kuò)展到12288——因?yàn)閼{空生成一張有意義的畫面比理解一張已有的畫面更具挑戰(zhàn)性。整個模型共有62億個參數(shù)其中語言理解和視覺理解各約15億視覺生成模塊約24億其余分布在共享模塊和外圍組件中。視覺內(nèi)容的生成采用了來自FLUX模型的凍結(jié)VAE變分自動編碼器作為圖像的編碼和解碼工具可以理解為一個專業(yè)的圖像壓縮與還原機(jī)器負(fù)責(zé)在模型內(nèi)部表示和最終輸出圖像之間架橋。為了讓模型在生成規(guī)劃序列時既能保持因果邏輯先發(fā)生的影響后發(fā)生的又能讓同一張圖片內(nèi)部的信息充分交流RxBrain設(shè)計了一套混合注意力機(jī)制處理文字時用因果注意力只看之前的內(nèi)容處理圖片時在每張圖片內(nèi)部用雙向注意力圖片內(nèi)所有位置互相參考跨圖片之間仍保持因果順序。這就像一本故事書同一頁內(nèi)的插圖細(xì)節(jié)可以互相對照但后面的頁面不能劇透前面的內(nèi)容。---**三、RxBrain如何生成文字畫面交織的計劃**RxBrain支持三種輸出模式對應(yīng)具身任務(wù)中的不同需求。第一種是純文字生成模式用于回答關(guān)于當(dāng)前場景的問題或輸出語言形式的規(guī)劃步驟。機(jī)器人看到眼前的場景后通過標(biāo)準(zhǔn)的逐詞生成方式輸出文字答案或行動指令。第二種是多幀視頻預(yù)測模式用于預(yù)測執(zhí)行某個動作后接下來四幀畫面會是什么樣子。這四幀畫面并行生成而非一幀一幀串行大幅提升效率同時幀間保持因果順序也就是越后面的幀可以參考越早的幀但不能看到未來。這就像同時制作四格漫畫的四個格子每個格子的畫師都能看到前面格子已經(jīng)畫好的內(nèi)容但不能偷看后面格子。第三種是交錯生成模式這也是RxBrain最核心的能力所在。在這種模式下模型輸出的是一個語言與圖像交替出現(xiàn)的完整規(guī)劃序列先生成第一步的文字描述再生成對應(yīng)的目標(biāo)狀態(tài)圖像然后把這張生成的圖像重新看一遍作為上下文輸入再生成第二步的文字再生成第二步的畫面……如此循環(huán)直到任務(wù)完成。關(guān)鍵的設(shè)計細(xì)節(jié)在于在訓(xùn)練時模型看到的上一步生成的圖像不是直接拿來的原圖而是經(jīng)過了生成→解碼→重新編碼這一完整流程處理過的圖像。這么做是為了讓訓(xùn)練時和真正推理時的體驗(yàn)盡量一致——因?yàn)樵趯?shí)際使用時上一步的圖像確實(shí)是模型自己生成的而不是來自真實(shí)世界的照片。這個細(xì)節(jié)減少了訓(xùn)練和推理之間的期望差距讓交錯生成的質(zhì)量更加穩(wěn)定。---**四、用五萬小時視頻訓(xùn)練出計劃感**要讓RxBrain學(xué)會這種語言加視覺的聯(lián)合規(guī)劃能力需要大量帶有每一步動作配對對應(yīng)狀態(tài)變化畫面的訓(xùn)練數(shù)據(jù)。然而現(xiàn)有的數(shù)據(jù)集幾乎沒有這種格式——大多數(shù)機(jī)器人數(shù)據(jù)只有動作指令或只有連續(xù)視頻沒有把兩者精確對齊起來。為此研究團(tuán)隊設(shè)計了一套全自動的數(shù)據(jù)構(gòu)建流水線把原始具身任務(wù)視頻轉(zhuǎn)化為文字畫面配對的聯(lián)合規(guī)劃訓(xùn)練樣本。原始視頻數(shù)據(jù)來自四大類來源真實(shí)機(jī)器人操作數(shù)據(jù)約17292小時、UMI手持夾持器采集數(shù)據(jù)約17506小時、仿真環(huán)境數(shù)據(jù)約1317小時、以及第一人稱人類日常操作視頻約14062小時??傆嫵^5萬小時包含約2150萬個可用片段通過約2861萬個候選片段篩選而來通過率約75%。這條流水線分三個階段。第一階段是時序片段標(biāo)注系統(tǒng)先對視頻進(jìn)行關(guān)鍵幀采樣——不是均勻采樣而是優(yōu)先選取畫面變化最明顯的時刻就像一本菜譜只需要在每道工序最關(guān)鍵的時刻拍一張照片而不是每秒都拍。采樣完成后用一個多模態(tài)大語言模型對視頻進(jìn)行整體理解提出候選動作步驟列表每個步驟包含一個簡短名稱、詳細(xì)描述以及在關(guān)鍵幀序列中對應(yīng)的粗略起止位置。隨后系統(tǒng)在粗略范圍附近密集采樣用模型精確定位每個步驟的真實(shí)開始幀和結(jié)束幀。第二階段是質(zhì)量驗(yàn)證對每一個標(biāo)注出來的片段系統(tǒng)自動檢查它是否符合高質(zhì)量訓(xùn)練樣本的標(biāo)準(zhǔn)。檢查項(xiàng)涵蓋三大類語義質(zhì)量這個片段是否只包含一個清晰的原子動作操作目標(biāo)是否清晰可見畫面是否有水印遮擋文字描述是否準(zhǔn)確匹配畫面動作是否真實(shí)發(fā)生兩幀錨點(diǎn)是否都可讀、視覺接地性手或夾持器是否可見機(jī)器手臂是否可見目標(biāo)物體是否有意外消失、以及一致性兩幀是否在同一場景相機(jī)視角是否穩(wěn)定畫面朝向是否正常描述與視覺變化是否一致手的變化是否在文字中有所體現(xiàn)。如果畫面變化有效但文字描述有誤系統(tǒng)會自動修正文字而不是直接丟棄這個片段。最終約75%的候選片段通過了質(zhì)量驗(yàn)證。第三階段是片段結(jié)構(gòu)化把通過質(zhì)量驗(yàn)證的片段組織成四個層級的訓(xùn)練任務(wù)。最基礎(chǔ)的L0層是單步預(yù)測輸入一步的起始畫面和動作描述預(yù)測這步結(jié)束時的畫面L1層是步驟級聯(lián)合規(guī)劃給定視覺上下文和目標(biāo)條件模型輸出一系列步驟文字及其對應(yīng)的結(jié)束畫面L2層是子目標(biāo)規(guī)劃把若干步驟合并為更高層次的子目標(biāo)每個子目標(biāo)配有邊界畫面L3層是最終狀態(tài)想象只給初始畫面和任務(wù)描述讓模型直接預(yù)測整個任務(wù)完成時的最終畫面。這四個層級從局部到全局讓模型學(xué)會在不同粒度上進(jìn)行聯(lián)合規(guī)劃。---**五、分兩階段訓(xùn)練先打基礎(chǔ)再專攻具身**RxBrain的訓(xùn)練采用兩階段課程式策略可以類比為先上通識課、再上專業(yè)課。第一階段是聯(lián)合視覺語言預(yù)訓(xùn)練訓(xùn)練數(shù)據(jù)由兩大部分混合而成60%是大規(guī)模圖文對來自LAION和COYO數(shù)據(jù)集共約2億條40%是多模態(tài)指令跟隨數(shù)據(jù)來自LLaVA-OneVision和MAmmoTH共約1.13億條。這一階段的核心目標(biāo)是讓模型同時學(xué)會理解圖像和生成圖像在一個共享的表示空間中把語言、視覺感知和視覺生成統(tǒng)一起來同時保留大語言模型原有的語言能力。圖像生成目標(biāo)損失權(quán)重設(shè)置相對更高λ1.0語言生成權(quán)重相對較低λ0.25這是因?yàn)橐曈X生成能力需要從頭建立而語言能力已有良好基礎(chǔ)。第二階段是具身監(jiān)督微調(diào)從第一階段的檢查點(diǎn)繼續(xù)訓(xùn)練訓(xùn)練數(shù)據(jù)混合了六類內(nèi)容總計約422份的混合比例一般圖文對T2I基礎(chǔ)數(shù)據(jù)和高質(zhì)量圖文對合計約25.9%、通用多模態(tài)理解數(shù)據(jù)34.6%、具身多幀世界模型數(shù)據(jù)16.2%、具身交錯規(guī)劃數(shù)據(jù)20.8%。這一階段兩類損失權(quán)重相等均為1.0讓語言推理和視覺生成在具身任務(wù)上協(xié)同提升。訓(xùn)練時使用了最高368塊GPU即46個8卡節(jié)點(diǎn)全局批量大小7360第二階段使用312塊GPU39個節(jié)點(diǎn)全局批量3120。兩階段均使用AdamW優(yōu)化器、余弦學(xué)習(xí)率調(diào)度和bf16精度圖像生成分辨率上限256像素通過16倍下采樣的VAE進(jìn)行潛變量操作。---**六、RxBrain-Bench專門評測聯(lián)合規(guī)劃能力的新基準(zhǔn)**為了衡量模型是否真正掌握了語言視覺聯(lián)合規(guī)劃的能力研究團(tuán)隊專門構(gòu)建了一個新的評測基準(zhǔn)**RxBrain-Bench**。這個基準(zhǔn)分三個評測賽道。第一個賽道叫具身視覺問答EVQA評測模型能否從視覺觀察中理解具身場景并作出任務(wù)相關(guān)的決策。題目來自工業(yè)、零售和服務(wù)等真實(shí)商業(yè)場景涵蓋高層規(guī)劃把任務(wù)分解為可執(zhí)行步驟、模擬推進(jìn)規(guī)劃在多輪交互中根據(jù)中間狀態(tài)更新后續(xù)決策、細(xì)粒度步驟推理抓取點(diǎn)、運(yùn)動軌跡、動作選擇、時序判斷、多視角觀察、錯誤恢復(fù)識別異常狀態(tài)并選擇正確應(yīng)對方式、以及任務(wù)完成判斷判斷當(dāng)前狀態(tài)是否滿足目標(biāo)。共1123道多選題加258道模擬規(guī)劃題總計1381個評測項(xiàng)目。第二個賽道叫世界狀態(tài)預(yù)測WorldPred評測模型在給定當(dāng)前觀察和自然語言動作指令后能否生成描述動作結(jié)果的短時序畫面4幀。評測標(biāo)準(zhǔn)包含五個維度觀察連續(xù)性生成的第一幀是否自然延續(xù)當(dāng)前觀察、動作正確性生成的幀序列是否執(zhí)行了正確的動作、目標(biāo)完成度最終幀是否達(dá)到了任務(wù)暗示的目標(biāo)狀態(tài)、時序物理合理性幀間運(yùn)動是否流暢且物理上合理、以及與真實(shí)軌跡的匹配度最終加權(quán)得分為這五項(xiàng)的線性組合。第三個賽道叫聯(lián)合規(guī)劃JointPlan也是RxBrain-Bench最核心的部分評測模型能否在完全自回歸的閉環(huán)推演中進(jìn)行語言加視覺的聯(lián)合規(guī)劃。模型在每一步都必須輸出自然語言子步驟描述和對應(yīng)的目標(biāo)畫面然后以自己生成的畫面作為下一步的輸入繼續(xù)規(guī)劃直到任務(wù)完成。評測標(biāo)準(zhǔn)包含六個維度觀察理解、子任務(wù)規(guī)劃、目標(biāo)圖像正確性、子任務(wù)與目標(biāo)的一致性、完整鏈條的完成度、以及圖像相似度用DINO特征的余弦相似度衡量生成畫面與真實(shí)目標(biāo)畫面的接近程度加權(quán)得分覆蓋這六個方面。---**七、評測結(jié)果在多個維度上表現(xiàn)出色**在通用圖像生成能力方面RxBrain在GenEval基準(zhǔn)上獲得82.4分與專門針對圖像生成優(yōu)化的BAGEL模型82分基本持平明顯高于同樣具備生成能力的Cosmos-3-Nano模型71.68分。這說明RxBrain在擴(kuò)展到具身任務(wù)的同時并沒有犧牲其通用圖像生成能力。在具身與空間理解方面RxBrain在多個公開基準(zhǔn)上處于前列。在CV-Bench上以88.59分排名第一在EmbSpatial上以82.3分緊追Cosmos-3-Nano82.1分的第二位在DA-2k深度感知理解上以83.4分排名第一。特別在多視角和三維理解領(lǐng)域RxBrain的優(yōu)勢最為突出在3DRSBench上以54.1分排名第一在MMSI-Bench多圖空間智能上以35.8分領(lǐng)先在MindCube空間心理建模上以47.5分名列前茅在SITE-Bench圖像空間理解上以54.9分居首。在機(jī)器人軌跡預(yù)測上Share-Robot-TrajectoryRxBrain以51.13分排名第一比此前最佳模型Cosmos-3-Nano的39.02分高出約12個百分點(diǎn)。在RoboSpatial-Home配置理解上以86.28分排名第一。不過在需要精確指點(diǎn)定位Pointing和機(jī)器人抓取位置預(yù)測Share-Robot-Affordance方面專門針對空間指向優(yōu)化的RoboBrain2.5模型仍然更強(qiáng)。在RxBrain-Bench-EVQA的自建評測中RxBrain綜合得分為72.7分低于Qwen3.5-4B的78.1分和Cosmos-3-Nano的76.7分但在成功檢測Success Detection85.1分和模擬規(guī)劃Simulation Planning51.6分兩個維度上表現(xiàn)最佳說明模型在判斷任務(wù)是否完成以及在多輪模擬中更新決策方面有獨(dú)特優(yōu)勢。主要差距集中在精細(xì)空間定位、軌跡與時序推理以及錯誤恢復(fù)方面。在世界狀態(tài)預(yù)測WorldPred評測中RxBrain以0.62的綜合得分超越Cosmos-3-Nano0.591和Wan2.2-TI2V-5B0.429。觀察連續(xù)性得分0.67和動作正確性得分0.65是最強(qiáng)項(xiàng)時序物理合理性0.53是最弱項(xiàng)說明生成畫面的物理連貫性仍有提升空間。在不同子數(shù)據(jù)集上的表現(xiàn)從UMI的0.73到arctic的0.35不等兩幀條件輸入的整體效果最佳。值得關(guān)注的是RxBrain雖然并非專門的視頻生成模型卻超過了專為具身世界建模設(shè)計且在大量視頻數(shù)據(jù)上預(yù)訓(xùn)練的Cosmos-3-Nano體現(xiàn)了統(tǒng)一模型架構(gòu)的優(yōu)勢。在聯(lián)合規(guī)劃JointPlan評測中RxBrain以0.68的綜合得分大幅領(lǐng)先所有基線Cosmos-3-Nano智能體得分0.521統(tǒng)一多模態(tài)模型BAGEL-7B-MoT得分0.503模塊化的Qwen-Agent得分0.431。具體來看觀察理解得分0.83和子任務(wù)規(guī)劃得分0.78是最強(qiáng)項(xiàng)目標(biāo)圖像正確性0.52是最弱項(xiàng)再次印證了語言推理能力強(qiáng)于視覺想象能力的規(guī)律。在不同規(guī)劃深度上兩步規(guī)劃得分0.69八步規(guī)劃得分降至0.55體現(xiàn)了長程推演中誤差累積的挑戰(zhàn)。RxBrain在子任務(wù)規(guī)劃和鏈條完成度上的領(lǐng)先優(yōu)勢最大說明它在保持整體計劃一致性方面具有明顯優(yōu)勢。---**八、從大腦到手臂擴(kuò)展到真實(shí)機(jī)器人動作生成**RxBrain不只是一個能規(guī)劃的大腦研究團(tuán)隊還把它擴(kuò)展成能控制機(jī)器人手臂實(shí)際運(yùn)動的系統(tǒng)。擴(kuò)展的方式是在原有的MoT架構(gòu)基礎(chǔ)上新增一個動作專屬分支包含獨(dú)立的注意力投影層、前饋網(wǎng)絡(luò)和層歸一化但仍與語言、視覺和狀態(tài)的全局注意力共享信息交流。這個動作分支的初始參數(shù)復(fù)制自視覺理解分支相當(dāng)于讓它從理解畫面的能力出發(fā)重新學(xué)習(xí)如何把理解轉(zhuǎn)化為動作。一個特別設(shè)計的門控專家融合機(jī)制讓動作分支能夠借用視覺生成分支中已經(jīng)學(xué)到的預(yù)測性和規(guī)劃性知識。具體來說動作模塊的前饋網(wǎng)絡(luò)輸出等于動作專屬前饋網(wǎng)絡(luò)的結(jié)果加上一個可學(xué)習(xí)的通道門控權(quán)重乘以視覺生成前饋網(wǎng)絡(luò)的結(jié)果。這個門控權(quán)重初始為零意味著訓(xùn)練開始時動作模塊完全依靠自身隨著訓(xùn)練推進(jìn)門控權(quán)重逐漸學(xué)習(xí)到哪些視覺生成知識對動作預(yù)測有幫助并選擇性地引入。這種設(shè)計讓動作模塊不需要從零開始學(xué)習(xí)規(guī)劃性知識而是站在視覺生成模塊已有積累的肩膀上。動作的表示方式是對于雙臂機(jī)器人每個機(jī)械手臂的末端執(zhí)行器狀態(tài)包含三維位置、四元數(shù)姿態(tài)和夾持器開合量共16維。本體感知狀態(tài)通過輕量級編碼器映射為單一狀態(tài)令牌未來H步的動作塊通過流匹配Flow Matching在歸一化動作空間中生成訓(xùn)練目標(biāo)是讓模型預(yù)測的速度場在去噪過程中準(zhǔn)確指向真實(shí)動作方向。在真實(shí)機(jī)器人實(shí)驗(yàn)中研究團(tuán)隊選取了三個多階段家務(wù)操作任務(wù)進(jìn)行評測每個任務(wù)各進(jìn)行100次真機(jī)試驗(yàn)。在擺設(shè)餐桌任務(wù)中需要從架子上取出盤子、叉子和刀并按正確位置擺放RxBrain成功率97%超過π0的82%和π0.5的90%。在折疊收納眼鏡任務(wù)中需要折疊眼鏡腿并放入眼鏡盒RxBrain成功率95%超過π0的76%和π0.5的82%。在撿拾垃圾任務(wù)中需要先開垃圾桶蓋再將廢紙放入RxBrain成功率68%超過π0的46%但略低于π0.5的74%。三個任務(wù)的平均成功率為87%π0為68%π0.5為82%。需要特別指出的是這些結(jié)果是在沒有大規(guī)模動作數(shù)據(jù)預(yù)訓(xùn)練的情況下取得的說明具身規(guī)劃預(yù)訓(xùn)練產(chǎn)生的世界知識確實(shí)能夠遷移到真實(shí)動作控制中。---**九、讓推理速度跟上機(jī)器人的手速**在實(shí)驗(yàn)室里表現(xiàn)優(yōu)秀的模型在真正控制機(jī)器人時還面臨一個重要挑戰(zhàn)速度。如果模型每次預(yù)測動作都需要很長時間機(jī)器人就會動得磕磕絆絆就像一個總是猶豫半天才邁腿的人走路一樣。研究團(tuán)隊對實(shí)時部署進(jìn)行了專項(xiàng)加速優(yōu)化并堅守一個底線所有優(yōu)化必須在數(shù)值上等價于原始模型也就是說機(jī)器人的軌跡不能因?yàn)榧铀俣l(fā)生任何可測量的變化。原始模型每幀推理需要210毫秒主要瓶頸出乎意料地不是矩陣乘法而是混合變換器架構(gòu)中的模態(tài)分發(fā)邏輯每一層都要重新計算哪些令牌屬于語言、哪些屬于視覺、哪些屬于動作這個操作在一次前向傳播中觸發(fā)了約1091次nonzero調(diào)用累計占據(jù)174毫秒CPU時間再加上索引操作的48毫秒和拷貝操作的21毫秒。針對這個瓶頸研究團(tuán)隊實(shí)施了三項(xiàng)優(yōu)化預(yù)計算前綴鍵值緩存觀察幀和指令文字的上下文在動作流匹配的多步去噪過程中是固定不變的可以只計算一次并復(fù)用僅對動作令牌進(jìn)行快速解碼有了緩存之后每步去噪只需要處理16個動作令牌而非989個前綴令牌加16個動作令牌去同步化模態(tài)分發(fā)加CUDA圖捕獲把每層的令牌路由索引預(yù)計算好用gather和scatter替換布爾索引消除GPU與CPU之間的反復(fù)同步最后用CUDA圖固定整個解碼步驟以消除內(nèi)核啟動開銷。三項(xiàng)優(yōu)化組合后推理延遲從210毫秒降至143毫秒提速約1.47倍同時位置誤差小于0.65毫米、姿態(tài)誤差小于0.73度完全處于bf16精度的舍入誤差范圍內(nèi)。---**研究的局限與未來方向**研究團(tuán)隊坦誠地指出了RxBrain目前存在的三個主要局限。第一模型規(guī)模相對較小62億參數(shù)可能限制了它處理高度復(fù)雜推理、精細(xì)視覺想象和長程規(guī)劃的能力擴(kuò)大模型和數(shù)據(jù)規(guī)模是顯然的改進(jìn)方向。第二雖然RxBrain能跨多種具身場景泛化但對于完全陌生的環(huán)境、機(jī)器人形態(tài)或任務(wù)領(lǐng)域仍然需要額外的微調(diào)才能達(dá)到理想性能。第三交錯生成涉及兩種不同的生成范式文字的自回歸生成和圖像的流匹配生成訓(xùn)練和推理之間仍然存在一些差異盡管通過VAE重建傳遞的視覺狀態(tài)構(gòu)建策略已經(jīng)有所緩解但尚未引入強(qiáng)化學(xué)習(xí)或其他序列級優(yōu)化方法來進(jìn)一步對齊兩種模態(tài)的生成過程。未來團(tuán)隊計劃向兩個方向發(fā)力一是擴(kuò)大模型規(guī)模預(yù)期更大的模型將在聯(lián)合規(guī)劃的連貫性、世界狀態(tài)預(yù)測的準(zhǔn)確性和整體規(guī)劃能力上帶來系統(tǒng)性提升二是增強(qiáng)自主性讓模型更好地分解開放性任務(wù)、監(jiān)控執(zhí)行進(jìn)度、修正規(guī)劃并以更自主的方式與環(huán)境交互。---說到底RxBrain這項(xiàng)工作的意義在于它清晰地回答了一個問題一個能真正勝任復(fù)雜任務(wù)的機(jī)器人大腦需要的不僅僅是會說第一步做什么也需要能在腦海中看見每一步完成后世界應(yīng)該是什么樣子這兩種能力必須緊密耦合而不是各自為政。RxBrain給出了一套初步但系統(tǒng)的實(shí)現(xiàn)方案——從模型架構(gòu)、數(shù)據(jù)構(gòu)建、訓(xùn)練策略到評測體系——為具身認(rèn)知基礎(chǔ)模型的研究開辟了一條有價值的路徑。對這項(xiàng)研究感興趣的讀者可以通過arXiv編號2607.14187找到完整論文也可以在Hugging Face上查找Tencent/Hy-Embodied-RxBrain-1.0獲取模型在GitHub上查找Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0獲取代碼。---**QA**Q1RxBrain和普通機(jī)器人規(guī)劃模型有什么區(qū)別A普通機(jī)器人規(guī)劃模型要么只用語言描述步驟要么只生成畫面兩者分開工作。RxBrain的特點(diǎn)是把語言步驟規(guī)劃和視覺狀態(tài)想象放在同一個序列里同時完成——每說出一個動作步驟就同時生成那步執(zhí)行后世界應(yīng)該是什么樣子的畫面兩者互相驗(yàn)證、互相依賴。Q2RxBrain真實(shí)機(jī)器人測試的成功率是多少A在三個家務(wù)操作任務(wù)上RxBrain平均成功率為87%擺設(shè)餐桌97%折疊收納眼鏡95%撿拾垃圾68%。對比基線π0平均68%和π0.5平均82%RxBrain整體更優(yōu)且是在沒有大規(guī)模動作數(shù)據(jù)預(yù)訓(xùn)練的條件下取得的。Q3RxBrain的訓(xùn)練數(shù)據(jù)有多大規(guī)模A研究團(tuán)隊從真實(shí)機(jī)器人操作、手持夾持器采集、仿真環(huán)境和人類第一視角視頻四類來源收集了超過5萬小時的具身任務(wù)視頻通過自動化流水線篩選出約2150萬個高質(zhì)量訓(xùn)練片段通過率約75%。

相關(guān)新聞

從零構(gòu)建智能移動機(jī)器人:四輪差速底盤與ROS 2導(dǎo)航實(shí)戰(zhàn)

從零構(gòu)建智能移動機(jī)器人:四輪差速底盤與ROS 2導(dǎo)航實(shí)戰(zhàn)

1. 項(xiàng)目概述:當(dāng)“智能”遇上“馬車”,一場關(guān)于移動與陪伴的跨界實(shí)驗(yàn)“真能拔腿撒歡的智能馬車”,這個標(biāo)題聽起來像是一個充滿奇思妙想的玩笑,或者某個科幻電影里的道具。但如果你把它拆開來看,會發(fā)現(xiàn)它精準(zhǔn)地指向了兩個…

2026/7/29 2:05:59 閱讀更多
【LLM面試專題】11.2 面試實(shí)戰(zhàn):場景設(shè)計題

【LLM面試專題】11.2 面試實(shí)戰(zhàn):場景設(shè)計題

大廠面試中拉開差距的核心題型。面試官給一個開放場景,讓你設(shè)計解決方案。 評分標(biāo)準(zhǔn)不在"答案正確",而在:結(jié)構(gòu)化思考、權(quán)衡取舍、知識廣度。 本章提供9個完整系統(tǒng)設(shè)計方案,每題包含:問題界定→架構(gòu)→權(quán)衡→故…

2026/7/29 2:05:59 閱讀更多
基于Raft分布式Kv存儲:sendAppendEntries

基于Raft分布式Kv存儲:sendAppendEntries

sendAppendEntries() 可以理解為: 針對某一個 Follower,執(zhí)行一次 AppendEntries RPC,然后把回復(fù)合并回 Leader 的 Raft 狀態(tài)。 它不負(fù)責(zé)構(gòu)造請求。請求由 doHeartBeat() 提前構(gòu)造,它只負(fù)責(zé): 發(fā)送 RPC↓ 等待結(jié)果↓ 檢…

2026/7/29 2:05:59 閱讀更多
SQL注入四種類型詳解:原理、利用與防御

SQL注入四種類型詳解:原理、利用與防御

1. 什么是 SQL 注入?SQL 注入是指攻擊者將惡意 SQL 代碼插入到輸入?yún)?shù)中,應(yīng)用程序未進(jìn)行過濾便將其拼接到 SQL 查詢語句中,導(dǎo)致數(shù)據(jù)庫執(zhí)行了非預(yù)期的命令。一句話解釋就是你輸入的內(nèi)容被直接當(dāng)作代碼執(zhí)行了2. 四種常見類型2.1 聯(lián)合查詢注入 …

2026/7/29 6:06:06 閱讀更多
機(jī)器學(xué)習(xí)與深度學(xué)習(xí):核心差異與實(shí)戰(zhàn)應(yīng)用指南

機(jī)器學(xué)習(xí)與深度學(xué)習(xí):核心差異與實(shí)戰(zhàn)應(yīng)用指南

1. 機(jī)器學(xué)習(xí)與深度學(xué)習(xí):從理論到實(shí)戰(zhàn)的全方位解析 在數(shù)據(jù)爆炸的時代,機(jī)器學(xué)習(xí)(Machine Learning)和深度學(xué)習(xí)(Deep Learning)已經(jīng)成為推動技術(shù)進(jìn)步的核心引擎。作為一名從業(yè)多年的數(shù)據(jù)科學(xué)家,我見…

2026/7/29 6:06:06 閱讀更多
NSAIDs藥物全解析:從作用機(jī)制到安全使用指南

NSAIDs藥物全解析:從作用機(jī)制到安全使用指南

1. 從“止痛藥”到“抗炎藥”:重新認(rèn)識NSAIDs 在藥柜里,布洛芬、阿司匹林、雙氯芬酸鈉這些名字你一定不陌生。頭疼腦熱、關(guān)節(jié)酸痛、運(yùn)動拉傷,我們總會習(xí)慣性地求助于它們。但你是否想過,這些被我們籠統(tǒng)稱為“止痛藥”的家伙&#…

2026/7/29 6:06:06 閱讀更多
51單片機(jī)LED點(diǎn)陣廣告牌設(shè)計:從硬件驅(qū)動到軟件掃描全解析

51單片機(jī)LED點(diǎn)陣廣告牌設(shè)計:從硬件驅(qū)動到軟件掃描全解析

1. 項(xiàng)目概述:從零到一,打造一個會“說話”的LED點(diǎn)陣廣告牌最近在帶學(xué)生做單片機(jī)課設(shè),發(fā)現(xiàn)“LED點(diǎn)陣廣告牌設(shè)計”這個題目真是經(jīng)久不衰。它麻雀雖小,五臟俱全,幾乎涵蓋了單片機(jī)應(yīng)用開發(fā)的所有核心環(huán)節(jié):從硬件…

2026/7/29 6:06:06 閱讀更多
Spring Security OAuth2 Scope驗(yàn)證全流程解析與實(shí)戰(zhàn)

Spring Security OAuth2 Scope驗(yàn)證全流程解析與實(shí)戰(zhàn)

1. 項(xiàng)目概述:為什么我們需要深入理解OAuth2的scope驗(yàn)證? 如果你正在開發(fā)或維護(hù)一個基于Spring Security OAuth2的授權(quán)服務(wù)器或資源服務(wù)器,那么“scope驗(yàn)證”這個環(huán)節(jié),很可能就是你系統(tǒng)安全防線上最容易被忽視,卻又至關(guān)…

2026/7/29 5:56:05 閱讀更多
面試官大笑:“一個任務(wù)拆給 5 個 Subagent 并行跑,不比 1 個快 5 倍?“我搖頭:“快不了,還可能更慢“

面試官大笑:“一個任務(wù)拆給 5 個 Subagent 并行跑,不比 1 個快 5 倍?“我搖頭:“快不了,還可能更慢“

前兩個月,我在重構(gòu) AlgoMooc 網(wǎng)站過程中,發(fā)現(xiàn)一個問題:在 Claude Code 里把一個任務(wù)拆給 5 個 Subagent 并行跑,結(jié)果可能比 1 個 agent 從頭干到尾還慢? 大多數(shù)人的第一反應(yīng)是反過來的:活是并行干的&#…

2026/7/29 0:15:24 閱讀更多
# 鴻蒙 HarmonyOS 應(yīng)用開發(fā)實(shí)戰(zhàn)(第25期)|骰子(Dice Roller)— Unicode 符號與動畫渲染精講

# 鴻蒙 HarmonyOS 應(yīng)用開發(fā)實(shí)戰(zhàn)(第25期)|骰子(Dice Roller)— Unicode 符號與動畫渲染精講

一、應(yīng)用概述 骰子(Dice Roller) 是一款經(jīng)典的休閑娛樂應(yīng)用,模擬了真實(shí)擲骰子的過程。應(yīng)用投擲兩個骰子(六面標(biāo)準(zhǔn)骰),使用 Unicode 骰面符號直觀展示每個骰子的點(diǎn)數(shù),并伴有快速滾動的動畫效果?!?/p>

2026/7/29 0:15:24 閱讀更多