国产av一二三区|日本不卡动作网站|黄色天天久久影片|99草成人免费在线视频|AV三级片成人电影在线|成年人aV不卡免费播放|日韩无码成人一级片视频|人人看人人玩开心色AV|人妻系列在线观看|亚洲av无码一区二区三区在线播放

網易首頁 > 網易號 > 正文 申請入駐

SpatialActor通過解耦語義與幾何,為具身智能注入強魯棒空間基因

0
分享至



機器人操作模型雖然在語義理解上取得巨大成功,但往往被困在 2D 圖像的「錯覺」中。現(xiàn)有的機器人操作模型主要依賴 2D 圖像作為輸入,這意味著它們容易丟失關鍵的深度信息和 3D 幾何結構。

具體而言,基于點云的方法受限于稀疏采樣,導致細粒度語義信息的丟失;基于圖像的方法通常將 RGB 和深度信息輸入到在 3D 輔助任務上訓練的 2D 骨干網絡中,但它們糾纏在一起的語義和幾何特征對現(xiàn)實世界中固有的深度噪聲非常敏感,從而干擾了語義理解。



圖 1:不同方法的對比

針對這一痛點,Dexmal 原力靈機作者團隊提出 SpatialActor,該工作核心在于 「解耦」(Disentanglement):它不再將視覺信息混為一談,而是明確地將語義信息(這是什么?)與空間幾何信息(它在哪里?形狀如何?)分離開來,從而實現(xiàn)語義流與空間流的雙流解耦與后期融合。

作者通過引入顯式的 3D 空間編碼器,并將其與強大的視覺語言模型結合,使機器人不僅能「讀懂」指令,更能「感知」三維空間。作者在包含 50 多個任務的多個仿真和真實世界場景中評估了 SpatialActor。它在 RLBench 上取得了 87.4% 的成績,達到 SOTA 水平;在不同噪聲條件下,性能提升了 13.9% 至 19.4%,展現(xiàn)出強大的魯棒性。目前該論文已被收錄為 AAAI 2026 Oral,并將于近期開源。



  • 論文名稱:SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation
  • 論文鏈接:https://arxiv.org/abs/2511.09555
  • 項目主頁:https://shihao1895.github.io/SpatialActor/

方法與架構

作者認為,機器人操作本質上需要兩種能力的協(xié)同:一是對任務目標的語義理解(由 VLM 提供),二是對環(huán)境幾何的精確把控(由 3D 表征提供)。SpatialActor 并沒有試圖訓練一個全能的端到端網絡,而是采用了一種「雙流解耦 - 融合」的架構設計。

整體架構



圖 2:SpatialActor 架構概覽

該架構采用了獨立的視覺與深度編碼器。語義引導幾何模塊(SGM)通過門控融合機制,將來自預訓練深度專家的魯棒但缺乏細粒度信息的幾何先驗與含噪但有逐像素細節(jié)的深度特征自適應地結合,從而生成高層幾何表征。

在空間 Transformer(SPT)中,低層空間線索被編碼為位置嵌入,用以驅動空間交互。最后,視圖級交互優(yōu)化了視圖內的特征,而場景級交互則整合了跨視圖的跨模態(tài)信息,為后續(xù)的動作頭提供支持。

語義引導幾何模塊(SGM)

由于傳感器的局限性和環(huán)境干擾,現(xiàn)實世界的深度測量往往含有噪聲,而 RGB 圖像則能提供高信噪比的語義線索。大規(guī)模預訓練深度估計模型學習到了平滑的 “語義到幾何” 映射,能夠提供魯棒且通用的幾何先驗。相比之下,原始深度特征雖然保留了細粒度的像素級細節(jié),但對噪聲高度敏感。

為此,SGM 模塊通過一個凍結的大規(guī)模預訓練深度估計專家模型從 RGB 輸入中提取魯棒但粗粒度的幾何先驗,同時利用深度編碼器從原始深度中提取細粒度但含噪的幾何特征。如圖 3 (a) 所示,SGM 模塊通過一個多尺度門控機制自適應地融合這些特征,從而生成優(yōu)化后的幾何表征;該表征在保留細微細節(jié)的同時降低了噪聲,并與語義線索保持對齊。



圖 3:語義引導幾何模塊和空間 Transformer

空間 Transformer(SPT)

如圖 3 (b) 所示,SPT 模塊旨在建立精確的 2D 至 3D 映射并融合多模態(tài)特征,是生成精準動作的關鍵。首先,模塊將視覺得到的空間特征與機器人本體感知信息(如關節(jié)狀態(tài))融合。利用相機內外參矩陣和深度信息,模型將圖像像素坐標轉換為機器人基座坐標系下的三維坐標,并采用旋轉位置編碼技術將這些三維幾何信息嵌入特征中,賦予其低層的空間感知。

在特征交互層面,SPT 依次執(zhí)行視圖級和場景級注意力機制:前者優(yōu)化單視圖內部表征,后者聚合所有視圖與語言指令特征,實現(xiàn)跨模態(tài)的全局上下文融合。最終,解碼器通過預測熱力圖確定動作的三維平移位置,并基于該位置的局部特征回歸計算旋轉角度和夾爪開閉狀態(tài),完成端到端的動作生成。

實驗結果

為了全面評估 SpatialActor 的有效性,作者在仿真和真實世界環(huán)境中均開展了實驗,既比較其與當前最先進方法的表現(xiàn),也考察其在噪聲干擾下的魯棒性,并進一步驗證其在真實機器人上的實際表現(xiàn)。

仿真基準測試結果



表 1:RLBench 仿真測試結果

作者給出了 SpatialActor 在 18 個 RLBench 任務及其 249 種變體上的成功率。SpatialActor 取得了最佳的整體性能,超越了此前的 SOTA 模型 RVT-2 6.0%。值得注意的是,在諸如 Insert Peg(插銷釘)和 Sort Shape(形狀分類)等需要高空間精度的任務中,SpatialActor 的表現(xiàn)分別優(yōu)于 RVT-2 53.3% 和 38.3%。

不同程度噪聲下的表現(xiàn)



表 2:不同程度噪聲下的表現(xiàn)

在噪聲實驗中,作者通過加入不同強度的高斯擾動模擬噪聲。結果表明,無論是輕度、中度還是重度噪聲,SpatialActor 的表現(xiàn)都始終明顯優(yōu)于 RVT-2,平均成功率分別提升 13.9%、16.9% 和 19.4%。在諸如 Insert Peg(插銷釘)這類需要高精度對位的任務中,這一差距更為突出,在三檔噪聲下分別高出 88.0%、78.6% 和 61.3%,展現(xiàn)出對噪聲干擾的強魯棒性。

真機實驗結果



圖 4:真機任務

在真機實驗中,作者使用一臺配備 Intel RealSense D435i RGB-D 相機的 WidowX 單臂機器人;并采用 8 個不同的任務,共計 15 種變體。



表 6:真機結果

真機實驗結果如表 6 所示,SpatialActor 的表現(xiàn)持續(xù)優(yōu)于 RVT-2,各任務平均提升約 20%,證明其在真實場景中的有效性。為了評估針對分布變化的魯棒性,作者在被操作物體、接收物體、光照和背景發(fā)生變化的情況下對 SpatialActor 進行了測試。在這些多樣且極具挑戰(zhàn)性的條件下,SpatialActor 始終保持了高水平表現(xiàn),有力證明了其在復雜真實世界場景中的強大魯棒性與泛化能力。

結論

在本文中,作者提出了 SpatialActor,這是一個用于機器人操作的魯棒空間表征框架,旨在解決精確空間理解、傳感器噪聲以及有效交互帶來的挑戰(zhàn)。SpatialActor 將語義信息與幾何信息進行了解耦,并將幾何分支劃分為高層和低層兩個組件:SGM 將語義引導的幾何先驗與原始深度特征自適應融合,以構建魯棒的高層幾何;而 SPT 則通過位置感知交互捕捉低層空間線索。

在 50 多個仿真和真實世界任務上進行的廣泛實驗表明,SpatialActor 在多樣化的條件下均取得了更高的成功率和強大的魯棒性。這些結果凸顯了解耦的空間表征對于開發(fā)更加魯棒且具備泛化能力的機器人系統(tǒng)的重要性。

附論

機器人操作可以分解為兩個維度:空間感知與時序理解。前者關注如何將視覺與語言映射為精確的 6-DoF 位姿,實現(xiàn)對當前場景的物理 Grounding;后者則需要基于當前與過往的歷史狀態(tài),連續(xù)做出多個決策以完成長期目標。



但是,真實世界的操作并非靜態(tài)的空間問題,而是貫穿時間的連續(xù)過程。機器人不僅要抓得準,還必須記得住之前的關鍵狀態(tài),才能在長程任務中真正抓得對。這使得記憶機制成為連接空間操作與長程決策的關鍵能力。

受人類大腦「工作記憶」與「海馬體」記憶機制的啟發(fā),作者團隊還提出了 MemoryVLA,創(chuàng)新性地引入「感知 - 認知記憶」到 VLA,在決策時智能地從記憶庫中「回憶」相關歷史信息,實現(xiàn)時序感知的決策。更多信息可以參考:

  • 論文:https://arxiv.org/abs/2508.19236
  • 項目主頁:https://shihao1895.github.io/MemoryVLA
  • GitHub:https://github.com/shihao1895/MemoryVLA

特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關推薦
熱點推薦
定了!中超第7輪只有一支熱門奪冠球隊有CCTV直播

定了!中超第7輪只有一支熱門奪冠球隊有CCTV直播

80后體育大蜀黍
2026-04-20 20:31:39
曾經是央視一姐,如今是大領導,女神真是完美的人生??!

曾經是央視一姐,如今是大領導,女神真是完美的人生啊!

鄉(xiāng)野小珥
2026-04-20 18:05:37
新疆有色“一把手”又栽了?張國華這次真的跑不掉!

新疆有色“一把手”又栽了?張國華這次真的跑不掉!

觀星賞月
2026-04-21 00:51:54
關于文章被處理的通知

關于文章被處理的通知

言立方
2026-04-15 18:22:17
35+5!馬刺擊敗開拓者,楊瀚森創(chuàng)造歷史記錄

35+5!馬刺擊敗開拓者,楊瀚森創(chuàng)造歷史記錄

阿嚼影視評論
2026-04-20 12:19:15
帶兒子看急診,護士竟是前妻,她頭都沒抬:孩子媽沒來?兒子:我媽不在了,護士阿姨能做我新媽嗎?

帶兒子看急診,護士竟是前妻,她頭都沒抬:孩子媽沒來?兒子:我媽不在了,護士阿姨能做我新媽嗎?

品讀時刻
2026-04-11 09:12:01
官方:阿爾卡拉斯當選勞倫斯2025年度最佳男運動員

官方:阿爾卡拉斯當選勞倫斯2025年度最佳男運動員

懂球帝
2026-04-21 03:06:04
遭公開控訴雙面人后,王陽被曝大瓜,才發(fā)現(xiàn)蔣欣當年決策有多高明

遭公開控訴雙面人后,王陽被曝大瓜,才發(fā)現(xiàn)蔣欣當年決策有多高明

阿褲趣聞君
2026-04-17 23:11:38
阿聯(lián)酋速度很快,剛訪華回來,高調表態(tài):上萬億真金白銀押注中國

阿聯(lián)酋速度很快,剛訪華回來,高調表態(tài):上萬億真金白銀押注中國

命運自認幽默
2026-04-20 13:30:49
萬斯及美國代表團 將在數小時內抵達巴基斯坦

萬斯及美國代表團 將在數小時內抵達巴基斯坦

每日經濟新聞
2026-04-20 22:32:54
震驚世界  美國校園槍擊慘案  一共 13 人死亡

震驚世界 美國校園槍擊慘案 一共 13 人死亡

那些看得見的老照片
2026-04-20 07:00:08
天塌了!螳螂標本盒里孵出無數小螳螂,當事人:沒有滅活是失誤,屬于本土品種已放生了

天塌了!螳螂標本盒里孵出無數小螳螂,當事人:沒有滅活是失誤,屬于本土品種已放生了

瀟湘晨報
2026-04-20 16:39:30
狂跌90%!造假成風,中產追捧的網紅飲品淪為“智商稅”!

狂跌90%!造假成風,中產追捧的網紅飲品淪為“智商稅”!

青眼財經
2026-04-20 15:03:39
深圳民辦教育“大地震”:再有三所頂流名校轉公

深圳民辦教育“大地震”:再有三所頂流名校轉公

Dr小魚
2026-04-20 20:18:52
成都溫江發(fā)生交通事故致5傷,警方通報

成都溫江發(fā)生交通事故致5傷,警方通報

界面新聞
2026-04-20 22:35:59
和日本公主撞衫的議員被網友審判了…

和日本公主撞衫的議員被網友審判了…

東京新青年
2026-04-20 11:39:44
西方國家為什么都不喜歡中國?英國專家:中國有一個“老問題”

西方國家為什么都不喜歡中國?英國專家:中國有一個“老問題”

甜到你心坎
2026-04-12 22:42:27
奢靡淫逸的白馬會所:性交易泛濫,讓富婆揮金如土,最終一夜覆滅

奢靡淫逸的白馬會所:性交易泛濫,讓富婆揮金如土,最終一夜覆滅

浮光驚掠影
2026-02-20 23:15:25
A股:人民日報重磅發(fā)文,散戶做好準備,周二很可能迎來新的行情

A股:人民日報重磅發(fā)文,散戶做好準備,周二很可能迎來新的行情

云鵬敘事
2026-04-21 00:00:03
修補關系?珍妮·巴斯稱歡迎詹姆斯回歸湖人隊

修補關系?珍妮·巴斯稱歡迎詹姆斯回歸湖人隊

本澤體育
2026-04-21 06:56:37
2026-04-21 07:27:00
機器之心Pro incentive-icons
機器之心Pro
專業(yè)的人工智能媒體
12813文章數 142633關注度
往期回顧 全部

科技要聞

重磅官宣:庫克卸任,特努斯接任蘋果CEO

頭條要聞

19歲女孩挪用自家1700萬當"榜一大姐" 親爹帶女兒自首

頭條要聞

19歲女孩挪用自家1700萬當"榜一大姐" 親爹帶女兒自首

體育要聞

阿森納已拼盡全力,但你早干嘛去了...

娛樂要聞

《八千里路云和月》田家泰暗殺

財經要聞

利潤暴跌7成,字節(jié)到底在做什么

汽車要聞

把天門山搬進廠?開仰望U8沖上45度坡的那刻 我腿軟了

態(tài)度原創(chuàng)

本地
房產
藝術
公開課
軍事航空

本地新聞

12噸巧克力有難,全網化身超級偵探添亂

房產要聞

大規(guī)模商改??!??谖骱0?,這波項目要贏麻了!

藝術要聞

春天最適合小住三五天的地方

公開課

李玫瑾:為什么性格比能力更重要?

軍事要聞

特朗普:美艦向伊朗貨船開火炸出個洞

無障礙瀏覽 進入關懷版