国产av一二三区|日本不卡动作网站|黄色天天久久影片|99草成人免费在线视频|AV三级片成人电影在线|成年人aV不卡免费播放|日韩无码成人一级片视频|人人看人人玩开心色AV|人妻系列在线观看|亚洲av无码一区二区三区在线播放

網(wǎng)易首頁 > 網(wǎng)易號 > 正文 申請入駐

AAAI 2026 Oral|InfiGUI-G1模型來了,刷新GUI Grounding SOTA

0
分享至



隨著多模態(tài)大語言模型(MLLM)的飛速發(fā)展,能夠像人類一樣通過視覺輸入操作圖形用戶界面(GUI)的智能體(Agent)正逐漸成為現(xiàn)實。然而,在通往通用計算機控制的道路上,如何讓模型精準(zhǔn)地將自然語言指令對應(yīng)到屏幕上的具體元素 —— 即 GUI Grounding 任務(wù),依然是一大難題。

現(xiàn)有的方法,特別是基于驗證獎勵的強化學(xué)習(xí)(RLVR),雖然在提升 “指得準(zhǔn)”(空間對齊)方面表現(xiàn)出色,卻往往在 “指得對”(語義對齊)上遭遇瓶頸。模型常常陷入 “自信陷阱”,在復(fù)雜的語義場景下無法通過有效探索找到正確的功能圖標(biāo)。

針對這一痛點,來自浙江大學(xué)、香港理工大學(xué)及 InfiX.ai 的研究團隊提出了一種全新的自適應(yīng)探索策略優(yōu)化框架(AEPO),并推出了InfiGUI-G1系列模型。該模型通過多答案生成與自適應(yīng)獎勵機制,徹底打破了傳統(tǒng) RLVR 的探索瓶頸。僅憑 3B 和 7B 的參數(shù)量,InfiGUI-G1 便在多個高難度 GUI 基準(zhǔn)測試中刷新了 SOTA,部分指標(biāo)甚至大幅超越了閉源模型。

本文將深入介紹這項被 AAAI 2026 接收為 Oral 的工作,解讀其如何通過 “學(xué)會探索” 來實現(xiàn)更精準(zhǔn)的 GUI 語義理解。



  • 論文標(biāo)題:InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
  • 論文鏈接:https://arxiv.org/abs/2508.05731
  • 代碼鏈接:https://github.com/InfiXAI/InfiGUI-G1

從 “空間對齊” 到 “語義對齊”:被忽視的探索瓶頸

GUI Grounding 任務(wù)的核心是將自然語言指令(如 “打開相機”)映射到屏幕上的特定元素坐標(biāo)。研究團隊指出,這一任務(wù)可以解構(gòu)為兩個正交的維度:

1. 空間對齊(Spatial Alignment):能否精確地定位到元素(即 “指得準(zhǔn)”)。

2. 語義對齊(Semantic Alignment):能否識別出功能正確的元素(即 “指得對”)。

現(xiàn)有的 RLVR 方法(如 Naive RLVR)雖然能通過優(yōu)化坐標(biāo)生成來提升定位精度,但在面對語義模糊或復(fù)雜的指令時卻顯得力不從心。

例如,當(dāng)指令是 “使用相機搜索物體” 時,屏幕上可能同時存在普通的 “相機應(yīng)用” 和具有視覺搜索功能的 “Google Lens”。缺乏深度語義理解的模型往往會自信地死磕 “相機應(yīng)用” 圖標(biāo)。由于傳統(tǒng) RL 依賴當(dāng)前策略采樣,模型會不斷重復(fù)這個高置信度的錯誤,陷入“自信陷阱”(Confidence Trap),從而無法發(fā)現(xiàn)真正正確的 “Google Lens” 圖標(biāo),導(dǎo)致無法獲得修正語義誤解所需的學(xué)習(xí)信號。



GUI Grounding 的主要失敗模式: (a) 空間對齊失敗,(b) 語義對齊失敗

InfiGUI-G1:自適應(yīng)探索策略優(yōu)化(AEPO)

為了解決這一探索效率低下的問題,InfiGUI-G1 引入了AEPO(Adaptive Exploration Policy Optimization)框架。與傳統(tǒng)的單次回答生成不同,AEPO 旨在通過更廣泛且高效的探索來捕捉低概率但正確的選項。

AEPO 框架由三個協(xié)同工作的核心組件構(gòu)成:

1.多答案生成機制(Multi-Answer Generation)傳統(tǒng)的 RL 方法通常只采樣一個動作,一旦模型 “固執(zhí)己見” 地選錯,梯度的學(xué)習(xí)信號就會消失。AEPO 強制模型在一次前向傳遞中生成 N 個候選坐標(biāo)點。這一機制迫使模型跳出單一的高置信度預(yù)測,去探索策略分布長尾中的可能性,從而大幅增加了發(fā)現(xiàn)正確答案(如上述例子中的 Google Lens)的概率。

2.自適應(yīng)探索獎勵(Adaptive Exploration Reward, AER)僅僅生成多個答案是不夠的,如何評價這些答案的質(zhì)量至關(guān)重要。研究團隊基于效率第一性原理(效率 = 效用 / 成本)設(shè)計了 AER 函數(shù)。

  • 動態(tài)激勵:如果模型在靠前的排名(Rank k)就找到了正確答案,給予高額獎勵;如果失敗,則給予較小的懲罰以鼓勵繼續(xù)探索。
  • 這種非線性的獎勵設(shè)計在失敗時鼓勵模型 “廣撒網(wǎng)”,在成功時引導(dǎo)模型追求 “快準(zhǔn)狠”,實現(xiàn)了探索與利用的動態(tài)平衡。

3.共線懲罰(Collinear Penalty)為了防止模型通過生成近似直線的點來 “作弊”(簡單的線性掃描策略),研究引入了共線懲罰。如果生成的多個候選點在幾何上近似共線,將被視為低質(zhì)量探索并受到嚴(yán)厲懲罰。這強制模型在語義空間而非單純的幾何空間中進行多樣化探索。



AEPO 與 Naive 強化學(xué)習(xí)基準(zhǔn)方法的對比

實驗結(jié)果:小參數(shù)量實現(xiàn)性能越級

研究團隊在 MMBench-GUI、ScreenSpot-Pro、UI-Vision 等五個極具挑戰(zhàn)性的基準(zhǔn)上對 InfiGUI-G1(3B 和 7B 版本)進行了全面評估。

1.綜合性能全面領(lǐng)先:在 MMBench-GUI 基準(zhǔn)測試中,InfiGUI-G1-7B 在 Windows、iOS、Android 等多個平臺上的表現(xiàn)均刷新了開源模型的最佳成績。值得注意的是,InfiGUI-G1-7B 在部分指標(biāo)上甚至優(yōu)于參數(shù)量大得多的 Qwen2.5-VL-72B 和閉源模型 GPT-4o。

2.攻克高難度語義理解任務(wù)ScreenSpot-Pro 基準(zhǔn)專門區(qū)分了文本類(Text)和圖標(biāo)類(Icon)任務(wù)。結(jié)果顯示,InfiGUI-G1 在更依賴語義理解的 “圖標(biāo)” 任務(wù)上提升尤為明顯。這直接證明了 AEPO 策略有效解決了語義對齊的瓶頸,讓模型真正 “看懂” 了抽象圖標(biāo)背后的功能含義,而不僅僅是進行簡單的文本匹配。

3.讓 “不可學(xué)習(xí)” 變得 “可學(xué)習(xí)”為了驗證 AEPO 是否真的解決了探索難題,研究團隊將樣本按難度分為簡單、中等和困難。實驗發(fā)現(xiàn),InfiGUI-G1 在 “困難” 樣本(即基座模型幾乎無法答對的樣本)上的提升最為巨大,相對 Naive RLVR 基線提升了超過60%。這意味著 AEPO 成功挖掘出了那些以往因缺乏探索而被模型 “放棄” 的長尾知識。



ScreenSpot-Pro 基準(zhǔn)測試的性能對比

總結(jié)與展望

InfiGUI-G1 的成功表明,GUI 智能體的性能瓶頸不僅僅在于視覺識別能力,更在于如何通過有效的強化學(xué)習(xí)策略來解決語義對齊問題。通過引入自適應(yīng)探索機制,InfiGUI-G1 以極高的數(shù)據(jù)效率和較小的模型規(guī)模,實現(xiàn)了超越大模型的 GUI Grounding 能力。這項工作為未來開發(fā)更通用、更智能的 GUI 交互助手提供了堅實的技術(shù)基礎(chǔ)。

目前,InfiGUI-G1 的代碼、模型權(quán)重及相關(guān)資源已在 GitHub 開源,歡迎社區(qū)進一步研究與使用。

特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關(guān)推薦
熱點推薦
官宣辟謠!鹿晗這波操作,關(guān)曉彤顏面何存?

官宣辟謠!鹿晗這波操作,關(guān)曉彤顏面何存?

搞笑娛樂笑話
2026-01-08 22:12:49
傅首爾的困境有多難解?一露頭就全網(wǎng)抵制,她不再被網(wǎng)友寬容了?

傅首爾的困境有多難解?一露頭就全網(wǎng)抵制,她不再被網(wǎng)友寬容了?

小熊侃史
2026-01-09 07:35:03
老鷹奇才1換2交易官宣!特雷-楊改穿3號球衣:滿懷欣喜開啟新篇章

老鷹奇才1換2交易官宣!特雷-楊改穿3號球衣:滿懷欣喜開啟新篇章

羅說NBA
2026-01-10 04:37:12
大學(xué)生辦轉(zhuǎn)賬提額,招行要求卡里得有20萬,“我讓母親轉(zhuǎn)錢后,銀行報警了”

大學(xué)生辦轉(zhuǎn)賬提額,招行要求卡里得有20萬,“我讓母親轉(zhuǎn)錢后,銀行報警了”

大風(fēng)新聞
2026-01-09 23:35:24
大鵬再次失手,新片上映3天票房14萬,投資血本無歸

大鵬再次失手,新片上映3天票房14萬,投資血本無歸

光影新天地
2026-01-08 21:59:11
還得是中國大爺,一出手,法國文旅直接白干,成功治愈我的巴黎病

還得是中國大爺,一出手,法國文旅直接白干,成功治愈我的巴黎病

番茄娛樂加
2026-01-08 18:44:38
中方:沉痛哀悼丹羽宇一郎

中方:沉痛哀悼丹羽宇一郎

新京報政事兒
2026-01-09 15:31:25
特朗普直言:中俄懼怕美國,話音剛落,土耳其呼吁中俄伊聯(lián)手抗美

特朗普直言:中俄懼怕美國,話音剛落,土耳其呼吁中俄伊聯(lián)手抗美

天天都是好日子
2026-01-09 23:06:03
洗澡可能影響壽命!醫(yī)生再次提醒:68歲以后,牢記洗澡“4不要”

洗澡可能影響壽命!醫(yī)生再次提醒:68歲以后,牢記洗澡“4不要”

劉哥談體育
2026-01-08 05:54:41
丈夫入獄、男友死緩,如今48歲又卷入風(fēng)波,為何劉芳菲一直不順?

丈夫入獄、男友死緩,如今48歲又卷入風(fēng)波,為何劉芳菲一直不順?

巧手曉廚娘
2026-01-08 22:08:42
美國即將對伊朗發(fā)起2026年第一波軍事打擊

美國即將對伊朗發(fā)起2026年第一波軍事打擊

軍機圖
2026-01-07 14:38:46
曝2026春晚彩排路透!小品領(lǐng)軍人物確認(rèn)回歸,網(wǎng)友:終于等到這天

曝2026春晚彩排路透!小品領(lǐng)軍人物確認(rèn)回歸,網(wǎng)友:終于等到這天

有范又有料
2026-01-07 10:43:16
滿是心酸!42歲著名歌手江蘇走穴,賓客只顧吃席沒人搭理

滿是心酸!42歲著名歌手江蘇走穴,賓客只顧吃席沒人搭理

查爾菲的筆記
2026-01-04 13:13:57
新華社消息|中央宣傳部、公安部聯(lián)合發(fā)布2025年“最美基層民警”

新華社消息|中央宣傳部、公安部聯(lián)合發(fā)布2025年“最美基層民警”

新華社
2026-01-09 20:09:29
白宮“購島”方案流出:向格陵蘭人一次性付款,以說服他們脫離丹麥并可能加入美國,每人或得1萬-10萬美元

白宮“購島”方案流出:向格陵蘭人一次性付款,以說服他們脫離丹麥并可能加入美國,每人或得1萬-10萬美元

都市快報橙柿互動
2026-01-09 08:14:32
佩特羅:“特朗普對我說已在策劃軍事行動”

佩特羅:“特朗普對我說已在策劃軍事行動”

環(huán)球時報國際
2026-01-09 23:53:19
A股:人民日報定調(diào)!釋放強烈信號,股民準(zhǔn)備好,下周要沖4200?

A股:人民日報定調(diào)!釋放強烈信號,股民準(zhǔn)備好,下周要沖4200?

云鵬敘事
2026-01-10 00:00:06
中組部決定:田宏斌履新

中組部決定:田宏斌履新

極目新聞
2026-01-09 19:35:30
蘋果首款新品官宣:1月8日,正式開售

蘋果首款新品官宣:1月8日,正式開售

科技堡壘
2026-01-07 12:54:13
事關(guān)經(jīng)營貸、消費貸!國常會:部署實施一攬子政策

事關(guān)經(jīng)營貸、消費貸!國常會:部署實施一攬子政策

21世紀(jì)經(jīng)濟報道
2026-01-09 20:54:36
2026-01-10 06:39:00
機器之心Pro incentive-icons
機器之心Pro
專業(yè)的人工智能媒體
12088文章數(shù) 142533關(guān)注度
往期回顧 全部

科技要聞

市場偏愛MiniMax:開盤漲42%,市值超700億

頭條要聞

特朗普:美扣押一艘離開委內(nèi)瑞拉油輪 石油將出售

頭條要聞

特朗普:美扣押一艘離開委內(nèi)瑞拉油輪 石油將出售

體育要聞

金元時代最后的外援,來中國8年了

娛樂要聞

關(guān)曉彤鹿晗風(fēng)波后露面 不受影響狀態(tài)佳

財經(jīng)要聞

投資必看!瑞銀李萌給出3大核心配置建議

汽車要聞

助跑三年的奇瑞 接下來是加速還是起跳?

態(tài)度原創(chuàng)

本地
旅游
手機
游戲
軍事航空

本地新聞

云游內(nèi)蒙|“包”你再來?一座在硬核里釀出詩意的城

旅游要聞

想看霧凇別瞎跑!吉林阿什哈達這 5 個觀賞秘訣,幫你避開空跑遺憾

手機要聞

小米17限時官降!新一代SU7申報 還有神秘終端

怎么會有游戲上來就說自己的新服活不過10天啊?"/> 主站 商城 論壇 自運營 登錄 注冊 怎么會有游戲上來就說自己的新服活不過10天?。?廉頗 202...

軍事要聞

特朗普:已開始從委石油資源中賺錢

無障礙瀏覽 進入關(guān)懷版