国产av一二三区|日本不卡动作网站|黄色天天久久影片|99草成人免费在线视频|AV三级片成人电影在线|成年人aV不卡免费播放|日韩无码成人一级片视频|人人看人人玩开心色AV|人妻系列在线观看|亚洲av无码一区二区三区在线播放

網(wǎng)易首頁 > 網(wǎng)易號 > 正文 申請入駐

NeurIPS 2025 | DePass:通過單次前向傳播分解實現(xiàn)統(tǒng)一特征歸因

0
分享至



共同一作:洪翔宇,清華大學電子系大四本科生,曾獲清華大學蔣南翔獎學金等,曾在NeurIPS,EMNLP,NAACL等頂級會議上發(fā)表論文。姜澈,清華大學電子系博士三年級在讀,主要研究方向為LLM Interpretebility,LLM Agent,曾在NeurIPS,ICML,EMNLP,NAACL等頂級會議上發(fā)表論文。

隨著大型語言模型在各類任務中展現(xiàn)出卓越的生成與推理能力,如何將模型輸出精確地追溯到其內(nèi)部計算過程,已成為 AI 可解釋性研究的重要方向。然而,現(xiàn)有方法往往計算代價高昂、難以揭示中間層的信息流動;同時,不同層面的歸因(如 token、模型組件或表示子空間)通常依賴各自獨立的特定方法,缺乏統(tǒng)一且高效的分析框架。

針對這一問題,來自清華、上海 AI Lab 的研究團隊提出了全新的統(tǒng)一特征歸因框架——DePass(Decomposed Forward Pass)。

該方法通過將前向傳播中的每個隱藏狀態(tài)分解為多個可加子狀態(tài),并在固定注意力權(quán)重與 MLP 激活的情況下對其逐層傳播,實現(xiàn)了對 Transformer 內(nèi)部信息流的無損分解與精確歸因。借助 DePass,研究者能夠在輸入 token、注意力頭、神經(jīng)元乃至殘差流子空間等多個層面上進行歸因分析,為機制可解釋性研究提供了統(tǒng)一而細粒度的新視角。



  • 論文標題:DePass: Unified Feature Attributing by Simple Decomposed Forward Pass
  • 論文鏈接: https://arxiv.org/pdf/2510.18462
  • 代碼鏈接: https://github.com/TsinghuaC3I/Decomposed-Forward-Pass

問題分析:

現(xiàn)有歸因方法的局限性

現(xiàn)有的歸因方法大致可以分為以下幾類:

  • 基于噪聲消融和激活修補的方法:這些方法通過直接對模型的所有模塊施加噪聲或修補激活值來分析模型行為,但計算成本高昂,且難以洞察中間信息流。
  • 基于梯度的歸因方法:這類方法在理論上面臨挑戰(zhàn),難以提供細粒度的解釋。
  • 基于模型近似或抽象的方法:雖然部分方法能夠與人類認知對齊,但通常無法達到細粒度的組件級別(如神經(jīng)元或注意力頭),且非保守的近似可能會損害歸因的可信度。

DePass:

一種全新的歸因框架



實驗驗證:

DePass 的有效性

DePass 提供了一個統(tǒng)一的歸因框架,支持在輸入 token、注意力頭、神經(jīng)元以及殘差流子空間等多個層面進行一致歸因,無需修改模型結(jié)構(gòu)或依賴任務特定近似,并可自然銜接人類推理及稀疏字典學習(如 SAE)等方法。研究團隊在 token 級、模型組件級和子空間級歸因任務上驗證了 DePass 的有效性:

Token-Level DePass——輸出歸因到輸入:精準識別驅(qū)動預測的核心證據(jù)

我們首先在輸出到輸入 token 的歸因任務上驗證了 DePass 的表現(xiàn),目標是評估每個輸入 token 對模型最終輸出的實際貢獻。

在「Disrupt-top」實驗中,移除 DePass 判定最關(guān)鍵的 tokens 會導致模型輸出概率急劇下降,表明其捕捉到了真正驅(qū)動預測的核心證據(jù);而在「Recover-top」實驗中,DePass 保留的極少量 tokens 依然能高度恢復模型判斷。這表明 DePass 能夠更忠實地刻畫模型內(nèi)部的信息流動與輸入貢獻關(guān)系,實現(xiàn)高可信度的 token 級歸因分析。



Token-Level DePass——子空間歸因到輸入:追蹤子空間信號的 token 來源

DePass 不僅能在 token 層面追蹤預測依據(jù),還能精準定位哪些輸入 token 激活了模型中「特定方向/特定語義子空間」的信號(例如「truthfulness」方向),從而識別出影響模型判斷的關(guān)鍵來源(如誤導性信息),并顯著提升模型的可控性與可解釋性。

在事實性任務中,團隊利用 DePass 將「虛假信息子空間」拆解后,進一步將其激活分配到每個輸入 token。歸因結(jié)果清晰揭示了哪些詞觸發(fā)了模型的錯誤方向?;谶@些 token 進行定向遮罩后,模型在 CounterFact 上的事實性準確率從約10% → 40%+大幅提升,顯著優(yōu)于現(xiàn)有 probe-based masking 方法。



Model-Component-Level DePass——模型組件級歸因:觀察注意力頭與 MLP 神經(jīng)元的實際功能

DePass 能直接量化每個注意力頭與 MLP 神經(jīng)元對預測的真實貢獻,在遮罩實驗中顯著優(yōu)于梯度、激活等傳統(tǒng)重要性指標。

當遮罩 DePass 判定的「重要組件」(Top-k Masking)時,模型準確率下降更快;當僅保留「最不重要組件」(Bottom-k Masking)時,模型性能保持得更好。這說明 DePass 識別的組件重要性具備更高的敏感性、完備性、因果性,在 IOI 與 CounterFact 等任務上均顯著超越 AtP、Norm 等主流歸因指標。



Subspace-Level DePass——子空間級歸因

DePass 還可以用于研究隱狀態(tài)中不同子空間之間的相互作用,以及這些子空間對最終輸出的影響。我們以語言子空間(language subspace)為例進行分析。

我們訓練了一個語言分類器,并將其權(quán)重方向作為語言子空間的基向量。隨后,將中間層的隱狀態(tài)分別投影到語言子空間與其正交語義子空間中;兩部分隱狀態(tài)在網(wǎng)絡中分別獨立傳播至最終層,并通過 LM Head 解碼,以觀察其對應輸出。

  • 語言子空間:經(jīng) t-SNE 顯示形成清晰的語言聚類(如英文/法文/德文),體現(xiàn)語言特征集中分布。
  • 語義子空間:獨立解碼結(jié)果跨語言一致,例如無論輸入語言為何,都會生成相同的事實答案(如「Dutch」)。

這一結(jié)果說明 DePass 能忠實保留并傳播子空間的功能屬性,為跨語言解釋和語義分解提供了全新視角。



(左)對 token 在語言子空間上的投影進行 t-SNE 可視化。(右)針對不同多語言提示語,從語言子空間與語義子空間中解碼得到的前五個 token

總結(jié)

DePass 作為一種基于分解前向傳播的 Transformer 解釋框架,兼具簡潔性與高效性。通過凍結(jié)并分配注意力得分和 MLP 激活,DePass 實現(xiàn)了無損的加性分解,可無縫適配各種 Transformer 架構(gòu)。

實驗結(jié)果表明,DePass 在多層次粒度的歸因分析中具有更高的忠實性。我們期望 DePass 能成為機制可解釋性研究中的通用工具,推動社區(qū)在更廣泛的任務與模型上探索其潛力與應用。

特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關(guān)推薦
熱點推薦
娛樂圈的對賭協(xié)議有多恐怖?贏的人就是楊冪,輸者直接變成張國立

娛樂圈的對賭協(xié)議有多恐怖?贏的人就是楊冪,輸者直接變成張國立

林輕吟
2026-03-01 19:35:00
《鏢人》背后資本局:吳京虧錢也要上,郭帆放棄投資

《鏢人》背后資本局:吳京虧錢也要上,郭帆放棄投資

光影新天地
2026-03-02 11:52:35
意外!被中國用核武器轟炸45次的羅布泊,如今竟然變成了這樣!

意外!被中國用核武器轟炸45次的羅布泊,如今竟然變成了這樣!

王鶔吃吃喝喝
2026-01-16 13:57:53
股民系好安全帶了,明天3月3號,A股牛市能否再次歷史重演?

股民系好安全帶了,明天3月3號,A股牛市能否再次歷史重演?

股市皆大事
2026-03-02 16:12:09
國家正式公布:2026年3月30日起全國統(tǒng)一執(zhí)行,老墳有新規(guī)定

國家正式公布:2026年3月30日起全國統(tǒng)一執(zhí)行,老墳有新規(guī)定

哄動一時啊
2026-03-02 17:21:01
鹿晗關(guān)曉彤集體辟謠,粉絲懸著的心終于放下了

鹿晗關(guān)曉彤集體辟謠,粉絲懸著的心終于放下了

喜歡歷史的阿繁
2026-03-02 16:23:13
特朗普同意對話,以色列卻再撂狠話,美以聯(lián)合行動能持續(xù)多久?

特朗普同意對話,以色列卻再撂狠話,美以聯(lián)合行動能持續(xù)多久?

新民晚報
2026-03-02 10:32:41
深圳市中心正在悄悄“搬家”?這2個區(qū)域正在強勢崛起!

深圳市中心正在悄悄“搬家”?這2個區(qū)域正在強勢崛起!

阿離家居
2026-03-02 12:48:09
神壇徹底崩塌!李莉被中情局盯上的謊言,該徹底戳穿了

神壇徹底崩塌!李莉被中情局盯上的謊言,該徹底戳穿了

老馬拉車莫少裝
2026-03-01 17:23:52
中美沖突升級的下一步,一定是軍事較量,我們要做好全面準備

中美沖突升級的下一步,一定是軍事較量,我們要做好全面準備

曾經(jīng)年少
2025-04-14 16:03:33
前西甲球星穆尼爾駕車逃離伊朗,歷經(jīng)16小時陸路險境抵土

前西甲球星穆尼爾駕車逃離伊朗,歷經(jīng)16小時陸路險境抵土

星耀國際足壇
2026-03-02 11:46:44
哈梅內(nèi)伊被“斬首”,更大黑洞來了?

哈梅內(nèi)伊被“斬首”,更大黑洞來了?

中國新聞周刊
2026-03-01 23:26:00
中山醫(yī)學院不是中山大學醫(yī)學院,而是中山大學的醫(yī)學院!

中山醫(yī)學院不是中山大學醫(yī)學院,而是中山大學的醫(yī)學院!

金哥說新能源車
2026-03-02 00:42:53
為什么說臺海戰(zhàn)爭爆發(fā),日本的介入比美國支持臺灣還要可怕?

為什么說臺海戰(zhàn)爭爆發(fā),日本的介入比美國支持臺灣還要可怕?

細語
2025-11-17 10:23:19
韓國網(wǎng)紅博主上海旅游被宰客?一頓火鍋花了177萬韓幣!

韓國網(wǎng)紅博主上海旅游被宰客?一頓火鍋花了177萬韓幣!

奮斗在韓國
2026-03-02 11:00:03
氫彈威力上不封頂,但核武器有個不成文的規(guī)定:扔不到對方頭上去

氫彈威力上不封頂,但核武器有個不成文的規(guī)定:扔不到對方頭上去

沒有偏旁的常慶
2026-03-01 07:00:11
美軍瞞不住了!炸航母基地,炸11億美元雷達,幾十萬噸燃油被點燃

美軍瞞不住了!炸航母基地,炸11億美元雷達,幾十萬噸燃油被點燃

夢史
2026-03-01 11:22:23
保命、保飯碗、保霸權(quán)!美以打擊伊朗的真實目的全露了

保命、保飯碗、保霸權(quán)!美以打擊伊朗的真實目的全露了

Ck的蜜糖
2026-03-03 00:21:07
輪到美國被“壟斷”了!“芯片之父”棄美回國,研發(fā)成果堪比核武

輪到美國被“壟斷”了!“芯片之父”棄美回國,研發(fā)成果堪比核武

安珈使者啊
2025-12-25 14:25:42
美媒承認:B-21要執(zhí)行地球上最艱巨任務,但無法突破中國防空網(wǎng)!

美媒承認:B-21要執(zhí)行地球上最艱巨任務,但無法突破中國防空網(wǎng)!

小楊侃事
2026-03-03 00:15:52
2026-03-03 01:28:49
機器之心Pro incentive-icons
機器之心Pro
專業(yè)的人工智能媒體
12395文章數(shù) 142575關(guān)注度
往期回顧 全部

科技要聞

蘋果中國官網(wǎng)上線iPhone 17e,4499元起

頭條要聞

媒體:拉里賈尼走向前臺 四大關(guān)鍵變量將決定伊朗命運

頭條要聞

媒體:拉里賈尼走向前臺 四大關(guān)鍵變量將決定伊朗命運

體育要聞

“想要我簽名嗎” 梅西逆轉(zhuǎn)后嘲諷對手主帥

娛樂要聞

李亞鵬與哥哥和解 只有一條真心話短信

財經(jīng)要聞

油價飆升 美伊沖突將如何攪動全球經(jīng)濟

汽車要聞

國民SUV再添一員 瑞虎7L靜態(tài)體驗

態(tài)度原創(chuàng)

房產(chǎn)
手機
旅游
數(shù)碼
家居

房產(chǎn)要聞

方案突然曝光!??诒睅煷蟾叫#钟袝蟊P殺出!

手機要聞

iPhone 17e發(fā)布:4499元起,e系列首次搭載靈動島

旅游要聞

熱度飆升!非遺、冰雪…禹州元宵“文旅大餐”承包圓滿佳節(jié)!

數(shù)碼要聞

高通MWC 2026發(fā)布多項通信技術(shù),定檔2029年開啟6G商用

家居要聞

萬物互聯(lián) 享科技福祉

無障礙瀏覽 進入關(guān)懷版