电竞比分网-中国电竞赛事及体育赛事平台

關(guān)于ZAKER Skills 合作
量子位 15小時(shí)前

Loss 收斂不代表學(xué)會(huì):騰訊混元 ACL 2026 拆解 SFT 訓(xùn)練中 15.3% 的“假學(xué)會(huì)”樣本

大模型微調(diào)(Supervised Fine-Tuning,SFT)是當(dāng)前最主流的 LLM 落地方案。無論是醫(yī)療問答、代碼生成,還是法律文書,上到千億參數(shù)大模型、下到端側(cè)小模型,幾乎都在用 SFT 做領(lǐng)域適配。

但一個(gè)尷尬的事實(shí)是:大家都默認(rèn) SFT" 訓(xùn)練完就是學(xué)完了 "。直到騰訊混元團(tuán)隊(duì)對(duì) Qwen、LLaMA、OLMo2 等多個(gè)模型家族(1.8B – 14B)和 10 個(gè)數(shù)據(jù)集做了全面排查,發(fā)現(xiàn)每個(gè)模型、每個(gè)數(shù)據(jù)集上都有一批訓(xùn)練樣本——模型在訓(xùn)練中見過,loss 也降下去了,但回頭重測(cè)就是答不對(duì)。平均比例高達(dá)15.3%。

這就是論文定義的不完全學(xué)習(xí)現(xiàn)象(Incomplete Learning Phenomenon,ILP)—— SFT 訓(xùn)練的系統(tǒng)性盲區(qū)。

發(fā)表:ACL 2026 主會(huì)長文(Long Paper,Pages 30186 – 30213)

背景場景與痛點(diǎn)

SFT 是 LLM 從 " 通才 " 變成 " 專才 " 的關(guān)鍵步驟。業(yè)界默認(rèn)做法是:

準(zhǔn)備標(biāo)注數(shù)據(jù)(QA 對(duì)、指令 - 回復(fù)對(duì)等)

在基座模型上跑 SFT 訓(xùn)練

看 loss 曲線收斂了→認(rèn)為訓(xùn)練完成

但問題在于:loss 是全局平均,掩蓋了樣本間的差異。loss 收斂只代表 " 大部分樣本學(xué)會(huì)了 " ——那些始終學(xué)不會(huì)的樣本被淹沒了。

與之對(duì)比,預(yù)訓(xùn)練階段對(duì)數(shù)據(jù)問題的排查非常深入(Dolma、C4 等都有專門的數(shù)據(jù)質(zhì)量研究),但 SFT 階段幾乎沒人追問 " 模型到底學(xué)會(huì)了什么、沒學(xué)會(huì)什么 "。

論文做了什么

這篇論文完成了四項(xiàng)工作:

定義 ILP ——將 SFT 后無法正確復(fù)現(xiàn)訓(xùn)練樣本的行為正式命名為 "Incomplete Learning"

找到五大根因——不是籠統(tǒng)地說 " 數(shù)據(jù)不好 ",而是把每個(gè)未學(xué)會(huì)樣本對(duì)應(yīng)到一個(gè)可解釋的原因

提出四步診斷框架—— Detect → Attribute → Intervene → Verify,全流程可復(fù)現(xiàn)

驗(yàn)證五種干預(yù)——證明了 CPT 補(bǔ)充知識(shí)遠(yuǎn)優(yōu)于加 epoch,且部分根因無法通過 SFT 本身解決

ILP 現(xiàn)象:訓(xùn)練 loss 收斂后仍有大量樣本無法正確復(fù)現(xiàn):

不完全學(xué)習(xí)現(xiàn)象示意圖—— SFT 后訓(xùn)練集回測(cè),部分樣本在訓(xùn)練過程中并未被有效學(xué)習(xí)

四步診斷框架一圖勝千言:

三段式診斷框架——檢測(cè)→歸因→干預(yù),覆蓋 ILP 全生命周期技術(shù)方案——四步診斷框架

整個(gè)框架分為四個(gè)階段:

Detect(檢測(cè))→ Attribute(歸因)→ Intervene(干預(yù))→ Verify(驗(yàn)證)

Step 1:檢測(cè)(Detect)——怎么知道模型 " 沒學(xué)會(huì) "?

這是最復(fù)雜的一步。難點(diǎn)在于:怎么區(qū)分 " 大致理解 " 和 " 真正學(xué)會(huì) "?

SFT 通常生成自由文本,這種形式的 " 答對(duì) " 太模糊。論文的做法是:

MC 轉(zhuǎn)換(Multiple-Choice Conversion):

把每條 SFT 數(shù)據(jù)(QA 對(duì))用 GPT-4 轉(zhuǎn)成 4 選 1 選擇題(1 個(gè)正確答案 +3 個(gè)干擾項(xiàng))

四級(jí)質(zhì)量過濾:答案可解性→唯一性→干擾項(xiàng)區(qū)分度→人工抽檢

極端情況直接丟棄(如正確答案和干擾項(xiàng)太接近無法分辨)

案例:原始數(shù)據(jù)是 "What is the capital of France?→ Paris",轉(zhuǎn)換成:

Q:What is the capital of France?

A. London B. Paris C. Berlin D. Madrid

pass@k 指標(biāo)(k=5):

對(duì)每個(gè) MC 題,用訓(xùn)練好的模型采樣 5 次

只要 5 次中有 1 次選對(duì)了答案→判定為 " 已學(xué)會(huì) "

5 次全部選錯(cuò)→判定為 ILP 樣本

這里 k=5 不是隨便取的:溫度變化可能帶來回答的隨機(jī)性,pass@5= 給了 5 次機(jī)會(huì),比 top-1 更公允。

三重驗(yàn)證(Triple Validation):

為避免誤判,論文做了三層交叉驗(yàn)證:

跨溫度一致性:同一樣本在 T=0.1/0.5/1.0 下重新評(píng)估,ILP 差異 <0.5%

重測(cè)信度(Kappa=0.89):同一批樣本兩次獨(dú)立檢測(cè),Cohen ’ s Kappa 高達(dá) 0.89

跨模型一致性:不同模型家族(Qwen/LLaMA/OLMo2)的 ILP 判定高度一致

檢測(cè)流程圖:

MC 轉(zhuǎn)換方案——將監(jiān)督響應(yīng)轉(zhuǎn)化為選擇題格式,消除自由文本評(píng)估噪聲 Step 2:歸因(Attribute)——為什么沒學(xué)會(huì)?

這是全文最核心的貢獻(xiàn)。論文提出了一個(gè)2 × 2 歸因矩陣,縱軸是 " 基模型是否已掌握該知識(shí) "(預(yù)訓(xùn)練階段),橫軸是 "SFT 標(biāo)簽是否正確 "(標(biāo)注質(zhì)量)。

兩步快速定位:

知識(shí)方向判斷:在基座模型上做零樣本測(cè)試→如果基模型能答對(duì),說明 " 知識(shí)已經(jīng)有了 ",問題出在 SFT 過程的沖突;如果基模型答不對(duì),說明 " 預(yù)訓(xùn)練階段就缺知識(shí) "

訓(xùn)練方向判斷:取 early-20% checkpoint 和 late-20% checkpoint,比較:如果先答對(duì)后答錯(cuò)→左側(cè)遺忘(IV);如果一直答不對(duì)→優(yōu)化不足(V);如果有多個(gè)沖突標(biāo)簽→數(shù)據(jù)矛盾(III)

最終鎖定五大根因:

2 × 2 歸因矩陣:

2 × 2 歸因框架——橫軸「基模型是否已知該知識(shí)」,縱軸「SFT 標(biāo)簽是否正確」

關(guān)鍵發(fā)現(xiàn):ILP 與標(biāo)注質(zhì)量無關(guān)。即使 SFT 標(biāo)簽正確率超過 98%,ILP 仍然存在。說明這不是 " 數(shù)據(jù)錯(cuò)了 " 的問題,而是 SFT 訓(xùn)練機(jī)制本身的系統(tǒng)性不足。

另一個(gè)驚人發(fā)現(xiàn):ILP 與模型規(guī)模弱相關(guān)。從 Qwen-1.8B 換到 Qwen-14B,ILP 僅降低 2.1 個(gè)百分點(diǎn)。也就是說,更大規(guī)模的模型并不能顯著解決 " 學(xué)不會(huì) " 的問題——這指向 SFT 優(yōu)化機(jī)制,而不是模型容量。

Step 3:干預(yù)(Intervene)——怎么讓模型學(xué)會(huì)?

論文根據(jù)五種根因,設(shè)計(jì)了對(duì)癥的五類干預(yù):

最驚人的對(duì)比實(shí)驗(yàn):

CPT(2 倍訓(xùn)練量)→ ILP 降 12.5%

加 epochs(10 倍訓(xùn)練量)→ ILP 僅降 2%

這意味著:拼命加 SFT 訓(xùn)練輪次幾乎沒用,真正的瓶頸在于預(yù)訓(xùn)練階段的知識(shí)儲(chǔ)備。SFT 本身存在物理上限,它只能 " 重新組織 " 已有知識(shí),無法憑空創(chuàng)造新知識(shí)。

Step 4:驗(yàn)證(Verify)——干預(yù)真的有效嗎?

干預(yù)后重新走一遍檢測(cè)流程,對(duì)比干預(yù)前后的 ILP 率:

使用相同的 MC 轉(zhuǎn)換 +pass@5 評(píng)估

引入最小效應(yīng)量閾值(min_effect=0.01),防止統(tǒng)計(jì)噪聲

確保干預(yù)收益 > 統(tǒng)計(jì)波動(dòng)

實(shí)驗(yàn)結(jié)果 ILP 現(xiàn)象確實(shí)存在

數(shù)據(jù)集中 ILP 分布:

CPT 引入后醫(yī)療、法律、金融等知識(shí)密集型領(lǐng)域的準(zhǔn)確率持續(xù)增長 ILP 與模型規(guī)模關(guān)系極弱

從 1.8B 到 14B,參數(shù)量翻了近 8 倍,ILP 僅降了 2.1 個(gè)百分點(diǎn)。ILP 是 SFT 機(jī)制層面的問題,不是模型不夠大。

干預(yù)效果:CPT>> 加 Epochs

10 倍算力換來 2%vs2 倍算力換來 12.5%。該把錢花在預(yù)訓(xùn)練,而不是無限堆 SFT epoch。

物理溯源驗(yàn)證

將 ILP 樣本中涉及的知識(shí)點(diǎn)在 Dolma 5T 語料庫中檢索:

19.3% 的知識(shí)點(diǎn)在 Dolma 中完全不存在→根因 I(知識(shí)缺失)

14.5% 存在沖突信息→根因 II(知識(shí)沖突)

消融與溯源結(jié)果:

CPT 前后各模型準(zhǔn)確率對(duì)比——提升在跨模型規(guī)模和領(lǐng)域中保持穩(wěn)定

模型家族對(duì)比:

應(yīng)用各項(xiàng)優(yōu)化策略后各基線模型的性能提升對(duì)比項(xiàng)目價(jià)值學(xué)術(shù)價(jià)值

首次系統(tǒng)性定義和量化 SFT 中的不完全學(xué)習(xí)現(xiàn)象

提出了可復(fù)現(xiàn)的診斷框架(Detect → Attribute → Intervene → Verify)

揭示了 SFT 的物理上限:它只能重組已有知識(shí),無法創(chuàng)造新知識(shí)

實(shí)踐指導(dǎo)意義

不要迷信 loss 收斂。訓(xùn)練完了不等于學(xué)會(huì)了,需要 pass@k+MC 轉(zhuǎn)換做樣本級(jí)診斷。

加 epoch 性價(jià)比極低。10 倍 SFT 算力換 2% 改善,不如把預(yù)算投到預(yù)訓(xùn)練數(shù)據(jù)上。

知識(shí)缺失是第一大根因。如果你的下游任務(wù)有大量模型沒見過的新知識(shí),SFT 幾乎無能為力——要先做 CPT。

數(shù)據(jù)去重和一致性是低成本高收益的事。全局 shuffle 和動(dòng)態(tài)分桶實(shí)現(xiàn)簡單,ROUGE-L 能提升 29%。

2 × 2 矩陣可在幾分鐘內(nèi)完成根因定位。不需要全量重訓(xùn),用 early/late checkpoint 對(duì)比即可。

作者團(tuán)隊(duì)

騰訊混元大模型團(tuán)隊(duì)(Tencent Hunyuan Team)& 新南威爾士大學(xué)(UNSW),14 位作者。研究方向涵蓋 LLM 推理增強(qiáng)、獎(jiǎng)勵(lì)建模、模型效率優(yōu)化等。

該工作入選ACL 2026 主會(huì) Long Paper,是 SFT 診斷方向第一篇系統(tǒng)性研究。

論文(arXiv):https://arxiv.org/abs/2604.10079

論文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/

代碼(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn

一鍵三連「點(diǎn)贊」「轉(zhuǎn)發(fā)」「小心心」

歡迎在評(píng)論區(qū)留下你的想法!

【學(xué)術(shù)投稿】請(qǐng)?jiān)诠ぷ魅瞻l(fā)送郵件至:ai@qbitai.com,標(biāo)題注明【投稿】,并告訴我們:你是誰,從哪來,投稿內(nèi)容附上項(xiàng)目 / 主頁鏈接,以及聯(lián)系方式

我們會(huì) ( 盡量 ) 及時(shí)回復(fù)你 : )

點(diǎn)亮星標(biāo)

科技前沿進(jìn)展每日見

相關(guān)閱讀

最新評(píng)論

沒有更多評(píng)論了