大模型微調(diào)(Supervised Fine-Tuning,SFT)是當(dāng)前最主流的 LLM 落地方案。無論是醫(yī)療問答、代碼生成,還是法律文書,上到千億參數(shù)大模型、下到端側(cè)小模型,幾乎都在用 SFT 做領(lǐng)域適配。
但一個(gè)尷尬的事實(shí)是:大家都默認(rèn) SFT" 訓(xùn)練完就是學(xué)完了 "。直到騰訊混元團(tuán)隊(duì)對(duì) Qwen、LLaMA、OLMo2 等多個(gè)模型家族(1.8B – 14B)和 10 個(gè)數(shù)據(jù)集做了全面排查,發(fā)現(xiàn)每個(gè)模型、每個(gè)數(shù)據(jù)集上都有一批訓(xùn)練樣本——模型在訓(xùn)練中見過,loss 也降下去了,但回頭重測(cè)就是答不對(duì)。平均比例高達(dá)15.3%。
這就是論文定義的不完全學(xué)習(xí)現(xiàn)象(Incomplete Learning Phenomenon,ILP)—— SFT 訓(xùn)練的系統(tǒng)性盲區(qū)。

背景場景與痛點(diǎn)
SFT 是 LLM 從 " 通才 " 變成 " 專才 " 的關(guān)鍵步驟。業(yè)界默認(rèn)做法是:
準(zhǔn)備標(biāo)注數(shù)據(jù)(QA 對(duì)、指令 - 回復(fù)對(duì)等)
在基座模型上跑 SFT 訓(xùn)練
看 loss 曲線收斂了→認(rèn)為訓(xùn)練完成
但問題在于:loss 是全局平均,掩蓋了樣本間的差異。loss 收斂只代表 " 大部分樣本學(xué)會(huì)了 " ——那些始終學(xué)不會(huì)的樣本被淹沒了。
與之對(duì)比,預(yù)訓(xùn)練階段對(duì)數(shù)據(jù)問題的排查非常深入(Dolma、C4 等都有專門的數(shù)據(jù)質(zhì)量研究),但 SFT 階段幾乎沒人追問 " 模型到底學(xué)會(huì)了什么、沒學(xué)會(huì)什么 "。
論文做了什么
這篇論文完成了四項(xiàng)工作:
定義 ILP ——將 SFT 后無法正確復(fù)現(xiàn)訓(xùn)練樣本的行為正式命名為 "Incomplete Learning"
找到五大根因——不是籠統(tǒng)地說 " 數(shù)據(jù)不好 ",而是把每個(gè)未學(xué)會(huì)樣本對(duì)應(yīng)到一個(gè)可解釋的原因
提出四步診斷框架—— Detect → Attribute → Intervene → Verify,全流程可復(fù)現(xiàn)
驗(yàn)證五種干預(yù)——證明了 CPT 補(bǔ)充知識(shí)遠(yuǎn)優(yōu)于加 epoch,且部分根因無法通過 SFT 本身解決
ILP 現(xiàn)象:訓(xùn)練 loss 收斂后仍有大量樣本無法正確復(fù)現(xiàn):

四步診斷框架一圖勝千言:

整個(gè)框架分為四個(gè)階段:
Detect(檢測(cè))→ Attribute(歸因)→ Intervene(干預(yù))→ Verify(驗(yàn)證)
Step 1:檢測(cè)(Detect)——怎么知道模型 " 沒學(xué)會(huì) "?
這是最復(fù)雜的一步。難點(diǎn)在于:怎么區(qū)分 " 大致理解 " 和 " 真正學(xué)會(huì) "?
SFT 通常生成自由文本,這種形式的 " 答對(duì) " 太模糊。論文的做法是:
MC 轉(zhuǎn)換(Multiple-Choice Conversion):
把每條 SFT 數(shù)據(jù)(QA 對(duì))用 GPT-4 轉(zhuǎn)成 4 選 1 選擇題(1 個(gè)正確答案 +3 個(gè)干擾項(xiàng))
四級(jí)質(zhì)量過濾:答案可解性→唯一性→干擾項(xiàng)區(qū)分度→人工抽檢
極端情況直接丟棄(如正確答案和干擾項(xiàng)太接近無法分辨)
案例:原始數(shù)據(jù)是 "What is the capital of France?→ Paris",轉(zhuǎn)換成:
Q:What is the capital of France?
A. London B. Paris C. Berlin D. Madrid
pass@k 指標(biāo)(k=5):
對(duì)每個(gè) MC 題,用訓(xùn)練好的模型采樣 5 次
只要 5 次中有 1 次選對(duì)了答案→判定為 " 已學(xué)會(huì) "
5 次全部選錯(cuò)→判定為 ILP 樣本
這里 k=5 不是隨便取的:溫度變化可能帶來回答的隨機(jī)性,pass@5= 給了 5 次機(jī)會(huì),比 top-1 更公允。
三重驗(yàn)證(Triple Validation):
為避免誤判,論文做了三層交叉驗(yàn)證:
跨溫度一致性:同一樣本在 T=0.1/0.5/1.0 下重新評(píng)估,ILP 差異 <0.5%
重測(cè)信度(Kappa=0.89):同一批樣本兩次獨(dú)立檢測(cè),Cohen ’ s Kappa 高達(dá) 0.89
跨模型一致性:不同模型家族(Qwen/LLaMA/OLMo2)的 ILP 判定高度一致
檢測(cè)流程圖:

這是全文最核心的貢獻(xiàn)。論文提出了一個(gè)2 × 2 歸因矩陣,縱軸是 " 基模型是否已掌握該知識(shí) "(預(yù)訓(xùn)練階段),橫軸是 "SFT 標(biāo)簽是否正確 "(標(biāo)注質(zhì)量)。

知識(shí)方向判斷:在基座模型上做零樣本測(cè)試→如果基模型能答對(duì),說明 " 知識(shí)已經(jīng)有了 ",問題出在 SFT 過程的沖突;如果基模型答不對(duì),說明 " 預(yù)訓(xùn)練階段就缺知識(shí) "
訓(xùn)練方向判斷:取 early-20% checkpoint 和 late-20% checkpoint,比較:如果先答對(duì)后答錯(cuò)→左側(cè)遺忘(IV);如果一直答不對(duì)→優(yōu)化不足(V);如果有多個(gè)沖突標(biāo)簽→數(shù)據(jù)矛盾(III)
最終鎖定五大根因:


關(guān)鍵發(fā)現(xiàn):ILP 與標(biāo)注質(zhì)量無關(guān)。即使 SFT 標(biāo)簽正確率超過 98%,ILP 仍然存在。說明這不是 " 數(shù)據(jù)錯(cuò)了 " 的問題,而是 SFT 訓(xùn)練機(jī)制本身的系統(tǒng)性不足。
另一個(gè)驚人發(fā)現(xiàn):ILP 與模型規(guī)模弱相關(guān)。從 Qwen-1.8B 換到 Qwen-14B,ILP 僅降低 2.1 個(gè)百分點(diǎn)。也就是說,更大規(guī)模的模型并不能顯著解決 " 學(xué)不會(huì) " 的問題——這指向 SFT 優(yōu)化機(jī)制,而不是模型容量。
Step 3:干預(yù)(Intervene)——怎么讓模型學(xué)會(huì)?
論文根據(jù)五種根因,設(shè)計(jì)了對(duì)癥的五類干預(yù):

CPT(2 倍訓(xùn)練量)→ ILP 降 12.5%
加 epochs(10 倍訓(xùn)練量)→ ILP 僅降 2%
這意味著:拼命加 SFT 訓(xùn)練輪次幾乎沒用,真正的瓶頸在于預(yù)訓(xùn)練階段的知識(shí)儲(chǔ)備。SFT 本身存在物理上限,它只能 " 重新組織 " 已有知識(shí),無法憑空創(chuàng)造新知識(shí)。
Step 4:驗(yàn)證(Verify)——干預(yù)真的有效嗎?
干預(yù)后重新走一遍檢測(cè)流程,對(duì)比干預(yù)前后的 ILP 率:
使用相同的 MC 轉(zhuǎn)換 +pass@5 評(píng)估
引入最小效應(yīng)量閾值(min_effect=0.01),防止統(tǒng)計(jì)噪聲
確保干預(yù)收益 > 統(tǒng)計(jì)波動(dòng)
實(shí)驗(yàn)結(jié)果 ILP 現(xiàn)象確實(shí)存在



干預(yù)效果:CPT>> 加 Epochs

物理溯源驗(yàn)證
將 ILP 樣本中涉及的知識(shí)點(diǎn)在 Dolma 5T 語料庫中檢索:
19.3% 的知識(shí)點(diǎn)在 Dolma 中完全不存在→根因 I(知識(shí)缺失)
14.5% 存在沖突信息→根因 II(知識(shí)沖突)
消融與溯源結(jié)果:

模型家族對(duì)比:

首次系統(tǒng)性定義和量化 SFT 中的不完全學(xué)習(xí)現(xiàn)象
提出了可復(fù)現(xiàn)的診斷框架(Detect → Attribute → Intervene → Verify)
揭示了 SFT 的物理上限:它只能重組已有知識(shí),無法創(chuàng)造新知識(shí)
實(shí)踐指導(dǎo)意義
不要迷信 loss 收斂。訓(xùn)練完了不等于學(xué)會(huì)了,需要 pass@k+MC 轉(zhuǎn)換做樣本級(jí)診斷。
加 epoch 性價(jià)比極低。10 倍 SFT 算力換 2% 改善,不如把預(yù)算投到預(yù)訓(xùn)練數(shù)據(jù)上。
知識(shí)缺失是第一大根因。如果你的下游任務(wù)有大量模型沒見過的新知識(shí),SFT 幾乎無能為力——要先做 CPT。
數(shù)據(jù)去重和一致性是低成本高收益的事。全局 shuffle 和動(dòng)態(tài)分桶實(shí)現(xiàn)簡單,ROUGE-L 能提升 29%。
2 × 2 矩陣可在幾分鐘內(nèi)完成根因定位。不需要全量重訓(xùn),用 early/late checkpoint 對(duì)比即可。
作者團(tuán)隊(duì)
騰訊混元大模型團(tuán)隊(duì)(Tencent Hunyuan Team)& 新南威爾士大學(xué)(UNSW),14 位作者。研究方向涵蓋 LLM 推理增強(qiáng)、獎(jiǎng)勵(lì)建模、模型效率優(yōu)化等。
該工作入選ACL 2026 主會(huì) Long Paper,是 SFT 診斷方向第一篇系統(tǒng)性研究。
論文(arXiv):https://arxiv.org/abs/2604.10079
論文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/
代碼(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn
一鍵三連「點(diǎn)贊」「轉(zhuǎn)發(fā)」「小心心」
歡迎在評(píng)論區(qū)留下你的想法!
— 完 —
【學(xué)術(shù)投稿】請(qǐng)?jiān)诠ぷ魅瞻l(fā)送郵件至:ai@qbitai.com,標(biāo)題注明【投稿】,并告訴我們:你是誰,從哪來,投稿內(nèi)容附上項(xiàng)目 / 主頁鏈接,以及聯(lián)系方式。
我們會(huì) ( 盡量 ) 及時(shí)回復(fù)你 : )
點(diǎn)亮星標(biāo)
科技前沿進(jìn)展每日見