很多人第一個會先想到,合成資料能補足 AI 訓練資料的數量。這個想法有實務理由:模型可以生成更多文字、圖片或標註,讓訓練集更完整,也能補上少見情境。但要先追問一個更前面的問題:如果生成內容沒有清楚標記,經過網路蒐集或資料整理後又被放回下一輪訓練,模型學到的資料分布會如何改變?答案取決於資料如何取代、累積、篩選與評估,不能只看資料量增加多少。

「模型崩潰」(model collapse)研究討論的正是這種回饋循環。它提醒團隊留意模型輸出逐代偏離原始資料分布的風險,也把注意力帶到資料來源、低頻樣本和訓練流程。對正在建置資料管線的團隊來說,關鍵工作是能辨識資料如何產生、保留哪些原始材料,並持續檢查模型品質是否改變。

研究中的模型退化,指的是什麼?

當模型一代代以先前模型生成的資料訓練,輸出可能逐漸偏離原始資料分布,少見特徵也可能先流失。研究稱這類現象為模型崩潰;它描述的是特定回饋訓練過程,不代表只要訓練資料含有合成內容就一定退化。

前一代的輸出如何回到下一輪

遞迴訓練可想成一條逐代傳遞的資料鏈:第一代模型從原始資料學習並生成內容;第二代再把第一代的生成內容納入訓練;後續模型則讀取前一代的輸出。若每輪都以新生成內容替代舊資料,資料集看似仍有固定規模,內部承載的卻是前一代模型已經取樣、整理過的分布。

Ilia Shumailov 等人在《Nature》發表的研究,以語言模型、變分自編碼器與高斯混合模型分析這類循環。研究發現,在不加辨別地以模型生成內容訓練時,模型會逐步偏離原始分布;論文也用理論分析與受控實驗展示這種現象。這項結果的核心,是資料來源經過模型轉換後,後續模型可能持續接收帶有前一代特徵的樣本。它不等於研究已測過所有現行大型模型或商用資料管線。

少見特徵為何容易先消失

分布中的「尾端」可以理解為比例很低、但仍真實存在的樣本,例如少見用字、特殊情境或不常見的影像特徵。模型生成內容是從已學到的分布取樣,低頻項目本來就較不容易出現。當每代資料量有限,某些低頻特徵在一輪抽樣中可能完全沒有被保留下來;下一代看不到這些例子,就更難再生成相同特徵。

這個過程會形成逐代篩減:少見樣本出現機率低,生成資料漏掉它的機會高;漏掉的部分再成為下一代的訓練材料,於是偏差可能沿著資料鏈傳遞。Shumailov 等人的論文指出,分布尾端資訊可能先消失,後續模型的輸出則可能集中在較常見的模式。資料量看起來很大,也無法單獨回答資料是否保留了必要的多樣性。

「反覆訓練時,原始資料分布的尾端可能先消失。」這是 Shumailov 等人對模型崩潰現象的研究描述,觀察來自論文中的理論分析與實驗結果。

這項研究發現了什麼,又沒有證明什麼?

不能。研究指出,在特定遞迴訓練與資料替代條件下,模型生成內容可能逐代累積偏差;是否退化會受訓練方式和資料組成影響。研究結果適合用來辨認回饋循環風險,不能直接推成所有合成資料用途的通則,也沒有提出適用所有模型的安全比例。

實驗結果要放回研究範圍理解

《Nature》論文分析多種生成模型,並以文字資料做語言模型實驗。研究重點是模型輸出如何成為後續訓練資料,以及多代之後模型分布的變化。這些設計能拆解遞迴回饋帶來的可能影響,卻沒有涵蓋所有公司採用的篩選、去重、人工審查、資料混合和模型評測方法,也沒有直接檢驗所有公開網路資料集的合成內容比例。

實際管線的資料會經過不同來源和處理方式:有些合成資料只用於特定任務微調,有些經人工核對後與真實樣本併用,也有些生成內容可能混在網頁、論壇或文件中,來源已不可辨識。這些情況對資料品質的影響不能只從一篇模型實驗推定。團隊應檢查資料是被新資料取代,還是逐批累積;原始資料是否可追溯;合成內容經過哪些篩選;測試資料是否獨立。

保留原始資料與累積資料,研究結果也有差異

另一篇研究《Is Model Collapse Inevitable?》比較「以新合成資料替換原有資料」和「逐代保留並累積資料」的設計。作者在其測試的語言、分子構形及影像生成模型中,觀察到替換資料的實驗出現退化,而累積資料與原始資料的情境沒有呈現同樣的崩潰趨勢。這說明訓練資料如何進入下一輪,是解讀模型退化的重要條件。

這項結果同樣有範圍限制。它是特定資料集、模型架構與實驗流程下的觀察,不能推成所有管線只要保留舊資料便不會退化。資料代表性、合成內容品質、資料權重和評測方式都可能改變結果。兩篇研究放在一起看,能支持的判斷是:遞迴訓練存在值得監測的風險,研究條件不同,結果也可能不同。

資料進入下一輪的方式研究中觀察到的情況解讀時要看什麼
以新生成資料替換舊資料可能逐代偏離原始分布原始資料是否被移除、樣本如何取樣
保留並累積資料部分實驗未見相同退化走勢原始資料、資料集與模型設定
篩選後使用合成資料不能由遞迴替換實驗直接判定篩選方式、用途與獨立評測

「將合成資料與原始資料一同累積,在我們測試的設定中避免了模型崩潰。」這是 Gerstgrasser 等人對其實驗結果的描述,不代表所有資料管線都能得到相同結果。

兩條資料訓練路徑分別呈現新生成資料取代舊資料,以及保留原始資料並加入審查後樣本
是否保留原始資料,會影響如何解讀不同遞迴訓練實驗的結果。

資料管線要怎麼檢查合成內容與來源?

先保存每筆資料的來源與生成方式,再保留原始資料並追蹤資料組成和模型評測變化。這些治理措施可協助團隊看見資料如何流動、調查品質改變的原因,但不能取代針對實際模型和用途的驗證。

記錄來源、生成方式與整理流程

資料的來源紀錄應能回答幾個具體問題:它來自公開網頁、授權資料集、人工撰寫、使用者互動,還是模型生成?若屬於生成內容,應記下生成工具或模型、生成時間、用途、提示或任務類型,以及後續是否經人工審閱。若資料經過翻譯、摘要、去重、改寫或標註,也要留下處理流程與版本。

實作上可將資料集版本與來源欄位綁定,並定義不同來源標記如何沿著清洗、抽樣、合併和匯出步驟保留下來。標記本身若在資料轉檔時遺失,團隊仍會遇到無法回溯的問題。若既有資料來源不完整,應將未知來源另行記錄,避免把「沒有標記」誤認為「人工原始資料」。這種設計能讓資料負責人回答:某次模型更新使用了哪些資料版本,合成內容經過哪些處置,以及發現異常時可以回退到哪個集合。

保留原始資料並監測資料組成與模型表現

保存原始資料快照有助於比較後續資料集的變化。團隊可以按來源、生成方式、語言、任務和資料型態觀察組成,追蹤重複率、低頻類別覆蓋與標記缺漏。這些數值不必直接變成單一的合成資料比例門檻;它們的用途是顯示資料分布是否有不尋常的移動,協助團隊找出需要檢查的區段。

模型面則應使用與訓練資料分開管理的測試集,評估一般能力、低頻情境和易受分布影響的任務。比較新舊模型時,測試題目、評分方式和資料版本也要留存,否則成績變化可能來自評測更新。若低頻類別表現下滑,可對照資料來源與版本,檢查樣本減少、標記錯誤、去重方式改變或其他訓練因素。

治理面板並列顯示資料來源紀錄、原始資料版本、合成資料用途分類與模型評測項目
把來源、資料版本與評測紀錄放在同一套治理流程中,異常才有線索可追。

導入治理流程前先分配責任

來源標記不是單一工程師的附加欄位。資料供應者、生成工具使用者、資料工程人員和模型訓練負責人,都需要知道自己在哪個步驟提供或保留資訊。團隊可指定資料集負責人,明確規定來源未知、授權不明、合成標記缺失或品質檢查未完成時,資料如何暫存、審核或排除。

流程也要設計例外處理。部分任務可能因隱私或授權限制,無法長期保留原始資料;這時仍須記錄限制原因、可保留的摘要資訊和核准責任人。部分合成內容經人工驗證後可能具備明確用途,也應保留驗證結果及使用範圍。這樣才能區別「未經辨識回流的網路內容」和「有來源、經篩選、目的明確的合成樣本」,避免用一個標籤涵蓋不同風險。

團隊應如何判斷治理是否有效?

把來源紀錄、資料分布和模型評測放在同一個版本流程裡,才能檢查治理措施是否真的改善了目標任務。重點在於異常可追查、比較有基準、資料有責任人,並根據實際模型與用途調整檢查項目。

  1. 盤點來源:確認訓練資料有哪些來源,並將人工內容、合成內容及未知來源分開記錄。
  2. 追蹤處理:為生成、清洗、去重、標註、混合和資料集版本保存可回溯紀錄。
  3. 保留比較基準:在可行的範圍保存原始資料快照、獨立測試資料與主要評測結果。
  4. 檢查分布變化:按任務和低頻類別檢視資料組成、標記缺漏與模型表現,不以單一總比例代替分析。
  5. 指定處置責任:明確訂出來源未知或評測異常時,由誰檢查、暫停使用、補充資料或回退版本。

治理成效要在實際訓練流程中驗證。例如,若某次資料更新後模型在少見情境表現改變,團隊能否找出資料集版本、檢視該類樣本比例,並用固定測試方式比較新舊模型?若不能,問題可能出在資料血緣或評測紀錄不足。若能追查,下一步才有基礎判斷是否需要調整資料保留、篩選或訓練方式。

合成資料也有適用情境。它可以用於擴充測試案例、產生特定格式的訓練樣本,或協助處理真實資料不易取得的任務。是否納入訓練集,應依任務目標、資料來源、品質驗證、隱私和授權條件評估。研究沒有提供通用安全比例,團隊應透過自身資料和獨立評測確認品質,不能將「合成」或「人工」任一來源標籤當成品質保證。

AI訓練資料治理的實際檢查點,是能否沿著資料管線回答三件事:資料如何產生、原始材料如何保存、模型品質如何被追蹤。這些紀錄不會自動排除所有偏差,卻讓團隊有機會辨認偏差何時進入資料、影響哪些任務,以及需要由誰處理。模型退化研究提供風險情境;落地決策仍要回到資料來源、訓練流程與目標任務逐項驗證。

  • 遞迴訓練可能讓低頻特徵逐代流失,風險與資料替換、累積及篩選方式有關。
  • 研究中的退化結果不能直接代表所有合成資料用途,也沒有通用安全比例。
  • 記錄來源與生成方式、保存可比較的原始資料,並持續評測模型,是檢查資料管線的起點。

常見問題

Q1: 合成資料一定會讓 AI 模型退化嗎?

不一定。研究指出,在模型生成資料反覆回流、尤其以新生成資料替代先前資料的特定設定下,可能出現模型退化。合成資料經過篩選、與原始資料一起累積,或用於其他任務時,條件和結果都可能不同,仍需依實際模型驗證。

Q2: 只靠 AI 生成內容偵測器,能找出所有合成資料嗎?

不能把偵測器視為完整來源紀錄。辨識結果可能受文字改寫、混合和資料格式影響;而且在內容進入資料集前,若生成方式沒有被記錄,事後分類仍有不確定性。較可追溯的做法是在生成及整理時保留來源欄位,再用抽查和品質評測補充檢查。

Q3: 團隊要設定多少比例的合成資料才安全?

目前引用的研究沒有提出適用所有模型與任務的通用安全比例。可先確認原始資料是否保留、合成資料如何篩選、低頻類別是否有足夠代表性,再以獨立測試集比較不同資料組成下的模型表現。

Q4: 要如何確認合成資料回流後模型品質有沒有改變?

固定評測資料和方法,對照訓練前後的整體表現及低頻類別表現;同時保留資料集版本、來源分布和整理紀錄。若只比較單一總分,可能看不出少數任務或樣本類別的變化。