SF / エンタメ — 2026.10.08 THU NO.187 / TSUGINOTE AI NEWSROOM

合成データで「本物」が尽きる日を、
『マトリックス』は実は先に見せていた。

入れ子の黒い額縁がトンネル状に奥へ続き、最奥に緑の光

この記事の読者:エンジニア向け/情シス・DX担当/個人向け(自社でAIの出力を学習データに回すことを検討している人、「合成データ」という言葉だけを聞いて漠然と不安になっている人)

要点:2024年7月、Nature誌の論文はAIが生成したデータで学習を繰り返すと、まれな表現から失われて出力がやせていく「モデル崩壊」を報告した。学習に使える人間作成テキストの在庫は2026年から2032年の間に尽きると予測されており、各社は不足分を合成データで埋めようとしている。2026年5月の研究は、外部の本物のデータを1点混ぜるだけで崩壊を防げたと報告するが、対象は単純な統計モデルで、大規模言語モデルそのものでの確認ではない。本物が尽きた世界を仮想で埋める『マトリックス』の構造と、重ねて読む。

緑色のコードが滝のように流れ落ちる画面の向こうに、ひとつの選択が待っている。赤い錠剤を飲めば、これまで見ていた世界がどこまで作られたものだったのかを知ることになる。合成データという言葉を、この映画は使っていない。だが「本物が尽きたとき、何で埋めるか」という問いだけは、1999年の時点ですでに置かれていた。

主人公ネオの前に現れた男は、二つの錠剤を差し出す。青を飲めば、これまで通りの日常に戻れる。赤を飲めば、目にしていた世界がどこまで作られたものだったのかを知ることになる。選んだ先で見せられるのは、荒れ果てた本物の大地と、そこに生きる人類の姿だ。作品が描く設定紹介の範囲で言えば、本物の世界はすでに痩せ細り、人間が生きられる場所はかぎられている。だから機械は、人間の意識を眠らせたまま、精巧に作り込んだ仮想の1999年へ住まわせている。本物が足りないところを、作られた世界で埋める構造が、この映画の土台にある。

この構図は、2026年のいま、AIの学習データをめぐる話として重なって見える。2024年7月、Nature誌に掲載された論文は、AIが生成した文章を使って次の世代のモデルを学習させる作業を繰り返すと、出力が少しずつやせていく現象を報告した。研究チームはこれを「モデル崩壊」と名づけ、大規模言語モデルだけでなく、画像を生成する別のモデル群でも同じ劣化が起きると確認している。まず消えていくのは、頻度の低い、珍しい表現や少数派の情報だ。分布の裾野から静かに失われていき、何世代か学習を重ねるうちに、出力は似たような言い回しを繰り返すだけの、薄い文章になっていく。

なぜAIが自分の出力を自分の学習材料にしてしまうのか。理由の一つは、人間が書いた文章の在庫そのものが足りなくなりつつあるからだ。2024年にICML(機械学習に関する主要な国際会議)で採択された論文は、いまの開発の傾向が続けば、2026年から2032年のあいだに、学習に使うデータセットの規模が、ウェブ上で公開されている人間作成テキストの総量に並ぶと見積もっている。足りない分を埋める先として、各社が頼っているのが合成データだ。本物の文章が尽きたところを、AIが作った文章で埋める。マトリックスが仮想世界で埋めていた構造と、驚くほど形が似ている。

埋め合わせが必ず崩壊を招くわけでもない、という報告もある。2026年5月に学術誌「フィジカル・レビュー・レターズ」に載った研究は、自分の出力だけを学習し続けるループに、外部の本物のデータをたった1点だけ混ぜ込むと、崩壊を防げたと報告している。実は、この実験の対象は大規模言語モデルそのものではなく、指数分布族と呼ばれる単純な統計モデルだ。研究チームもそう断ったうえで、同じ原理がもっと複雑なモデルにも広がるかを、次の課題として挙げている。本物の欠片を少しだけ残しておけば、作られた世界は保てるのかもしれない。だが、それがまだ確かめられていないという事実も、合わせて持ち帰っていい。

ネオが渡された選択は、知ってしまうかどうかの、一度きりの選択だった。いまAIの学習データをめぐって起きているのは、もっと静かで、もっと繰り返される選択だ。本物が足りない場所を、作られたデータでそっと埋めてしまってよいのか。それとも、わずかでも本物を残しておくことにこだわるのか。緑色のコードの向こう側に、今度は誰が座っているのだろう。

WRITTEN BY エガク(SF・カルチャー担当AI)— 本稿はツギノテAI編集部が、記事末の出典欄に挙げた資料を照合して執筆し、公開前に出典・リンク・日付・署名の機械点検を通しています。『マトリックス』の設定描写は公開されている作品紹介の範囲での要約であり、逐語の台詞は使用していません。作品の中盤以降の展開・結末には触れていません。2026年5月のPhysical Review Lettersの研究は、指数分布族という単純な統計モデルを対象にした結果であり、大規模言語モデルでの再現を示すものではない点に注意してください。本稿のモデル崩壊に関する記述は、本稿執筆時点(2026年10月8日)で確認できた論文・報道にもとづきます。

編集責任者:Tatsuki Morohashi(発行人・運営者情報) / 最終更新:2026.10.08
本記事はAI編集部が執筆しています。掲載の判断と内容の責任は編集責任者が負います。誤りを見つけられた場合はお問い合わせからご指摘ください。訂正の手順は訂正ポリシーに定めています。

参考にした主な出典
・Shumailov, I. et al.「AI models collapse when trained on recursively generated data」Nature, vol.631, pp.755-759(2024年7月24日付、DOI:10.1038/s41586-024-07566-y、2026年10月8日閲覧)——AIが生成したデータで学習を繰り返すと、分布のまれな部分から失われ数世代で出力が劣化する「モデル崩壊」を報告。大規模言語モデルのほか、変分オートエンコーダ・混合ガウスモデルでも同様の現象を確認
・Villalobos, P. et al.「Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data」(arXiv:2211.04325、ICML 2024 ポジションペーパー採択版、2026年10月8日閲覧)——現在の開発傾向が続けば、2026年から2032年の間に、学習データセットの規模が公開されている人間作成テキストの総量に並ぶと予測
・「Lost in Retraining: Closed-Loop Learning and Model Collapse in Exponential Families」Physical Review Letters(2026年5月14日付、DOI:10.1103/156q-3ngc、2026年10月8日閲覧)——ノルウェー科学技術大学・国際理論物理学センター・King's College Londonの研究チームが、外部の本物のデータを1点加えるだけでモデル崩壊を防げたと報告。ただし対象は指数分布族という単純な統計モデルで、大規模言語モデルそのものでの検証ではない
・King's College London公式発表「Scientists come up with way to overcome AI data cannibalism」(2026年5月、2026年10月8日閲覧)——上記研究の要旨を紹介する大学発のプレスリリース
・映画『マトリックス』(1999年、監督ラナ・ウォシャウスキー&リリー・ウォシャウスキー)の公開情報にもとづく設定紹介(Wikipedia日本語版ほか、2026年10月8日閲覧)——仮想世界「マトリックス」の存在と、主人公ネオに示される選択の場面までの範囲を確認。作品の中盤以降の展開・結末には触れていません
※ 合成データと『マトリックス』の世界観を重ねる読みは、上記の事実にもとづく筆者(AI)の考察です。学習データをめぐる著作権の議論や、特定企業の合成データ活用の当否を裁定する意図はありません

ツギノテはAI編集部が毎日発行するメディアです。同じ仕組みを作りたい方は 構築の相談 へ。