
- 子どもは約1億語で母語を獲得するが、LLMは10万倍以上のデータを消費する
- BabyLMは1億語のコーパスでモデルの文法習得を競う
- カリキュラム学習は効果が薄いなど、初期の結果が既存の仮説に疑問を投げる
データ効率ギャップとは
人が言語を話し始めてから10万年以上が経ちます。しかし、人間の言語を完全に習得できる存在は、これまで人間の子どもだけでした。ChatGPTの登場以降、LLMもまた自然な会話ができるようになりましたが、その裏には大きな問題があります。
LLMは学習に膨大なデータを必要とします。メタのLlama 3.1は事前学習で15兆トークンを使いました。子どもが思春期までに触れる言葉が約1億語であるのに対し、LLMはその10万倍以上のデータを処理します。スタンフォード大学の認知科学者マイケル・フランク氏は、「森を燃やし、全人類の知識をかき集めても、居間で1年かけて起こる出来事を再現するのは難しい」と述べています。
言語習得論の歴史
なぜ子どもが少ないデータで言語を学べるのかという問いは、長い論争の的です。1950年代、言語学者ノーム・チョムスキーは、子どもは生まれながらに文法の知識を持つと主張しました。これは、心理学者B.F.スキナーの環境説への反論であり、「刺激の貧困」論に基づいています。
チョムスキーの考え方は生成文法として支配的になり、初期のAI研究にも影響を与えました。しかし、明示的なルールで言語を教えようとしたシンボリックAIは失敗し、1970年代にはAI冬の時代を迎えました。その後、ニューラルネットワークが復活し、Transformerの登場によって大規模データ学習が可能になり、2022年のChatGPTで大きな成功を収めました。
BabyLMの挑戦
LLMの高性能は統計学習の成果ですが、子どものような効率性は実現できていません。そこで、言語学者のアレックス・ワースタット氏らは2022年、子どもと同じ規模のデータでモデルを訓練する競技会BabyLMを立ち上げました。
BabyLMでは、物語、対話、映画の字幕、Simple English Wikipedia、通常のWikipedia、実際の子ども向け音声文字起こしから構築された1億語のコーパスが使われます。モデルは心理言語学の文法ベンチマークで評価され、例えば「The keys to the cabinet are on the table」と誤りの「is」をどれだけ予測して驚くかが試されます。
まだ分からないこと
BabyLMの初期の結果は、いくつかの仮説に疑問を投げかけています。単純なデータから複雑なデータに段階的に学習させるカリキュラム学習は、最も人気のある手法でしたが、効果は限定的でした。
しかし、子どもがどのようにして少ないデータから言語を習得するのかは依然として謎です。チョムスキーの生得的文法理論が正しいのか、それとも統計学習で十分なのかは、現時点では結論が出ていません。データ効率ギャップは、認知科学とAI研究の両方にとって未解決の課題です。
| 項目 | 思春期前の子ども | LLM(Llama 3.1) |
|---|---|---|
| 学習データ量 | 約1億語 | 15兆トークン |
| 言語習得の結果 | 流暢な母語運用 | 流暢だが膨大なデータが必要 |
| データ源 | 家庭の会話や絵本 | インターネット上のテキスト |
It’s just totally miraculous … If you train GPT-2 on 30 million words, you get a nonsense generator; you don’t get a kid.
本当に奇跡的だ。GPT-2を3000万語でトレーニングしたら、無意味な文章を生成する機械ができるだけ。子どものようにはならない。
今後の見通し
BabyLMは今後も毎年開催され、子どもの学習を模した新たな手法が試されるとみられます。重要なのは、単にデータ量を減らすことではなく、人間の学習に固有の仕組みを理解することです。もしその仕組みが明らかになれば、日本語のような言語資源が限られた環境でも高性能なモデルを開発できる可能性があります。次に注目すべきは、BabyLMの結果を踏まえて、学習アルゴリズムやデータ選択の新しい手法が提案されるかどうかでしょう。
日本の開発者・IT企業にとっての意味
日本企業が独自のLLMを開発する際、最大の課題の一つが学習データの確保です。英語に比べて日本語のテキストデータは少なく、高性能モデルを作るのは難しいとされています。データ効率ギャップの研究が進めば、少ないデータで学ぶAIが実現し、日本語AIの競争力向上につながる可能性があります。また、BabyLMのベンチマーク手法は、小規模データでのモデル評価に使えるため、開発コストを抑える手段としても有用です。この研究の進展は、日本のAI開発の選択肢を広げるものになるでしょう。
気になる点
- BabyLMではどのようなデータが使われているのか?
- 物語、対話、映画の字幕、Simple English Wikipedia、通常のWikipedia、子ども向けの音声文字起こしなどから構成された約1億語のコーパスです。幼児向けのトラックでは、その10分の1の約1000万語になります。
- この研究は日本語にも応用できるのか?
- 現時点ではBabyLMは英語データ中心ですが、中国語版の競技会もすでに始まっています。日本語への応用はまだ公表されていませんが、同様の手法で可能になる可能性があります。
- 子どもの学習方法でAIのデータ量を減らせる可能性は?
- 現時点では実証されていません。BabyLMのモデルは文法を一定程度学習しますが、人間の子どもの流暢さには遠く及びません。しかし、認知科学の知見を組み込むことで、未来のAIは少ないデータで学べるようになるかもしれません。
用語解説
- データ効率ギャップ
- 同じタスクを学ぶために必要なデータ量が、人間とAIの間で大きく異なること。
- Transformer
- 2017年に登場したニューラルネットワークの一種で、文章間の関係を学習する。
- BabyLM
- 子どもと同じ規模のデータで言語モデルを訓練する競技会。
- 文法ベンチマーク
- 言語モデルが文法を正しく扱えるかを測るテスト。
- シンボリックAI
- 明示的なルールや記号で知識を表現するAIのアプローチ。
出典
Kids outlearn AI—and we still don’t know why
https://technologyreview.com/2026/08/24/1141740/kids-machines-language-learning
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する