
- Simile AIが20億ドルのシリーズB調達、GreenOaksやIndex Venturesが支援
- 実在する1,000人のデジタルツインを作成し、行動を85%の精度で再現
- フォーチュン100社向けに数千万回のシミュレーションを提供
資金調達と会社概要
Simile AIは、人間の行動をシミュレートする基盤モデルを開発するスタートアップだ。同社はシリーズBで20億ドルを調達した。投資家にはGreenOaksとIndex Venturesが名を連ね、著名なAI研究者であるFei-Fei Li氏やAndrej Karpathy氏も支援者として参加している。同社はフォーチュン100の顧客向けに数千万回のシミュレーションを実行しており、その中にはCVSも含まれる。
同社のCEOであるJoon Sung Park氏は、スタンフォード大学で生成エージェントに関する研究を率いていた。2023年に発表された「Smallville」論文は、AIキャラクターが記憶や計画、社会的交流を自律的に行うことを示し、大きな反響を呼んだ。Simileはその研究を発展させ、実世界の人間の行動を再現するデジタルツインの構築を目指している。
技術的な新規性
Simileのアプローチは、単に既存の大規模言語モデル(LLM)にプロンプトを与えるのではなく、人間の行動データを基にモデル自体を訓練するところにある。具体的には、長時間のインタビュー、観察・取引データ、ランダム化比較試験を組み合わせ、人間の意思決定の背後にある因果メカニズムを学習する。このようにして行動の基盤モデルを構築する。
このアプローチは、Web上のテキストデータが人の発言を捉えても実際の行動を捉えられないという問題を克服する。また、合理性を追求するよう最適化されたモデルは、非合理な人間のシミュレーションには不向きであり、人間のバイアスや誤りを再現する必要があると同氏は指摘する。このため、Simileは人間の判断のゆがみを積極的にモデルに組み込む。
既存手法との比較
従来の市場調査では、焦点グループと呼ばれる数人のグループインタビューが一般的だ。Simileはこうした手法を、合成人口と呼ばれる仮想的な集団によるシミュレーションで代替する。同社によれば、フォーチュン100社の顧客向けのシミュレーションは、人間の焦点グループと比較して85〜99%の精度を達成している。
また、実在する1,000人のデジタルツインを作成した実験では、人々が自分の回答を再現する精度に対して85%の精度で行動と態度を再現したという。この数字は、人々が自分の回答を再現する精度を基準にした相対的なものだ。つまり、人間自身が同じ質問に再度答えたときの一致度に対して、85%の再現度を達成している。
課題と未知の点
シミュレーションの精度をさらに高めるには、スケーリング則の確立が必要だ。Joon氏は、将来的には地球上の80億人全員をシミュレートすることも視野に入れているが、それにはデータセンター規模の計算資源が必要になると述べている。また、マルチエージェントのシミュレーションでは、エージェント同士の相互作用がどのように創発的現象を生むかも研究課題だ。
シミュレーションの評価方法も課題の一つだ。単にLLMの幻覚を積み重ねるのではなく、シミュレーションの質をどう測定するかが重要になる。現時点では、人口全体を代表するシミュレーション集団の作成方法や、モデルの汎化性など、解決すべき点は多い。
If you poke at the right angle, then you could see human behavior that would just pop out
正しい角度で突けば、人間の行動が飛び出してくる。
今後の見通し
今後、シミュレーションは市場調査や政策検証の標準的な手法になる可能性がある。Simileが蓄積するデータとモデルが進化すれば、気候変動や民主主義の不安定化といった複雑な社会課題の分析にも応用できるとみられる。ただし、シミュレーションの精度を保証するには、評価方法の確立とデータの代表性が鍵となる。次のステップとして、Simileが公開するベンチマーク結果や、日本を含む非英語圏での実証データが明らかになれば、実務への採用を判断できるだろう。
日本の開発者・IT企業にとっての意味
日本のIT企業にとって、人間行動のシミュレーションは市場調査やサービス開発のコストを大幅に下げる可能性がある。従来のアンケートやインタビューに代わり、仮想的なユーザー集団を生成して製品の反応を事前に検証できるようになる。また、パーソナライズエージェントや推薦システムの開発にも、ユーザーの行動モデルが活用できる。ただし、日本語のデータでモデルがどの程度機能するかは未知数であり、文化的なバイアスを考慮する必要がある。また、個人データの取り扱いやプライバシー保護の観点からの検討も欠かせない。まずは小規模な実験で効果を測定し、既存の調査手法と比較することが現実的なアプローチだろう。
気になる点
- Simileのシミュレーションはどのように人間の行動を再現するのか?
- 長時間のインタビュー、観察・取引データ、ランダム化比較試験を組み合わせ、人間の意思決定の因果メカニズムをモデルに学習させる。単にLLMにプロンプトするのではなく、モデルの重みを調整することで、人間のバイアスや非合理性を再現する。
- 85%の精度とは具体的にどういう意味か?
- 実在する1,000人のデジタルツインを作成し、人々が自分の回答を再現する精度と比較して、85%の精度で行動と態度を再現したというもの。つまり、人間自身の再テスト信頼性に対して85%の再現度を意味する。
- 日本企業も利用できるのか?
- 現時点では、Simileの公式サイトや資料では日本での提供状況は明らかにされていない。フォーチュン100社向けの事例が公開されており、エンタープライズ向けのサービスとみられるが、詳細な価格や提供地域は不明。
用語解説
- デジタルツイン
- 現実の物体や人の行動をコンピューター上に再現したもの。ここでは実在する個人の行動・態度を模倣するモデル。
- 生成エージェント
- 人間らしい行動を自律的に生成するAIエージェント。記憶や計画、社会的交流を行う。
- 基盤モデル
- 大量のデータで事前学習された汎用AIモデルのこと。特定のタスクに特化せず、多様な用途に転用できる。
- スケーリング則
- モデル規模やデータ量を増やすと性能が向上するという経験則。ここではシミュレーションの精度と計算資源の関係を指す。
- フォーカスグループ
- 商品やサービスの印象を調べるために行われる少人数のグループインタビュー。市場調査の伝統的な手法。
- ランダム化比較試験
- 被験者を無作為にグループ分けして効果を検証する実験手法。因果関係の推定に用いられる。
出典
Simulation: the new Scaling Law — Joon Sung Park, Simile AI
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する