
- 独Aleph AlphaがApache 2.0のオープンウェイトLLM「Kolibri」を公開
- 総パラメータ781億でもトークンあたり約34.6億のみ使うMoE構造
- ドイツ語に強く、知らない時に「分からない」と答えられるよう訓練
何が公開されたのか
ドイツのAI企業Aleph Alphaが、ドイツ語と英語に対応するオープンウェイトの大規模言語モデル(LLM)「Kolibri」を2026年10月3日に公開した。ライセンスはApache 2.0で、学習済みの重み(ウェイト)はHugging Faceで入手できる。ドイツとフィンランドのインフラ上でゼロから学習されたと説明されている。
Kolibriはドイツ語でハチドリを意味する。Aleph Alphaはこのモデルを「ソブリン(主権的)」と位置づけており、ドイツ国内のチームが欧州法・ドイツ法の下で構築し外部の支配を受けないこと、利用者が自社サーバー上で自由に配備でき知的財産の安全性が確保されることを利点に挙げている。同社はEUの汎用AI(GPAI)行動規範にも署名している。
ただし欧州外の要素が一切入っていないわけではない。モデルカードによれば、英語のウェブテキストの言い換えにGoogleのGemma 4、ドイツ語にMistral-NeMo、品質フィルター用のラベル付きデータにQwen3-32Bを使ったとされる。学習データには政治的バイアスを除去するフィルタリングも施された。
MoEと独自トークナイザー
KolibriはMixture of Experts(MoE、専門家混合)という構造を採用する。通常の密な(dense)モデルでは全トークンが全パラメータを通るが、MoEでは各層に多数の小さなサブネットワーク(エキスパート)と、トークンごとに使うエキスパートを選ぶルーターが置かれる。Kolibriは50層からなり、各層に384のエキスパートと全トークンが通る1つの共有エキスパートがあり、ルーターは各トークンを384のうち6つへ送る。
この仕組みにより、総パラメータ数は781億(78.1 billion)だが実際に計算に使われるのはトークンあたり約34.6億(3.46 billion)分になる。ただし全てのパラメータをメモリに保持する必要がある点には注意が要る。
トークナイザーもドイツ語向けに作り込まれている。ドイツ語は語を連結して長い複合語を作るため、英語中心で学習したトークナイザーは語を細かく分割してしまう。Kolibriのトークナイザーは語彙12.8万で、UniBPEと呼ぶ独自アルゴリズムを採用した。ドイツ語テキストではGPT-5のトークナイザーより11.2%少ないトークン数で済むと報告されている。記事の筆者がドイツ連邦憲法の全文で試したところ、差は15%に広がり、英語では同等だったという。
長文脈とドイツ語推論
50層のうち40層はsliding-window attention(直前512トークンだけを見る方式)を使い、5層ごとにそれ以前の全てを見る。これは100万トークン規模のコンテキストを現実的なコストで扱うための工夫とされる。位置情報を持つのはsliding-window層だけで、全注意層は持たないため、学習時の262,144トークンを超えて文脈を伸ばせる。Aleph Alphaは1,048,576トークンまで検証したとしている。
推論(reasoning)でもドイツ語を重視している。ドイツ語の推論モデルはドイツ語のプロンプトでも英語で考えることが多い。Aleph Alphaは約80万件のドイツ語推論例を生成したが、少量のドイツ語データは逆効果で、ドイツ語数学スコアが70.2から48.3に落ちたと報告している。大量のデータ投入により67.3まで回復したとされる。Kolibriはこの大量データで訓練され、ドイツ語AIME 2025で87.5を記録した。
また、文書の根拠が足りない時に「分からない」と答えられるよう訓練する独自手法(Merlin-Arthurプロトコル)も導入している。Aleph Alphaの比較では、答えを知らない場面で不明または部分回答を返した割合は44%で、Qwen3.5 35B-A3Bの11.1%やGPT-OSS 120Bの23.7%を上回った。
得意な点と苦手な点
Aleph Alphaはモデルカードで最も弱い指標も公開している。Kolibriは記憶に頼る知識問題が苦手で、文書なしのclosed-bookテストでは12モデル中最低の51.0、Omniscienceの正答率は14.8%にとどまる。一方で「分からない」と答えられる点は強く、同じOmniscienceで不明・部分回答を返した割合は44%だった。
ツール呼び出しやコーディングエージェントとしての性能は控えめだ。Berkeley Function Calling Leaderboardのマルチターンは39.8、Terminal-Bench 2.1は27.7、SWE-bench Verifiedは66.4で、いずれも比較対象の一部に劣る。長文脈も中間付近では精度が落ち、RULERの128,000トークンではQwen3.5のベースモデルが89.9に対しKolibriは67.9だった。非常に長い領域で逆転する。
対応言語はドイツ語と英語の2つだけだが、モデルカードはこれを「広さより深さを選んだ意図的な選択」と説明している。
実行要件と制約
実行には約78GBのGPUメモリが必要で、80GBのNVIDIA A100またはH100を2枚、あるいはH200、B200、B300の1枚が最低構成とされる。トークンあたり35億パラメータという数値からノートPCで動くと誤解されやすいが、実際にはデータセンター向けGPUが必要だとモデルカードは明記している。
配備にはAleph AlphaのvLLMプラグインが必要で、対応するvLLMのバージョンは一度に1つ(執筆時点で0.29)に限られる。公開時点でホスト型プロバイダーは提供しておらず、記事の筆者もモデル自体はまだ実行できていないと述べている。
| 指標 | Kolibri | Qwen3.5 35B-A3B |
|---|---|---|
| Omniscience 正答率 | 14.8% | 22.2% |
| Omniscience「不明」回答率 | 44% | 11.1% |
| BFCL マルチターン | 39.8 | 54.0 |
| Terminal-Bench 2.1 | 27.7 | 39.7 |
| RULER 128k(ベース) | 67.9 | 89.9 |
teams built the model in Germany, trained it on infrastructure in Germany and Finland, under European and German law, with no foreign control.
ドイツのチームがモデルを構築し、ドイツとフィンランドのインフラで、欧州法とドイツ法の下、いかなる外国の支配も受けずに学習した。
今後の見通し
Kolibriは公開されたばかりで、ホスト型プロバイダーが現れるかどうかが実利用のハードルを左右するとみられる。日本語対応や他言語への拡張、vLLMプラグインの対応バージョンの拡大が示されれば、日本の開発者にとって試しやすくなる。一方、記憶型の知識問題やコーディング性能が改善するかは、今後のベンチマーク更新を待つ必要がある。ソブリンAIという設計方針が欧州の公共部門や企業でどの程度採用されるか、また同種の言語特化モデルが他社から出るかが、オープンウェイトLLMの競争軸を測る材料になりそうだ。
日本の開発者・IT企業にとっての意味
日本のIT企業・開発者にとって、Kolibriは「特定言語に最適化したオープンウェイトモデル」という選択肢を示す例になる。日本語で同じことを狙うなら、トークナイザーの設計やドイツ語推論データの知見が参考になる。特に、少量の言語データが逆効果になるという報告は、日本語特化モデルを訓練する際のデータ量設計に示唆を与える。また、モデルに「分からない」と答えさせる訓練は、RAGを前提とした業務システムの信頼性向上に直結する。実行にはデータセンター向けGPUが必要で、公開時点でホスト型サービスがないため、すぐに業務投入するのは難しい。だがApache 2.0で自社環境に配備できる点は、機密データを外部に出せない公共・製造分野の案件で検討に値する。
気になる点
- ライセンスはApache 2.0なので商用利用できますか。日本からも使えますか。
- ライセンスがApache 2.0であること、重みがHugging Faceで公開されていることは原文に明記されており、日本からダウンロードして自社環境で動かすことは可能と考えられます。ただし公開時点でホスト型プロバイダーは提供されておらず、動かすにはデータセンター向けGPUが必要です。
- 日本語には対応していますか。
- 対応言語はドイツ語と英語の2つで、モデルカードはこれを「広さより深さを選んだ意図的な選択」と説明しています。日本語対応や追加言語の予定は原文では言及されていません。現時点では公表されていないというのが正確なところです。
- 既存のvLLM環境にそのまま組み込めますか。
- 配備にはAleph AlphaのvLLMプラグインが必要で、対応するvLLMは一度に1バージョン(執筆時点で0.29)に限られます。既存環境のバージョンによっては調整が必要になる可能性があります。具体的な互換性の範囲は原文では明記されていません。
用語解説
- MoE(Mixture of Experts)
- 各層に多数の小規模ネットワーク(エキスパート)を置き、トークンごとに少数だけを使う構造。計算量を抑えつつ規模を大きくできる。
- オープンウェイト
- 学習済みのパラメータ(重み)が公開され、自社環境で実行・改変できるモデル。利用条件はライセンスごとに異なる。
- vLLM
- LLMの推論を高速化するオープンソースのサーバーソフトウェア。モデルごとに対応バージョンが異なることがある。
- RAG
- Retrieval Augmented Generation。外部文書を検索してプロンプトに含め、回答の根拠を持たせる手法。
- ルーター
- MoEにおいて、各トークンをどのエキスパートに送るかを決める仕組み。
出典
Kolibri is an open-weight LLM from Aleph Alpha for German and English
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する