- Qwen 3.8 27BがAI知能指数で52点を獲得
- GPT-5.6 Lunaと同点、GLM-5.2などに1点差
- 27B規模で巨大モデルに匹敵する結果に
スコアの内容
Simon Willison氏は2026年8月17日のブログ投稿で、Qwen 3.8 27BがArtificial Analysis Intelligence Indexで52点を獲得したと報告した。
このスコアはGPT-5.6 Luna(max)と同点で、GLM-5.2(max)とDeepSeek V4 Pro 0813(max)には1ポイント及ばない。
同氏はこの結果を「本当に驚くべきモデル」と評している。
パラメータ規模の差
この指数で比較されたモデルのうち、GLM-5.2は753B、DeepSeek V4 Pro 0813は1.7Tのパラメータを持つ。
一方、Qwen 3.8 27Bは27Bパラメータであり、数十倍以上の規模の差がある。
GPT-5.6 Lunaのパラメータ数は不明だが、27Bよりはるかに大きいとみられる。
小型モデルの可能性
今回の結果は、大きなパラメータ数を持たないモデルでも、高い知能指数を達成できる可能性を示している。
パラメータ数が少ないほど、学習や推論に必要な計算資源は一般に少なくなる。
そのため、コストやインフラの制約がある環境でも、高い性能を活用できる可能性がある。
評価の注意点
Artificial Analysis Intelligence Indexが何をどのように測定しているかについては、この記事では詳細が明かされていない。
また、同じモデルについて、Willison氏は別の投稿で「優れているが、過剰に考えすぎる」という傾向も指摘している。
スコアの高さと実際のタスクでの使い勝手は必ずしも一致しない点に注意が必要だ。
Qwen 3.8 27B is a truly astonishing model.
Qwen 3.8 27Bは本当に驚くべきモデルだ。
日本の開発者・IT企業にとっての意味
日本企業にとって、今回の結果は高性能なAIモデルをより低コストで導入できる可能性が高まったことを示す。27Bパラメータ規模のモデルが巨大モデルに匹敵するスコアを出せるなら、大規模なGPU基盤がなくても、オンプレミスやクラウド上で高度な言語処理を運用できる選択肢が増える。これにより、データを外部に出せない業務や、コスト制約の厳しいプロジェクトでも、優れたAI機能を利用しやすくなる。一方、知能指数はあくまで一つの測定値であり、実際のタスクでの性能や応答品質は別途検証する必要がある。ベンチマークスコアだけでなく、自社のユースケースに合った評価指標でモデルを選ぶことが重要だ。
用語解説
- Artificial Analysis Intelligence Index
- AIモデルの知能を比較するために作られた指標。評価方法の詳細は公開情報による。
- パラメータ
- モデルのニューラルネットワーク内の重みの数。多いほど大規模で、学習や推論に多くの計算資源を要する。
- max
- この文脈では、モデルの最大規模・最大性能での評価結果を指すとみられる。
出典
Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する