この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • Apache 2.0で商用利用可能な27Bパラメータの視覚対応LLM
  • デフォルトの推論強度xhighで簡単な指示にも過剰に思考する
  • バウンディングボックス検出やコーディングエージェントで高性能

「Qwen 3.8 27B」とは何か

AlibabaのQwen研究チームが公開した「Qwen 3.8 27B」は、Apache 2.0ライセンスのオープンなLLMです。パラメータ数は27B(約270億)で、視覚(画像入力)にも対応しています。先行モデル「Qwen 3.6 27B」に続くモデルで、同社の自己評価では、より大規模なクローズドモデル「Qwen 3.7-Plus」を上回る結果も示しています。サイズとしては、ハイエンドのノートPCでも動作できる現実的な規模です。

記事の著者は、128GBメモリのM5 Max MacBook ProとNVIDIA DGX Sparkの2台でテストしています。モデルはLM Studioで提供されている17GBの量子化版(Q4_K_M)を利用しました。このモデルは、推論の深さを制御する「reasoning_effort」パラメータを公式にサポートしており、デフォルトは最大の「xhigh」です。

デフォルトの「xhigh」が招く過剰推論

このxhighというデフォルト設定が、実用上は厄介です。簡単なプロンプトでも、モデルは余計なことまで考え込み、時間とトークンを大量に消費します。たとえば「円のSVGを描いて」という単純な指示に対し、モデルは円の装飾や配色、アニメーションまで検討し始めたとのことです。

具体的には、ペリカンのSVGを生成するプロンプトで、推論なしの場合は137秒で完了したのに対し、デフォルトのxhighでは21分かかりました。この間、22,276トークンの推論を消費して、実際の出力は3,223トークンでした。このため、コンシューマ向けハードウェアで使うには、推論強度をmediumやlowに下げるなどの調整が実用的です。

視覚モデルとしての性能:バウンディングボックス

一方で、視覚能力は高く評価されています。ペリカンの写真に対して、座標を0〜1000のスケールで指定してバウンディングボックス(物体を囲む矩形)を出力させたところ、正確な位置と大きさで2つのペリカンを検出できました。これは従来のローカルLLMでは難しいとされる成果です。

さらに、このバウンディングボックスを可視化するHTMLツールを、Qwen 3.8 27B自身に1回のプロンプトで作成させることにも成功しています。推論をオンにしたままだったため設計が過剰になったものの、動作するツールを生成しました。推論をオフにした場合は座標の表示位置がずれるなど、推論の有無が品質に大きく影響する場面もあるようです。

コーディングエージェントとしての可能性と注意点

ローカルモデルでコーディングエージェントを動かせるかは、開発者にとって大きな関心事です。著者は「Pi」というコーディングエージェントをQwen 3.8 27Bと組み合わせて試し、データセットのコードベースで「auth how work?」という質問に対し、複数のファイルを調べたうえで的確な回答を返せたと報告しています。

また、その会話ログをMarkdownに変換するPythonコードも、同じモデルに書かせて実行できたそうです。ただし、ローカル実行には長いコンテキストや信頼できるツール呼び出し機能が重要です。このモデルは最大262,144トークンのコンテキストに対応しており、そうした点でも有望です。一方、速度やデフォルト設定の扱いには注意が必要です。

同じペリカンのSVG生成での推論設定による比較
項目xhigh(デフォルト)推論なし
所要時間21分137秒
推論トークン数22,276なし
出力トークン数3,2233,715
原文からの引用
This is a hilarious default. It's absolutely not a good way to run the model, especially on consumer hardware.

これは笑ってしまうようなデフォルト設定だ。特に一般向けハードウェアでは、このままの設定でモデルを動かすのはまったく良い方法とは言えない。

今後の見通し

今後は、独立したベンチマークによる客観的な性能評価が待たれます。また、Qwen側がデフォルトの推論強度を変更したり、ユーザーが簡単に調整できる仕組みが整うかどうかも注目です。ローカルLLMとしては、速度と品質のトレードオフをどう制御するかが実用化の鍵を握ります。次に、他のハードウェアでの実行結果や、reasoning_effortを変更した場合の品質差が明らかになれば、導入判断をより確かなものにできるとみられます。

日本の開発者・IT企業にとっての意味

日本企業にとって、Apache 2.0のローカル実行可能なモデルは、データを外部に出さずにAIを活用できる選択肢として重要です。特に、Qwen 3.8 27Bは27Bパラメータという現実的なサイズで、視覚対応とコーディングエージェント性能を備えているため、社内文書の解析やプロトタイプ開発での利用が期待されます。一方で、デフォルト設定のままでは応答が遅く、トークン消費も大きいため、実運用では推論強度の調整が必須です。この点を理解した上で、製品やサービスの設計に組み込むことが求められます。

気になる点

このモデルは商用利用できますか?
はい、Apache 2.0ライセンスで公開されているため、商用利用が可能です。ただし、ライセンス表示などの条件を確認する必要があります。
簡単なプロンプトでも遅いのはなぜですか?
デフォルトのreasoning_effortが「xhigh」に設定されており、モデルが複雑な推論をしようとするからです。設定を「low」や「medium」に下げたり、推論をオフにすると高速化できます。
どのくらいのスペックのPCが必要ですか?
記事では128GBメモリのM5 Max MacBook ProとNVIDIA DGX Sparkで動作しています。17GBの量子化版を動かすには、それなりのメモリ量と性能が必要とみられますが、詳細な要件は公式に公表されていません。

用語解説

Apache 2.0
商用利用を含めて自由に使えるオープンソースライセンスの一種。
パラメータ数
ニューラルネットワーク内の重みの数。多いほど専門的な性能を発揮しやすい。
reasoning_effort
推論の深さを設定するパラメータ。xhigh、medium、lowなどがある。
量子化
モデルの計算精度を下げてファイルサイズを縮小する技術。Q4_K_Mはその一つ。
バウンディングボックス
画像中の特定物体を囲む矩形領域。座標で表現される。

出典

Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

Simon Willison / Simon Willison / 2026年8月17日

https://simonwillison.net/2026/Aug/16/qwen-38-27b

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する