
- Redis作者がC実装のローカル推論エンジンds4を公開、MITライセンスで提供
- DeepSeek V4など2840億パラメータ級MoEを2ビット量子化で高メモリ機に搭載
- CLI・ローカルAPI・エージェントの3形態、KVキャッシュはSSDに保存
何が公開されたのか
Redisの作者として知られる開発者が、ローカル環境で大規模なオープンウェイトモデルを動かすための推論エンジン「DwarfStar 4(ds4)」を公開しました。メモリを多く積んだMac、CUDA、ROCmの各環境を対象にした、対象を絞ったC言語実装だと説明されています。ライセンスはMITです。
対応モデルとしては、DeepSeek V4とV4.1 Flash、GLM 5.x、Qwen3.8 Flash Nextが挙げられています。テキストモデルだけでなく視覚モデルも対象で、ローカルAPI、CLI、ネイティブエージェントを1つのスタックにまとめている点が特徴とされています。
圧縮とキャッシュの工夫
対象の中核となるDeepSeek V4 Flashは、2840億パラメータのMoE(専門家混合)モデルです。通常はリモートのサーバーで提供されるような規模ですが、ds4は逆に「手元のマシンで動かす」という制約から設計を始めたと説明されています。
鍵となるのが非対称な2ビット量子化です。ルーティングされて選ばれる専門家の部分を圧縮しつつ、重要な共有パスは精度を保つことで、対応するMoEモデルを目標のマシンに収まるようにしています。
もう一つの特徴がKVキャッシュの扱いです。長いプレフィックスをSSDに保存し、プロンプトのハッシュで再開できるため、再起動のたびに全文を処理し直さずに済むとしています。
3つの入り口と動作条件
同じモデル状態とキャッシュを共有する3つの入り口が用意されています。対話用の「./ds4」、ローカルAPI用の「./ds4-server」、継続的なコーディングセッション向けの「./ds4-agent」です。
基準となるのはV4 FlashのQ2版です。128GBのメモリがあればGLM 5.3 Q2とQwen Q4も収まり、V4.1 Q2はSSDからストリーミングする形で動くとされています。Qwenについては64GBでも扱えるとの記載があります。
導入手順は「./download_model.sh ds4f-q2 && make」から始まります。ベンチマークとして、M5 Max 128GB・32Kコンテキストで生成34.4トークン/秒、prefill 557トークン/秒という数値が示されていますが、これはds4のベンチマーク表からの推定値だと注記されています。
現時点での留意点
示されている性能値は推定値であると明記されており、実環境での速度を保証するものではありません。また詳細な構成は別途「Architecture notes」を参照する形になっており、このページだけでは内部実装の全体像は分かりません。
対応モデルとして挙げられているDeepSeek V4やGLM 5.x、Qwen3.8などの各モデルの仕様やライセンス条件は、このページでは説明されていません。GPU側のCUDA/ROCmについても、必要なVRAM量などの具体的な要件は示されていません。
| モデル | 量子化 | 128GB環境での扱い |
|---|---|---|
| DeepSeek V4 Flash(Q2) | 2ビット | 基準となる構成 |
| GLM 5.3(Q2) | 2ビット | 128GBに収まる |
| Qwen(Q4) | 4ビット | 128GBに収まる |
| DeepSeek V4.1(Q2) | 2ビット | SSDからストリーミング |
DeepSeek V4 Flash is a large mixture-of-experts model. The usual path is remote serving; ds4 starts from the opposite constraint.
DeepSeek V4 Flashは大規模な専門家混合モデルである。通常はリモートでの提供が選ばれるが、ds4は逆の制約から出発している。
今後の見通し
ds4はMITライセンスのC実装として公開されており、今後は対応モデルの追加や量子化方式の改良が進むとみられます。判断材料として重要なのは、量子化ごとの精度変化と、CUDA/ROCm環境での実測性能です。原文の性能値は推定値と注記されているため、実際の手元環境でどの程度の速度と品質が得られるかが明らかになれば、業務利用の可否を判断しやすくなります。また、M5 Max以外のマシン構成でのデータや、長いコンテキストでのKVキャッシュ再利用の効果が示されれば、実運用の見積もりが立てやすくなるでしょう。
日本の開発者・IT企業にとっての意味
社内データを外部に出さずにLLMを使いたいという需要は、日本のIT企業でも小さくありません。ds4は、MITライセンスのC実装としてローカル推論の選択肢を増やすものと位置づけられます。ただし要求メモリは大きく、基準構成でも128GB級のマシンが前提とされているため、開発者個人の端末というより、検証用の高メモリ機やオンプレ環境での利用が現実的だとみられます。実務では、量子化によって精度がどこまで落ちるか、既存のアプリケーションからローカルAPIに切り替えられるかが判断の分かれ目になります。原文には他ツールとの比較や精度評価がないため、導入検討では自社データでの検証が欠かせません。
気になる点
- ds4は業務利用できるライセンスなのか
- MITライセンスで提供されると記載されています。MITライセンスは商用利用や改変、再配布を比較的自由に認める条件のため、業務での検討はしやすい立場にあります。ただし対応モデル自体のライセンス条件はこのページには書かれておらず、別途確認が必要です。
- どのくらいのスペックのマシンが必要か
- このページでは128GBメモリのM5 Maxでの数値が示され、Qwenは64GBでも扱えるとされています。DeepSeek V4.1 Q2はSSDからのストリーミングで動くという記載もあります。一方、CUDA/ROCm環境で必要なVRAM量などは示されていません。
- 日本から利用する場合の制約はあるか
- このページには配布地域や利用制限に関する記載はなく、現時点では公表されていません。ローカルで動かす前提のツールであるため、クラウドAPIのような地域単位の提供制限とは性質が異なるとみられますが、根拠となる記載はありません。
用語解説
- MoE(専門家混合)
- 複数の専門家サブネットワークのうち一部だけを入力ごとに選んで使うモデル構造。総パラメータを増やしつつ計算量を抑えられる。
- 量子化
- モデルの重みをより少ないビット数で表現し、メモリ使用量と計算量を減らす手法。一般に精度とのトレードオフがある。
- KVキャッシュ
- 文章生成時に計算した注意機構の中間結果を保持する領域。再利用すると同じ部分の再計算を省略できる。
- prefill
- 入力プロンプト全体をまとめて処理し、生成開始前の内部状態を作る工程。最初の応答までの待ち時間に関わる。
- ROCm
- AMD製GPU向けのオープンな計算基盤。NVIDIAのCUDAに対応する位置づけのソフトウェア群。
出典
From the creator of Redis; run LLM locally with ds4
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する