- OpenAIのGPT-6.1 Solは100万トークンあたり入力2ドル・出力10ドル。Astraの10ドル・50ドルから大幅に下がった
- Sol [Max]はAgent Arenaで5位、タスクあたり0.56ドル。Astra比81%安でスコア差は1.04ポイント以内
- Sonnet 5.5 [Max]は3位でChat部門1位。AnthropicがAgent Arena上位3位を占める
Sol投入と価格の引き下げ
Latent SpaceのAINewsによると、OpenAIは新しいモデル「GPT-6.1 Sol」を投入した。価格は100万トークンあたり入力2ドル・出力10ドルで、既存のAstraの入力10ドル・出力50ドルから大きく下がっている。OpenAIの社員は「good, cheap AND fast」と表現していると伝えられた。ただし、これは公式発表そのものではなく、SNS上の投稿をまとめた内容だ。
性能面では、GPT-6 SolをDeepSWE v1.1で6.4ポイント上回り、Opus 5.5をAutomationBenchで2.2ポイント上回ったと主張されている。Codexの利用枠は10月2日午前10時(太平洋時間)に全体リセットされる予定とされた。Solは「codemodeを非常に好む」とも報告されており、GPT系モデルがcodemodeで学習されていることと整合するとしている。
Agent Arenaの順位と単価
Agent Arenaでは、Sol [Max]が5位(+11.23%)で初登場し、タスクあたりの中央値コストは0.56ドルだった。これはGPT-6 Solより39%安く、スコアは1.52ポイント高い。Astraと比べると81%安く、スコア差は1.04ポイント以内に収まるという。性能と価格のバランスを示す指標として注目されている。
AnthropicのSonnet 5.5 [Max]は3位(+12.5%)で初登場し、Chat部門では1位だった。タスクあたりコストは2.74ドルで、2位のOpus 5.5の1.58ドルより高く、パレートフロンティアから外れると指摘されている。AnthropicのモデルはAgent Arenaの上位3位を占めている。
コスト性能の新しい基準
コードとテキストのArenaでは、SolがWebDevで一時3位に入ったが、Sonnet 5.5に押されて4位になった。SonnetはWebDevでGPT-6 Astra [Max]に2ポイント差まで迫り、コストは80%低いとされる。Gemini 4 Argon [High]はText Arenaで1位を取った。
オープンモデルでは、MiMo-V2.6-ProとFlashがAgent Arenaのオープンモデル内で5位と9位に入った。独立系の評価では、WeirdML v3がSolをトークン効率が高いと評価し、Astraに近いがピークは低いとしている。同じベンチマークでSonnet 5.5はOpus 5を、Grok 4.7はKimi-K3を上回ったが、これらの結果は不完全だとされる。
未確認の噂と不明点
未確認の情報も複数ある。Claude Fable 5.5が来週登場するとの噂があり、セキュリティ上の懸念で延期されたとされる「Astra 6.1」を上回るという。ただし投稿者自身がどちらも検証できないと述べている。「GPT-6 Astra Lite」のリストが見つかり、Solと同じモデルではないかと推測する声もある。
Design Arenaは324件の思考サマリーを分析し、AstraはOpus 5.5の約20倍の頻度で留保表現を使い、Opusは5件中約4件で早い段階に結論を出すと報告した。StepFunのStep 5 Previewはオープンウェイトモデル内で7位、タスクあたり2.54ドルで、1回あたり平均約2時間かかり、100万トークンのコンテキストウィンドウを持つとされる。
| 項目 | GPT-6.1 Sol [Max] | Claude Sonnet 5.5 [Max] | Opus 5.5 |
|---|---|---|---|
| Agent Arena順位 | #5 (+11.23%) | #3 (+12.5%) | #2 |
| タスクあたりコスト | $0.56 | $2.74 | $1.58 |
Sol cost comparison: That is 39% cheaper than GPT-6 Sol while scoring 1.52 points higher. It is 81% cheaper than Astra while landing within 1.04 points.
Solのコスト比較:GPT-6 Solより39%安価でありながらスコアは1.52ポイント高い。Astraより81%安価でありながら1.04ポイント以内に収まっている。
今後の見通し
今後の焦点は、未確認とされるClaude Fable 5.5や「Astra 6.1」の動向とみられる。Fable 5.5が来週登場するとの噂は投稿者自身が検証できないとしており、正式な発表があるかどうかが最初の判断材料になる。また、WeirdML v3など独立系評価の結果は不完全とされているため、確定値が揃えばコストと性能の関係をより正確に比較できる。Gemini 4 ArgonのText Arena 1位やオープンモデルの順位も、今後の更新で変わり得る。API価格やタスク単価が実際の請求にどう反映されるかが、導入判断の分かれ目になりそうだ。
日本の開発者・IT企業にとっての意味
日本企業がLLMを使ったエージェントやコーディング支援を実運用する場合、モデルの性能差よりも推論コストが採算を左右しやすい。今回伝えられたGPT-6.1 Solの価格は100万トークンあたり入力2ドル・出力10ドルで、Astraの5分の1に相当する。Agent Arenaのタスクあたり0.56ドルという数値は、1タスクごとに費用が積み上がる業務では無視できない差になる。ただし、これらはSNS投稿をまとめた情報で、ベンチマークの主張値やタスク単価が自社のユースケースにそのまま当てはまるとは限らない。PoCでは同一タスクでの実測コストと品質を比較し、Sonnet 5.5のように上位でもタスク単価が高いモデルとの使い分けを検討する価値がある。
気になる点
- Solは日本からもAPI経由で使えるのか
- 原文では、Solは100万トークンあたり入力2ドル・出力10ドルで提供され、Codexの利用枠リセットも言及されている。ただし日本からの提供可否やリージョン制限、日本語での性能については原文に記載がなく、現時点では公表されていない。
- Agent Arenaの順位はどう読めばよいか
- Agent Arenaはスコアとタスクあたりコストの両方を示す。Sonnet 5.5 [Max]は3位(+12.5%)だがタスク単価2.74ドルで、2位のOpus 5.5の1.58ドルより高く、パレートフロンティア外とされる。順位だけでなく単価も見る必要がある。
- 噂されているFable 5.5やAstra 6.1は信頼できるか
- いずれも未確認の情報だ。Fable 5.5が来週登場し、セキュリティ上の懸念で延期されたとされるAstra 6.1を上回るという話は、投稿者自身が検証できないと述べている。「GPT-6 Astra Lite」のリストも、Solと同じモデルではないかという推測にとどまる。
用語解説
- Agent Arena
- LLMエージェントの性能とタスクあたりコストを並べて比較する公開リーダーボード。スコアと価格の両方で評価する。
- パレートフロンティア
- 性能とコストの両面で他の選択肢に劣らない点の集合。ここから外れると、より安く同等以上のモデルが存在することを示す。
- codemode
- Solが「非常に好む」と報告された動作形式。GPT系モデルが学習されているとされるが、原文に詳細な定義はない。
- DeepSWE v1.1
- モデル性能を測るベンチマークの一つ。原文ではSolがGPT-6 Solを6.4ポイント上回ったとされる以外の詳細は示されていない。
出典
[AINews] not much happened today
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する