- GPT-6.1 SolがAmazon Bedrockで一般提供開始。GPT-6 Solの主要アップグレード版
- OpenAIによればDeepSWE v1.1でGPT-6 Astraと同等、タスクあたりコストは約5分の1
- CodexやChatGPT Workから利用でき、IAMやCloudTrailで統制できる
何が発表されたのか
AWSは、OpenAIのモデル「GPT-6.1 Sol」をAmazon Bedrockで一般提供開始したと発表しました。GPT-6 Solの主要アップグレード版にあたり、エージェントによるコーディング、コンピュータ操作、業務ワークロードでより強い推論を提供するとしています。OpenAIによれば、日常的なワークフローに「Astraに近い知能」をもたらすとされています。Bedrock上では、性能・セキュリティ・信頼性を重視して構築された推論エンジンで動作します。
AWSは、エージェントの経済性はタスク全体で決まると説明しています。トークン単価は各やり取りのコストに影響し、推論の質は必要なやり取りの回数や、成功に至るかどうかに影響します。そのためタスク完了までの総コストは、単価と推論の質の両方で決まるという考え方です。正解に到達するまでのステップ数の少なさが、コスト面でも重要になります。
エージェントコーディングでの評価
ソフトウェアエンジニアリングは、推論の質がワークフロー全体に効く典型例として挙げられています。エージェントは未知のリポジトリを理解し、依存関係をたどり、変更すべき箇所を判断し、実装を検証する必要があります。OpenAIによれば、GPT-6.1 SolはDeepSWE v1.1でGPT-6 Astraと同等のスコアを、タスクあたり約5分の1のコストで達成します。またGPT-6 Solの最高スコアを6.4ポイント上回り、そのGPT-6 Solの結果より低い推論エフォートで達成したとされています。
Codexからこの推論能力を利用でき、調査・実装・テストをまたぐ作業に設定できます。リポジトリやローカルファイル、ターミナル、開発ツールを扱い、機能の追加やバグ修正、テスト実行を行います。デスクトップアプリ、CLI、対応IDEからアクセスでき、AWS開発向けには「Agent Toolkit for AWS」がターミナルの1コマンドでCodexをAWSのドキュメントやAPI、サービスに接続します。
文書・業務ツールへの適用
同じ推論能力は、複雑な文書の解釈や適切なツールの選択、状況変化への適応にも使われます。OpenAIによれば、GPT-6.1 Solは複雑な文書分析でGPT-6 Astraに近づき、業務ツールをまたぐ複数ステップのワークフローではGPT-6 Solを上回ります。
利用方法は、既製の体験を使うか、自前でアプリケーションを構築するかの2通りです。デスクトップアプリではChatGPT Workがファイルやアプリケーションをまたいで情報を集め、成果物にまとめます。対応するAmazon Bedrock APIを使えば、文書を統合する社内ツールや、システム間の作業を調整するエージェント、複数の入力を評価する顧客向けアプリケーションを構築できます。
制約の認識とBedrock上の統制
ツールをまたいで作業するには、ツールの失敗や制限された操作、情報の欠落を認識する必要があります。こうした制約を伝えることで、不完全な情報のまま進んだり意図しない操作をしたりする前に、アプリケーションやユーザーが介入できます。OpenAIによれば、GPT-6.1 Solは透明性やユーザーの意図、明示的な制限に関する難易度の高い評価でGPT-6 Solを上回ります。対応するBedrock APIでは、モデルが利用できるツールを定義し、承認が必要な操作や完了できない操作に対してアプリケーションがどう応答するかを決められます。
Bedrockは本番運用のための基盤と統制を提供します。IAMポリシーでモデルへのアクセスを管理し、CloudTrailで呼び出しを監査できます。AWS PrivateLinkによるVPCエンドポイントを使えば、トラフィックをネットワーク境界内に保てます。推論はハードウェア分離されたインフラ上で、ゼロオペレーターアクセスで実行されるため、推論中のプロンプトと完了結果はAWSのオペレーターでもアクセスできないとされています。
推論データはモデル学習に使われず、GPT-6.1 Solの利用にあたってOpenAIへのデータ共有にオプトインする必要もありません。自動不正検出のため、分類器がフラグを付けたトラフィックはAWSが最大30日保持し、プログラムで処理します。ゼロデータ保持は、AWSアカウントチーム経由で申請できます。
現時点で分かっていないこと
対応するAWSリージョンやエンドポイント、API、機能、推論プロファイル、料金は、原文では具体的に示されておらず、Amazon Bedrockのドキュメントを参照するよう案内されています。日本国内のリージョンで利用できるか、実際の料金体系がどうなるかは、この発表だけでは判断できません。
また、DeepSWE v1.1での比較や文書分析、ワークフローに関する評価は、いずれも「OpenAIによれば」として示された数値です。第三者が再現・検証した結果ではない点には注意が必要です。導入を検討する際は、自社のタスクでコストと成功率を測る進め方が現実的とみられます。
| 比較軸 | GPT-6.1 Sol | 比較対象 |
|---|---|---|
| DeepSWE v1.1 | GPT-6 Solの最高スコアを6.4ポイント上回る | GPT-6 Solの最高スコア。GPT-6.1 Solはより低い推論エフォートで達成 |
| タスクあたりコスト | GPT-6 Astraと同等のスコアを約5分の1のコストで達成 | GPT-6 Astra(DeepSWE v1.1) |
| 文書分析・複数ステップの業務ワークフロー | GPT-6 Astraに近づき、GPT-6 Solを上回る | GPT-6 Astra、GPT-6 Sol |
According to OpenAI, GPT-6.1 Sol matches GPT-6 Astra on DeepSWE v1.1 at roughly one-fifth the cost per task.
OpenAIによれば、GPT-6.1 SolはDeepSWE v1.1においてGPT-6 Astraと同等のスコアを、タスクあたりおよそ5分の1のコストで達成します。
今後の見通し
今後は、モデルの単価とタスクあたりの成功率を組み合わせた評価が進むとみられます。エージェントは試行錯誤の回数が総コストを左右するため、単価の安さだけでなく「何ステップで正解に到達するか」が導入判断の軸になります。AWSは対応リージョンや料金、推論プロファイルの詳細をドキュメントで順次示すとみられ、日本リージョンでの提供有無やレイテンシが明らかになれば、国内企業が本番採用を判断しやすくなります。さらに、DeepSWE v1.1以外の評価や第三者の検証結果が出れば、GPT-6 Astraとの使い分けが妥当かをより客観的に判断できるでしょう。
日本の開発者・IT企業にとっての意味
日本のIT企業にとっては、Bedrock経由でGPT-6.1 Solを使えることで、既存のAWS統制の枠組みを流用しやすくなる点が実務上の意味を持ちます。IAMによるアクセス管理、CloudTrailによる監査、PrivateLinkのVPCエンドポイントは、金融・公共など監査要件の厳しい案件でそのまま説明材料になります。推論データが学習に使われず、OpenAIへの共有オプトインも不要という条件は、データの持ち出しに慎重な国内企業の稟議を通しやすくする可能性があります。また「タスクあたりコスト」という考え方は、エージェント導入の費用対効果を説明する際の枠組みになります。ただし日本リージョンでの提供や単価が不明なため、まずは小規模な検証でステップ数と成功率を測る進め方が現実的とみられます。
気になる点
- GPT-6.1 Solは日本リージョンでも使えますか?
- 原文では対応するAWSリージョンが明記されておらず、Amazon Bedrockのドキュメントを参照するよう案内されています。日本国内リージョンでの提供有無は、この発表だけでは判断できません。Bedrockコンソールやドキュメントで対応状況を確認する必要があります。
- 入力したデータはモデルの学習に使われますか?
- 推論データはモデル学習に使われないと説明されています。GPT-6.1 Solの利用にあたり、OpenAIへのデータ共有にオプトインする必要もありません。ただし自動不正検出のため、分類器がフラグを付けたトラフィックはAWSが最大30日保持し、プログラムで処理します。ゼロデータ保持はアカウントチーム経由で申請できます。
- 料金はいくらですか?
- 原文には具体的な単価が示されておらず、料金を含む詳細はAmazon Bedrockのドキュメントを参照するよう案内されています。一方、DeepSWE v1.1でのタスクあたりコストは、GPT-6 Astraと同等のスコアを約5分の1のコストで達成するとされています。単価ではなくタスク完了までの総コストで見る考え方が示されています。
用語解説
- Amazon Bedrock
- AWSが提供する生成AIモデルのマネージドサービス。複数のモデルをAPI経由で利用でき、アクセス管理や監査の仕組みと組み合わせられる。
- エージェントコーディング
- AIエージェントがリポジトリの調査や実装、テストまでを自律的に進めるコーディングの進め方。
- 推論エフォート
- モデルが回答前にどれだけ考えるかに割く計算量の設定。一般に高いほど精度が上がり、コストも増える。
- VPCエンドポイント/AWS PrivateLink
- インターネットを経由せず、VPC内からAWSサービスへプライベートに接続するための仕組み。
- DeepSWE v1.1
- 原文でソフトウェアエンジニアリングの文脈に用いられている評価指標。詳細な定義は原文に記載がない。
- ゼロデータ保持
- リクエスト内容をサービス側に保存させない契約・設定。機密性の高いワークロードで検討される。
出典
Bring near-Astra intelligence to everyday work with GPT-6.1 Sol on Amazon Bedrock
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する