この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 環境を独立した再利用可能なサービスとして提供するOrchard Envが中核
  • 約3Bパラメータの小型モデルでSWE-bench Verified 69.7%を達成
  • Codexなど実運用ハーネス内で直接訓練できる点が特徴

発表の概要

米Microsoft Researchは2026年8月3日、エージェントAI研究向けのオープンソースフレームワーク『Orchard』を公開した。エージェントは、複数段階の作業を計画・推論しながら自律的に実行するAIシステムで、コードのバグ修正やWeb操作、カレンダーやメールの管理といったタスクを担う。Orchardはこうしたエージェントの訓練と評価に必要な実行環境を、『Orchard Env』として再利用可能な形で提供する。

公開にあわせて、ソフトウェア工学向けのOrchard-SWE、Webナビゲーション向けのOrchard-GUI、パーソナルアシスタント向けのOrchard-Clawという3つの訓練レシピと、それらの訓練データ・評価方法も公開された。クローズドな独自基盤ではなく、研究コミュニティ全体が再現・拡張できる形を目指しているとみられる。

再利用可能な環境層

Orchardの中心的な考え方は、実行環境を特定の訓練フレームワークに組み込むのではなく、独立したサービスとして切り出すことだ。Orchard EnvはKubernetesを基盤として、数千の分離されたコンポーネントを並列に生成・管理できる。新しいベンチマークやエージェントシステムを導入する際も、基盤インフラをゼロから作り直す必要がない。

もう一つの特徴は、実際のデプロイ環境である『ハーネス』内で直接訓練できることだ。Claude CodeやCodex、OpenClawといった運用向けハーネスは、複数回の推論やツール利用を管理する。従来のオープンな訓練ツールではこうした状態を持つ複数プロセスの処理が難しく、簡略化した環境で訓練した後に実環境へ移すというミスマッチがあった。Orchardは軽量プロキシがハーネスのモデル呼び出しを記録し、各ロールアウトをコンテナ内で実行することで、このギャップを埋める。

3つの領域別レシピ

Orchard-SWEは、GitHub Issueの解決を自律的に行うソフトウェア工学エージェントの訓練ワークフローだ。MiniMax-M2.5とQwen3.5-397Bという2つのオープンウェイトモデルから蒸留した10万7,000件のエージェント行動を学習に用いる。失敗した試行の生産的な部分も学習に活用する信用割当型の教師あり微調整や、強化学習の報酬を補完する手法を組み合わせ、SWE-bench Verifiedで69.7%を達成した。価値モデルによる再ランキングを加えると73.0%となり、約30億のアクティブパラメータで10倍以上大きいフロンティアモデルに迫る。

Orchard-GUIは40億パラメータの視覚言語モデルをブラウザエージェントとして訓練し、400件の蒸留デモと2,200件のタスクという比較的少ないデータで、WebVoyager 74.1%、Online-Mind2Web 67.0%、DeepShop 64.0%を記録した。Orchard-Clawは200件の合成タスクでパーソナルアシスタント向けエージェントを訓練し、Claw-Evalで59.6%を達成する。より強力なZeroClawと組み合わせた場合は73.9%に向上し、Codexハーネスでは訓練前の18.6%から51.5%へと成功率が改善した。

既存手法との位置づけ

従来のエージェントAI研究では、カスタムのサンドボックスやクローズドな訓練パイプライン、プロプライエタリなデータセットが必要になることが多く、再現性が課題だった。Orchardはこれらをオープンかつ軽量な形で提供し、誰でも同じ環境で訓練・評価を行えるようにする。特に、実運用ハーネス内で訓練できる点は、研究とデプロイの乖離を縮める意味で新しいとみられる。

記事は、Orchardの結果が『環境層の重要性』を裏付けるものだと説明している。小規模なオープンモデルでも、適切な環境と訓練手法があれば複雑な実世界タスクで強い結果を出せる可能性が示された。もっとも、これらの数値は特定のベンチマーク環境でのものであり、実務での再現性や汎用性は今後の検証が待たれる。

展望と注意点

Orchardの今後の方向性として、記事は『累積的なエージェント学習』を挙げている。訓練のたびに破棄される軌跡を永続的な資産として扱い、価値モデルなどに蒸留することで、次世代のエージェントが前の世代の知識を引き継げるようにする構想だ。また、Orchard-GUIのデータ効率の高さは、Webエージェントの大規模訓練に手動作成データを大量に必要としない可能性を示唆している。

一方で、公開されたモデルやデータの具体的な利用条件や、訓練に必要な計算資源など、運用面の詳細は記事では明らかにされていない。導入を検討する場合は、公式リポジトリやドキュメントで要件を確認し、自社のユースケースで検証する必要がある。

原文からの引用
By making the underlying infrastructure open, lightweight, and reusable, Orchard lowers the cost of agentic AI research.

基盤となるインフラをオープンで軽量かつ再利用可能にすることで、OrchardはエージェントAI研究のコストを引き下げる。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、Orchardの公開はエージェントAIの研究開発コストを下げる選択肢になりうる。実行環境を再利用できるOrchard Envにより、カスタム環境を自前で構築せずに、ソフトウェア工学やWeb操作エージェントの訓練・評価を始められる点は実務上の利点だ。また、CodexやOpenClawといった実運用ハーネス内で直接訓練できるため、研究環境と本番環境の差による性能低下を避けやすいとみられる。一方で、公開データの利用条件や再現性は事前に確認が必要であり、ベンチマーク以外の実タスクでの検証を踏まえて採用を判断することが求められる。

用語解説

エージェント
複数段階の作業を計画・推論しながら自律的に実行するAIシステム。コード修正やWeb操作などを行う。
ハーネス
エージェントの推論やツール利用を管理する実行環境。Claude CodeやCodexなどが該当する。
蒸留
高性能なモデルの出力を教師データとして、より小さいモデルを訓練する手法。
強化学習
試行錯誤を通じて報酬を最大化するようモデルの振る舞いを最適化する学習手法。
価値モデル
候補となる解の質を評価し、最良のものを選ぶために使うモデル。
Kubernetes
コンテナ化されたアプリケーションのデプロイや運用を自動化するオープンソース基盤。

出典

Orchard: An open framework for scalable agentic AI

Microsoft Research / Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Jianfeng Gao / 2026年8月4日

https://microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai

企業のAI活用顧問を、いまなら無料で承っています

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて一緒に整理します。導入前の相談だけでも構いません。

無料でAI活用の相談をする