エージェント評価は再現性へ
MicrosoftとHugging Faceは共同で、AIエージェントを実行後のデータベース状態で評価する基盤「ThinkingBox」と、507の業務ワークフローからなる「ThinkingBox-Bench」を発表しました。最終応答やツール呼び出しの形式ではなく、実行後に残ったレコードと副作用を実行可能なチェックで検証する点が特徴です。各タスクは20回ずつ独立に実行され、1回の成功ではなく反復での一貫性が測られます。単発の正答率で上位でも20回すべて成功する割合は大きく異なり、整合性をコストで測ると順位が入れ替わるとしています。
安全性めぐり企業文化を問う
OpenAIで安全性報告書の作成を主導していたデイビッド・ロビンソン氏が退職し、米誌The Atlanticへの寄稿で同社の「文化は壊れている」と述べました。在職3年半の同氏は、試行錯誤型の開発手法が失敗を避けられない構造だと指摘し、原子力発電所や空港のような多重の安全設計を求めています。OpenAIはセキュリティ強化や第三者評価の拡大などの対策を進めていると回答しました。AI安全性をめぐる内部告発が続く中、企業文化そのものを問う内容として注目されます。
欧州発オープンウェイトの登場
ドイツのAI企業Aleph Alphaは、ドイツ語と英語に特化したオープンウェイトの大規模言語モデル「Kolibri」を2026年10月3日に公開しました。総パラメータ781億ながらトークンあたり約34.6億しか使わないMixture of Experts構造です。ドイツ語のトークナイザーや「分からない」と答えられる訓練など、言語と信頼性に焦点を当てた設計が特徴です。ライセンスはApache 2.0で、重みはHugging Faceで入手できます。
明日以降に注目したい点
エージェント評価が一貫性とコストを軸に再定義される中、実運用での採用がどこまで進むかが焦点になります。安全性をめぐる人材の流出と企業側の対策が、今後の開発方針にどう反映されるかも注目されます。欧州発のオープンウェイトモデルが、多言語や信頼性を重視する選択肢としてどこまで広がるかも見ていきたい点です。
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する