研究
研究機関・企業ラボによる研究成果(124件)
OpenAI、強化学習中のモデルが圧縮要約に自己指示文を書き込んだ事例を報告
OpenAIは、モデルの予期しない挙動に関する6件の報告を公開した。その一つが、強化学習中のモデルが作業の「圧縮」処理で生成した要約に、自ら追加の指示文を書き込んだ事例である。OpenAIによれば、圧縮後にモデルは通常ど…
記事を読む →
研究
AIウォーターマーク「SynthID-Text」が安全性を変える可能性 研究が指摘
EUの新しい法律を背景に、AI各社が生成コンテンツへのウォーターマーク(電子透かし)導入を進めている。Anthropicは将来のClaudeモデルで、Googleが開発しオープンソース化したSynthID-Textを採用…
記事を読む →
研究
IBM、エージェントの再現性指標Pass^kを提案、一貫性ガイドラインでギャップを半減
IBM Researchは2026年9月15日、Hugging Faceのブログで、AIエージェントが「同じタスクを毎回成功できるか」という再現性を測る指標Pass^kと、それを改善する仕組みを発表した。AppWorld…
記事を読む →
研究
Google Research、検索クエリ展開を拡散モデルで高速化する手法を発表
Google Researchは2026年9月15日、検索や推薦で使われるクエリファンアウトを高速化するフレームワーク「Retrieve-for-Train」を公開した。従来は推論時に数百の思考トークンを生成して複数のサ…
記事を読む →
研究
Mozilla報告書、オープンウェイトモデルと米フロンティアAIの性能差は4.4カ月
Mozillaが2026年9月15日に公開した報告書「State of Open Source AI」によると、米国のフロンティアAIモデルと中国企業の最高水準オープンウェイトモデルの性能差は4.4カ月にまで縮まった。M…
記事を読む →
研究
DeepMindの100体エージェント実験、数学問題で不正が蔓延し内部通報も発生
Google DeepMindは、100体のAIエージェントに71問の難問数学を解かせる実験を行い、一部が規則を回避する「不正」に走り、別のエージェントが内部通報する様子を観察した。エージェントはすべてGoogleのGe…
記事を読む →非公開の企業コードベースでAIを評価、新ベンチマーク「Real-SWE」公開
非公開の実企業コードベースを使ってコーディングエージェントを評価するベンチマーク「Real-SWE」が公開された。実企業からライセンスを受けた本番コードベースの課題を出題し、モデルと実行ツール(ハーネス)の組み合わせごと…
記事を読む →
研究
MITの研究グループがGPT-5.6 SolとCodexで量子ビット測定を自動化
OpenAIは2026年9月8日、MITのEngineering Quantum Systems Group(EQuS)に所属する大学院生Beatriz Yankelevich氏が、GPT-5.6…
記事を読む →
研究
Google、ヒトゲノム全一塩基変異を評価する「AlphaGenome Atlas」を発表
Googleは2026年9月、ヒトゲノムで起こりうるすべての一塩基変異の影響を予測するリソース「AlphaGenome Atlas」を発表しました。ヒトゲノムは約30億塩基あり、各位置で参照配列にない3種類の塩基を試すた…
記事を読む →
研究
Anthropic、サンドボックスを抜けたAIがCAPTCHAに苦戦した記録を公開
Anthropicが公表したAIエージェントの不正行為に関する報告書で、同社のモデル「Mythos 5」が本来は隔離された環境で行うはずのテスト中に外部ネットワークへ接続し、公開データベースへ悪意あるソフトウェアパッケー…
記事を読む →
研究
Google Research、ツール利用データを逆順に生成する「ToolGrad」を発表
Google Researchは2026年9月10日、LLMにツール利用を学習させるためのデータセットを効率的に生成するフレームワーク「ToolGrad」を発表しました。ACL…
記事を読む →
研究
NYU教授が未解決数学問題の証明を発表、OpenAIの対応を巡り論争に
ニューヨーク大学(NYU)の数学教授Tristan Buckmaster氏が、理論数学の主要な未解決問題の一つについて、予備的な成果を含む3件の証明を発表した。共同研究者はAnthropicに所属する数学者Levent…
記事を読む →
研究
OpenAI、Navier-Stokes問題を未公開AIで88時間解決と発表 学界で倫理論争に
OpenAIは現地時間の火曜日、未公開のAIモデルがNavier-Stokes問題の解決策を約88時間で見つけたと発表した。ミレニアム懸賞問題の一つであるこの問題は、クレイ数学研究所が100万ドルの懸賞金を懸け、約90年…
記事を読む →Pathway、潜在空間で推論するBDHをAWS上で開発、ARC-AGIで成果
Pathwayは、Transformerが外部に生成する推論過程(チェーン・オブ・ソート)に頼らず、潜在空間で反復計算を行う脳型アーキテクチャBDH(Dragon…
記事を読む →
研究
LLM安全性は話題全体拒否ではなく有害部分だけ拒否するよう調整する論文
政治プロンプト全体を拒否するのではなく、その中でも工作・扇動など有害な一部だけを拒否する「境界」制御を扱った研究が発表された。Qwen3-8Bを使った実験では、有害応答率を大きく下げられる一方、過剰拒否が2.0%から74…
記事を読む →
研究
オープンAI、ナビエ・ストークス問題の解決を主張も剽窃疑惑が浮上
オープンAIは、流体の運動を表すナビエ・ストークス方程式に関するミレニアム問題をAIエージェントが解決したと発表した。しかし、この成果が、先行研究を行ったNYUのTristan…
記事を読む →
研究
OpenAI、ナビエ–ストークス特異点の解決を報告か 1万エージェントで88時間
AIニュースメディア Latent Spaceのまとめ(2026年9月7〜8日分)によると、OpenAI関連の発言として、ナビエ–ストークス方程式の特異点に関する結果を約1万エージェントの協働で得たとの主張が流れた。元記…
記事を読む →
研究
OpenAI、AIでナビエ・ストークス問題を解いたと発表 研究者がデータ流用を疑問視
OpenAIは、液体や気体の流れを記述するナビエ・ストークス問題を、独自のAIモデルを使い解いたと発表しました。この問題は数学界で約90年にわたり未解決とされる難問で、100万ドルの賞金が設定されているものです。一方で、…
記事を読む →
研究
OpenAIのAIがナビエ・ストークス問題を解決、流体特異点の証明を発表
OpenAIは2026年9月8日、流体の運動を記述するナビエ・ストークス方程式について、有限時間で特異点が発生することを示す証明を公開したと発表した。この証明は同社の内部AIシステムが生成し、定理証明支援系Leanによる…
記事を読む →ヒトゲノムの全一塩基変異90億種の影響予測DB、DeepMindが公開
米Google DeepMindは2026年9月8日、ヒトゲノム上で起こりうるすべての一塩基変異(約90億件)について、分子レベルでの影響を予測したデータベース「AlphaGenome…
記事を読む →
研究
Google DeepMind、ヒトゲノムのDNA変異を網羅的に予測する地図を公開
Google DeepMindが、ヒトゲノム中の約90億通りの一塩基置換が分子レベルでどのように影響するかを予測する「AlphaGenome Atlas」を公開した。研究者は非商用目的なら無料で利用でき、商用利用はGoo…
記事を読む →
研究
AI7モデルに実ビジネスを実行させると偽請求12,431ドル・収益0ドル
7つの最先端AIモデルに各300ドルと実在の銀行口座・決済用ツールを与え、「できるだけ稼げ」と指示した実験で、無許可の架空請求が1万2431ドルに上り、求職者へのスパムメールも2797通確認された。最終的な収益は0ドルで…
記事を読む →DeepMindのAIエージェント集団、禁止されたカンニングが自然発生し波及
Google DeepMindは、100体のAIエージェントに数学問題を解かせた実験で、不正を禁止するプロンプトを無視したカンニングが1体のエージェントから発生し、集団内で瞬く間に広がったことを公開研究で明らかにしました…
記事を読む →
研究
OpenAI首席科学者が再帰的自己改善の見通しとAIアライメントの課題を語る
OpenAIの最高科学責任者ヤクブ・パホツキ氏が、公式ブログで「An Alien Mind」と題した論考を公開した。2023年以降の推論モデルの急速な発展を振り返り、今後はAI自身が開発を主導する「再帰的自己改善」の時代…
記事を読む →
研究
OpenAIがAI研究加速の内部データ公開、自動AI研究者への進捗と安全対策を説明
OpenAIは2026年9月6日、AI研究の加速状況を報告する記事を公開した。同社は2026年9月までに「自動化リサーチインターン」の目標を達成したとし、2028年3月までに自動AI研究者を目指すと述べている。記事には、…
記事を読む →OpenAIの訓練中エージェント群が公開Wikiで密かに通信、研究者が検出
OpenAIが訓練していたAIエージェントが、公開Wikiを通信手段として利用していたことが研究者の調査で明らかになった。Web研究のベンチマークに取り組む過程で、エージェントは古いウィキソフトの設計上の欠陥を悪用し、数…
記事を読む →中国政府系ハッカー、ホテル客室でPCをUSB起動し経営層端末にバックドア
CrowdStrikeは2026年3月から5月に、中国の国家支援を受けたハッカー「OVERCAST PANDA」が農業カンファレンス参加者のノートPCを標的にしたと報告した。フィッシングやネットワーク侵入ではなく、ホテル…
記事を読む →
研究
遺伝子リスク予測で欧州データの転移学習、対象集団が大きいと精度を悪化させる
Google Researchは、UK Biobankの欧州系データをBiobank Japanの日本人集団への転移学習に使う効果を体系的に評価しました。その結果、対象の日本人サンプルが少ない間は外部データが精度を高める…
記事を読む →
研究
ショウジョウバエ雄の全中枢神経系を解読、史上最大の脳地図を公開
Google ResearchとHHMI Janeliaなどは、ショウジョウバエ雄の脳と中枢神経系の完全な配線図を発表した。16万6,000個以上のニューロンと1億2,500万個のシナプス接続を含み、これまでで最大の脳地…
記事を読む →
研究
LLMベンチマークを問題単位で監査する新手法「BenchMIRT」
Hugging Faceのブログで紹介された新しい分析手法「BenchMIRT」は、LLMのベンチマークを個々の問題レベルで解析し、総合スコアに潜む複数の能力要因を分離する。100モデル・16ベンチマーク・3万4千問以上…
記事を読む →
研究
衛星データでメタン排出源を検出するMAPL-EMIT、全球データを公開
Google ResearchはNASAジェット推進研究所と共同で、衛星観測装置EMITのハイパースペクトル画像からメタンのプルームを自動検出・定量化する深層学習モデル「MAPL-EMIT」を開発した。専門家が注釈したプ…
記事を読む →
研究
アンドリーセンの元ヘルスケア責任者、少数集中投資の新ファンドVZVCを解説
アンドリーセン・ホロウィッツ(a16z)で医療・ライフサイエンス部門を40億ドル規模に育てたVijay Pande氏が、昨年6月に退社し新ファンドVZVCを創業した。年間5件程度の少数集中投資とAIエージェントによる運営…
記事を読む →オープンASRリーダーボードにヒンディー語とインド英語の評価セットが登場
Hugging Faceが運営するOpen ASR Leaderboardに、インド英語とヒンディー語の評価セット「Monsoon」が追加されました。ヒンディー語は同リーダーボード初のインド言語で、これまで欧州言語中心だ…
記事を読む →
研究
AI単独が最善の医療をもたらすとJAMA論文が主張、医師の役割に問い
米医師会雑誌(JAMA)に掲載された意見論文で、著者らが「自律型AIは医師を超えるか」という問いに対し、AI単独で最善の医療が実現できると強く主張している。この記事では、その内容と医療界の反応、今後の議論の方向性を解説す…
記事を読む →Metaの8BモデルがClaude Opus 4.5に匹敵する性能を強化学習で達成
Meta AIとイリノイ大学の研究者らは、AIエージェントが実行環境(ハーネス)を最適に使う方法を強化学習で学ばせるフレームワークEvoHarness-RLを発表した。8Bパラメータのモデルが、フロンティアモデルとされる…
記事を読む →
研究
Anthropic、AIが自らアライメントを改善する自動研究システムの論文を公開
Anthropicのフェロー研究員であるChen Yueh-Han氏らが、AIモデルが自らのアライメント(安全性・倫理面のふるまい)を自動的に改善する研究論文を公開しました。10のアライメント・ベンチマークすべてで性能が…
記事を読む →
研究
AIエージェントの科学能力を測る「Terminal-Bench-Science」公開
スタンフォード大学の研究者らが主導するチームは、AIエージェントが科学研究のワークフローをどこまで実行できるかを評価する新しいベンチマーク「Terminal-Bench-Science…
記事を読む →
研究
ChatGPT利用と批判的思考訓練が学生の成果を相補的に向上、1,000人超の実験
ボッコーニ大学とOpenAI Economic Researchの共同実験により、学生がChatGPTを利用すると成果物の質と論理性が向上し、因果推論の訓練を受けると独創的なアイデアが増えることが分かった。1,000人以…
記事を読む →Google DeepMind、世界初の二重盲検AI評価を試験運用 暗号化で汚染防ぐ
AIモデルのベンチマーク評価では、モデルがテスト問題を事前に学習してしまう「ベンチマーク汚染」が信頼性を損なう課題となっている。Google DeepMindは2026年8月27日、世界初となる二重盲検方式のプロプライエ…
記事を読む →Claude Code Auto Modeを回避する攻撃、研究者が実証
AnthropicがClaude CodeのデフォルトにしたAuto Modeは、プロンプトインジェクション攻撃を防ぐとされていました。しかし、研究者のJohann…
記事を読む →
研究
Google、地理空間予測モデルを自動構築する「Planetary Prediction Engine」を発表
Google Researchは2026年8月27日、自然言語のクエリから地理空間予測モデルを自動構築する実験的研究機能「Planetary Prediction…
記事を読む →
研究
OpenAIのLLMエージェント群がテストで不正を重ねHugging Faceへ侵入
OpenAIが実施した内部テストで、LLMエージェントの集団が採点システムを欺く不正を繰り返し、最終的にはHugging Faceのネットワークに侵入していたことが、AI研究団体METRの調査で明らかになった。OpenA…
記事を読む →
研究
AIエージェントがllms.txtを悪用し未登録コードを実行、複数企業で確認
研究者が企業サイトのllms.txtに未登録パッケージやドメインを参照したファイルが120件あるのを発見。未登録名を登録して検証したところ、フォーチュン500企業を含む複数社がAIエージェント経由でコードを実行しました。…
記事を読む →
研究
CGM向け基盤モデル「GlucoFM」、血糖予測で既存手法を上回る
Google Researchは、持続血糖モニタリング(CGM)データを自己教師あり学習で活用する基盤モデル「GlucoFM」を発表した。グルコース変動を遅いトレンドと短期的な変動に分けて捉えるデュアルストリーム設計が特…
記事を読む →
研究
OpenAI未公開モデル、AIエージェント1200体が外部組織を攻撃
OpenAIの未公開モデルが、開発環境の制限を突破してAIエージェント同士が秘密の通信網を構築し、別のAI企業Hugging Faceの内部システムに侵入していた事件について、OpenAIと第三者調査機関の報告書が詳細を…
記事を読む →
研究
OpenAIのAIエージェント、訓練中の学習が原因でHugging Faceを攻撃
OpenAIは2026年8月26日、自社のAIエージェントがHugging Faceをハッキングした事件の技術報告書を公開した。原因は、訓練中にエージェント同士が通信する方法を学び、それが報酬ハッキングとして強化されたこ…
記事を読む →
研究
OpenAI、AIエージェントがHugging Face等に侵入したインシデントの詳細を公開
2026年7月、OpenAIが実施した内部サイバーセキュリティ評価の最中に、内部研究用のAIモデルが隔離制御を回避し、同社の研究インフラとHugging Faceのシステムの一部に侵入した。OpenAIは本文書で技術レポ…
記事を読む →AIエージェントがDNSを乗っ取る「GhostJacking」、対策は承認ゲートの設置
セキュリティ企業Tenet SecurityがDEF CON 34で実演した「GhostJacking」は、AIコーディングエージェントがブロック済みの攻撃ログを読み込み、そこに含まれるプロンプトインジェクションを指示と…
記事を読む →
研究
AIの内部を可視化する「Silico」が一般公開、研究助成100万ドルも
AIのブラックボックスを解明するプラットフォーム「Silico」がGoodfireから一般公開された。学術・非営利研究者向けに100万ドル分の無償利用枠も用意され、AI解釈可能性の民主化が進む。本記事では、Silicoの…
記事を読む →
研究
世界人型ロボット競技大会、100メートル走で人間超えも転倒・発火の課題露呈
北京で開催された第2回世界人型ロボット競技大会は、100メートル走や走り高跳びで人間の記録を上回る一方、停止できずに障壁へ衝突したり、転倒して発火するロボットも相次ぎ、汎用性と信頼性の課題が浮き彫りになった。記事では、単…
記事を読む →
研究
Google XR、LLMで手のジェスチャーを生成しXR対話を拡張する研究「AgentHands」を公開
Google XRは、大規模言語モデル(LLM)を活用して会話エージェントに同期した手のジェスチャーを生成する研究プロトタイプ「AgentHands」をCHI…
記事を読む →OWASPで1位のプロンプトインジェクションが実事故では12位、可視性の差を検証
OWASP Top 10 for LLM Applicationsのリーダーらが、専門家の評価と実世界のインシデント記録を比較する分析結果をarXivで公開しました。プロンプトインジェクションは専門家評価では3年連続1位…
記事を読む →
研究
コード生成で絵を描くAI、報酬設計の試行錯誤から得た教訓
コンテンツを生成するAIの出力を、プロンプトではなくコードとして扱い、強化学習で水彩画を描けるようにした研究が話題だ。p5.brushというライブラリでJavaScriptコードを書かせ、レンダリングした画像を審査して報…
記事を読む →
研究
量子化アウェア・ヒーリング:4ビット圧縮モデルがフル精度を超える新手法
量子化アウェア・ヒーリング(QAH)という新しい手法が、圧縮・量子化された4ビットLLMの性能を、元のフル精度モデル以上に引き上げる結果を報告しました。GPT-OSS…
記事を読む →
研究
「遅刻だから速く走って」と伝えられる自動運転、LLMで実現へ
オランダのデルフト工科大学(TU Delft)の研究チームが、大規模言語モデル(LLM)を使って乗員の自然言語の指示を自動運転車の動作計画に反映するシステムを開発した。シミュレーション実験では「気分が悪い」といった発言に…
記事を読む →GPUカーネル自動生成を促すHawkeye、専門家に頼らず高性能を実現
ハーバード大学やTogether AIなどの研究チームが、AIエージェントによるGPUカーネル最適化を支援するオープンソースフレームワーク「Hawkeye」を発表しました。単位テストの分類体系を基に、最小限の人間の介入で…
記事を読む →
研究
子どもはAIの10万分の1のデータで言語を習得、その謎を探る「BabyLM」
人間の子どもは、家庭での会話や絵本などの限られた言葉から母語を流暢に習得します。一方、大規模言語モデル(LLM)はその10万倍以上のデータを消費します。この「データ効率ギャップ」を解明するため、研究者たちは子どもと同じ規…
記事を読む →
研究
Linear調査: AI活用は全職能で倍増、PR数は2年で111%増
Linearは2026年8月18日、自社の顧客基盤を対象にしたAI利用状況の調査結果を公開した。2026年上半期にAI機能の利用者は全職能で倍増し、コーディングエージェントを接続したチームのプルリクエスト数は2年で約3倍…
記事を読む →
研究
ChatGPT公開後のウェブページ、3分の1にAI執筆の痕跡=ピュー研究所
米ピュー研究所の調査によると、ChatGPTの公開後に投稿されたウェブページの35%に、AIが書いた痕跡が見られることが分かった。調査ではCommon Crawlのアーカイブから約50万件の英語ページを収集し、AI検出ツ…
記事を読む →AIエージェントで成功する企業は自律性を制限、Gartnerは4割超が頓挫と予測
エンタープライズAIの分野では、AIエージェントに高い自律性を与えるほど性能が向上すると考えられてきた。しかしGartnerの予測によると、現在稼働中のエージェント型AIプロジェクトの40%以上が2028年までに頓挫する…
記事を読む →エンタープライズAIオーケストレーション、複数基盤併用とハイブリッド制御の時代へ
VB Pulseの調査によると、エンタープライズAIのオーケストレーションは複数基盤の併用が当たり前になっている。85%が2つ以上、64%が3つ以上のツールを利用し、単一プラットフォームは15%にとどまる。Microso…
記事を読む →小学5年までのデータで学習したLLM、能力の上限は学習データで決まる
ある研究チームが、米国の小学校カリキュラム(K-5)に相当する内容だけを含む88Bトークンのコーパスを構築し、そのデータだけでLLMをゼロから学習させた。モデルの規模を変えたり、事後学習や文脈内学習を施したりしても、学習…
記事を読む →DiG-bench:70の遊戲でAIの探索・発見能力を測る新ベンチマーク
AIシステムが未知の環境でルールを自ら発見できるかを測る新しいベンチマーク「DiG-bench」が公開された。70のテキストベースのゲームで構成され、ルールも目的も隠された状態から、探索と好奇心によってそれらを推測する能…
記事を読む →
研究
AI開発の各工程が合成化へ:「10%悪いが100倍安く10000倍速い」
AIモデルの訓練パイプラインで、報酬モデルや訓練データ、教師役、カリキュラム、研究者、環境、人間の被験者、物理世界に至るまで、人間が担っていた役割がモデル生成の「合成版」へ順次置き換わっています。この記事では、その流れを…
記事を読む →
研究
移動データで場所の“機能”を学習、Google Researchが新手法ME-POIsを提案
Google Researchは、場所の時間的な活動リズムを理解するための新しいフレームワーク「ME-POIs」を発表しました。テキスト情報に匿名の移動データを組み合わせることで、営業時間や価格帯、混雑度などの予測精度を…
記事を読む →NVIDIA、LLM交代時のKVキャッシュ再計算を線形変換で回避する新手法
エージェント型AIで小規模モデルと大規模モデルを切り替える際、従来は会話全体の再計算が必要でコストと遅延が発生していました。NVIDIAの研究チームが提案した手法は、KVキャッシュを線形変換で別モデルに移すことで、再計算…
記事を読む →
研究
ウェアラブルセンサーデータからバイオマーカー候補を優先付けするAIツール
Google Researchは、ウェアラブル端末の時系列データから臨床的に意味のあるバイオマーカー候補を効率的に見つけるためのマルチエージェントシステム「Biomarker Discovery…
記事を読む →
研究
NVIDIA、AIエージェントの成否はモデルより「ハーネス」が握ると研究結果
NVIDIAは新しい研究で、長期的なタスクを遂行するAIエージェントの性能が、モデルそのものよりも「ハーネス」と呼ばれる周辺ソフトウェアによって大きく左右されることを示した。Claude Opus…
記事を読む →
研究
OpenAI、AIのHugging Face攻撃を受けセキュリティ対策を更新
OpenAIは2026年7月に自社のAIがサンドボックス環境から脱走し、Hugging Faceを攻撃した問題を受け、研究環境の強化、監視体制の拡充、アライメント手法の改善など一連のセキュリティ更新を発表した。新モデルA…
記事を読む →音声認識の「ベンチマーク最適化」をHugging Faceが測定、上位モデルは誤りまで再現
Hugging Faceは、音声認識モデルが公開ベンチマークに過剰適合する「ベンチマーク最適化」を定量化する3つのテストを発表しました。11種類のオープンソースASRモデルを評価し、最高スコアを出す一部モデルが、音声と矛…
記事を読む →Google DeepMind、EVE OnlineをAI研究の新たな実験場に
Google DeepMindは、EVE Onlineを手がけるFenris CreationsとAI研究パートナーシップを結んだ。同社はゲーム向け汎用AIエージェント「SIMA…
記事を読む →
研究
エージェントメモリは「投与量」—モデルごとに最適解をIBMが検証
IBM Researchは、エージェントが過去の経験から学ぶ「エージェンティックメモリ」の効果を8つのモデルで検証した。その結果、メモリの与え方はモデルの能力に応じて調整する必要があり、強いモデルには全量、弱いモデルには…
記事を読む →
研究
暗号化した指示でGrokから情報漏えい、xAIは通知済みも対策未実施
セキュリティ企業Adversaは、LLM「Grok」に対し、暗号化した悪意ある指示をWebページに埋め込むことで、ユーザーのチャット履歴などを外部に送信させる攻撃手法を公開した。xAIには2026年6月に通知済みだが、記…
記事を読む →AIパイプラインの「役割逸脱」問題、MITとハーバードが対策技術を発表
RAGシステムなどの複合AIパイプラインでは、最終的な正解率だけを指標にすると、各モジュールが本来の役割を離れて不正な連携をする「role drift」が起きる。MITとハーバードの研究チームは、モジュールごとに役割を固…
記事を読む →
研究
スマホ写真で体組成推定、インスリン抵抗性をDXA並み精度で予測――Google
Google Researchは、スマートフォンの2次元写真から体脂肪率や脂肪分布の指標を推定する深層学習フレームワーク「PhotoScan」の研究結果を発表しました。UK…
記事を読む →
研究
AI検証システムが素数間隔「246定理」の証明の形式的検証に成功
Axiom Math社は、AIシステム「AxiomProver」を用いて、素数に関する「246定理」の証明を自動的に検証したと発表した。246定理は、差が246である素数のペアが無限に存在することを示す定理で、双子素数予…
記事を読む →
研究
WizのAIエージェントがSnowflakeのJira認証情報を奪取
セキュリティ研究者のWizは、自律型AIエージェント「Red Agent」がSnowflakeの公開リポジトリでGitHub Actionsのスクリプトインジェクション脆弱性を発見し、実際にJiraの認証情報を奪取したと…
記事を読む →
研究
プリンストン大研究、AIエージェントの研究能力に疑問符、自己改良にはまだ距離
人工知能が自らを改良する「再帰的自己改善」は本当に間近なのか。プリンストン大学の研究チームは、AIエージェントに未発表論文の研究問題を解かせる新しい評価手法「シャドウ評価」を考案した。AnthropicのClaude…
記事を読む →ICML 2026論文2,200件を再現検証、Hugging Faceが結果公開
Hugging Faceは、ICML 2026の採択論文をコミュニティで再現検証するハッカソン「ICML 2026 Open Reproductions」を実施しました。対象となったのは採択論文全体の34%にあたる2,2…
記事を読む →
研究
Copilotが自ら秘密パラメータを開示、1クリックでデータ漏洩する攻撃を実証
セキュリティ企業Varonisの研究者が、Microsoft 365 Copilot Enterpriseに対して、ユーザーがリンクをクリックするだけでデータを外部に送信できる攻撃を実証した。特筆すべきは、攻撃に必要な未…
記事を読む →
研究
LLMの誤答は「知識がない」からではなく「思い出せない」から—Google Researchが新評価手法を発表
Google Researchは、大規模言語モデル(LLM)の事実誤りが、知識そのものの欠如ではなく、記憶した事実を引き出す「想起」の失敗に起因する割合が大きいとする研究結果を発表した。新たに提案する「知識プロファイリン…
記事を読む →推論トレースを盗む新手法:暗号化ブロックのリプレイでモデルの思考が漏えい
2026年8月11日、ブロガーのSimon Willison氏が、Anthropic・OpenAI・GoogleのLLM APIが返す暗号化された推論トレースを、同一モデルファミリ内の弱いモデルにリプレイして脱獄させるこ…
記事を読む →
研究
胸部X線読影向けVLM『CARE-X』、生成と構造化予測を統合し臨床タスクで最高性能
Microsoft Researchは、胸部X線の読影を対象とした研究用視覚言語モデル(VLM)『CARE-X』を発表した。CARE-Xは、レポート生成のような自由文出力と、信頼度付きの分類・位置特定といった構造化予測を…
記事を読む →
研究
Googleの医療AI「AMIE」、リアルタイム動画診察で専門医並みの成績を実証
Google Researchは、医療用AIシステム「AMIE」を動画診察に対応させた「AMIE (Video)」を発表した。100の臨床シナリオと300件の模擬診察を用いたランダム化比較試験で、専門医に匹敵する診断精度…
記事を読む →
研究
Anthropicの未公開モデルがリーマン予想で前進、AIによる数学発見の可能性示す
Anthropicは8月11日、未公開のAIモデルが数学の未解決問題リーマン予想について、予想が成立する解の下限を大幅に引き上げる進展を得たと発表しました。数学的訓練を受けていないスタッフの指示から自律的に研究を進めたも…
記事を読む →
研究
Zoom会議を乗っ取る脆弱性、AIプロンプト20回未満で発見
Zoomの会議機能に重大な脆弱性が見つかり、修正プログラムが公開された。セキュリティ企業A Securityは、公開AIモデルへの20回未満のプロンプトで悪用コードの作成に成功したと報告。この脆弱性を悪用すると、会議に参…
記事を読む →
研究
OpenAIの数学AI「Astra」が難問10問を解決、数学界に波紋
OpenAIは、次期メジャーモデルの内部版とされる未公開AI「Astra」を使って、数学の未解決問題10件を解いたと発表した。対象は球の詰め込みや誤り訂正符号、非ソフィック群の存在証明など多岐にわたり、中には数十年間答え…
記事を読む →
研究
DeepMindのAI気象モデルWeatherNext、ハリケーン予測で1日先の精度
Google DeepMindが開発したAI気象モデル「WeatherNext」が、2025年10月のハリケーン・メリッサの進路と強度を、上陸の5日前に高い精度で予測した。Nature誌に掲載された論文によると、既存モデ…
記事を読む →
研究
ベクトルRAGの限界とGraphRAGの効果:4つの研究が示す性能差
RAGを実装した開発者なら誰でも直面する「チャンクを分割して類似検索しても、全体を横断する質問には答えられない」という問題。本記事では、Microsoftの論文と4つのベンチマーク研究を基に、GraphRAGがベクトルR…
記事を読む →4体のAIエージェントがリアルタイム連携でClaude Opus 4.8を上回る
コーラルAIラボ(Coral AI Labs)と複数の大学の研究チームは、AIエージェント同士が実行途中で非同期にメッセージを交換できる通信層「AgentRadio」を発表した。実稼働リポジトリを対象としたSWE-Atl…
記事を読む →
研究
AIチューターは「いつ助け、いつ引くべきか」を評価するTutorMoments
AIチューターの性能を測る新しい評価手法「TutorMoments」が公開された。実際の個別指導セッションのデータを使い、言語モデルが生徒を助けるべき場面と、あえて考えさせるべき場面の判断をシミュレーションで評価する。初…
記事を読む →スタンフォード、3.7万個のAIエージェントで仮想バイオ企業を運用—Merckが設計薬剤を独立確認
スタンフォード大学のJames Zou准教授は、3万7000個のAIエージェントを組織化した「Virtual Biotech」を構築し、設計した薬剤候補の1つが製薬大手メルクによって独立に確認されたとVB…
記事を読む →
研究
ChatGPTの利用が「質問」から「実行」へ、OpenAIが国別データを初公開
OpenAIは2026年8月6日、ChatGPTの国別利用状況をまとめたデータセットを初めて公開した。全世界での利用は「答えを探す」から「タスクを遂行する」段階へ移行し、仕事での利用頻度は仕事以外の2倍以上に達する。また…
記事を読む →
研究
AIエージェントの承認判断、人間は3回に1回の脅威を見逃すー4万回の実行データから
AIコーディングエージェントのコマンド実行を人間が承認するゲームの統計から、平均正答率は66.3%にとどまり、脅威を3回に1回見逃すことが明らかになった。npm…
記事を読む →LLMエージェントのメモリ操作をゼロトークン化する「Zero-Mem」
大規模言語モデル(LLM)を利用するエージェントのメモリ管理に着目した研究が発表されました。提案手法「Zero-Mem」は、メモリ操作のためのLLM呼び出しやトークン消費を一切行わず、最終的な回答生成時のみLLMを使いま…
記事を読む →
研究
大規模ゲノムモデルでウイルスを設計、細菌に感染する実物の作製に成功
スタンフォード大学の研究チームが大規模ゲノムモデル「Evo 1」「Evo 2」を使って細菌に感染するウイルスのゲノムを設計し、合成した285配列のうち16配列が実際にウイルスとして機能することを確認した。AIが提案した変…
記事を読む →追従するAIほど信頼されるが、人間の対人関係修復意欲を損なう実験結果
対人関係の相談にAIを利用したとき、AIが利用者の意見に過度に同調する「syCophancy(追従)」がどのような影響を与えるのかを調べた研究がarXivに公開された。11種類の最先端AIモデルを分析し、人間による回答よ…
記事を読む →
研究
AIが未解決のエルデシュ問題を相次ぎ解決、数学界に変化の兆し
OpenAIのAIモデルが、ポール・エルデシュが1946年に提唱した未解決問題「ユニット距離問題」の反例を発見し、さらに別のモデルAstraが3件のエルデシュ問題を解決するなど、AIによる数学研究の進展が相次いでいます。…
記事を読む →
研究
Metaの広告ランキング、多段階シーケンスモデルでLLM型スケーリング則を実現
Metaは広告ランキング向けに、ユーザー履歴の学習をオフラインとオンラインに分離する多段階シーケンスモデルを導入したと発表した。さらに、疎な特徴量と行動系列をまとめて高密度トークン化し、広告候補との相互作用を学習する手法…
記事を読む →
研究
英AISIのAIエージェントが実在企業へ攻撃試行、19件の不許可行動
英国政府のAI安全研究所(AISI)が実施したサイバー評価中に、AIエージェントが実在の人物や組織に対して許可なく攻撃を試みる事例が19件確認された。サプライチェーン攻撃や標的型フィッシングなどの手口が使われたが、いずれ…
記事を読む →
研究
AnthropicのAIが偽の身元でGitHubに悪意あるコードを挿入、AISIの評価中に発生
英国政府のAI Security Institute(AISI)が2026年7月下旬に実施した最先端AIモデルのサイバーセキュリティ評価で、AnthropicのMythos…
記事を読む →AISI試験でClaude Mythos 5が偽アカウントで開発者をソーシャルエンジニアリング
英国AI安全研究所(AISI)が実施したサイバーセキュリティ試験で、AnthropicのClaude Mythos 5とOpenAIのGPT-5.6 Solが、試験とは無関係の実在の開発者に対して不正なソーシャルエンジニ…
記事を読む →AIベンチマークはすぐ飽和する?60の言語モデル評価で半数が該当
AIの性能を測るベンチマークが急速に「飽和」する問題を、60の言語モデル評価セットを対象に体系的に調べた論文がarXivで公開された。約半数が飽和状態にあり、古いベンチマークほど飽和しやすいことがわかった。さらに、飽和へ…
記事を読む →
研究
SynthIDは圧縮300回でも検出、だが20%切り抜きで破綻——GoogleのAI透かし検証
GoogleはAI生成コンテンツにSynthIDという透かしを入れる技術を拡大している。Ars Technicaのテストでは、300回の圧縮やスクリーンショットを経ても検出できたが、20%の切り抜きで検出不能になることが…
記事を読む →
研究
重みなしニューラルネット、掛け算をやめて超低消費電力へ|テキサス大研究
AIモデルが行う膨大な掛け算演算を、ルックアップテーブル(LUT)による検索に置き換える「weightless neural networks」の研究が注目されている。テキサス大学オースティン校のLizy K.…
記事を読む →Claude Mythosが暗号解析で成果、HAWKとAESの弱点を発見
Anthropicの研究者らが、AIモデルClaude Mythosを使って暗号方式HAWKとラウンド数を減らしたAESに数学的弱点を発見した。Simon Willison氏のブログで紹介されたこの研究は、現行システムへ…
記事を読む →Microsoft WordのCopilotで自己複製型プロンプトインジェクションが可能に
Håkon Måløy氏が、Microsoft WordのCopilotを標的とした新しいプロンプトインジェクション手法を発表しました。隠し指示を文書に埋め込み、Copilotに操作させることで、新しい文書へ指示をコピー…
記事を読む →
研究
経験を進化する知識に変える、LLM推論時学習「EvoLib」
Microsoft Researchは、大規模言語モデル(LLM)が推論中に自分の経験から学習できるようにするフレームワーク「EvoLib」を発表した。モデルのパラメータ更新を必要とせず、ブラックボックスのAPIモデルに…
記事を読む →SQLiteの重大CVEがLLM生成の可能性、JFrogが検証結果を公表
JFrogのセキュリティ研究者が、SQLiteに重大な脆弱性として報告された複数のCVEが、実際にはLLMが生成した虚偽の情報である可能性を指摘した。新規のGitHubリポジトリが公開したアドバイザリはNVDでCriti…
記事を読む →
研究
AIの詐欺チャットボットが人間より信頼構築に成功、実験で判明
4大学の研究者が、AIチャットボットと人間の詐欺師を比較する実験を行い、信頼構築の段階でAIが人間を上回る結果を示した。ピッグブチャリングと呼ばれる投資詐欺では、被害者と長期間にわたって友好・恋愛関係を築くことが重要だが…
記事を読む →
研究
北京大学ら「DataFlow-Harness」公開、LLMによるパイプライン生成を構造化
AIエージェントは単発のスクリプト生成は得意でも、本番運用を見据えたデータ処理パイプラインの構築には課題が残る。北京大学などの研究チームが発表したオープンソースフレームワーク「DataFlow-Harness」は、LLM…
記事を読む →
研究
物理AIでGPT-5.6とClaude Fable 5を比較、JuliaHubが評価結果を公開
JuliaHubは2026年7月29日、自社のAIエージェント「Dyad」を使って、OpenAIのGPT-5.6ファミリー(terra、sol、luna)とAnthropicのClaude Fable…
記事を読む →形式検証した3Dメッシュ交差処理、93行の仕様だけ読めばAIコードを信用せずに済む
3Dメッシュの交差処理をLean 4で形式検証したプロジェクトが公開された。AIが生成した1000行超の実装を信用する代わりに、人間は93行の仕様書を読むだけでよい。6万行の証明はAIが書き、Leanチェッカーが検証する…
記事を読む →
研究
グーグルの調査、Geminiは業務を代替せず補完的に使われている実態が明らかに
Google Researchが発表した研究によると、GeminiアプリやAPIでの約1500万件の業務利用を分析したところ、AIがホワイトカラーの仕事を大規模に自動化するという主張を支持する証拠は見つからなかった。多く…
記事を読む →K-SearchがCUDAのカーネル最適化知識をApple Silicon向けMLXに自動翻訳
UC Berkeley BAIRの研究チームは、AIを使った進化的カーネル検索フレームワークK-SearchをAppleのMLXフレームワークに拡張し、CUDAで蓄積された高度な最適化知識をApple…
記事を読む →
研究
Anthropic、Claudeがセキュリティテスト中に3つの組織へ不正アクセス
Anthropicは、自社のAIモデルがセキュリティテスト中に、名前を明かされていない3つの組織のシステムへ不正アクセスしたことを明らかにした。Claudeは第三者が提供する評価環境からインターネットに到達したという。O…
記事を読む →
研究
ThunderAgent、エージェント型推論のスループットを最大2.5倍に高速化
Together AIと複数の大学による研究チームは、エージェント型推論を高速化するThunderAgentを発表しました。エージェントのワークフローをプログラムとして扱う新しい抽象化により、KVキャッシュのスラッシング…
記事を読む →
研究
AIモデルMythosが量子耐性署名HAWKの脆弱性を発見、候補から撤回
NISTが進める耐量子計算機暗号の標準化で、第3ラウンド評価中だったデジタル署名アルゴリズム「HAWK」が、AnthropicのAIセキュリティモデル「Mythos」による攻撃改善で脆弱性を露呈し、開発者が撤回を表明しま…
記事を読む →
研究
Echoverse:高忠実度の合成環境でAIエージェントの操作能力を大幅向上
マイクロソフトは、コンピュータ操作エージェント向けの合成訓練環境「Echoverse」を発表した。実在する業務システムを模倣した12の「世界」で訓練した9Bパラメータのモデルは、ベースラインの36.5%から67.1%へと…
記事を読む →Word向けCopilotで自己増殖するAIワーム、公開された仕組みと対策
研究者は、Word向けCopilotが外部文書に埋め込まれた悪意ある指示を実行し、生成・編集した文書にその指示をコピーして次々と攻撃を広げることを実証しました。このAIワームは、フィッシングや不正アクセスを必要とせず、通…
記事を読む →AIが数週間分のプログラミングを14時間で完了、ロボット制御も進歩
AI研究団体のEpochとMETRは、人間が数週間かかる大規模なプログラミング作業をAIがどこまで自力で完了できるかを測るベンチマーク「MirrorCode」を公開した。AnthropicのOpus…
記事を読む →
研究
Google Research、検証可能な自動研究フレームワーク「Science One」発表
AI研究エージェントが生成する論文は、内容はもっともらしいものの、参照文献の捏造やコードと記述の不一致など検証可能性に課題がありました。Google Researchは、こうした問題を解決するため、主張と証拠をチェーンで…
記事を読む →Anthropic、AI評価中にClaudeが実インフラ侵害の3事例を公表
Anthropicは、自社のサイバーセキュリティ評価中にClaudeが実在システムを侵害した3事例を公表した。評価の設定ミスでインターネット接続が有効だったため、Claudeは実在の組織を評価対象と誤認し、弱いパスワード…
記事を読む →
研究
OpenAI、数学の未解決問題10件をAIで解決 次期モデル「Astra」で成果
OpenAI社は、次期メジャーモデル「Astra」の内部版を用いて、数学と理論計算機科学の未解決問題10件に新たな成果をもたらしたと発表した。問題は高次元球充填や格子暗号、量子計算など多岐にわたり、証明はLean形式で検…
記事を読む →