研究・論文

AI

arXiv論文:LLM審査AIの判定層をモデル内部から特定

米研究者が、要約評価に使われるLLM審査モデルThemisとPrometheusの内部を分析しました。層15を境に誤り検出と採点統合が分かれ、最終判定は26層目前後で固まると判明しました。評価パイプラインの信頼性を考える手がかりになります。
AI

Google医療AI「AMIE」、リアルタイムビデオ問診に対応

Google ResearchとGoogle DeepMindは医療AI「AMIE」をリアルタイムのビデオ診療に対応させたと発表しました。模擬患者はテキストよりビデオでの問診を好み、対話型AI診療の実用化に向けた研究が前進しています。
AI

DeepMind、AI評価を二重盲検化 ベンチマーク不正防止

Google DeepMindが、非公開モデルの評価を第三者に委ねる二重盲検方式を試験導入しました。試験問題とモデルの重みを互いに見せないまま採点でき、ベンチマーク汚染対策の切り札として期待されています。
AI

arXiv新研究、ツール応答の“命令化”攻撃をSARAで防ぐ

研究チームがAIエージェントの外部ツール応答を命令と誤認する脆弱性を実証し、行動誘発の判定と実行認可を分離する防御フレームワークSARAを提案しました。ベンチマークで攻撃成功率を1%未満に抑えています。
AI

Anthropic、自己改善AI手法「AAR」で全10項目改善

Anthropicの研究者チームが、AIに自らのアライメントを改善させる自動化手法「AAR」を発表しました。10種のベンチマーク全てで性能を落とさず改善し、平均6時間で人間の専門家の提案を上回りました。
AI

Puro-2B、RTX 5090で約5000ドルのLLM事前学習

研究チームがゲーミング向けGPUのRTX 5090だけでLLMをゼロから事前学習し、計算コストを6,900ドル未満に抑えました。Llama-3.2-3Bの再現に必要な150万ドルと比べ、桁が2つ下がります。
AI

MoE型LLMに新攻撃、ビット反転で出力が平均60倍に

研究チームは、MoE型LLMのルーティング層をビット反転で操作し、出力トークン数を平均5,912%増加させるDoS攻撃を実証しました。会話・推論・エージェントの全モードで再現し、防御策は今後の課題です。
AI

ローカル動作AIのコード生成、偽パッケージ名が攻撃で73%出現

研究チームは、ローカルで動くコード生成AIが実在しないパッケージ名を作り出す危険性を検証しました。攻撃を受けると発生率が最大73%に達する一方、二段階の検知システムなら76%を防げると報告しています。
AI

SWE Refactor Bench、AIの合格率は5.4%のみ

新ベンチマークSWE Refactor Benchは、コーディングAIのリポジトリ全体改修を検証しました。520回の試行中、全検証通過はわずか28回で、最高性能のClaude Opus 5でも47点にとどまっています。
AI

AgenticRAG-FP、多段階RAGの障害特定で精度ゼロに

新ベンチマークAgenticRAG-FPは、多段階検索の誤り特定精度が後段になるほど低下すると実証しました。Claude Haiku 4.5を使った検証では1段階目は91%、2段階目以降は0%まで落ち込んでいます。