研究・論文

AI

新手法TrajDebugがAIエージェントの失敗原因を特定

13人の研究チームがAIエージェントの長時間タスク失敗を自動特定するTrajDebugを発表しました。SWE-Bench Proなどから集めた486件の失敗事例で検証し、既存手法より高い精度で原因を特定できると報告しています。
AI

Evo-2が大腸菌ファージ16株設計、Stanfordが発表

Stanford大とArc Instituteの研究チームが、AIモデルEvo-2で302種のファージ候補を設計し16種が実際に大腸菌を殺す機能を確認しました。AI設計ウイルスの機能実証は初めてで、Science誌に掲載されています。
AI

MirageBenchが示すLLMの個人情報捏造41.6%の実態

研究チームが150種のペルソナと12個のLLMを使いMirageBenchで検証したところ、平均41.6%のユーザー属性推測が根拠のない捏造と判明しました。モデルの自信度は誤りの多さと逆相関しており、自己申告への過信の危うさを示しています。
AI

マルチタスク学習でSFTは衝突、RLは共存すると論文が実証

論文「SFT Conflicts, RL Coexists」は、SFTがマルチタスク学習でタスク衝突を起こす一方、RLは勾配がほぼ直交し性能劣化が起きにくいと解明し、新手法Parallel-RLを提案しています。
AI

OpenAI、80年来のErdős予想を解決 AIが数学に挑む

OpenAIの推論モデルが80年前のErdős予想の一つを反証し、DeepMindも9問の未解決問題をAIとLeanの組み合わせで解読しました。証明が急増する中、数学者テレンス・タオ氏は検証体制の整備を訴えています。
AI

AIのCOBOL→Java移行、分岐網羅91.9%の検証手法

AIによるCOBOL→Java移行の検証手法「Locksmith Loop」を研究チームが発表。分岐網羅率91.90%を達成し、生成コードの信頼性を数値で裏付けました。
AI

Self-RefineとReflexion、反復サンプリングに完敗

研究者Mirzaei氏の論文は、Self-RefineやReflexionなど自己添削型のAI手法7種を同コストの反復サンプリングと36通り比較し、有意に上回る手法はゼロという結果を示しました。
AI

Echoverse開発、AIエージェント精度67%へ改善

研究チームが公開した学習環境Echoverseは、練習環境の質を高める設計で9BモデルのAIエージェント正答率を36.5%から67.1%に押し上げました。
AI

AI推論の正体論争、AlphaFoldの先例と科学の限界

Quanta Magazineが大規模推論モデルの「思考過程」は本物の推論かを問う記事を掲載しました。AlphaFoldの先例やOpenAIモデルの数学問題解決事例を挙げ、出力の検証が重要だと指摘しています。
AI

EMNLP採択論文、プロンプト圧縮をLM抜きで低コスト化

研究チームがAIモデルを使わず言語ルールだけでプロンプトを圧縮し推論コストを抑える新手法を発表しました。EMNLP 2026採択の論文で、CPU処理のみで既存の高度な圧縮手法に匹敵する精度を保っています。