研究・論文

AI

Claude、リーマン予想の証明済み零点67.2%に前進

Anthropicは未公開の研究用Claudeが、150年以上未解決のリーマン予想で証明済み零点の割合を41.6%から67.2%へ引き上げたと発表しました。証明そのものではありませんが、数学研究でのAI活用の広がりを示す事例です。
AI

CLAUDE.md肥大化率+226%、24万件分析で原因判明

AIコーディングツールの指示ファイルCLAUDE.mdは、書き足すだけで削除が進まず肥大化し続けます。論文が1867リポジトリ・24万件超の指示履歴を分析し、削除されない理由と有効な改善策を実証データで示しました。
AI

arXiv論文ElasticBack、AIスキルに条件付きバックドア

研究チームがAIエージェントの「スキル」を狙う条件付きバックドア手法ElasticBackを発表しました。150個のスキルと4つのLLMで検証し、攻撃成功率89%を誤検知率6%に抑えて達成、既存の防御手法もすり抜けています。
AI

VLMで時系列データを画像化、AI推論の電力を最大2.5倍削減

研究チームがAI推論の消費電力を最大2.5倍削減する新手法を発表しました。時系列データをグラフ画像化してVLMに入力する方式で、入力トークン数を最大10倍以上削減しつつ、異常検知の精度もあわせて高めています。
AI

論文EnvACE、「世界リハーサル」でAIエージェント訓練

研究チームがAIエージェントの新訓練手法EnvACEを発表しました。エージェントが行動役と環境役を自ら演じる「世界リハーサル」により、外部環境構築コストを抑えつつ4種のベンチマークで既存手法を上回りました。
AI

新手法TrajDebugがAIエージェントの失敗原因を特定

13人の研究チームがAIエージェントの長時間タスク失敗を自動特定するTrajDebugを発表しました。SWE-Bench Proなどから集めた486件の失敗事例で検証し、既存手法より高い精度で原因を特定できると報告しています。
AI

Evo-2が大腸菌ファージ16株設計、Stanfordが発表

Stanford大とArc Instituteの研究チームが、AIモデルEvo-2で302種のファージ候補を設計し16種が実際に大腸菌を殺す機能を確認しました。AI設計ウイルスの機能実証は初めてで、Science誌に掲載されています。
AI

MirageBenchが示すLLMの個人情報捏造41.6%の実態

研究チームが150種のペルソナと12個のLLMを使いMirageBenchで検証したところ、平均41.6%のユーザー属性推測が根拠のない捏造と判明しました。モデルの自信度は誤りの多さと逆相関しており、自己申告への過信の危うさを示しています。
AI

マルチタスク学習でSFTは衝突、RLは共存すると論文が実証

論文「SFT Conflicts, RL Coexists」は、SFTがマルチタスク学習でタスク衝突を起こす一方、RLは勾配がほぼ直交し性能劣化が起きにくいと解明し、新手法Parallel-RLを提案しています。
AI

OpenAI、80年来のErdős予想を解決 AIが数学に挑む

OpenAIの推論モデルが80年前のErdős予想の一つを反証し、DeepMindも9問の未解決問題をAIとLeanの組み合わせで解読しました。証明が急増する中、数学者テレンス・タオ氏は検証体制の整備を訴えています。