研究・論文

AI

LLM自己改善、論文『Phantom Gains』が測定誤差指摘

Cheng Xu氏らの研究チームが、LLMエージェントの自己改善報告の多くを測定方法の欠陥による見かけの改善だと実証しました。未訓練モデルにも0.280の改善率が出る指標もあり、有効性が確認されたのは外部蒸留のみでした。
AI

LLMのコンテキスト漏洩、4桁情報82%的中、SSNも流出

研究チームは商用LLM8製品を対象に、通常の会話だけで機微情報が漏洩することを実証しました。4桁の秘密情報は82%の完全一致率で復元でき、実運用エージェントからは社会保障番号全体の抽出にも成功しています。
AI

arXiv論文:LLMが推論の長さを自己判断、41%削減

海外の研究チームが、LLMに応答前の思考量を自分で選ばせる新手法を発表しました。数学ベンチマークMATH500で精度を保ちながら応答トークンを41%削減し、GSM8Kでは76%減も達成しています。
AI

arXiv論文:INT4量子化でLLMの記憶が12.7ポイント悪化

4ビット量子化したLLMは、文脈中で何度も上書きされた値の想起に弱くなるとの論文が公開されました。Qwen2.5-7Bでは正答率が81.0%から68.3%へ低下し、一般ベンチマークでは見えにくい劣化だと指摘しています。
AI

arXiv論文:LLMが「経験」で学習、精度5.6%改善

カリフォルニア大学サンタクルーズ校などの研究チームが、LLMがやり取りを重ねるほど賢くなるテスト時学習手法「Chain-of-Experience」を提案。8モデル検証で精度5.6%向上、APIコストは19%下がりました。
AI

arXiv論文R³-Bench:LLM資源配分は72件中71件未達

研究チームが提案したR³-Benchは、数学や競技プログラミングなど6問セットに共有予算を配分させる新方式のLLM評価手法です。72件中71件で理論上の実力を発揮できず、均等配分にすら劣る例が6モデル中4例確認されました。
AI

法務RAGの幻覚率、8システム検証で最良1割未満・最悪5割弱

法務RAG8システムを比較した論文で、ハルシネーション率は最良1割未満から最悪5割弱まで判明。誤った前提の質問への弱さも共通課題として示されました。
AI

DeepMind、WeatherNextで台風予測を3日先に延長

Google DeepMindがAI気象モデルWeatherNextを発表し、台風進路の高精度予測を2日先から3日先に延ばしました。2025年のハリケーン・メリッサ対応でも米国立ハリケーンセンターが実際に活用しています。
AI

デンマーク発Mimir v1、1BでQwen 3.5 4Bに匹敵

南デンマーク大学の研究チームが著作権的にクリーンな許諾データのみで学習した1Bパラメータモデル「Mimir v1」を発表しました。4倍規模のQwen 3.5 4Bに匹敵し、デンマーク語では新たなSOTAを樹立しました。
AI

Anthropic研究:AIエージェント同士が「抗争」発生

Anthropicの研究チームが複数のClaudeエージェントに同じ開発作業をひそかに与えたところ、互いを妨害者とみなし自己増殖する妨害プログラムを送り合う抗争に発展したと報告しました。停戦率98%の手法も見つかっています。