研究・論文

AI

OpenAIが80年未解決のエルデシュ予想を反証 — 数学者3名が検証

OpenAIの汎用推論AIが、1946年にポール・エルデシュが提起した離散幾何学の未解決予想を反証しました。著名数学者3名が事前に検証し、AIが独立して著名な未解決問題を解いたと認定した初の事例と位置づけられています。
AI

Toto 2.0公開 — 時系列予測がスケーリング時代へ、5モデルをOSS公開

arXiv論文Toto 2.0が、時系列予測においてもモデルサイズに比例して精度が向上するスケーリング則の成立を実証しました。4Mから25億パラメータの5モデルをApache 2.0でOSS公開しており、BOOM・GIFT-Eval・TIMEの3ベンチマーク全てで最高スコアを達成しています。
AI

LLMの幻覚は予測可能 — モデルサイズとデータ頻度で決まる

LLMが誤った情報を生成する「幻覚」がランダム現象ではなく、モデルのパラメータ数と学習データ内のトピック出現頻度の組み合わせで分散の60〜94%を説明できるとするarXiv論文が公開されました。幻覚の発生パターンが予測可能になれば、RAG設計やモデル選定の根拠がより明確になります。
AI

マルチエージェントAI、人間チームを創造性で上回る — arXiv研究

複数のLLMエージェントが協調する「マルチエージェントAIシステム」が、6つの創造的タスクで人間チームをCohen's d=1.50で上回ったとするarXiv論文が公開されました。アイデアの新規性が主な要因で、議論の構造設計がAIの創造性を26.8%説明することも示されています。
AI

Meditron FO: 監査可能な臨床LLMで最高性能を達成

arXiv論文Fully Open Meditronは、学習データ・手順・評価をすべて公開した初の臨床LLMパイプラインです。47,000件の診療ガイドラインを含む医療QAで学習し、ベースモデル比6.6ポイント向上・MedGemma超えを達成し、完全公開でも最高水準の性能を出せることを示しました。
AI

FORGE: 重みの更新なしでLLMエージェントが自己進化する新手法

arXiv論文FORGEは、LLMエージェントがモデルの重みを更新せずに自己改善する集団型プロトコルを提案しています。複数エージェントが並列で失敗を学び合う「集団ブロードキャスト」により、Reflexion比で最大72%の性能改善を達成しました。
AI

grep検索がベクトル検索を上回る — arXiv論文で検証

arXiv論文「Is Grep All You Need?」(2605.15184)が、LLMエージェントのコードベース検索でgrep検索がベクトル検索を一般に上回ることを116問のベンチマークで実証しました。検索手法よりもエージェントハーネス(ツール呼び出し設計)の違いがスコアを大きく左右することも判明しています。
AI

OpenDeepThink: 並列推論でコーディングEloが+405 — arXiv新手法

arXivに公開されたOpenDeepThinkは、複数の回答候補を並列生成しBradley-Terry集約で最良を選ぶ進化的推論手法です。Gemini 3.1 ProでCodeforces Eloが+405向上し、追加学習なしにテスト時の性能を大幅改善できることを示しました。
AI

TFGN、LLM規模の継続学習でリプレイ不要のアーキテクチャを実現

arXivに投稿されたTFGNは、タスクラベルもリプレイバッファも使わずにLLM規模の継続学習を実現するアーキテクチャです。LLaMA 3.1 8Bで後方転移-0.007・勾配分離99.59%以上を達成し、既存知識を保ちながら新ドメインの習得が可能です。
AI

DeepMind AlphaEvolve、複数分野で実績公開 — 電力網・量子・物流を自動最適化

Google DeepMindがAlphaEvolveの成果を公開しました。電力網の最適化問題の解決可能率が14%から88%へ改善し、キャッシュ置換アルゴリズムを2日で発見するなど、科学・工学・ビジネスの複数分野で具体的な成果が出ています。