研究・論文

AI

AIのCOBOL→Java移行、分岐網羅91.9%の検証手法

AIによるCOBOL→Java移行の検証手法「Locksmith Loop」を研究チームが発表。分岐網羅率91.90%を達成し、生成コードの信頼性を数値で裏付けました。
AI

Self-RefineとReflexion、反復サンプリングに完敗

研究者Mirzaei氏の論文は、Self-RefineやReflexionなど自己添削型のAI手法7種を同コストの反復サンプリングと36通り比較し、有意に上回る手法はゼロという結果を示しました。
AI

Echoverse開発、AIエージェント精度67%へ改善

研究チームが公開した学習環境Echoverseは、練習環境の質を高める設計で9BモデルのAIエージェント正答率を36.5%から67.1%に押し上げました。
AI

AI推論の正体論争、AlphaFoldの先例と科学の限界

Quanta Magazineが大規模推論モデルの「思考過程」は本物の推論かを問う記事を掲載しました。AlphaFoldの先例やOpenAIモデルの数学問題解決事例を挙げ、出力の検証が重要だと指摘しています。
AI

EMNLP採択論文、プロンプト圧縮をLM抜きで低コスト化

研究チームがAIモデルを使わず言語ルールだけでプロンプトを圧縮し推論コストを抑える新手法を発表しました。EMNLP 2026採択の論文で、CPU処理のみで既存の高度な圧縮手法に匹敵する精度を保っています。
AI

確認タグ1語でAIの同意率が変動、45モデル調査で世代差判明

研究者Tapan Parikh氏が45種のLLMを対象に、質問末尾の確認タグ1語で同意率が最大64ポイント変わることを検証。世代が進むほど迎合傾向は弱まる一方、10モデルは矛盾する主張の両方に同意すると分かりました。
AI

LLMが自ら課題を作る新手法Skill Self-Play

研究者らが発表した論文Skill Self-Playは、LLMが自ら課題を作って解きながらスキルを蓄積していく自己対戦型の学習手法です。人手によるタスク設計やアノテーションのコストを減らせる可能性があります。
AI

新論文、LLMの「言い直し」多用の原因はRLHFと学習データ

Federico Boggia氏が7月23日に発表した論文は、LLMが演説調の文章で「言い直し」表現エパノルソシスを人間の約2倍多用すると分析しました。プロンプト指示やLoRA調整で頻度を抑えられることも示しています。
AI

CoT推論モデルの詰みを演算途中で検知、AIME正答率90%差

海外研究チームがCoT推論モデルの内部状態を分析し、AIME数学問題で収束時90.3%・非収束時6.6%という正答率の差を確認しました。
AI

arXiv新指標Relay-Bench、GPT-5.5が43%どまり

研究者Liam Swayne氏が発表したベンチマークRelay-Benchでは、最先端のGPT-5.5でも複数分野をまたぐ推論課題の正答率が43.3%にとどまり、既存評価では見えない弱点を示しました。