AI LLM自己改善、論文『Phantom Gains』が測定誤差指摘
Cheng Xu氏らの研究チームが、LLMエージェントの自己改善報告の多くを測定方法の欠陥による見かけの改善だと実証しました。未訓練モデルにも0.280の改善率が出る指標もあり、有効性が確認されたのは外部蒸留のみでした。
AI
AI
AI
AI
AI
AI
AI
AI
AI
AI