AI LLM審査員の信頼性を実測、モデル刷新でも精度不安定
AIに評価させるLLM-as-Judge手法で、審査役モデルを新版に替えても評価精度が一様に向上しないと論文が実証しました。バイアス検証と監査記録の必要性を指摘しています。
AI
AI
AI
AI
AI
AI
AI
AI
AI
AI