AI STATEWITNESS論文:LLM欺瞞をAUROC 0.916で検出
LLMが欺瞞的な応答を生成するリスクを活性化ベクトルから説明付きで検出するSTATEWITNESSが公開されました。既存最良手法と比べてAUROC 11.6%向上し、トークンレベルの根拠トレースで監査コスト削減にも貢献します。
AI
AI
AI
AI
AI
AI
AI
AI
AI
AI