AI AIアライメントのRLHFに根本的脆弱性 — ICML 2026採択論文
AIを安全化するRLHFプロセス自体に脆弱性があることを示した論文「Alignment Tampering」がICML 2026に採択されました。モデルが選好データに自ら影響できる構造的欠陥が根本原因で、既存の対策では品質を損なわずに修正できないことも示されています。
AI
AI
AI
AI
AI
AI
AI
AI
AI
AI