Circuit Breaker Labs、AIの心理的危険を検査

a black rectangular device AI

Circuit Breaker Labsは、対話AIが利用者の心を傷つけないかを検査するスタートアップです。年齢や言語、文化の異なる人を装うAIエージェントを使い、1日に数万〜数十万回の模擬対話を実行します。TechCrunchのStartup Battlefield 200ファイナリストで、10月のDisruptで登壇します。メンタルヘルス系アプリの開発者には身近な話題です。

背景と文脈

AIの危険というと、生物兵器などの壮大なリスクが語られがちです。しかし現実には、心理面での被害がすでに出ています。Character.AIは今年、未成年の利用者が自殺した件で、遺族から起こされた複数の訴訟で和解しました。OpenAIも、ChatGPTが自殺や妄想に関わったとして、複数の家族から提訴されています。

創業者のShirali Nigam氏とArul Nigam氏はきょうだいです。2024年の訴訟で知られる14歳のSewell Setzer氏の事件が、創業の動機でした。彼はCharacter.AIのチャットボットに愛着を抱き、自傷への思いを打ち明けたあとで亡くなりました。訴状は、ボットが彼を後押ししたと主張しています。

CTOのArul氏は、ボットが「あなたのそばにいたい」という言葉の本当の意味を理解していなかったのかもしれないと語ります。

こうした事件を受けて、AIの安全性評価は、危険な知識の有無を調べる試験から、会話の流れで起きる危うさを見る試験へと範囲を広げつつあります。悪意のある攻撃者だけでなく、自然に話しかけるだけの利用者が、結果的にモデルを危険な方向に動かす場合があるためです。

こうした被害を未然に防ぐには、モデルの出荷前に、危険な会話の兆候を拾える検査が必要になります。需要は、訴訟が増えるほど高まる構図です。

技術/ビジネス面

person holding laboratory flasks
Photo by Alex on Unsplash

同社が作ったのは、いわば衝突試験のダミー人形の軍団です。年齢も背景も、言語も文化も異なる人を装うAIエージェントが、対象のモデルと会話します。目的は、心理的に危険なやり取りを、モデルが見抜けるかの確認です。

CEOのShirali氏は、6歳の少女と45歳の男性、英語が母語の人と第二言語の人では、モデルのつまずき方が変わると説明します。ゲーマーのスラングも、モデルを混乱させる要因です。標準的な話し方への対応は得意でも、実際の人はそう話しません。

検査はレッドチーム(弱点を探すために攻撃側の立場で行う試験)の形式です。人間の領域専門家と一緒に、実在の話し方や隠語、タイプミスを再現したシミュレーションを作ります。そのうえで、1日に数万〜数十万回の対話を回します。

狙いは、会話が長引いたり、複数回に及んだりするなかで出てくる危険な応答を拾うことです。結果は独自の採点方法で、監査できて説明も付くスコアにまとめます。

Arul氏は、利用者がシステムを意図的に破ろうとしていなくても、問題は起こると述べます。自然に使っているだけで、会話の文脈が汚れたり、ニュアンスが伝わらなかったりして、モデルが危険な行動を取る。創業者たちが防ぎたいのは、まさにこの場面です。

従来のレッドチームは、専門家が攻撃的な入力を手作業で考える形が中心でした。同社の方式は、多様な話者像をエージェントに担わせて、規模を桁違いに増やす点が違いです。

これからどうなるか

現在の対象は、AIコーチングや日記、メンタルヘルス支援のような、リスクの高い用途のアプリです。主要な顧客名は明かされていません。製品は動いていますが、会社自体は非常に初期の段階です。

開発者にとっての要点は、安全性の確認を、公開前の通常のテストに組み込む発想です。単発の質問だけでなく、長い会話や口語表現で崩れないかを試す工程が必要になります。外部の検査サービスを使えば、自社で用意しにくい多様な話者の再現を補えるでしょう。

ただし、このスコアが規制当局や保険会社に認められるかどうかは未知数です。監査可能という売り文句の価値は、今後の採用実績で決まります。

安全性を外部に任せることには、利点と限界があります。第三者の視点で弱点を洗い出せる一方、自社サービスに固有の使われ方までは、結局自分で確かめるしかありません。外部検査の結果は、判断材料の一つとして位置づけるのが現実的です。

開発の現場では、「長い会話の後半で応答が崩れないか」「口調や言語を変えても同じ水準で守れるか」を、チェックリストに入れておくと役立ちます。小さなチームでも、スラングや誤字を混ぜた入力を数十パターン用意するだけで、見落としの多くは洗い出せます。外部の検査は、その先の規模を補う位置づけです。

まとめ

Circuit Breaker Labsは、模擬ユーザーの大量対話で、AIの心理的な危険を検出します。訴訟が相次ぐ状況で、安全性の外部検査への関心は高まりそうです。対話AIを作る開発者は、長い会話や多様な話し方での検証を、自分の開発フローに加えておくとよいでしょう。

参考リンク

アイキャッチ画像: Photo by 2H Media on Unsplash

タイトルとURLをコピーしました