FT調査:主要AIチャットボット18種、金融相談57%誤答

データネットワークのイメージ AI

英フィナンシャル・タイムズ(FT)が報じた調査により、ChatGPT・Claude・Copilot・Gemini・Grokなど18種類のAIチャットボットが、借金や住宅ローン、年金、税金に関する金融相談の57%で誤った回答をしていることが分かりました。調査会社Saturnが121問を用意して実施したもので、質問が複雑になるほど誤答率は88%まで跳ね上がったとされます。日常的に家計や資産の相談にAIを使う人が増えるなか、その信頼性に疑問符が付く結果です。

背景と文脈

専門家に相談すれば費用も時間もかかる家計や資産の相談を、無料または低コストで使えるAIチャットボットに任せる人が増えています。深夜でもすぐに答えが返ってくる手軽さは、忙しい人ほど魅力的に映ります。並行して行われたPensionBeeの調査では、米国でチャットボットを使う成人の57%が、専門家による裏付けを取らずにAIの助言どおりに行動すると回答しており、誤情報がそのまま生活設計に影響しかねない状況がうかがえます。

AIチャットボットは自然な文章で自信たっぷりに回答するため、内容が正しいかどうかに関わらず説得力を感じやすいという性質があります。この「もっともらしさ」と「正確さ」のギャップこそが、今回の調査が浮き彫りにした問題の核心です。コーディング支援や文章作成であれば誤りに気づいて修正すればよいだけですが、金融相談は一度誤った判断をすると取り返しがつきにくい領域だという点も、今回の結果を重く受け止めるべき理由です。

技術/ビジネス面

スマートフォンでチャットアプリを操作するイメージ
Photo by Solen Feyissa on Unsplash

調査では平均正答率が43%にとどまり、モデルごとの差も大きく出ました。最も誤答が多かったのはClaude Haiku 4.5で82%、次いでGoogleのGemini 3.1 Proが73%でした。質問は借金・住宅ローン・年金・税金という4分野121問で構成されており、実生活で誰もがぶつかりうるテーマばかりです。さらに無料版と有料版を比べると、無料モデルの誤答率が63%だったのに対し、有料モデルでも49%の誤答率が残っており、料金を払えば安心とは言い切れない結果です。

指摘された問題は、計算ミス、重要なリスク警告の欠落、今後予定されている税制変更の考慮漏れ、さらには存在しない金融制度をもっともらしく作り出すハルシネーション(Hallucination:AIが事実に基づかない情報をあたかも真実であるかのように生成してしまう現象)まで多岐にわたります。特に税制やローン条件のような「その場では検証しにくいが、間違えると実害が大きい」領域で誤りが目立った点は見過ごせません。モデルの世代が新しくなれば自動的に改善するとは限らず、金融という専門領域特有の落とし穴があることを示す結果と言えるでしょう。

これからどうなるか

金融関連のチャット機能を自社サービスに組み込もうとしている開発者にとって、この結果は設計を見直すきっかけになります。汎用モデルにそのまま金融相談をさせるのではなく、RAG(Retrieval-Augmented Generation:外部の信頼できる情報源を検索して回答に反映させる仕組み)で最新の税制・金利データを都度参照させたり、回答に出典を明示させたりする実装が、事故を防ぐうえで欠かせなくなりそうです。モデルの知識が古い時点で止まっている以上、税制のように毎年変わる情報を外部ソースなしに答えさせること自体が、そもそもリスクの高い設計だと言えます。

ユーザー側の意識づけも課題です。PensionBeeの調査が示すように、多くの人はAIの回答を鵜呑みにしがちです。金融関連のプロダクトを作る開発者には、「参考情報であり専門家への確認を推奨する」といった注意書きを画面設計に組み込むなど、誤答が実害につながらない工夫が今まで以上に求められます。各国の金融当局や消費者保護団体といった第三者機関が、こうしたAIサービスの精度を継続的に検証する仕組みづくりも、今後の議論の対象になりそうです。

まとめ

主要AIチャットボット18種類を対象にした調査で、金融相談の誤答率が平均57%、複雑な質問では88%に達することが分かりました。有料モデルでも誤りは半数近く残っており、金融分野でAIを活用する際は出典の明示や専門家への確認を前提にした設計が欠かせません。

参考リンク

アイキャッチ画像: Photo by Google DeepMind on Unsplash

タイトルとURLをコピーしました