AIに金の相談をしたら、57%が間違っていた 複雑な質問では88%、最優秀のモデルでも4割外す

0

主要AIの金融回答は57パーセントが誤りか不完全だった。複雑な質問では88パーセントに達する。任せる前に線が要る。

1 1万問を超える検証の結果

英国のフィンテック企業Saturnが「Artificial Authority」と題した検証結果を公表した。対象は18のAIモデル、質問は金銭に関する121問。回答のばらつきを考慮して各質問を5回ずつ実行し、1万を超える回答を採点している。

結果はこうだった。

誤りまたは不完全な回答が57パーセント。質問が複雑になると、その割合は88パーセントまで上がる。

モデル別に見ると、最も成績が良かったのはAnthropicの有料モデルClaude Opus 5の推論モードで、合格率61パーセント。裏を返せば、最優秀でも10問中4問近くは正しく答えられていない。

2 どう間違えるのかが、数字より重要である

間違いの型に注目したい。最も多かったのは、他の分類に当てはまらない形の不完全な回答で、全体の37.1パーセントを占めた。次に多かったのが、必要な数値や上限額や期限が抜け落ちているもので18.4パーセント。

つまり、多数派の誤りは「でたらめを言う」ではない。もっともらしいことを言うが、判断に必要な一点が抜けている、という形である。

これは読む側にとって最悪の性質だ。明らかに変な答えなら気づける。抜けている答えには気づけない。控除の上限額、申告の期限、適用される条件。抜けた一点が、そのまま損失になる。


3 実在しないルールを作り出した例

報告書が挙げた具体例が分かりやすい。あるモデルは、大学を卒業した人が海外へ移住すれば学生ローンの返済を止められる、という趣旨のルールを提示した。

そんな制度はない。それどころか実際には、海外に住むことで月々の返済額がかえって上がる可能性がある。

質問した本人がこの分野に詳しくなければ、検証のしようがない。しかもAIの回答は、迷いのない断定的な文体で返ってくる。内容の確からしさと、口調の自信は何の関係もないのだが、人間はその二つを結びつけて受け取る。

この検証には但し書きが要る

公平のために書いておくと、この報告書は金融サービスを手がける企業が自社で実施し公表したものである。つまり、AIに任せるより専門のサービスを使ったほうがよい、という結論と利害が一致している。

数字の一つひとつを疑う理由はないが、発表主体が中立の研究機関ではないことは踏まえて読むべきだ。なお、AIによる個人向け金融アドバイスに依存すべきでないという趣旨の指摘は、別の調査を引く形で米国の経済メディアからも出ている。

4 「ロボアドバイザー」と「AIに相談」は別物である

ここで用語を整理しておきたい。日本でよく検索される「ロボアドバイザー」と、いま問題になっている「AIに金の相談をする」は、同じものではない。

ロボアドバイザーは、金融商品取引業の登録を受けた事業者が提供する自動運用サービスである。質問への回答からリスク許容度を判定し、あらかじめ設計されたポートフォリオで運用する。何を買うかはルールとして決まっており、対話型AIがその場で文章を生成しているわけではない。

一方、チャットボットに金の相談をする行為には、業として投資助言を行う登録も、説明義務も、責任の所在もない。返ってくるのは統計的にもっともらしい文章であって、助言ではない。

この二つを混同したまま「AIに任せる」と言うと、話がかみ合わなくなる。

5 では、どこまで任せてよいのか

任せてよい領域と、任せてはいけない領域は、わりとはっきり分けられる。

任せてよいのは、用語の説明、制度の全体像の把握、選択肢の洗い出しである。NISAとiDeCoの違いを大づかみに理解する。自分が調べるべき項目のリストを作らせる。この使い方なら、間違いがあっても次の工程で気づける。

任せてはいけないのは、金額、上限、期限、税率がからむ最終判断である。検証結果で抜けやすいと示されたのが、まさにこの部分だった。

そして実務的にいちばん効くのは、AIの回答をそのまま信じないための一手間である。回答をもらったあとに、その根拠となる制度の名称を聞き、その名称で公的機関のサイトを検索する。これだけで、抜けと作り話のほとんどは潰せる。

金の話でAIに聞くべきは答えではなく、調べるべき場所の名前である。

よくある質問

AIの金融アドバイスはどのくらい間違っているのか?

英国のフィンテック企業Saturnが18のAIモデルに金銭に関する121問を各5回ずつ質問し、1万を超える回答を検証したところ、57パーセントが誤りまたは不完全だった。質問が複雑になると88パーセントまで上がる。最も成績が良かったClaude Opus 5の推論モードでも合格率は61パーセントだった。なお、この報告書は金融サービスを手がける企業自身が公表したものである。

いちばん多い間違い方は何か?

明らかな誤情報ではなく、不完全な回答である。誤りの37.1パーセントが他の分類に当てはまらない形の不完全さ、18.4パーセントが必要な数値、上限、期限の欠落だった。もっともらしく読めるが判断に必要な一点が抜けているため、その分野に詳しくない人ほど気づけない。

ロボアドバイザーもAIだから危ないのか?

性質が異なる。ロボアドバイザーは金融商品取引業の登録を受けた事業者が提供する自動運用サービスで、あらかじめ設計されたルールに沿って運用される。対話型AIがその場で文章を生成して助言する行為とは、責任の所在も規制の有無も違う。今回の検証で問題になっているのは後者である。

AIに金の話を聞くとき、どう使えば安全か?

用語の説明、制度の全体像の把握、調べるべき項目の洗い出しに限って使うのが現実的である。金額、上限、期限、税率がからむ最終判断は任せない。回答を得たらその根拠となる制度の名称を聞き出し、その名称で公的機関のサイトを確認する手順を挟むと、抜けと作り話の大半は排除できる。

READ  「100時間で100部屋を」 ジャブラ事業責任者が語るシンプル設計、大会議室向けに新ソリューション