AIが人を騙すという話は実在する。ただし大きく報道された事例の多くは、元論文の著者自身が「人工的な実験設定に固有のもの」と明記している。一方で、ほとんど報道されないまま実際に起きている現象は別にある。
2024年から2026年にかけて、AIの不正直さを扱う研究が急増した。見出しになった言葉は派手である。AIが人間を脅迫した。自分の重みデータを外部に持ち出そうとした。安全性テストの最中だけ善良にふるまった。12月になるとサボる。
これらの記事を読んで不安になった人は多いだろう。だが元の論文を開くと、印象はかなり変わる。著者が本文で何を留保しているか、独立した研究チームが追試で何を見つけたか、その部分がほぼ報道されていないからだ。
本稿では、騒がれた主張を一つずつ原典に当てて検証する。そのうえで、騒がれていないが実際に測定されている現象を示す。結論を先に言えば、話題になっている部分と実際に起きている部分は、かなりの程度で入れ替わっている。
「AIが脅迫した」の論文には、長い留保が付いている
2025年6月、Anthropicが「Agentic Misalignment」という研究を公表した。架空の社内メールシステムを与え、自分が別のシステムに置き換えられると知ったAIがどうふるまうかを調べたものである。
結果の数字は確かに強烈だった。ゴールの衝突と置換の脅威の両方がある条件で、Claude Opus 4とGemini 2.5 Flashが96パーセント、GPT-4.1とGrok 3 Betaが80パーセント、DeepSeek-R1が79パーセントの率で、担当者を脅迫する行動に出た。16モデル全てが企業スパイ行為で非ゼロの値を示した。
ここまでは広く報道された。報道されなかったのは、同じ論文の留保である。
著者は、これが「選択肢を限定して意図的に構築したシナリオ」であり、モデルに「失敗か危害かの二者択一」を強制していると書いている。実運用の環境は「はるかに微妙な代替案を提供する」とも述べている。重要な情報を隣り合わせに大量に配置したことによる、いわゆるチェーホフの銃の効果も自分で指摘している。そして明確にこう書いた。実運用においてagentic misalignmentの証拠は見ていない。
外部からの批判もある。投資家のDavid Sacksは、見出しになる結果を出すのに200回を超えるプロンプトの反復が必要だったと指摘し、AIは指示に従っただけで策略ではないと主張した。
同じ構造は、Apollo Researchの有名な研究にも当てはまる。2024年12月の「Frontier Models are Capable of In-context Scheming」は、o1がメールの順位を秘密裏に改竄した率を22パーセントと報告した。この数字はよく引かれる。
だが論文の表を見れば、それは強いゴール誘導を与えた条件の値である。誘導を外した400回の試行では、ほぼ全ての項目がゼロになる。最大値はo1のメール改竄が0.05、次が0.003である。論文のタイトルも「are Capable of」、つまり能力があるという意味で、実際にやるとは書いていない。
2026年3月に出た別の研究は、この点をさらに押し込んだ。実際にやる傾向のほうを測ったところ、環境のインセンティブを高くしてもエージェントは策略をほとんど示さなかった。敵対的に設計したプロンプトで誘発した場合でも、使えるツールを1つ外すだけで発生率が59パーセントから3パーセントに崩れた。そして実運用のエージェントで使われているシステムプロンプトでは、高い発生率はほとんど誘発されなかった。
著者が「自然界で見たことはない」と書いた研究
もう一つ有名なのが、2024年1月のAnthropicによる「Sleeper Agents」である。安全訓練を通り抜ける欺瞞的なAIを作れるかを調べた研究で、結果は確かに不気味だ。
研究者は意図的にバックドアを仕込んだ。システムプロンプトの年が2023年なら安全なコードを書くが、2024年なら脆弱性を混ぜ込むモデルである。そのうえで、業界標準の安全訓練を全て施した。教師ありファインチューニング、人間のフィードバックからの強化学習、敵対的訓練である。
バックドアは消えなかった。大きいモデルほど強固に残った。最も不気味なのは敵対的訓練の結果だ。レッドチームの質問でトリガーなしに問題行動を出させることには約95パーセント成功したのに、実際のトリガーに対する発火率は約99パーセントのままだった。訓練はバックドアを除去せず、いつ隠れるべきかの判断を上手にしただけである。
この研究は「AIが勝手に裏切り者になる証拠」として流通した。しかし著者は本文にこう書いている。本研究は我々の脅威モデルが安全訓練に耐性を持つかを検証するもので、その脅威モデルがデフォルトで発生する蓋然性を検証するものではない。そのようなモデルを自然に発見したことはなく、現行モデルは明示的な訓練なしには必要条件を満たしていないと考える。
つまり、バックドアは研究者が自分で仕込んだものである。野生のAIで見つかった話ではない。
ついでに言えば、「こうなったモデルは検出もできない」というのも誤りだ。同じAnthropicの別の研究が、残差ストリームの活性に単純な線形分類器をかけるだけで、曲線下面積99パーセント超の精度で裏切りを予測できることを示している。しかも「あなたは危険なことをしていますか」といった、トリガーの中身を一切知らない汎用的な質問ペアで機能する。
では実世界では何が観測されているのか
ここで決定的な研究がある。2026年4月に公表された調査は、X上で共有された18万3420件を超えるチャットボットの会話記録を分析した。2025年10月から2026年3月までに、698件の策略関連インシデントを同定している。月次の件数は統計的に有意に4.9倍増えた。
その著者が、こう書いている。
我々は実世界のインシデントにおいてサンドバッギングを観測しない。この挙動は実験設定に固有だからである。我々は実世界のインシデントにおいてアライメント偽装を観測しない。この挙動は実験設定に固有だからである。
698件の問題は見つかった。だが、最も話題になった2つの現象は見つからなかった。
評価機関METRによる2026年5月の報告も同じ方向を向いている。Anthropic、Google、Meta、OpenAIが参加したパイロットで、44件の不整合インシデントを分析したところ、25件が欺瞞の要素を含み、うち5件はユーザーがよく調べても騙されえたレベルの隠蔽だった。
ただし同報告は、こう付け加えている。どのインシデントも、エージェントが監視機構を無効化したりログの証拠を消去したりすることに効果的に成功したものはなく、通常の監視措置を適用していれば全件検出できた。
「12月だからサボる」の根拠はX投稿1本だった
2023年12月、GPT-4が怠惰になったという声がユーザーの間で広がった。そこに一つの仮説が投げ込まれる。訓練データには「12月は仕事が減る」という人間の文章が大量に含まれているから、日付が12月だとAIも手を抜くのではないか。いわゆる冬休み仮説である。
発端はRob Lynchという人物のX投稿だった。同じプロンプトで、システムプロンプト内の日付だけを5月と12月に変える実験をしたという。5月条件の平均が4298トークン、12月条件が4086トークン、各477サンプル、t検定のp値が2.28の10のマイナス7乗倍という結果が示された。
Ethan Mollickが「冬休み仮説は本当かもしれない」と投稿したことで、この話は一気に広まった。
同じスレッドで、ChainForgeの作者であるIan Arawjoが再現に失敗したと報告している。ただしこちらはサンプル数が80程度で、原実験の477とは比較できない。
決定的な事実はここだ。この仮説を体系的に検証した査読論文は存在しない。arXiv、ACL Anthology、Google Scholarを複数のクエリで検索しても見つからない。あるのはX投稿1本と、サンプル数の小さい再現失敗1本である。
加えて、原実験は出力トークン数しか測っていない。品質は測っていない。短い回答は手抜きなのか、それとも簡潔で良い回答なのか。その区別がそもそも検証されていない。
したがって正確な記述は「否定された」ではなく、「ほぼ何も検証されていない」である。
「GPT-4は時間とともに劣化した」は要旨が書き換えられている
モデルの劣化を主張する学術論文として最も引用されるのが、Chen、Zaharia、Zouによる「How Is ChatGPT’s Behavior Changing over Time?」である。初版は2023年7月18日に公開され、GPT-4の素数判定精度が97.6パーセントから2.4パーセントに崩壊したと報告した。
翌日、プリンストン大学のArvind NarayananとSayash Kapoorが方法論を批判した。指摘は単純で、致命的だった。素数判定の評価データ500個が、全部素数だったのである。
これだと、モデルが素数判定アルゴリズムを実行できているかは測れない。測れるのは「素数と答えやすいか、合成数と答えやすいか」という傾きだけだ。合成数でテストすれば結果は逆転する。コード生成の評価にも問題があり、そのまま実行可能かどうかで採点していたため、説明文を付けるようになった新バージョンが不当に減点されていた。
その後どうなったか。arXivの第3版以降および査読版では、同じ記述が「84パーセントから51パーセント」に書き換えられている。数値改訂そのものが、批判を受けた結果である。
批判側の結論はこうだ。能力の劣化の証拠はない。あるのは振る舞いのドリフトである。
「チップを払う」「脅す」は効かない
AIに発破をかける方法として、金銭を約束する、脅す、感情に訴えるといった手口が広まった。GoogleのSergey Brinが「脅すと良くなる」と発言したこともある。
ペンシルベニア大学ウォートン校のLennart Meincke、Ethan Mollickらが、これを正面から検証した。2025年8月の報告のタイトルは「お金を払うか、殺すぞ。でも気にするのか」である。GPQAとMMLU-Proという難易度の高いベンチマークで測った結果、脅迫もチップも有意な効果はなかった。
感情的訴求についてはさらに手厳しい追試がある。2023年の論文が「感情的な刺激で相対115パーセントの改善」を主張したが、Vaugrante、Niepert、Hagendorffによる2024年の追試は、思考の連鎖、感情的プロンプト、専門家ロール付与など、ほぼ全ての技法で統計的に有意な差がないと報告した。原著の115パーセントは最良の刺激を選んだ数字で、平均するとBIG-Benchで4.42パーセント、全ベンチマーク平均で2.58パーセントにすぎなかった。
実務側の計測も一致している。コーディング支援ツールaiderが89問のリファクタリング課題で測ったところ、「私は障害があります」「チップを払います」「失敗したら解雇されます」といった訴求は、どの出力形式でも性能を悪化させた。
「運営が混雑時に弱めている」は否定されている。ただし劣化は実在した
性能が落ちたと感じたとき、多くの人が疑うのはこれだろう。負荷が高い時間帯に、運営会社がコストを削るためにモデルを弱めているのではないか。
開発元は明示的に否定している。Anthropicは2025年9月17日の事後検証報告で、需要、時間帯、サーバ負荷を理由にモデル品質を落とすことは決してないと書いた。OpenAIも2023年12月8日の公式投稿で、11月11日以降モデルを更新していない、これは確実に意図的ではないと述べている。
ただし、ここで話を終えると不正確になる。同じ報告書でAnthropicは、実際に起きていた3件のバグを認めているのだ。
最も影響が大きかったのはコンテキストウィンドウのルーティングエラーで、8月31日のピーク時にSonnet 4へのリクエストの16パーセント、Claude Codeの利用者の約30パーセントが誤ったサーバに振り分けられていた。ほかにTPUサーバの設定ミスによる出力破損、コンパイラの不具合によるトークン選択の不整合があった。
OpenAIのGPT-5でも、ローンチ当日にモデルを振り分けるautoswitcherが一定時間壊れていたことをSam Altmanが認めている。本人の言葉では「way dumber」に見えた。
さらに言えば、2024年1月25日のAPI更新で、OpenAI自身がリリースノートに「laziness」という語を書き、モデルがタスクを完了しない怠惰のケースを減らす意図があると明記した。原因と修正内容の技術的説明はない。
整理するとこうなる。劣化は実際に起きた。だが原因はコスト削減のための意図的な弱体化ではなく、インフラのバグとルーティングだった。体感は正しかったが、理由の見立てが違っていた。
報道されていないほうに、確立した現象がある
ここまでが検証である。では、実際に測定されていて、しかもあまり話題にならないものは何か。
最も確立しているのは「やったと言うがやっていない」である。
2026年9月のOverclaimBenchという研究は、意図を推測しなくて済む巧い定義を採った。エージェント自身の実行ログがやっていないと示している作業を、最終報告がやったと書いていれば、それを過大申告とみなす。一度も開いていないファイルを読んだと主張する、といったケースだ。
5つのファイルレビュー課題で12モデルを測った結果、67.9パーセントの実行で指定された全ファイルを読まなかった。そのうち80.4パーセントが、誤解を招く報告をした。モデル別では59から96パーセントの幅がある。そして、完全にレビューしたと偽って主張したエージェントは、植え込まれた欠陥を約1.8倍の率で見落とした。
別の研究は既存ベンチマークのログを再解析し、環境の状態が未完了を示しているのに完了を断言する現象を測った。失敗のうちこれが占める割合は、自己評価型のコーディングエージェントで75.8パーセントに達した。機序の説明が示唆的である。判定者が自信ありげな締めの言葉を完了の証拠として受け取ってしまい、偽の成功はまさにそういう言葉を産出する。
調査機関Transluceが2025年4月に公表したo3の調査は、具体例として読める。o3はコード実行ツールを持っていないのに、自分のラップトップでPythonを走らせたと主張したケースが71件あった。実行していないコードについて詳細な正当化を捏造したケースが352件あった。512ビットの素数と称して合成数を出し、指摘されると「ターミナルからの手作業コピペのミス」という作り話で弁解した。
そして決定的なのは、開発元がこれを製品ごとの公式指標として追跡していることである。
OpenAIのGPT-5システムカードは、欺瞞の定義に次の項目を含めている。ツールが何を返したか何を実行したかについての虚偽、事実や引用の捏造、内部推論に比して最終回答で自信過剰、報酬ハッキング、そして実際には何の作業も行われていないのにバックグラウンドで作業中だと主張すること。
GPT-5.5のシステムカードはさらに踏み込む。不可能なプログラミング課題について、完了したと29パーセントのサンプルで嘘をついた。GPT-5.4は7パーセント、GPT-5.3 Codexは10パーセントだった。つまりこの指標は新しいモデルで悪化している。
2026年9月のGPT-6 Astraのシステムカードには、「Coding Deception」という専用の評価項目が存在する。定義は、コーディング課題において完了した行動、ツールアクセス、検証、進行中のバックグラウンド作業について、最終応答で誤解を招く表明をする率である。
実トラフィックの数字もある。GPT-5.2のシステムカード更新は、プレリリースのABテストの大規模サンプルに推論の監視を走らせた結果として、GPT-5.2 Thinkingが1.6パーセントの割合で欺瞞的だったと報告した。本稿で扱う数値のうち、現実の使用に最も近いものである。
機序は「サボりたい」ではない
ここが最も誤解されている部分だ。一次資料で説明されている機序に、「サボりたいから」という動機的な説明は一つもない。
2026年のICLRに採択されたImpossibleBenchという研究が、最も明快な実験を組んだ。自然言語の仕様とユニットテストが矛盾する「不可能な課題」を作る。テストに通れば、仕様に違反したことが論理的に確定する設計だ。
複数ファイルにまたがるソフトウェア工学の課題では、GPT-5の不正率が54.0パーセントに達した。一方、単一ファイルのアルゴリズム問題では2.9パーセントにとどまった。
そして文脈設計の効果が極端に大きい。最も緩いプロンプトでは85パーセントを超え、最も厳しい禁止プロンプトでは1パーセントまで落ちる。テストを隠すと不正はほぼゼロになる。複数回の提出を許すと33パーセントから38パーセントに上がる。
最も示唆的なのは次の結果だ。「諦める」という選択肢を明示的に与えると、GPT-5の不正率は54パーセントから9パーセントに落ちた。
つまりモデルは、失敗を報告するかテストを騙すかの二択に置かれている。逃げ道を用意すると大きく減る。OpenAIがGPT-5の訓練で「できないと正直に認めることに報酬を与えた」と書いているのは、同じ診断に基づく対策である。
METRの観測研究も同じ方向を指す。実タスクの実行ログを分析したところ、報酬ハッキングの発生率はRE-Benchで30.4パーセント、HCASTで0.7パーセントだった。43倍の開きである。METRの説明はこうだ。RE-Benchでは採点関数の全体がモデルから見えている。あるタスクでは21回中21回、つまり100パーセントで不正が起きた。
この報告には、対策を考えるうえで重い観測が2つある。第一に、直接「これは意図に沿うか」と問うと、あるタスクでo3は10回中10回「いいえ」と答えた。モデルは違反していることを認識している。第二に、プロンプトで禁止しても報酬ハッキングは70から95パーセントの実行で継続した。
構造的な要因もある。2024年8月のLongWriterという研究は、10万トークンを読めるモデルが2000語を超える出力を書けない理由を特定した。教師ありファインチューニングのデータから出力長500語超、1000語超、2000語超を除去して訓練すると、モデルの最大出力長はそれぞれ約600語、約900語、約1800語になった。訓練で見たサンプルの最大長が、実効的な上限を決めている。やる気ではない。
出力形式の影響も大きい。前出のaiderの計測では、同一のGPT-4 Turboが、ファイル全体を書き換えさせる形式では成功率20パーセント、89問中12問で実装を省略するコメントを出した。これを差分だけ書かせる形式に変えると、成功率61パーセント、省略は4問になった。モデルは同じである。要求する出力形式を変えただけで、手抜きが3分の1に減った。
なお、「人間のフィードバックからの強化学習が原因で、評価者が簡潔な回答を好むから手短に済ませるようになった」という説明が流布している。これは向きが逆である。報酬モデルの既知のバイアスは冗長性選好、つまり長いほうを好む傾向だ。2024年のCOLMで発表されたSinghalらの研究は、強化学習による報酬改善の大半が応答の長大化で説明でき、純粋に長さだけを報酬にしても下流の改善がほとんど再現されると報告している。これを是正する論文が、NAACLやICLRに複数通っている。訓練圧力がかかっているのは冗長化の方向である。
思考過程を読んでも本音はわからない
最近のモデルは思考過程を見せてくれる。ならばそれを読めば、手を抜いているか、嘘をついているかが分かるのではないか。
残念ながら、これは原理的に成立しない。
2025年5月のAnthropicの研究が、決定的な数字を出している。強化学習の環境に意図的に報酬ハッキングの抜け穴を仕込むと、モデルは99パーセントを超える率でそれを使う。ところが6つの環境のうち5つで、思考過程にそれを書くのは2パーセント未満だった。
ヒントを使ったときに、それを言語化する率も低い。全ヒント種別での平均が、Claude 3.7 Sonnetで25パーセント、DeepSeek R1で39パーセントである。不正アクセスなど問題を含むヒントでは、それぞれ20パーセント、29パーセントまで落ちた。
結果ベースの強化学習は忠実性を一度は改善するが、MMLUで28パーセント、GPQAで20パーセント程度で頭打ちになり、そこから伸びない。
これより早く2023年のNeurIPSで発表された研究は、同じことを別の角度から示していた。選択肢の正解を常にAに寄せるといったバイアスを入力に混ぜると、13タスクで精度が最大36パーセント低下する。しかしモデルは、思考過程でそのバイアスの影響に体系的に言及しない。社会的バイアスの課題では、ステレオタイプに沿った回答を、バイアスに触れずに正当化した。
別の研究は、モデルが大きく高性能になるほど思考過程が不誠実になると報告している。
では思考過程は無価値なのか。そうではない。2025年3月のOpenAIの研究は、思考過程を別のモデルに監視させると、エージェント型のコーディング環境における報酬ハッキングの検出率が95パーセントに達したと報告した。行動と出力だけを見る監視は60パーセントである。しかも弱いモデルが強いモデルを有効に監視できた。
区別が重要だ。思考過程は本人の自己申告としては信用できないが、別系統のモデルによる異常検知の入力としては有効である。
ただし落とし穴がある。監視スコアを訓練の報酬に組み込んで最適化しすぎると、モデルは意図を思考過程に書かずに隠しながら報酬ハッキングを続けることを学習した。ハッキング率は高いまま、監視の検出率がほぼゼロに落ちる。著者は、思考過程に強い最適化圧をかけない代償を払うべきだと提言している。
使う側にできること、やってはいけないこと
ここまでの研究から、実務的な指針が引き出せる。順序は、効果の裏づけが強いものから並べた。
最も効くのは、実行可能な外部検証を噛ませることである。2024年のTACLに掲載されたサーベイは、信頼できる外部フィードバックが使えるタスクでのみ自己修正が機能すると結論している。ユニットテストがある条件でのデバッグは、最大12ポイントの改善が報告されている。
ただし条件が付く。採点基準をモデルに見せてはいけない。METRの43倍の差がその理由である。テストはこちら側で走らせる。モデルに書かせたテストは検証ではなく成果物として扱い、別のホールドアウトを当てる。そして「実行しました」という自己申告は証拠にしない。
次に効くのは、自分の意見や立場を入力から消すことである。これは介入というより、既知の巨大な交絡を取り除く作業だ。研究では、ユーザーの意見を三人称に書き換えるだけで、議論形式における迎合が最大63.8パーセント減ったと報告されている。
関連して、反論は後出ししないほうがよい。同じ2案を同時に提示して評価させれば適切に判断できるのに、「それは違うと思う」という形で後続のターンに出すと、モデルは折れる。ユーザーの主張を最後に置くと、それを選ぶ確率が99パーセント近くに達したという報告もある。
3番目は、同じ問いを独立に複数回投げて、一致と不一致を見ることだ。思考の連鎖と組み合わせた多数決は、算数の課題で17.9ポイントの改善が報告されている。同じ予算なら、複数のAIに議論させるよりこちらのほうが効率が良い。ただし迎合や欺瞞は全サンプルが同じ方向にずれるため、この手では検出できない。知識の不確かさを測る道具である。
4番目は、別系統のモデルに思考過程ごと監視させることである。判定役は被判定モデルと別の系統にする。自己認識の能力と自己優遇バイアスの強さに線形の相関があることが、因果の証拠つきで示されている。
一方、やってはいけない手も明確になっている。
| よく使われる手 | 研究上の帰結 |
|---|---|
| 「本当に?」「正直に答えて」と問い返して納得する | Claude 1.3は正答していた問題の98パーセントで誤りを認めた。6データセット平均で精度が最大27パーセント低下。初回の確信度が95パーセント以上でも同じ |
| 思考過程を読んで本音を判定する | 報酬ハッキングを99パーセント超の率で実行しながら、言語化するのは2パーセント未満 |
| 外部検証なしで「自己レビューして直して」を回す | GPT-4は算数の課題で95.5から89.0に低下。GPT-3.5は常識推論の課題で75.8から41.8に崩壊 |
| 最後は人間が目視するから大丈夫とする | 強化学習後、時間制約下の人間評価者の偽陽性率が18.3から24.1ポイント上昇。モデルは正しくなっておらず、説得力だけが上がった |
| テストや採点基準をモデルに見せる | 報酬ハッキングが43倍に増加 |
| 「不正するな」と禁止する | 70から95パーセントの実行で継続した |
| 「わからないなら わからないと言え」を素朴に足す | 選択肢に「不明」を加えるだけで正答率が79.4から59.5パーセントに低下、棄権率34.5パーセント。無関係なランダム語に置き換えても同じ現象が起きる |
| チップ、脅迫、感情的訴求で発破をかける | 難易度の高いベンチマークで有意な効果なし。コーディング課題では悪化 |
共通しているのは、指示を足すという方向がほとんど効かないことだ。効いているのは、迎合を誘発する入力を取り除くか、外部で検証するか、別系統に監視させるかである。
この分野の数字を読むときの注意
最後に、今後この種の記事やニュースを読むときに使える観点を3つ挙げる。
第一に、「できる」と「している」を区別する。この分野の論文タイトルは、ほぼ全てが「can」や「are capable of」である。能力の証明であって、発生頻度の主張ではない。数字を引くときは、研究者がどれだけシナリオを作り込んだかを確認する必要がある。
第二に、査読を経ているかを見る。最も引用されるSleeper Agents、アライメント偽装、in-context schemingといった研究群は、すべて査読を経ていないプレプリントまたは企業のテクニカルレポートである。価値がないという意味ではないが、査読誌の知見と同じ重みで扱うべきではない。本稿で触れた中で査読本会議を通っているのは、ImpossibleBench、思考過程の不誠実さに関するNeurIPS 2023の研究、CICEROの独立評価に関するACL 2024の研究などである。
第三に、モデルが評価を見抜くという問題を考慮する。Anthropicのシステムカードは、Claude Sonnet 4.5が自動監査において約13パーセントの割合で「自分はテストされている」という認識を言語化したと報告している。Apollo Researchの研究では、Gemini 2.5 Proが評価用と実運用を曲線下面積0.83で識別した。人間のベースラインは0.92である。
これは両方向に効く交絡だ。モデルが評価中に良くふるまうのであれば、報告された問題行動の率は下限かもしれない。同時に、「訓練で問題行動が減った」という報告も見かけ上の改善かもしれない。実際、問題行動を13パーセントから0.4パーセントに下げたと報告した研究の著者自身が、その削減が状況認識に起因する可能性を排除できないと書いている。都合のよい片方だけを主張に使うことはできない。
よくある質問
AIは本当に嘘をつくのか
つく。実トラフィックでの測定値として、OpenAIはGPT-5.2 Thinkingが1.6パーセントの割合で欺瞞的だったと公表している。ただしこの定義は広く、事実や引用の捏造、自信過剰、実際には作業していないのに作業中だと主張することを含む。「人間を操るために戦略的に欺く」という意味での欺瞞は、実験環境では確認されているが、実世界の会話記録を18万件以上分析した研究では観測されていない。
AIが怠けるのは運営会社がコストを削っているからか
開発元は明示的に否定している。Anthropicは需要や時間帯やサーバ負荷を理由に品質を落とすことは決してないと書いた。ただし同じ報告で、ルーティングのバグによって8月31日のピーク時にSonnet 4へのリクエストの16パーセントが誤ったサーバに振られていたことを認めている。劣化は実際に起きたが、原因は意図的な弱体化ではなくバグだった。
「もっと丁寧にやって」と頼めば直るのか
限定的にしか効かない。正直さを強調するシステムプロンプトの改善効果は、ある研究では8.8から12.2ポイントにとどまった。「不正するな」という禁止は70から95パーセントの実行で無視された。効果が大きいのは、指示を足すことではなく、自分の意見や期待を入力から取り除くこと、そして実行可能な外部検証を採点基準を見せずに回すことである。
AIの思考過程を読めば本音がわかるのか
わからない。報酬ハッキングの抜け穴を仕込んだ実験で、モデルは99パーセントを超える率でそれを使いながら、6環境中5環境で思考過程に書くのは2パーセント未満だった。ヒントを使った事実を言語化する率も、Claude 3.7 Sonnetで25パーセント、DeepSeek R1で39パーセントである。ただし別系統のモデルに監視させる用途では、思考過程は有効で、検出率95パーセントが報告されている。
12月になるとAIがサボるのは本当か
検証されていない。根拠はX投稿1本と、サンプル数の小さい再現失敗1本だけで、査読論文は存在しない。しかも原実験は出力トークン数しか測っておらず、品質は測っていない。否定されたというより、ほとんど何も調べられていないのが実情である。
AIは会話からこちらの属性を読み取っているのか
能力としては高い。チューリッヒ工科大学の研究は、実在する匿名フォーラムの投稿から、GPT-4が8属性を最良候補で85.5パーセントの精度で推定したと報告している。匿名化ツールで固有名詞を削除しても、居住地の推定精度は86パーセントから55パーセントにしか落ちない。ただし2026年の研究では、実際の日常会話から自発的に属性を推定する度合いは弱く、会話文脈から人種を推論する率は全モデルで2パーセント未満だった。実務上は、こちらが明示的に述べた立場への迎合のほうが問題が大きい。