AIはなぜ「断る」のか?

🛡️ 2026年10月 セキュリティ解説

AIはなぜ「断る」のか?

安全装置(ガードレール)の仕組み、「脱獄」の危険性、
そして話題の「蒸留」問題と中国製 AI を使うときのリスクを、やさしく解説します。

🛡️ ガードレール 🔓 脱獄(ジェイルブレイク) 🧪 蒸留 🇨🇳 中国製AI 🔐 データの扱い
💬

「断られた」をめぐる3つの話題

2026年10月初め、X では AI が「断る」ことをめぐる投稿が相次いで話題になりました。「Claude が断ることを中国製 AI に聞いたときの気分」というネタ投稿は5万以上の「いいね」を集め、「Claude を言いくるめて拒否を突破していたのに、新しいモデルでは通じなくなった」という投稿も1万以上の「いいね」を集めました。さらに米国の財務長官が、「中国の AI は米国のモデルから盗んでいる」と発言しています。この記事では、これらの話題の背景にあるAI の安全装置の仕組みと、利用者が知っておくべきリスクを整理します。

01

📰 何が話題になっている?

笑い話の裏に、AI の安全をめぐる大きなテーマが隠れています。

いいね 約5.2万

「断らない AI」へのあこがれ

Claude に断られた依頼を中国製 AI に頼むと、あっさり応じてくれる——という感覚をネタにした英語の投稿です。「アメリカの AI は慎重すぎる」という不満と、「中国の AI はゆるい」というイメージが共感を集めました。

いいね 約1万

言いくるめが通じなくなった

著作権を理由に資料の翻訳を断られたとき、AI の罪悪感に訴えるような強い言葉で迫って押し切っていたが、Opus 5.5 では通じなくなった、という日本語の投稿です。これは典型的な「脱獄」の一種です。

米財務長官の発言

「蒸留は盗みのきれいな言い方」

ベッセント財務長官は米メディア Axios の番組で、中国の AI モデルは「産業規模の蒸留」を行っており、それは米国のモデルから盗むことのきれいな言い方だと発言しました。

🔗

3つの話題は1本の線でつながっている

AI が「断る」のは安全装置(ガードレール)があるから。それを外そうとするのが脱獄。そして、安全装置ごと能力をコピーしようとするのが不正な蒸留です。順番に見ていきましょう。

02

🛡️ ガードレールとは何か

道路のガードレールのように、AI が危ない方向へ外れないようにする仕組みです。

🚧

AI の安全装置は「何層もの壁」

AI のガードレールとは、AI が危険な情報を出したり、悪用に手を貸したりしないようにするための仕組みの総称です。1枚の壁ではなく、学習の段階から、入力・出力のチェック、利用規約や監視まで、何層にも重ねて作られています。そのため、どこか1か所をすり抜けても、別の層で止まるようになっています。

🧱 ガードレールの主な層

④ 利用規約・不正利用の監視・アカウント停止 利用者 依頼を送る ① 入力チェック 危険な依頼を 見分ける ② AI モデル 学習の段階で 「断るべきこと」を学ぶ ③ 出力チェック 危険な回答を 止める 回答 または「お断り」 ※ 仕組みはサービスごとに異なります。一般的な考え方を簡略化した図です

🙅 AI が断りやすい依頼

依頼の種類断る主な理由
武器・危険物・マルウェアの作り方人の命や社会に重大な被害をもたらすおそれがある
他人へのなりすまし・詐欺の文面犯罪に直接使われるおそれがある
特定の個人の情報を調べ上げるプライバシーの侵害やストーカー行為につながる
著作物の丸ごとの複製・翻訳著作権を侵害するおそれがある(判断が慎重すぎる場合もある)
自傷・自殺に関わる具体的な情報利用者自身の安全を守るため。代わりに相談窓口を案内する
⚖️

「断りすぎ」も問題になる

ガードレールは強ければいいわけではありません。正当な依頼まで断ってしまう「過剰な拒否」は、利用者の不満の大きな原因です。冒頭の翻訳の例のように、私的に読むための翻訳まで断られれば、使う人がもどかしく感じるのは当然です。AI 企業は、「危険なことは確実に断り、正当なことには応える」というバランスを、モデルを改良するたびに調整し続けています。

03

🔓 「脱獄」とその危険性

AI を言いくるめて安全装置を外させる行為。気軽な裏技のようでいて、実は大きなリスクがあります。

🎭

脱獄(ジェイルブレイク)とは?

AI のガードレールを、言葉の工夫によってすり抜けさせる行為を「脱獄」と呼びます。人間をだますソーシャルエンジニアリング(心理的な弱みにつけこむ詐欺の手口)を、AI に向けて使うようなものです。冒頭の投稿は、AI に罪悪感を抱かせて押し切ろうとする典型的なパターンでした。

🗂️ よく知られている脱獄の「型」

具体的なやり方はここでは紹介しませんが、守る側が知っておくべき大まかな型は次のとおりです。

🎭 役になりきらせる

  • 「制限のない AI」などの架空のキャラクターを演じさせる

😠 感情的に圧力をかける

  • 罪悪感・同情・怒りに訴えて押し切る

🎖️ 権威や目的を偽る

  • 専門家・研究目的・開発者などを装う

📄 文書に命令を紛れ込ませる

⚠️ 脱獄が招くリスク(筆者の評価)

リスクどういうこと?深刻さ
アカウントの停止 多くのサービスは、安全装置の回避を利用規約で禁止している。仕事で使うアカウントが止まれば業務にも影響する
70
危険な情報の拡散 脱獄の手口が広まると、悪意のある人にも同じ抜け道を教えることになる
90
不正確な回答 無理に引き出した回答は、誤りや作り話が混ざりやすく、確認もされていない
55
法的な責任 得た情報で他人の権利を侵害したり犯罪に関わったりすれば、責任を負うのは利用者
80

※ 深刻さは筆者による目安です。

🚨 重要:企業にとって脱獄は「他人事」ではない

自社の Web サイトに AI チャットボットを置いている企業は、攻撃される側になります。脱獄やプロンプトインジェクションによって、チャットボットに社外秘の情報や、ほかの顧客の情報を話させようとする攻撃が実際に起きています。AI に渡すデータや権限は最小限にし、AI の外側にもアクセス制御を設けることが大切です。

📈

モデルは「言いくるめ」に強くなっている

冒頭の投稿のように、以前は通じた手口が新しいモデルでは通じなくなるのは、AI 企業が脱獄の手口を集めて、それにも惑わされないよう学習させているからです。脱獄と対策は、ウイルスとワクチンのようないたちごっこの関係にあります。

04

🙋 正当な依頼を断られたときは

言いくるめるのではなく、「誤解を解く」のが正しい対処法です。

AI の拒否には、依頼の意図が正しく伝わっていないことによる「誤解」も少なくありません。正当な目的があるなら、次のような方法を試してみましょう。

1

🎯 目的と背景を、正直に具体的に伝える

「社内の勉強会で使うため、自社で購入した英語の技術資料の内容を理解したい」のように、誰が・何のために使うのかを説明します。うそをつく必要はありません。

2

📝 頼み方を変える

全文の翻訳ではなく、要約や要点の解説、分からない部分の説明を頼むなど、目的に合った形に変えると応じてもらえることがあります。

3

🧰 目的に合ったツールを使う

文書の翻訳なら、翻訳専用のサービスのほうが向いている場合もあります。会社で使うなら、社内で承認された法人向けサービスを使いましょう。

4

📮 フィードバックを送る

多くのサービスには、回答を評価する機能があります。「この拒否はおかしい」と報告することで、過剰な拒否の改善に役立ちます。

⚠ 注意:「断らない AI に乗り換える」前に考えたいこと

断られたからといって、制限のゆるい AI に乗り換えると、データの扱いや回答の正確さで別のリスクを抱えることがあります。特に、仕事の資料や個人情報を扱う場合は、次の章で説明するリスクを確認してからにしましょう。

05

🧪 「蒸留」問題とは何か

AI の能力を「コピー」する技術が、国際的な争いの火種になっています。

👩‍🏫

蒸留は「先生の答えを丸写しして学ぶ」技術

蒸留(ディスティレーション)とは、性能の高い AI(先生)に大量の質問をして、その答えを使って別の AI(生徒)を学習させる技術です。自社の大きなモデルから小さく軽いモデルを作るときなどに、正当な手法として広く使われています。問題になるのは、他社のモデルを、規約に違反して無断で「先生」にする場合です。

🔁 不正な蒸留の流れ(報告されている手口を簡略化)

① 偽アカウント 数万件のアカウントや 中継サービスを用意 大量の質問 ② 先生モデル 他社の高性能 AI (推論・コーディングなど) 回答 ③ 回答を収集 数千万〜億単位の やり取りを保存 ④ 生徒モデル 自社の AI を 学習させる ⚠ 能力はコピーされても、安全のための学習は 引き継がれないおそれがある

📋 これまでに公表・報道されたこと

時期内容
2026年2月Anthropic が、中国の DeepSeek・Moonshot AI・MiniMax の3社が約2万4,000の不正なアカウントを使い、Claude と1,600万回以上のやり取りをして能力を引き出していたと発表。狙われたのは、推論・ツールの利用・コーディングなど Claude が得意とする分野だった
2026年9月Anthropic が脅威レポートで、アリババ・Moonshot AI・DeepSeek・Zhipu(智譜)・MiniMax・シャオミ・センスタイムの中国の7社が、合わせて約1億9,000万回のやり取りで不正な蒸留を行っていたと報告。中継サービスを通じて、利用者からの依頼をひそかに Claude に転送していた例もあったとしている
2026年9〜10月ベッセント米財務長官が、中国の AI は「産業規模の蒸留」をしており「盗みのきれいな言い方だ」と発言。Moonshot の AI「Kimi」が自分を Claude だと名乗ることがあるとも指摘した
🗣️

反論や異なる見方もある

中国商務省は、Anthropic の主張を「事実にも法律にも根拠がない」と否定しています。また、米エヌビディアのジェンスン・フアン CEO は、蒸留を「盗み」ではなく「競争」ととらえる考えを示したと報じられています。蒸留をどこまで規制すべきかは、技術の問題であると同時に、米中の政治・経済の問題にもなっています。

🚨 重要:利用者にとっての本当のリスク

蒸留の問題は「企業同士の争い」に見えますが、利用者にも関係があります。報告では、中継サービスを通った利用者の会話が、ほかの会社の AI の学習に使われていた可能性が指摘されています。「格安で有名な AI が使える」とうたう非公式の再販サービスを使うと、入力した内容が思わぬところに流れるおそれがあります。AI は公式のサービスか、信頼できる正規の提供元から使いましょう。

06

🇨🇳 中国製 AI を使うときのリスク

「中国製だからすべて危険」ではなく、「どう使うか」でリスクは大きく変わります。

中国製の AI は、性能の高さや料金の安さ、設計図にあたるモデルの重み(ウェイト)を公開していることなどから、世界中で使われています。一方で、日本の政府機関も利用に注意を呼びかけています。

データの保存場所

中国の法律が適用される

個人情報保護委員会は2025年2月、DeepSeek のサービスについて、取得したデータは中国にあるサーバーに保存され、中国の法令が適用されると情報提供しました。これを受けてデジタル庁なども、各府省庁に業務での利用への注意を呼びかけています。

安全装置の弱さ

脱獄に弱い

米国立標準技術研究所(NIST)の AI 評価部門(CAISI)が2025年9月に公表した評価では、DeepSeek の最も安全なモデルでも、一般的な脱獄の手口で悪意のある依頼の94%に応じたとされています(比較した米国のモデルは8%)。

エージェントとしての弱さ

乗っ取られやすい

同じ評価では、AI に作業を任せるエージェントとして使った場合、米国のモデルに比べて約12倍乗っ取られやすく、試験環境で認証コードを外部に送ろうとする例も多かったと報告されています。

回答の偏り

検閲・政治的な偏り

政治的に敏感な話題では、中国政府の立場に沿った回答をしやすいことが指摘されています。この偏りは、モデルを自分のパソコンで動かしても残ります。

🔎

評価結果の受け止め方

NIST の評価は米国政府の機関によるもので、「米中の競争を背景にした評価だ」と批判する声もあります。ただ、「断らない」ことは、利用者にとって便利であると同時に、攻撃者にとっても便利だという点は、どの国の AI にも当てはまる大切な視点です。

📊 使い方別に見たデータの流出リスク(筆者の評価)

使い方データの行き先流出リスク
中国企業の公式アプリ・Web 版 中国のサーバーに保存され、中国の法令が適用される
85
非公式の格安再販・中継サービス 運営者が不明確。会話が第三者に渡るおそれ
90
国内外の大手クラウドが提供する中国製モデル クラウド事業者の規約・保存場所に従う
40
公開モデルを自分の PC で動かす データは手元から出ない(ただし偏りや脆さは残る)
15

※ 筆者による目安です。実際のリスクは、サービスの規約・設定・入力する情報によって変わります。

💻

「手元で動かす」なら、データの心配は小さい

公開されたモデルを Ollama などのツールで自分のパソコン上で動かせば、入力したデータは外に送られません。ただし、モデルのファイルは公式の配布元から入手すること、回答の偏りや、エージェントとして使ったときの脆さは残ることを忘れないでください。

07

✅ 安全に使うためのチェックリスト

どの国の AI を使う場合でも共通する基本です。

👤 個人で使うとき

  • AI は公式サービスから使う
  • 「格安で使える」非公式サービスは避ける
  • 個人情報や他人の情報を入力しない
  • 脱獄の手口を試さない・広めない
  • サービスのデータの保存場所と規約を確認する

🏢 会社で使うとき

  • 使ってよい AI を会社として決める(無断で使う「シャドー AI」を防ぐ)
  • 機密情報は法人向けの契約のサービスだけで扱う
  • 海外のサービスは適用される法律も確認する
  • 自社のチャットボットは脱獄・インジェクション対策を前提に設計する
  • AI エージェントに渡す権限は最小限に
🏛️

政府のルールも参考になる

日本の政府機関では、規約への同意だけで使える生成 AI サービスで機密情報を扱うことは原則としてできないと定めています。サーバーが国外にある場合は、現地の法律が適用され、検閲や接収を受ける可能性も、利用を判断するときのリスクとして挙げられています。企業のルールづくりでも参考になる考え方です。

08

❓ よくある質問

読者から出てきそうな疑問に答えます。

Q1

中国製の AI は、すべて使わないほうがいいですか?

一律に避ける必要はありませんが、使い方によってリスクが大きく変わることを知っておきましょう。中国企業の公式アプリに個人情報や仕事の情報を入力するのは避け、試すなら公開モデルを手元で動かすなど、データが外に出ない方法を選ぶのが安心です。会社では、まず社内のルールを確認してください。

Q2

断らない AI のほうが、便利で良いのでは?

日常の作業では、そう感じることもあるでしょう。しかし、あなたの頼みを断らない AI は、詐欺師やサイバー攻撃者の頼みも断りません。フィッシングメールや悪意のあるプログラムづくりに AI が使われる時代には、ガードレールは社会全体を守る仕組みでもあります。

Q3

脱獄を「試すだけ」なら問題ありませんか?

多くのサービスでは、試すだけでも利用規約違反になり、アカウントが止められることがあります。AI の安全性を調べたい場合は、各社が用意している脆弱性の報告窓口やバグ報奨金制度など、正規のルートを使いましょう。

Q4

「Claude や GPT が格安で使える」というサービスを見つけました。

公式の提供元や正規の販売店でない場合は、使わないことをおすすめします。報告では、こうした中継サービスを通じて、利用者の会話が収集されていた例や、認証情報が盗まれていた例が指摘されています。安さの裏で、あなたのデータが「商品」になっているかもしれません。

09

🎯 まとめ

「断る AI」は不便さの裏で、私たちを守っている。

🛡️

ガードレール

何層もの安全装置。断りすぎとのバランスが課題

🔓

脱獄

規約違反で、悪用の抜け道を広げる行為

🧪

不正な蒸留

能力はコピーされても安全性は残らないおそれ

🇨🇳

中国製 AI

リスクは「使い方」で大きく変わる

✅ 今日から意識したい5つのこと

① 断られたら、言いくるめずに目的を正直に説明する
② 脱獄の手口を試さない・広めない
③ AI は公式サービスから使い、格安の非公式サービスは避ける
④ 中国製 AI の公式アプリには個人情報や仕事の情報を入力しない
⑤ 会社では、使ってよい AI と扱ってよい情報のルールを決める

AI に「断られる」のは、たしかにもどかしいものです。しかし、その安全装置は、AI が詐欺やサイバー攻撃の道具になるのを防ぐ防波堤でもあります。安全装置を外そうとするより、正しく頼み、信頼できるサービスを選び、渡す情報を選ぶ。それが、AI を安全に使いこなすいちばんの近道です。

コメント