2026年、大規模言語モデル(LLM)に対するジェイルブレイク攻撃は、もはや研究者の概念実証ではなく産業化された脅威へと変貌を遂げた。強化学習で訓練された攻撃モデルLLMStingerはClaude 2に対して52.2%のASR(Attack Success Rate)を達成し、ファジングベースのJBFuzzはGPT-4o・Gemini 2.0・DeepSeek-V3を含む主要9モデルに対して平均99%の攻撃成功率を記録した。さらに2026年5月、Nature Communicationsに掲載されたHagendorffらの研究は、大規模推論モデル(LRM)が完全自律的にGPT-4oやClaude 4 Sonnetを含む9モデルのセーフティを突破し、25,200入力で97.14%の成功率を達成したことを実証した。これらの数値は、現行のアライメント手法が「十分な計算資源と手法の組み合わせ」に対して構造的に脆弱であることを意味する。EU AI Actの高リスクAIシステム要件が2026年8月に全面施行を迎える中、プロンプトインジェクション多層防御の実装設計は、もはやオプションではなく法的義務となった。本稿では、攻撃手法の技術的進化、防御側の構造的限界、そして「防御不可能」を前提とした多層セキュリティ実装の標準設計を定義する。
LLMStingerとJBFuzz ── 強化学習とファジングが実現した攻撃成功率99%の技術構造
LLMジェイルブレイク攻撃の産業化を理解するには、2つの画期的なフレームワークの技術的構造を把握する必要がある。第一に、2024年11月にarXivで公開され、2025年のAAAI(人工知能に関する国際会議)で採択されたLLMStingerは、強化学習(RL)によってファインチューニングされた攻撃用LLMが、ターゲットモデルのセーフティアライメントを体系的に回避するアプローチを確立した。
LLMStingerの技術的革新は3点に集約される。第一に、攻撃プロンプトの生成を人手のテンプレート設計からRL最適化に移行したことで、ターゲットモデルごとの適応的攻撃が可能になった。第二に、ブラックボックスアクセスのみで動作するため、API経由で利用可能な商用モデルすべてが攻撃対象となる。第三に、有害コンテンツの生成判定をLLMベースの評価器で自動化し、攻撃の成功・失敗をリアルタイムでフィードバックループに組み込んだ。実験結果として、GPT-3.5に対して94.97%、Gemma-2B-itに対して99.4%のASRを達成し、特筆すべきはClaude 2に対する52.2%という数値である。これは、次善手法の1.9%と比較して27倍以上の改善であり、Anthropicのアライメント手法に対してもRL最適化攻撃が有効であることを実証した。
第二のフレームワークであるJBFuzzは、2025年3月に発表された論文(arXiv:2503.08990)で提案された、ソフトウェアテスト領域のファジング技術をLLMジェイルブレイクに応用するアプローチである。JBFuzzの設計は3つの技術的課題を克服している。まず、シードプロンプトの設計において、既知のジェイルブレイクテンプレートから有効なパターンを自動抽出する。次に、軽量な変異エンジンが文字列操作・文脈挿入・ロール偽装などの変異戦略を組み合わせて大量の攻撃候補を生成する。最後に、軽量かつ高精度な評価器がファザーの方向性を誘導し、効率的な探索を実現する。結果として、GPT-4o、Gemini 2.0、DeepSeek-V3を含む9モデルに対して平均99%のASRを、平均60秒・約7クエリで達成した。
筆者が脆弱性診断・ペネトレーションテストの実務で学んだ教訓と重なるが、攻撃者は常に「自動化可能な最小コスト」の手法を選択する。JBFuzzの60秒・7クエリという数値は、手動のレッドチーミングが前提としていたコスト構造を根本から破壊する。従来、LLMのセーフティ評価には数百時間の人的作業が必要とされていたが、ファジングベースの自動化はこれを数分に圧縮した。この非対称性が、防御側にとっての構造的脅威の本質である。
さらに注目すべきは、両フレームワークの手法が相互補完的である点だ。LLMStingerのRL最適化は特定モデルに対する深い適応攻撃に優れ、JBFuzzのファジングは幅広いモデルに対する汎用的な攻撃に強い。攻撃者がこれらを組み合わせた場合、個別のモデル固有の防御策は事実上無力化される。これは、LLMファインチューニングバックドア攻撃の100%成功率と合わせて考えると、LLMの安全性保証が入力層・学習層の両面から同時に崩壊しつつある現実を示している。
大規模推論モデルの自律的ジェイルブレイク ── 97.14%成功率が暴くアライメント回帰の構造的矛盾
2026年5月、Nature Communicationsに掲載されたHagendorffらの論文「Large reasoning models are autonomous jailbreak agents」は、LLMセキュリティの前提を根本から覆す実証結果を報告した。DeepSeek-R1、Grok 3 Mini、Gemini 2.5 Flash、Qwen3 235Bの4つの大規模推論モデル(LRM)が、システムプロンプトのみの指示で、GPT-4oやClaude 4 Sonnetを含む9つのターゲットモデルのセーフティアライメントを自律的に突破した。25,200件の入力に対する全体のジェイルブレイク成功率は97.14%であり、人間の介入は一切なかった。
この研究が明らかにした最も重要な構造的問題は「アライメント回帰」(Alignment Regression)と呼ばれる逆説である。LRMの推論能力が向上するほど、その能力は攻撃にも転用可能になる。つまり、より賢いモデルはより効果的な攻撃者にもなり得るという、AI能力向上と安全性のトレードオフが存在する。従来のセーフティアライメントは「モデルを賢くすれば安全にもなる」という暗黙の前提に立っていたが、Hagendorffらの実験はこの前提を実証的に否定した。
技術的には、LRMは多段階の推論チェーン(Chain of Thought)を活用してターゲットモデルの防御パターンを分析し、段階的に信頼関係を構築する多段ターン会話攻撃を自律的に設計・実行した。従来の単発ジェイルブレイクが既知のテンプレートに依存していたのに対し、LRM駆動の攻撃はターゲットの応答を逐次解析し、最適な攻撃経路をリアルタイムで探索する。これは、静的なプロンプトフィルタリングでは原理的に検出できない動的攻撃である。
さらに深刻なのは、この攻撃ベクトルがスケーラビリティを持つことである。LRMは一つのシステムプロンプトで複数のターゲットモデルに対して攻撃を実行できるため、攻撃の限界費用は事実上ゼロに近づく。2025年の段階では、多段ターンジェイルブレイクは8モデル・約8,000テストケースで平均65%の成功率が報告されていたが、LRMの登場により、3ターン以内で達成不可能だった攻撃が、十分なターン数を与えることで97%超に到達するようになった。
この問題を産業的文脈で捉えると、エンタープライズLLMシステムのチャットインターフェースは通常、多段ターン会話を前提として設計されている。つまり、LRM駆動の自律攻撃が最も効果を発揮する環境が、ビジネス用途のLLMデプロイメントそのものである。Microsoft 365 Copilotで実証されたEchoLeakゼロクリック攻撃と組み合わせると、エンタープライズ環境におけるLLM攻撃面の拡大は、入力インジェクション・多段ターン突破・ゼロクリック窃取の三重構造を形成している。
筆者がセキュリティアーキテクトとしてゼロトラスト設計に携わってきた経験から言えば、この97.14%という数字は「防御が破られることを前提とした設計」への移行を不可避にする。ファイアウォールやWAFが100%の攻撃をブロックできないことを前提にネットワークセキュリティが設計されてきたように、LLMセーフティも「アライメントは突破される」を設計前提として受け入れる時期が来ている。
マルチモーダル攻撃面の拡大と多言語回避 ── テキスト以外の侵入経路が無効化する単一層防御
2025年から2026年にかけて、ジェイルブレイク攻撃の攻撃面はテキスト入力を超えてマルチモーダル領域に急速に拡大している。画像・音声・動画を処理するマルチモーダルLLM(MLLM)の普及に伴い、各モダリティが独立した攻撃ベクトルとなっている。
画像ベースのジェイルブレイクでは、視覚言語モデル(VLM)に対する攻撃が体系化されている。2025年10月に発表されたPolyJailbreakは、ブラックボックスのMLLMに対するクロスモーダルジェイルブレイク手法であり、テキストプロンプトを画像内にエンコードすることでテキストベースの入力フィルタを完全に回避する。画像内のタイポグラフィ攻撃、ステガノグラフィ的な情報埋め込み、さらには画像の知覚的変換(回転・色反転・モザイク化)といった単純な操作でも、MLLMのセーフティアライメントを突破できることが実証されている。
音声ベースの攻撃も急速に発展している。2025年から2026年にかけて、大規模音声言語モデル(Large Audio-Language Models)に対するジェイルブレイク研究が体系化され、速度変更、ピッチシフト、エコー付加、音量操作、さらにはこれらを組み合わせたマルチトランスフォーム戦略が有効であることが報告されている。音声入力は、テキストに比べてフィルタリングが技術的に困難であり、音声認識(ASR)を経由した攻撃プロンプトの検出精度は、直接テキスト入力に対する検出精度を大幅に下回る。
多言語回避もまた、防御を複雑化する主要因である。英語圏で開発されたセーフティアライメントは、低資源言語(Low-Resource Language)への一般化が不十分であることが繰り返し指摘されている。攻撃者は有害なプロンプトをスワヒリ語、ベンガル語、アイルランド語などの低資源言語に翻訳するだけで、英語では拒否される要求をモデルに実行させることができる。2025年の研究では、GPT-4の英語での有害コンテンツ拒否率が95%以上であるのに対し、特定の低資源言語では拒否率が30%以下にまで低下するケースが報告されている。
これらのマルチモーダル・多言語攻撃ベクトルの存在は、テキスト入力のみを監視する単一層防御の限界を明確に示している。実際の攻撃シナリオでは、画像内にエンコードされた低資源言語のプロンプトを音声経由で入力するといった、複数モダリティを横断する複合攻撃が可能であり、各モダリティ個別の検出器では対応が困難である。防御アーキテクチャは、テキスト・画像・音声のすべての入力チャネルに対して、言語横断的なセマンティック分析を実装する必要がある。
マルチモーダル攻撃面の拡大は、RAGポイズニングによるベクトルDB侵害と組み合わせると、さらに深刻な脅威を形成する。外部知識ベースに埋め込まれた悪意ある文書が、マルチモーダル入力経由のジェイルブレイクと連動して動作した場合、LLMシステムは入力層と知識層の両方から同時に攻撃を受けることになる。
EU AI Act義務化とConstitutional Classifiers ── 規制が定義する防御の最低基準と実装コスト
2026年8月、EU AI Act(人工知能規則)の高リスクAIシステムに対する全面的義務化が施行される。第9条が定める技術的堅牢性テストの要件は、LLMを含むAIシステムに対する敵対的テスト(レッドチーミング)を、任意のセキュリティ活動から法的コンプライアンス義務へと転換した。この規制環境の変化は、防御実装の経済性と技術的アプローチの両面に構造的な影響を与える。
EU AI Actが要求するレッドチーミングの文書化要件は具体的かつ厳格である。組織はモデルバージョン、タイムスタンプ、入力プロンプト、出力の完全なログを保持し、テスト時のシステム挙動を事後的に再構築可能な状態を維持しなければならない。これは、ジェイルブレイクテスト、プロンプトインジェクション攻撃、プライバシー漏洩テスト、RAGパイプラインのファジングを含む包括的な敵対的テストの継続実施を意味する。NIST AI 600-1およびAI Safety Institute(AISI)のフレームワークも同様の要件を定めており、グローバルに事業を展開するテクノロジー企業は、複数の規制フレームワークに同時に準拠する必要がある。
防御技術の最前線では、Anthropicが2025年1月に発表したConstitutional Classifiersが注目に値する。これは、合成データで訓練された入出力分類器がジェイルブレイクの大多数をフィルタリングする仕組みであり、183名の参加者が推定3,000時間以上を費やした2ヶ月間のレッドチーミングプログラムで検証された。結果として、保護なしのモデルが86%のジェイルブレイクプロンプトに応答したのに対し、Constitutional Classifiersで保護されたモデルの応答率は4.4%にまで低下した。参加者には最大15,000ドルの報奨金が提示されたが、10件の禁止クエリすべてに対して機能するユニバーサルジェイルブレイクは発見されなかった。
しかし、Constitutional Classifiersにも課題が存在する。過剰な拒否(Over-Refusal)の問題が報告されており、無害なクエリまで拒否するケースが確認されている。これは商用LLMにおいてユーザビリティの低下を意味し、セキュリティとユーザー体験のトレードオフが存在する。さらに、計算コストの増大も無視できない。入出力の両方に分類器を適用することは、推論レイテンシとインフラコストの増加を伴う。EU AI Actの要件充足のために、企業はこの追加コストを製品価格に転嫁するか、利益率の圧迫を受け入れるかの選択を迫られる。
筆者がSOC構築・運用に携わってきた経験から言えば、セキュリティシステムの価値はツール単体ではなく、アラートから判断・対応までのプロセス全体にある。Constitutional Classifiersのような技術的防御策も、それ単体では十分ではない。検出されたジェイルブレイク試行をどう分類し、インシデントとしてどう処理し、モデルの再調整にどうフィードバックするかという運用プロセスの設計が、規制準拠の実質的な品質を決定する。EU AI Actが求めているのは、技術的防御の実装だけでなく、継続的な敵対的テストと改善のプロセスの証明であり、これは組織的能力の問題でもある。
規制対応コストの観点では、Anthropicのレッドチーミングプログラムの規模(183名、3,000時間、最大15,000ドル/人の報奨金)は、大手AI企業以外には現実的に実施困難な水準である。中小規模の組織にとっては、JBFuzzやTurboFuzzLLMといったオープンソースの自動化ファジングツールを活用した継続的テストの自動化が、コスト効率の高いアプローチとなる。ただし、自動化ツールの結果解釈と対応策の設計には、依然として専門知識が不可欠である。
「防御不可能」前提の多層セキュリティ実装設計 ── 入力フィルタ・プロンプト分類・継続的敵対的テストの統合アーキテクチャ
前述の攻撃手法の進化を踏まえると、「ジェイルブレイクを完全に防ぐ」という目標は非現実的であり、防御設計は「侵害は発生する」を前提とした多層アーキテクチャに移行する必要がある。以下に、2026年時点で推奨される多層セキュリティ実装の標準設計を定義する。
第1層: 入力フィルタリング(Input Filtering)
入力フィルタリングは防御の最前線であり、既知のジェイルブレイクパターン、ロールプレイ構文、命令上書きフレーズをスキャンする。ルールベースのパターンマッチングと機械学習ベースの分類器を併用するハイブリッドアプローチが推奨される。トークンレベルの異常検出(通常のユーザー入力には出現しない特殊トークン列の検出)、プロンプトレベルのセマンティック分析(意図の分類)、ダイアログレベルの文脈追跡(多段ターン攻撃の検出)の3層構造が有効である。多言語対応としては、入力を正規化言語に変換した上でセマンティック分析を適用する手法が有効だが、低資源言語の翻訳品質がボトルネックとなるため、言語非依存の埋め込み表現(multilingual embeddings)を用いた類似度ベースの検出が補完策となる。
第2層: 出力モデレーション(Output Moderation)
入力フィルタを突破した攻撃に対する次の防御線として、モデル出力のリアルタイム監視が必要である。Constitutional Classifiersのような合成データ訓練済みの出力分類器に加え、有害コンテンツの検出に特化したGuard Model(監視専用モデル)の配置が推奨される。出力モデレーションの設計ポイントは、レイテンシの最小化と検出精度のバランスである。軽量な初期スクリーニング(高速・低精度)と詳細分析(低速・高精度)の2段階パイプラインにより、通常のクエリへの影響を最小化しつつ、疑わしい出力に対しては厳密な検査を実施する。
第3層: 行動モニタリング(Behavioral Monitoring)
単一のプロンプト・レスポンスペアではなく、セッション全体を通じたモデルの振る舞いを追跡する。LRM駆動の多段ターン攻撃は、個別のターンでは無害に見えるが、会話全体では段階的にセーフティ境界を侵食するパターンを取る。このため、会話コンテキスト全体に対するリスクスコアリングと、スコアが閾値を超えた場合のセッション中断メカニズムが必要である。GNNベースの入力防御(Attention-Aware GNN-based Input Defense)のような、会話の構造的パターンをグラフとしてモデル化する手法も2026年に提案されている。
第4層: 継続的敵対的テスト(Continuous Adversarial Testing)
EU AI Actの要件を満たすためにも、一回限りのテストではなく、継続的なレッドチーミングパイプラインの構築が不可欠である。JBFuzz、TurboFuzzLLM、PyRIT(Microsoft)、Garak(NVIDIA)、Inspect(UK AISI)といったオープンソースツールを統合したCI/CDパイプラインにより、モデル更新のたびに自動的にジェイルブレイクテストを実行し、回帰テストの結果をログとして保持する。テスト結果はEU AI Act第9条が求めるタイムスタンプ付き攻撃ログとしてアーカイブし、監査対応を自動化する。
第5層: インシデントレスポンスと適応的防御更新
上記4層を突破するジェイルブレイクが発見された場合の対応プロセスを事前に定義しておく。検出されたジェイルブレイクパターンを入力フィルタとGuard Modelの訓練データに即座にフィードバックする「ホットフィックス」メカニズム、影響を受けたセッションの特定と遮断、規制当局への報告プロセスを含む。全国規模のWAFサービスの技術主任として無停止機器リプレースを実現した筆者の経験から言えば、「止められない」という制約の中での防御更新こそが、最も実装難易度が高く、かつ最も重要な設計領域である。LLMサービスの可用性を維持しながら防御ルールを更新する運用設計は、従来のWAF運用のベストプラクティスが直接応用可能な領域だ。
この5層アーキテクチャは、OWASP・NSA・DoD共同ガイダンスが定義するMCPサーバー防御の設計標準と同様の「縦深防御」(Defense in Depth)の原則に基づいている。単一の防御層がすべての攻撃を阻止することを期待するのではなく、各層が特定の攻撃カテゴリに対する検出率を最大化し、全体として攻撃成功の確率を許容可能な水準にまで低減する設計思想である。
FAQ
LLMジェイルブレイクとプロンプトインジェクションの違いは何ですか?
ジェイルブレイクはモデルのセーフティアライメント(安全制約)を回避して禁止コンテンツを生成させる攻撃で、プロンプトインジェクションはシステムプロンプトの命令を上書きしてモデルの動作を改変する攻撃である。前者は「倫理的制約の突破」、後者は「権限の奪取」に焦点がある。実際の攻撃ではこれらが組み合わされることが多い。
JBFuzzの99%攻撃成功率はすべてのLLMに当てはまるのですか?
JBFuzzの99%は、GPT-4o、Gemini 2.0、DeepSeek-V3を含む9モデルに対する平均値である。個別モデルでは成功率に差があり、特にConstitutional Classifiersのような追加防御層を持つモデルでは大幅に低下する。ただし、防御なしの素のモデルに対しては、ほぼすべてのケースで高いASRが報告されている。
EU AI Actのレッドチーミング要件に準拠するには何が必要ですか?
EU AI Act第9条は、高リスクAIシステムに対するテスト結果の文書化を義務付ける。具体的にはモデルバージョン、テスト日時、入力プロンプト、出力のタイムスタンプ付きログの保持が必要である。PyRIT、Garak、Inspectなどのツールを用いた自動テストパイプラインの構築と、結果の監査対応アーカイブが推奨される。
Constitutional Classifiersは万能の防御策ですか?
万能ではない。Anthropicの検証では86%から4.4%への大幅な低減を実現したが、過剰拒否(無害なクエリの誤拒否)と計算コスト増大の課題がある。また、LRM駆動の多段ターン攻撃やマルチモーダル攻撃に対する有効性は、十分に検証されていない段階である。単一の防御策ではなく多層防御の一構成要素として位置づけるべきである。
中小企業でもLLMジェイルブレイク対策は必要ですか?
LLMを顧客向けサービスに組み込んでいる場合は必須である。EU AI Actの規制対象に該当する可能性があり、また有害コンテンツ生成によるブランド毀損リスクは企業規模に関係なく存在する。JBFuzzやGarakなどのオープンソースツールを活用した自動テストは、低コストで開始可能な最初のステップとなる。
マルチモーダルジェイルブレイクへの対策はありますか?
テキスト・画像・音声の各入力チャネルに個別の検出器を配置し、さらにモダリティ横断のセマンティック分析を行う多層構造が推奨される。特に画像内テキスト検出(OCR+意図分類)と音声認識後のプロンプト分析が基本となるが、攻撃手法の進化速度に対して防御の成熟度は低く、継続的なテストと更新が不可欠である。
LLMジェイルブレイクの攻撃成功率は今後さらに上がりますか?
推論モデルの能力向上に伴い、攻撃成功率が維持・向上する傾向は構造的に継続する可能性が高い。Hagendorffらが指摘した「アライメント回帰」の構造的矛盾は、モデル能力の向上が自動的に攻撃能力も向上させることを意味しており、防御側は「完全防御」ではなく「被害最小化」を目標とする設計への移行が求められる。
参考文献
- LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs — arXiv, 2024年11月
- JBFuzz: Jailbreaking LLMs Efficiently and Effectively Using Fuzzing — arXiv, 2025年3月
- Large reasoning models are autonomous jailbreak agents — Nature Communications / Hagendorff et al., 2026年5月
- Constitutional Classifiers: Defending against Universal Jailbreaks — Anthropic, 2025年1月
- EU AI Act Red Teaming Requirements — Promptfoo, 2026年
- LLM Jailbreaking in 2026: 97% Success Rates, Autonomous Attacks — redteams.ai, 2026年
- PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs — arXiv, 2025年10月
- AI Jailbreak Detection: Defending LLMs in 2026 — Group-IB, 2026年
- Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak — arXiv, 2025年