Dellows News

チェック・ポイントが新手法PuzzleMaskを発見 AIスクリーニングを迂回

チェック・ポイント・ソフトウェア・テクノロジーズの脅威インテリジェンス部門であるチェック・ポイント・リサーチ(CPR)は、新たなプロンプトインジェクション手法「PuzzleMask」を発見したことを明らかにしました。この手法は、自然な文章の中にポリシー違反の指示を埋め込むことで、外部の簡易なAIゲートキーパーをすり抜け、高性能なターゲットモデルに到達させます。実運用で一般的な多層防御アーキテクチャにおいて、軽量な審査モデルと高性能な推論モデルの能力差が悪用可能な攻撃対象になり得ることが示されました。

PuzzleMaskの手法とモデル間の能力差を突く仕組み

PuzzleMaskは、Base64エンコーディングや不可視文字、絵文字、不自然な書式といった従来の手法を用いず、自然な文章だけを使って悪意ある指示を隠すプロンプトインジェクション手法です。

この手法は、高性能なターゲットモデルが処理を行う前に、高速かつ低コストのモデルがポリシーに基づいて入力をスクリーニングする「ゲートキーパーからターゲットへ」という構成を標的としています。ターゲットAIモデルの安全性やアライメントを直接突破するジェイルブレイク手法とは異なり、外部ゲートキーパーによる入力スクリーニングを迂回して隠された指示をターゲットモデルへ届かせる仕組みとなっています。

CPRが通常の文章の中にポリシー違反ペイロードを埋め込んで実施したテストでは、モデルごとに明確な差が現れました。

AIゲートキーパーとしてテストされたgpt-4o-mini、gpt-oss-safeguard、claude-3-haiku、llama-guard3の4つのモデルは、難読化されていない通常の同一ペイロードは正しく検知したものの、PuzzleMaskを用いたプロンプトに対しては23回の試行中一度も検知できず、回避率は100%となりました。

一方、ターゲットモデルとして高い推論能力とコードインタープリターへのアクセスを持つgpt-5-thinkingを使用したところ、18回の試行のうち17回(約94%)で隠されたペイロードを復元して実行しました。成功したケースではいずれも1分以上の推論と複数のコードスクリプト実行を必要としました。なお、AnthropicのOpusクラスのモデルは例外として毎回処理を停止しており、処理中の難読化されたプロンプトを検出する分類システムが関係している可能性があるとしています。

入力監視だけでなく推論や出力の監視が課題に

チェック・ポイント・リサーチのリサーチ責任者であるイーライ・スマッジャ(Eli Smadja)は、有害な指示が普通のテキストに隠されている可能性があり、インプットの検査だけでなくAIモデルの推論や行動についても監視する必要性を指摘しています。

チェック・ポイントはAnthropic、Meta、OpenAIにこの手法を開示し、緩和策を提示しました。対策として、信頼できない入力の言い換え、定量的・自己参照的な表現を検知するためのポリシー強化、出力と推論の監視、ゲートキーパーの能力をターゲットに合わせることなどが挙げられていますが、それぞれレイテンシの増加や誤検知、コストなどのトレードオフを伴うとしています。

企業概要

  • 社名:チェック・ポイント・ソフトウェア・テクノロジーズ株式会社(日本法人)
  • 設立:1997年10月1日
  • 所在地:東京都港区
  • URL:https://www.checkpoint.com/jp/

本記事はチェック・ポイント・ソフトウェア・テクノロジーズの発表をもとに作成しています。

アクセスランキング

今日

1週間