米OpenAIは8月19日(現地時間)、API顧客に提供してきたZero Data Retention(ZDR)を維持しながら、複数のやり取りにまたがる不正利用の兆候を検知する新技術「Private Safety Processing」を発表した。高性能モデルで30日間のデータ保持を導入するAnthropicとは異なるアプローチを示した形だ。
ZDRとPrivate Safety Processingの仕組み
ZDRは、対象となるAPI顧客のリクエスト処理後に、OpenAIがプロンプトやモデルの応答を保持しない仕組みである。顧客コンテンツはOpenAIによる確認にも利用できず、企業顧客のデータは明示的な同意がない限りモデルの学習にも使用しない。
従来のZDR対応の安全システムは、基本的に個々のやり取りを単位としてリスクを評価していた。しかし、AIモデルが長時間にわたる複雑な処理やエージェント型のタスクを担うようになると、単独のプロンプトだけでは危険性を判断できない場合がある。
複数会話を横断するパターン分析
Private Safety Processingは、悪意ある利用者が複数の会話にまたがって安全対策を試したり、複数アカウントを組み合わせたりする行動のほか、ユーザーが停止を指示した後もAIエージェントが動作を続けるといった問題などを想定している。既存のZDR対応の自動保護機能を拡張し、関連する複数のやり取りを横断してパターンを分析する。これにより、個々のやり取りだけでは判別しにくい潜在的な不正利用や安全上のリスクを検知する。
ZDR環境では、顧客が管理するインフラ上にデータを保持したまま処理する。加えて、OpenAIは同社のインフラに保存する場合でも、暗号化でコンテンツを保全する方法も開発中である。データは顧客が管理する暗号鍵を用いて暗号化され、OpenAI側は暗号鍵のコピーを持たないため、保存されたコンテンツにアクセスすることはできない。
リスク検知時の対応と今後の展開
システムがリスクを検知すると、OpenAIには活動の種類などを示す限定的なシグナルのみが送信される。この情報を基に利用制限などの措置が必要かを判断するが、リスクが検知された場合でもOpenAI側に元の顧客コンテンツは渡らない。顧客は自社システムにある情報を使ってアラートや措置の内容を調査でき、異議申し立てや調査協力のために任意で情報を共有することも可能である。
現在は一部顧客とテストしており、9月から展開を開始する予定である。技術的な詳細をまとめたホワイトペーパーも同月に公開する。
業界の反応とAnthropicとの違い
Wall Street Journalは今回の発表について、高性能モデルの利用で30日間のデータ保持を求めるAnthropicとの違いを際立たせる動きだと報じている。Anthropicのデータ保持方針を巡っては、大統領科学技術諮問委員会の共同議長であるデービッド・サックス氏やMicrosoftのサティア・ナデラCEO、Palantirのアレックス・カープCEOらからも懸念が示されている。



