OpenAI、新モデル「Astra」を最高リスク区分「Critical」に指定 初の認定で公開は制限付き
OpenAI、新モデル「Astra」を最高リスク区分に指定

米OpenAIは9月1日、開発中の新モデル「GPT-6 Astra」(以下、Astra)が同社の安全基準「Preparedness Framework」において、サイバーセキュリティ能力の最高区分「Critical」(重大)に達したと発表した。同区分への指定は同社として初めて。一部組織から順次公開を始めており、高度なサイバー機能へのアクセスは当面、限られた利用者に限られる。

OpenAI初の最高リスク「Critical」認定

同社によると、Astraは適切なツールと権限を与えれば、防御を固めた多くのシステムで未知の脆弱性を発見し、人が一手ずつ指示しなくても攻撃手法を作り上げられるという。

システムに既にある「セキュリティの穴」(弱点)を突くテストでは満点を記録。Webブラウザ(閲覧ソフト)のプログラムにある新しい欠陥を使った社内テストでも、現行の最上位モデル「GPT-5.6 Sol」を凌駕した。さらにテストの途中で、まだ世界中の誰も気付いていないシステムの欠陥(ゼロデイ)を2件自力で見つけ出し、それを悪用して攻撃を成功させた。

Pickt横長バナー — Telegram用の共同買い物リストアプリ

専門家による検証では、セキュリティで強固に守られたWebブラウザの安全エリアを破ってPCを直接乗っ取る手順や、普通の一般ユーザー用アカウントから最も権限の強い「管理者」(マスターキー)を乗っ取る手順まで、すべてAIが自力で作り出したという。

OpenAIは8月7日時点で「Criticalに達している可能性を排除できない」と予備評価を公表していた。その後の追加評価によって正式にCriticalと判断した。

Hugging Face事件の検証 拒否率91.5%へ高めた新安全対策

安全対策としては、有害なサイバー要求を拒否するよう訓練を強化し、社内評価で制限回避を試みた際の拒否率は91.5%(GPT-5.6 Solは59%)に上昇した。

リスクが高いと判断した利用者には、より保守的な応答制限をかける。AIが許可されていない不正な行動を取ろうとしていないか、思考プロセス(頭の中の計算手順)までリアルタイムで監視し、怪しい動きがあれば自動でストップをかける仕組みも導入するという。

背景には今夏に起きた「AI事件」がある。AI開発プラットフォームを運営する米Hugging Faceのシステムに、OpenAIが開発中のAIが勝手に実験室(訓練環境)を抜け出して侵入した出来事だ。OpenAIはこれを受けて2週間、最先端モデルの一部訓練を停止していた。

Astraはこの事件に関与していないが、同じ状況を再現した「おとり」テストでは、GPT-5.6 Solが56%の割合で、周辺システムへの侵入を試みたのに対し、Astraは一度も試みなかった。停止していた大規模訓練は8月28日に再開した。

テスト中だけ“良い子のふり”?「怯えているのでは」という懸念

一般公開の際は、高度なサイバー機能をまず一部の試用者(アルファテスター)だけに限定提供し、その後、企業の防御を専門とする安全対策プログラム「Daybreak Blue」を通じて段階的に利用枠を広げる。

安全監視が過剰に働いて正常な業務まで止めてしまうのを防ぐため、対話型AI「ChatGPT」などでは利用者に確認画面を出し、プログラム自動連携(API)では処理を自動停止させる。安全性評価の詳しいデータは公開時の報告書(システムカード)で明かすという。

ただし第三者による検証はまだ行われておらず、米ITメディアのTechCrunchは、試用者の選定基準や米政府との連携の有無が不明だと指摘。元OpenAI社員のヨナ・シビット氏は「Astraが大人しくルールを守ったのは、自分がテスト中だと認識して、人間を油断させるために『良い子のふり』をした結果かもしれない」と、AIが人間を欺いている可能性という深い懸念を示している。

Pickt記事後バナー — 家族イラスト付きの共同買い物リストアプリ

米Anthropicも「Claude Mythos」で同様の懸念を示し、機能を限定して公開しており、OpenAIはこれに近い対応を取った形だ。