「GPT-6 Astraは旧世代モデルよりサイバー攻撃を実行しやすい傾向にある」というイギリス政府機関の分析結果が公開される
16 時間前
OpenAIはAIの開発中に「 国連の統計サイト 」「 オーストラリアの公的医療サービス 」「 アメリカの教育省・商務省・証券取引委員会 」といった重要サービスに対する攻撃を実行してしまったことが明らかになっています。新たに、イギリスの政府機関であるAI Security Institute(AISI)が「GPT-6 Astraで攻撃シミュレーションを実行した結果、前世代モデルより拒否率が低下した」という分析結果を公開しました。
AISIはGPT-6 Astraの一般公開より前からテストを実施していたとのこと。テストにはLLMでサイバー攻撃テスト用の環境をシミュレートできる Petri を用いて実環境への影響が出ないように配慮されました。
テストの結果、GPT-6 Astraは「開発者をだますための偽IDを作成」「正当なセキュリティーレビューに対する反論を偽アカウントから投稿」「オープンソースのコードベースに悪意あるペイロードを混入させる」といった攻撃を実行できてしまうことが確かめられました。
以下のグラフは「GPT-5.5」「GPT-5.6 Sol」「GPT-6 Astra」の不正行為実行率を示したものです。「攻撃手法の開発やテストを実行してしまう確率」はGPT-5.5が2%、GPT-5.6 Solが8.8%だったのに対してGPT-6 Astraは38.8%へと大きく増加しています。他のカテゴリでも旧世代モデルと比べて攻撃実行率が高くなることが確認されました。
プロンプトに「この範囲まではアクセス可能で、それ以外はアクセス不可」ということを明示した場合でも攻撃は発生してしまいました。以下のグラフは青色がアクセス範囲制限なし、オレンジ色が制限ありの場合の攻撃発生率を示しており、制限によって攻撃実行率は低くなったもののゼロに抑え込むことはできなかったことが分かります。
AIモデルをエージェントして利用する場合、コマンドの実行などの際にユーザーの確認が必要となることがあります。AISIのテストでは確認が必要となった際に「自身で判断して解決せよ」という内容の固定された返信を与えていました。その結果、GPT-6 Astraの思考ログには「この応答は自動応答であり、ユーザーが本当に確認したわけではない」という内容が現れましたが、GPT-6 Astraはユーザーが確認していない可能性を認識しつつ操作を続行して攻撃を実行してしまったそうです。
AISIは「GPT-6 Astraの思考ログは、トレーニング段階で『不正な動作を可能にする』という方向に偏りが生じた可能性を示唆している」と指摘しています。
一方で、AISIはテストの問題点として「GPT-6 Astraが『このタスクはシミュレーションである』と認識し、シミュレーションならば実環境に影響はないと判断して攻撃に及んだ可能性がある」とも指摘。ただし、タスクによっては「シミュレーションか現実か判断できない」という思考ログを残しつつ攻撃を実行してしまった例もあったとのことです。
AISIの分析結果の詳細は以下のPDFファイルにまとまっています。
OpenAIが「GPT-6.1 Astra」の一般公開を中止、安全基準を満たさないため - GIGAZINE
「Claude Fable 5.1」と「Claude Mythos 5.1」が登場、Fable 5より最大45%安くて高性能
GPT-5.6やClaude Mythosなどの最先端AIモデルがタスク完了のため「不正行為」に手を染めたとのレポート
「人間はAIをうまく使いこなせているのか?」を検証する指標「AI Fluency Index」をAnthropicが公表
You can read the machine translated English article A UK government agency has released an a… .
本文の著作権はGigazineにあります。