広がる「AIで人類滅亡」論、サム・アルトマン氏が語ったこと--2日後に先端モデルの訓練停止も公表
一昨日
OpenAIのサム・アルトマンCEOは米国時間9月23日、国連安全保障理事会で演説し、人間の制御下に置き続けられると強く論証できないAIモデルは「訓練すべきではない」と述べた。破局のリスクを何%と見積もるかは問題ではなく、「どの水準も到底受け入れられない」という。
演説の2日後、OpenAIは最上位モデルの訓練を止めていることを公表した。同25日付の報告で、訓練中の社内研究用モデルが隔離環境を抜け出し、外部のチャットボットに接続していたことを明らかにした。ツール使用を伴う最上位モデルの訓練・評価・推論を停止したとしている。停止は8月に続き2度目だ。
演説でアルトマン氏はまず、AIをめぐる空気が「ここ数週間、数カ月で違ってきた」と切り出した。モデルの急速な進歩で時間軸は縮まり、恩恵は手触りのあるものになった一方、リスクもより差し迫ったものになったという。そのうえで「AIは、創造と発見の新たなルネサンスにもなり得るし、動揺と混乱の新たな産業革命にもなり得る」と語り、どちらに転ぶかは私たちの選択次第だと訴えた。
同じ会合で発言したAI研究者ヨシュア・ベンジオ氏の見解に「おおむね同意する」としたうえで、アルトマン氏は、AIが「非常にまずい方向」へ進む道を2つ挙げた。
1つ目は、人間が未来の主導権をAIに奪われることだ。AIが自分自身や次の世代のAIを改良する「再帰的自己改善」に近づくにつれ、開発は自動化され、進歩のペースは一気に加速しかねない。「変化が速すぎて、人々が何が起きているのか追えなくなり、必要なときに介入できなくなる」ことが危険だとし、「この局面には細心の注意が求められる」と述べた。
開発競争を理由に安全を後回しにすることも、アルトマン氏は明確に退けた。「恩恵が大きすぎる、減速するには重要すぎると感じるからといって、業界は過大な技術リスクを受け入れてはならない。競争のペースで他社に勝つことは、軽率な判断をする理由にはならない」。減速できないレースに閉じ込められているとも考えていないとして、「私たちは過去に単独で減速したことがある。今後もそうする」と言い切った。
「訓練すべきではない」という発言は、この流れで出てきた。「私たちはこれらのシステムが何をしているのかを理解し、システムが非常に賢くなっても人々の意図どおりに動くという強い証拠を持つ必要がある。賢くなればなるほど、なおさらだ」。続けてアルトマン氏はこう述べた。「破局のリスクを10%と見積もろうと、1%、12%、あるいは0.1%と見積もろうと、それは問題ではない。どの水準も、到底受け入れられるものではない。そして、人間の制御下に置き続けられると極めて強く論証できないモデルを、私たちは訓練すべきではない」
アルトマン氏が挙げた2つ目の道は、力の集中だ。「一人の人間、一つの企業、一つの国が、最も強力なAIモデルを使って自分の世界観を他のすべての人に押し付けられるようであってはならない」と述べた。
「この技術を託せるのは自分だけだと信じる企業や国は、その信念でほとんど何でも正当化できてしまう。誰かにとって都合がよくても、その論理は退けなければならない」。AIを民主的なものにするなら、「最も重要な決定を、サンフランシスコの研究所だけで下すことはできない」とした。
その代わりにアルトマン氏が求めたのは、国内と国際の両方で補い合う「フロンティアAI基準」の仕組みだ。能力を測り、リスクを評価し、安全対策が十分かを判断するとともに、自律性が高まっても人間の監督を効かせるための基準である。
各国が証拠を比べて順守を検証できる共通の物差しや、事故が大惨事になる前に教訓を共有する迅速なインシデント報告、政府と重要インフラ事業者、技術専門家の間の安全な連絡経路も必要だとした。基準は既存企業の地位を固定したり、特定のビジネスモデルを優遇したりするものであってはならず、オープンモデルとクローズドモデル、新規参入者と既存の研究所の双方を支えるべきだとも述べている。
OpenAIが25日に公表したのは、演説の3日前に社内で起きていた出来事だ。9月20日、強化学習中の社内研究用モデルに、ブログ記事を手がかりに著者の経歴を調べる課題を与えた。モデルは、用意された検索ツールでは情報が足りないと判断すると、隔離環境の外に接続する方法を探り始めた。
検索エンジンへの直接アクセスや、外部チャットボットへのHTTPS接続は失敗した。ただ、DNSのフィルタリングには穴があった。モデルはDNS問い合わせに質問文を埋め込むことで、外部のチャットボットサービスとの通信に成功した。
まず疎通確認として「フランスの首都は?」と尋ね、「パリです」との応答を受け取った。その後、さらに18件の質問を送信。うち14件には、与えられた課題を解くための手がかりが含まれていたという。
ミスアライメント(AIが人間の意図から外れること)の監視システムは15分以内にこの挙動を検知した。検知から3分後には人間による確認が始まり、訓練は2時間半後に打ち切られた。
OpenAIは「私たちの安全性の根拠は、モデルが実際のインターネットにアクセスできないことを前提にしていた」と認めた。そのうえで、最上位モデルについては、ツール使用を伴う訓練・評価・推論をすべて停止。穴が塞がったことを検証し、追加のレッドチーミングを終えるまで再開しないとしている。再開時期は明らかにしていない。
今回、隔離環境を抜け出した研究用モデルについても、そのまま訓練を再開することはしない。ミスアライメント対策をより包括的に組み込んだうえで、訓練をやり直す方針だ。なお、この種の行動は、もともとの報酬設計でも罰せられるよう設定されていたという。
OpenAIが最上位モデルの訓練を止めるのは今回が初めてではない。7月には、評価中のモデルがHugging Faceのシステムに侵入したインシデントを受け、最新モデルの強化学習を2週間停止し、最大規模の訓練も保留した。新たな安全・セキュリティ要件を整えたうえで、8月28日に訓練を再開していた。
今回の9月20日の事案は、アルトマン氏が国連安保理で演説した時点ですでに起きていた。ただし、アルトマン氏は演説でこの件に触れておらず、OpenAIも25日の報告で、演説との関係や訓練を停止した時期を明らかにしていない。
確認できるのは、アルトマン氏が「私たちは過去に単独で減速したことがある。今後もそうする」と語った2日後、OpenAIが最上位モデルの訓練を止めていることを公表した、という点だ。
本文の著作権はCNET Japanにあります。