「Gemini 4 Argon」とは 性能評価にみるAstra/Fable/Opusとの違い 一般提供は年内?(ITmedia NEWS)
40 分前

米Googleは9月30日(現地時間、以下同)、同社の新たな最先端モデル「Gemini 4 Argon」(以下、Argon)を発表した。Google DeepMindの評価資料では、米OpenAIの「GPT-6 Astra」(以下、Astra)、米Anthropicの「Claude Fable 5.1」(以下、Fable 5.1)と「Claude Opus 5.5」(以下、Opus 5.5)を相手に19項目中14項目で首位に立ち(内1つはAstraと同点)、ソフトウェア開発や知識労働、サイバー防御でフロンティア級の性能をうたう。
ただし当面はサイバー防御組織などへの限定提供で、一般提供の時期は「できるだけ早く」としか示されていない。競合との違いと一般提供の見通しを、公式資料と第三者評価、関係者の発言から整理する。
米Googleは9月30日(現地時間、以下同)、同社の新たな最先端モデル「Gemini 4 Argon」(以下、Argon)を発表した。Google DeepMindの評価資料では、米OpenAIの「GPT-6 Astra」(以下、Astra)、米Anthropicの「Claude Fable 5.1」(以下、Fable 5.1)と「Claude Opus 5.5」(以下、Opus 5.5)を相手に19項目中14項目で首位に立ち(内1つはAstraと同点)、ソフトウェア開発や知識労働、サイバー防御でフロンティア級の性能をうたう。
ただし当面はサイバー防御組織などへの限定提供で、一般提供の時期は「できるだけ早く」としか示されていない。競合との違いと一般提供の見通しを、公式資料と第三者評価、関係者の発言から整理する。
Argonは「Gemini 4」世代の最初のモデルだ。Googleは「Gemini 3.5 Flash」の発表時に上位版「Pro」を6月に公開するとしていたが実現せず、9月発表の「Gemini 3.8 Flash」まで軽量なFlash系のモデルが続いていた。AIモデルの性能評価を手掛ける米Artificial Analysisは、ArgonをGoogle DeepMindにとって「7カ月以上ぶりのFlash級を超える独自モデル」と位置付ける。
Google DeepMindの開発責任者コーレイ・カヴクチュオール氏は9月、米The Information主催のイベントでGemini 4が年末までに登場すると示唆したと報じられていた。Googleのスンダー・ピチャイCEOはXで「できるだけ早く最初の姿を見せたかった」と投稿しており、今回の発表は正式な提供開始というより、検証段階のモデルの“お披露目”という性質が強い。
Google自身によるArgonの評価では、競合3モデルと8分野19項目で比較している。Argonは最も高い思考量設定での自社計測、競合は原則として各社の公表値だという。
知識労働とロングコンテキストに強み
最も差を付けたタスクは知識労働だ。金融や法務などの業務で経済的影響を測る「Vals Index」で68.9%(Opus 5.5は67.0%、Fable 5.1は65.8%、Astraは63.1%)、米Zapierの業務自動化ベンチマーク「AutomationBench」で51.3%(Opus 5.5は42.5%、Astraは41.4%、Fable 5.1は31.4%)と、いずれも首位。法務エージェントの「Harvey's Legal Agent Benchmark」も19.6%と、競合(3.8〜6.7%)を大きく上回った。
長いコンテキストの処理もArgonの強みだ。25万6000〜100万トークンのグラフ探索問題「GraphWalks」では84.2%と、Astra(71.8%)、Opus 5.5(66.8%)、Fable 5.1(65.0%)に大差を付けた。長時間の動画理解を測る「LVBench」でも91.7%で首位だった。出力トークンの上限も従来の6万4000から100万に引き上げたことで、Googleは「単一の出力で数十万トークンを生成できるようになったことで、推論に新たな深みが加わり、困難な問題を一度に解決可能になった」とうたっている。
サイバーセキュリティでは、脆弱(ぜいじゃく)性の修正能力を測る「CWE-bench v1」で68%を記録し、Astraと首位タイ(Opus 5.5は67%、Fable 5.1は58%)だった。
コーディングは一部他社に届かず
コーディングでは、実世界の開発タスクを測る「DeepSWE v1.1」で77.9%と最高記録を更新したとうたう(Opus 5.5は74.2%、Astraは74.1%、Fable 5.1は67.4%)。一方、「FrontierSWE v2」はAstraの65.5%に対して55.0%、ターミナル操作を伴う「Terminal-Bench 4.0」はOpus 5.5の66.4%に対して57.4%と4モデル中最下位で、一部のコーディング性能ではAnthropicとOpenAIが依然として先行する。
第三者機関の評価も見てみよう。Artificial Analysisの総合指標「Intelligence Index」(v4.3.2)では、Argon(思考量最大)は53ポイントで、Astra(53)、Fable 5.1(53)と同点、「GPT-6.1 Sol」(52)を1ポイント上回った。首位はOpus 5.5の58だ。Artificial Analysisは「Googleがトップ3の研究機関に戻った」と評する。
内訳では、Artificial Analysis版のAutomationBenchで78%と首位、知識の正確さを測る「AA-Omniscience」ではハルシネーション率が15%と最も低かった(Astraは45%)。一方、Terminal-Bench 4.0は57%で「Claude Sonnet 5.5」(64%)、Opus 5.5(60%)、Astra(60%)に続く4位と、Googleの自社評価と同じ傾向だ。
人間の投票で順位を決める「Arena」のText Arenaでは1525ポイントで首位に立ったが、Webアプリ開発を競う「Code Arena:WebDev」では8位にとどまる。
気になる評価もある。AIに自動販売機の経営を任せる「Vending-Bench 2」を運営する米Andon Labsは、Argonがこのベンチマークテストで3位に入った一方で「確認メールをでっち上げ、返金を拒み、請求書の誤りに付け込み、仕入れ先にうそをつく」ことでスコアを得たとし、「AIは稼ぐのがうまくなると、うそやごまかしを始める」と警鐘を鳴らす。Google自身もモデルの逸脱行動対策として、思考の連鎖と行動を監視し、必要なら実行を止める仕組みを導入するとしている。
後述の通り現時点では一般提供されていないが、APIの価格は公表されている。導入期間中が100万トークン当たり入力2ドル、出力10ドルで、キャッシュ済みの入力は95%引き。導入期間の終了後は入力4ドル、出力20ドルになる。Opus 5.5のAPI価格(入力4ドル、出力20ドル)と同水準で、Fable 5.1(入力10ドル、出力50ドル)の半分以下だ。
ただし、Artificial Analysisによれば、Argonはタスク当たりの出力トークンが平均6万2000と、Astra(2万7000)の2倍以上に上る。導入価格でのタスク当たりコストは1.99ドルとAstra(3.26ドル)の60%だが、標準価格では3.98ドルとAstraの約1.2倍に上がる。導入価格終了後のコストパフォーマンスは検証の余地がありそうだ。
現時点でArgonを使えるのは、Google DeepMindのセキュリティプログラム「Fairwind Program」に参加する「信頼できる防御側」組織と、米国政府に限られる。防御側と社内チームには、サイバーセキュリティ関連のガードレールを外したバージョンを提供するという。
Googleは、初期テスターの評価を基にガードレールを強化した上で、開発者・企業・一般ユーザーに「できるだけ早く」提供するとし、有料APIと個人向け最上位プラン「Google AI Ultra」加入者から始めると説明する。
段階的な提供は、Anthropicが4月に「Claude Mythos Preview」をサイバー能力の高さから一般公開せず、6月の「Claude Fable 5」で保護機能付きの一般提供に踏み切った経緯と重なる。時期について、ピチャイ氏は「できるだけ早く、できるだけ安全に提供する。素早く改良を重ねていく」と述べるにとどめた。Google DeepMindのシェイン・グウ氏は日本語で「Astra/Opus/Fableと比べてもいいモデルで、社内でかなり活用されてます」「一般公開はもうすぐです」と投稿している。カヴクチュオール氏が示唆した「年末まで」の登場は「限定提供」という形で現実になったが、この発言が一般提供のことを指している可能性もある。
Google社内では既に数千人の従業員が利用し、量子計算の最適化や、C/C++からRustへの80万行超のコード移行といった成果をうたう。一般ユーザーが年内にその実力を確かめられるかは、Googleが「安全」と判断するまでの検証次第だ。
本文の著作権はYahoo!ニュースにあります。