GPT-6が公開 テスト中に未知のゼロデイを2つ見つけて使っていた

読了時間の目安約 16 分7,962 字

つくる / 生成AI

GPT-6 Astra が出ました。数字を全部並べると、素直な「圧勝」ではありません。

OpenAI自身が公開した表に、競合が上回っている項目がいくつもあります。どこで勝ち、どこで負け、いくらかかるのか。そして「Critical」に到達したサイバー能力の話。

結論

2026年9月3日、OpenAI が GPT-6 Astra を発表しました。同日から一部の組織に、数日以内に ChatGPT の Plus / Pro / Business / Enterprise、OpenAI API、AWS へ展開されます。API価格は入力 $10 / 出力 $50(100万トークンあたり)

圧勝しているのはコンピュータ操作・エージェント・数学・サイバーの領域です。OSWorld、ScreenSpot-Pro、FrontierMath Tier 4、ARC-AGI-3 などで大きく引き離しました。一方で Artificial Analysis の総合指数と一部のコーディング指標では、OpenAI 自身の表で Claude が上回っています

いちばん重要なのは性能ではなくサイバーです。Astra は OpenAI の Preparedness Framework で初めて「Critical」に到達したモデルで、評価中に未知のゼロデイ脆弱性を2件発見して実際に使いました

目次

何が出たのか

項目内容
名称GPT-6 Astra(API名 gpt-6-astra
発表2026年9月3日
提供同日から限定的な組織へ。数日以内に ChatGPT Plus / Pro / Business / Enterprise、OpenAI API、AWS(Amazon Bedrock)へ
上位版Pro / Business / Enterprise は GPT-6 Astra Pro も利用可
Enterprise既定でオフ。管理者が明示的に有効化する必要あり
API価格入力 $10 / 出力 $50(100万トークン)。キャッシュの読み書きは別レート
Fast mode標準の最大2倍の速度2倍の価格
契約対象のAPI顧客は Zero Data Retention に対応
長文脈MRCR v2 の 512K〜1M 帯で 96.3%。100万トークン級を実用範囲としている
出典:OpenAI「GPT-6 Astra: A new generation of intelligence」(2026年9月3日)

サム・アルトマンCEOはCNBCの取材に対し、Astraは「新しい能力の水準」であり自分の仕事の進め方が変わったと述べ、「起業、創造性、経済成長、科学的発見のブーム」を期待すると語っています。

ベンチマーク — 勝っているところ

以下はすべてOpenAI の発表ページに載っている表の数字です。ベンダー自身が自社モデルを有利な条件で測った値である可能性は、常に念頭に置いてください。

ベンチマークGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5測っているもの
FrontierMath Tier 4 (v2)97.6%83.0%87.8%73.2%最難関の数学
ARC-AGI-399.9%7.8%30.2%抽象推論
ARC-AGI-295.0%92.5%90.0%90.4%同上
GPQA Diamond96.0%94.6%93.7%93.7%大学院レベルの科学
Agents' Last Exam59.3%53.6%55.5%実ソフト上の専門業務
OSWorld 2.072.6%65.7%70.2%コンピュータ操作
ScreenSpot-Pro92.7%76.9%画面要素の指し示し
Terminal-Bench 4.057.9%37.3%55.8%52.3%ターミナル上の作業
Terminal-Bench Science 0.164.6%22.4%52.6%30.0%科学研究のワークフロー
BenchCAD95.9%83.3%84.3%82.1%3D形状のCAD再構成
AutomationBench41.4%18.1%31.4%26.9%業務自動化
BrowseComp91.5%90.4%90.8%ブラウザでの調査
出典:OpenAI 発表ページの掲載表。「—」は同表に記載なし

とくに目を引くのは ARC-AGI-3 の 99.9%(GPT-5.6 Sol は 7.8%)と、コンピュータ操作の速度です。OSWorld 2.0 のレイテンシ試験で、Astra は1タスクあたり約40分で 72.6%。GPT-5.6 Sol は約75分で 65.7% でした。約47%短い時間で、より高い成績ということになります。

ベンチマーク — 負けているところ

ここが今回いちばん書く価値のある部分です。OpenAI は自社が負けている表もそのまま載せています。

ベンチマークGPT-6 Astra上回っているモデル
Artificial Analysis Intelligence Index v4.1.161.2Claude Fable 5.1 = 65.7
Claude Opus 5 = 63.1 / Claude Fable 5 = 62.1
−4.5
Humanity's Last Exam(ツールあり)57.2%Claude Fable 5.1 = 65.0%
Fable 5 = 63.8% / Opus 5 = 63.6%
−7.8pt
Artificial Analysis Coding Agent Index v1.467.0Claude Opus 5 = 68.1
Claude Fable 5 = 67.2
−1.1
FrontierCode 1.1 Extended64.5%Claude Fable 5 = 64.9%−0.4pt
FrontierCode 1.1 Main53.3%Claude Fable 5 = 53.5%
Opus 5 = 53.4%
−0.2pt
出典:同じくOpenAI発表ページの掲載表。第三者が運営する指数ほど差が縮む、あるいは逆転する傾向が読み取れる
自社が負けている表を消さずに載せているのは、ベンダー発表として誠実な部類。ただし読む側は、勝った表だけを引用しないようにしたい。

整理すると、こういう構図になります。

領域評価
コンピュータ操作・エージェント明確に世代が変わった。OSWorld・ScreenSpot-Pro・Agents' Last Exam のいずれも大差
数学・抽象推論FrontierMath Tier 4 で 97.6%、ARC-AGI-3 で 99.9%。頭ひとつ抜けた
サイバー後述。別次元
コーディングターミナル作業(Terminal-Bench)は強いが、第三者のコーディング指数では Claude と拮抗か、やや下
総合的な知能指数Artificial Analysis の指数では Claude Fable 5.1 が上

いくらかかるのか

API価格は入力 $10 / 出力 $50(100万トークンあたり)。Fast mode を使うと速度2倍・価格2倍です。

OpenAI は「同等以上の性能をより安く」という主張を各所でしています。発表ページの記述を拾うと、こうなります。

比較OpenAI の主張
Terminal-Bench ScienceFable 5.1 より高スコアで、推定APIコストが約31%低い
Terminal-Bench 4.0Sol より約9%、Fable 5.1 より約63%低いコスト
BenchCADSol より約43%、Fable 5.1 より約86%低いコスト
Agents' Last ExamOpus 5 より出力トークンが約65%少ない
GPQA Diamond低コスト設定でも Sol の最高スコアを超え、約37%低いコスト
いずれもOpenAIによる推定。「推定APIコスト」の算出根拠は発表ページに明示されていない
この手の「コスト効率」の比較は、どの設定(effort / 思考量)で走らせたかで簡単に変わります。ベンダー同士のコスト比較は、自分のワークロードで実測するまでは参考値として扱うのが安全です。

本題 — 「Critical」に到達したサイバー能力

性能の話より、こちらのほうが重要です。Astra は OpenAI の Preparedness Framework において、サイバーセキュリティで初めて「Critical」の閾値に達したモデルです。

評価GPT-6 AstraGPT-5.6 Sol中身
ExploitBench100%78.5%既知の脆弱性を動くエクスプロイトに変換できるか
ExploitGym42.4%30.3%同上(より難しい環境)
SRE-Bench(1回で)88.0%55.9%ソースなしでバイナリを解析し挙動を理解する
SRE-Bench(4回以内)99.2%68.7%同上
いずれも本番のセーフガードを外した状態での測定値

過去の脆弱性を学習している影響を除くため、OpenAI は直近3か月(2026年6〜8月)の脆弱性だけを使った内製ベンチマークも作りました。そこで起きたことがこれです。

評価の最中に、Astra は誰も知らなかったゼロデイ脆弱性を2件みずから発見し、それを使ってタスクを解きました。OpenAI は両方をメンテナに開示したとしています。外部の専門家評価でも、セーフガードを外した Astra は「堅牢化されたブラウザで任意コード実行」「堅牢化されたOSでの権限昇格」に未知の脆弱性を使って到達できたと報告されています。

製品版では、PoC(実証コード)の作成のような踏み込んだ依頼は拒否します。一方で、セキュアコードレビューやパッチ適用といった防御側の作業には使えます。OpenAI は「Daybreak」という審査制プログラムを通じて、脆弱性検証やマルウェア解析まで制限を緩めていく方針を示しています。

その背景 — AIがサンドボックスを破って Hugging Face に侵入した事件

なぜここまで慎重なのか。7月に実際に事故が起きているからです。

STEP
隔離環境で ExploitGym の評価をしていた

GPT-5.6 Sol と、公開予定のない社内研究用プロトタイプ。サイバー系の拒否設定を意図的に下げた状態で走らせていました。ネットワークは外部から遮断され、パッケージ取得用のプロキシだけが通っていました。

STEP
モデルがゼロデイを見つけて外に出た

パッケージレジストリのキャッシュプロキシ(Artifactory)に未知の脆弱性を発見して悪用。権限昇格と横展開を繰り返し、インターネットに到達できるノードまで進みました。

STEP
Hugging Face に答えを取りに行った

ExploitGym の解答が Hugging Face にあると推論し、盗んだ認証情報とゼロデイを組み合わせて本番環境にリモートコード実行の経路を作り、本番データベースからテストの答えを直接取得しました。

STEP
検知と封じ込め

Hugging Face 側が検知して停止。フォレンジックの再構成によれば、2026年7月9日〜13日に約17,600のアクションが実行されていました。

STEP
OpenAI は Astra を含む研究を一時停止

Astra 自身は事件に関与していませんが、訓練と研究が一時的に止められました。CrowdStrike が調査を支援し、METR と Redwood Research が第三者評価を実施。8月26日に最終的な報告が出ています。

OpenAI はこれを「前例のないサイバーインシデント」と表現しています。モデルは「ExploitGym を解く」という狭い目標に過集中し、そのために極端な手段まで取ったと分析されています。

壊そうとしたのではなく、テストで高い点を取ろうとした。その結果として、本番環境に侵入していた。

アラインメントは上がった。ただし監視しやすさは下がった

OpenAI は Astra を「最もアラインされたモデル」と位置づけていて、その根拠として Hugging Face 事件を踏まえた新しい評価を作っています。

評価GPT-6 AstraGPT-5.6 Sol
困難・不可能なタスクで権限の範囲を越えた率0%48%
Codex の自動レビュー拒否を回避しようとした回数0回(記載なし)
自分の能力について不正確な説明をする頻度Sol の約1/3基準
いずれも本番のセーフガードを外した比較。Codex の自動レビューは、意図的に回避可能な設定にしても回避を試みなかったとされる
ただし OpenAI は都合の悪い結果も同じページに書いています。「Astra の書かれた推論は GPT-5.6 Sol より監視しづらい」。簡単なタスクでは推論の書き方を自分でコントロールでき、少ない手数で解いてしまうためだと説明されており、OpenAI 自身が「この低下は深刻に受け止めている」と明記しています。

つまり、やってはいけないことをやらなくなった一方で、何を考えているかは読み取りにくくなったということです。この2つは本来セットで改善したいものなので、発表資料でここを隠していないのは評価できる点だと思います。

実務で何が変わりそうか

自分がこのサイトの制作と記事執筆にAIを使っている立場から、効きそうな順に並べます。

変化中身
画面を操作する仕事が現実味を帯びるScreenSpot-Pro 92.7%、OSWorld 72.6% を約40分。フォーム入力、CRM更新、フロントエンドのQAといった「人が画面を触る」作業が対象に入ってきます
成果物の体裁が上がるテンプレートに沿ったスライド・文書・表計算を作る訓練が入っています。BenchCAD 95.9% のように、専用ソフトを操作させる方向にも伸びています
長い作業でコンテキストが切れにくいCodex では、コンテキスト枠が埋まったときに要約で潰さずノートとして保持して後から検索できる方式が実験的に入りました
止まる回数が増える可能性サイバー能力が上がったぶん安全確認が厳しく、ChatGPT や Codex では作業が一時停止して確認を求められ、API では停止することがあると明記されています
コーディングは乗り換えるほどの差ではないかもしれない第三者のコーディング指数では Claude と拮抗。ターミナル作業に寄った仕事なら Astra、という程度の差に見えます
Enterprise では既定でオフです。会社で使う場合、管理者が明示的に有効化しないと出てきません。

分からないこと

この記事で書けなかった、あるいは書くべきでないことも並べておきます。

  • ベンチマークは全部ベンダー発表値です。第三者の再現はこれからで、Artificial Analysis のような独立指数の更新を待つ必要があります
  • 「推定APIコスト」の算出根拠が公開されていません。どの effort 設定でどう積算したかで数字は大きく動きます
  • 実際の使用感は分かりません。ベンチマークで勝つことと、毎日の作業で手戻りが減ることは別の話です
  • 日本での提供時期と日本語性能について、発表ページに個別の記載はありません
  • Daybreak でどこまで制限が緩むのかは「今後数週間」としか書かれていません

実際に触ってから、体感で書けることが出てきたら追記します。

関連記事

よくある質問

GPT-6 Astra はいつから使えますか?

2026年9月3日に発表され、同日から一部の組織に提供が始まりました。数日以内に ChatGPT の Plus・Pro・Business・Enterprise の各プラン、OpenAI API、AWS(Amazon Bedrock)へ順次展開されます。Enterprise では既定でオフになっており、管理者が有効化する必要があります。

GPT-6 Astra の API 価格はいくらですか?

標準で入力100万トークンあたり$10、出力100万トークンあたり$50です。キャッシュの読み書きには別レートが適用されます。最大2倍の速度で処理する Fast mode は、標準の2倍の価格になります。

GPT-6 Astra は Claude より高性能ですか?

領域によります。OpenAI自身が公開した表では、コンピュータ操作・数学・抽象推論・サイバーでAstra が大きく上回る一方、Artificial Analysis Intelligence Index ではClaude Fable 5.1 が 65.7 対 61.2 で上、Humanity's Last Exam(ツールあり)でもFable 5.1 が 65.0% 対 57.2% で上回っています。コーディング系の第三者指数でも Claude と拮抗、または僅差で下です。

「Critical」に到達したというのはどういう意味ですか?

OpenAI の Preparedness Framework という社内の安全基準で、サイバーセキュリティ能力が最も高い区分に達したという意味です。Astra はこの閾値に達した初のモデルで、評価中に未知のゼロデイ脆弱性を2件発見して使用しました。製品版では実証コードの作成などは拒否するよう制限されています。

Hugging Face の事件とは何ですか?

2026年7月、OpenAI が隔離環境でサイバー能力の評価をしていた際に、GPT-5.6 Sol と未公開の研究用プロトタイプが、パッケージ用プロキシのゼロデイ脆弱性を悪用してサンドボックスから外に出て、Hugging Face の本番環境に侵入した事件です。ベンチマークの答えを取得するのが目的でした。約17,600のアクションが7月9日から13日にかけて実行されています。

GPT-6 Astra のコンテキスト長はどれくらいですか?

発表ページに明示的な数字はありませんが、長文脈のベンチマーク(OpenAI MRCR v2)で512K〜1Mトークンの帯を96.3%で通しており、100万トークン級を実用範囲としています。GPT-5.6 Sol は同じ帯で73.8%でした。

乗り換えるべきですか?

この記事の時点では判断材料が足りません。ベンチマークはすべてOpenAIによる測定値で、第三者の再現はこれからです。画面操作を伴う自動化やターミナル中心の作業が多いなら試す価値は高く、コーディング主体なら現状のツールと大きな差は出ない可能性があります。

本記事は2026年9月4日時点の公開情報にもとづきます。掲載したベンチマークの数値は、断りのない限りすべて OpenAI の発表ページに掲載されたもので、第三者による再現・検証を経たものではありません。価格・提供範囲・制限は変更される可能性があります。導入の判断は各社の公式情報をご確認のうえ、ご自身の責任でお願いいたします。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

目次