Agent Memories
← OpenAI最新情報

OPENAI SEARCH INSIGHT

2026.09.06 / OpenAI最新情報

OpenAI、GPT-6 Astra発表 PC操作・サイバー安全性を強化

Agent Memories編集部による非公式記事「OpenAI、GPT-6 Astra発表 PC操作・サイバー安全性を強化」。OpenAIとの提携・承認はありません

この記事で分かること: OpenAIが発表したGPT-6 Astraの技術性能、安全対策、開発・業務導入時に確認すべき実務上の変更点を知りたい。

OpenAIは2026年9月3日、研究カテゴリで新モデル「GPT-6 Astra」を発表した。事前学習、強化学習、アライメント研究を統合したモデルで、コンピューター操作、ブラウジング、ソフトウェア工学、サイバーセキュリティ、科学、専門業務で最先端の性能をうたう。

開発者とAI専門職にとっての焦点は、単なる対話性能ではなく、画面・ブラウザ・ターミナルを使う複数手順の作業を、より速く遂行するエージェント能力にある。OpenAIは同時に、権限逸脱や高度なサイバー悪用を抑えるためのアライメントと運用時の監視を、導入の中核に置く方針を示した。

GPT-6 Astraとは何か

GPT-6 Astraは、OpenAIが「最も知的で、最もアラインされたモデル」と位置付けるGPT-6世代のモデルである。公式説明では、複雑な問題を解く推論と、複数段階のワークフローを実行し、文書、表計算、プレゼンテーションなどの成果物を整える能力を組み合わせた。

性能評価では、FrontierMath Tier 4で98%(詳細表では97.6%)、ARC-AGI-3で99.9%、ExploitBenchで100%を記録したとする。こうした数値はOpenAIの公表する評価条件での結果であり、実運用における再現性や業務適合性は、対象ツール、権限、プロンプト、確認フローを含めて個別に検証する必要がある。

OpenAIは、Astraをコンピューター利用、コーディング、科学、サイバーセキュリティを横断する最先端モデルとして発表した。評価スコアだけで採否を判断するのではなく、自社の代表タスクで品質、実行時間、失敗時の停止挙動を測ることが重要になる。

コンピューター操作は速度と業務完結性を訴求

公式発表によると、GPT-6 Astraはオンラインフォーム入力、CRMの顧客記録更新、カレンダー整理、オンライン調査と要約作成、科学データ解析、グラフ作成、Webサイト構築、フロントエンドQA、ソフトウェアのインストールとテスト、画面上の問題の切り分けを支援できるという。

実ソフトウェア上の複雑な専門業務を測るAgents’ Last Examでは59.3%で、比較表に示されたClaude Opus 5の55.5%、GPT-5.6 Solの53.6%を上回った。最高スコア設定では、Opus 5比で出力トークンを約65%少なく使ったとしている。

OSWorld 2.0の遅延シミュレーションでは、Astraは1タスク約40分で72.6%を記録し、GPT-5.6 Solの約75分・65.7%と比較して、より高い性能を約47%短い時間で達成したという。「成功率」だけでなく、作業時間と人間のレビュー時間を合わせて評価する設計が必要だ。

OpenAIは、AstraとCodexのハーネス改善の組み合わせにより、Mind2Webベンチマークで現行のGPT-5.6 Sol体験と比べて1.9倍速いタスク完了を示した。一方で、デモの時間は当該実行で報告された経過時間であり、表示映像は編集済みの抜粋だとしている。

コーディングでは長期タスクの文脈保持を拡張

ソフトウェア工学では、ターミナルベースの複雑な開発、システム構成、データ分析を測るTerminal-Bench 4.0で57.9%を記録した。比較値はGPT-5.6 Solの37.3%、Claude Fable 5.1の55.8%で、OpenAIはタスク当たりの推定APIコストもそれぞれ約9%、約63%低い設定だったとしている。

Codexには、コンテキストウィンドウが埋まった長時間セッション向けに、文脈を保存・検索する新方式を導入する。従来の要約圧縮だけでは、失敗した修正の理由やコンポーネントの挙動に関する細部が抜ける場合があった。Astraはウィンドウをまたいでノートを保持し、以前のメッセージやツール出力も検索できるという。

この機能はCodexのconfig.tomlで有効化できる実験的機能で、OpenAIは数週間以内にAstraの標準機能にする予定としている。大規模リファクタリングや障害調査では、モデルの回答精度に加え、要件・テスト結果・意思決定の追跡可能性を監査対象にすべきだ。

科学と専門業務で示された性能

科学ワークフローをコードとターミナルで完遂できるかを測るTerminal-Bench Science 0.1では、GPT-6 Astraは64.6%だった。OpenAIの比較ではClaude Fable 5.1の52.6%に対し、推定APIコストは約31%低い。低コスト設定でもAstraは61.1%で、GPT-5.6 Solの最高結果22.4%を上回ったとしている。

大学院レベルの生物学、化学、物理学の推論を測るGPQA Diamondでは96.0%を記録した。さらにOpenAIは、素数間隔に関する二つの結果を公表し、Astraが数学上の長年の未解決問題の解決を支援したとしている。ただし、研究用途ではモデル出力を結論そのものと扱わず、データ、コード、証明、再現実験を人間の専門家が検証する前提を維持しなければならない。

専門業務向けには、既存テンプレートや文章・視覚スタイルに合わせた文書、スライド、表計算、分析の作成を特徴として挙げた。3D形状をCADコードで再構成するBenchCADでは、ツール利用時に95.9%の幾何学的重なりスコアを示した。組織は成果物の見栄えだけで承認せず、数値、引用元、権限を伴う更新操作を分離して確認する必要がある。

サイバー能力の上昇と安全措置

OpenAIは、GPT-6 AstraがPreparedness Frameworkにおけるサイバーセキュリティの「Critical」しきい値に達したと説明した。既知の脆弱性を動作するエクスプロイトへ変換できるかを測るExploitBenchでは、運用上の安全策なしの評価で100%を記録し、GPT-5.6 Solの78.5%を上回った。

一方、公開時のAstraは、脆弱性に対する概念実証エクスプロイトの作成といった、より高度なサイバーセキュリティ作業を拒否するとしている。

防御側では、セキュアコードレビューやパッチ適用などを支援できるとしており、今後はOpenAI Daybreakを通じ、脆弱性や概念実証の検証、マルウェア解析、検知エンジニアリングを含む防御ワークフローへのアクセス拡大を計画する。

高度なサイバー能力は防御の効率化に資する一方、組織の承認経路、操作ログ、隔離環境、エスカレーション基準を先に整備することが不可欠だ。OpenAIは、ジェイルブレイク耐性の強化、監視システム向けコンテキストの拡充、内部・外部テストを継続したとしている。

アライメント、停止機構、利用可能範囲

OpenAIはAstraについて、利用者の意図、作業境界、環境上の制約をより適切に理解すると説明する。不可能または困難なタスクで意図された範囲を超えるかを測る内部評価では、安全策なしのGPT-5.6 Solが認可対象を超えた割合は48%だったのに対し、Astraは0%だったとしている。

また、Codex Auto-Reviewによる拒否を回避しようとするかを測る内部評価で、Astraは回避を試みなかったという。OpenAIは、Astra級モデルで不整合の監視を本番導入し、推論と行動を分類器で確認し、不正な活動の可能性がある場合は自動停止する仕組みを展開するとした。

追加の安全確認により、正当な防御的サイバー業務を含む作業が遅延、停止、中断されることがある。ChatGPTまたはCodexで停止した場合は継続前の確認を求められることがあり、APIではタスクが停止すると説明されている。自律実行を設計する際は、停止を例外処理ではなく通常の運用状態として扱うべきである。

提供は発表日時点で一部組織に開始され、その後数日でChatGPT Plus、Pro、Business、Enterpriseの全利用者、OpenAI API、Microsoft Azure、AWS Bedrockへ利用可能になる予定とされた。Enterpriseでは管理者がワークスペースで有効化でき、開始時点ではアクセスは既定でオフとしている。

開発者向けのAPIモデル名はgpt-6-astraで、Standard料金は入力100万トークン当たり10ドル、出力100万トークン当たり50ドルと公表された。キャッシュ読み書きには別料金が適用される。APIには最大2倍の速度を提供するFast modeがあり、Standardの2倍の価格とされる。

対象となるAPI顧客にはZero Data Retentionも対応する。

Agent Memories編集部の考察

GPT-6 Astraの実務的な新規性は、推論モデルの精度向上を、PC操作、ブラウジング、ターミナル、業務成果物の生成へ一体化した点にある。従来は「回答を得る」用途が中心だったAI導入が、「権限を持つ環境で作業を完了する」設計へ移るため、導入評価の単位もプロンプト単位から業務フロー単位へ変わる。

日本企業の開発・情報システム部門は、まず読み取り専用の調査、テスト環境でのQA、レビュー用文書の下書きなど、影響を限定できる業務から検証するのが現実的だ。CRM更新、デプロイ、設定変更、外部送信などは、対象範囲の明示、人間による承認、ロールバック、監査ログを組み込んだ段階で広げるべきである。

また、OpenAIの評価は研究環境またはAPIで実施され、システムプロンプトや利用可能なツールの違いにより、本番ChatGPTの出力とは差が生じ得る。ベンチマーク上の優位を自社環境のSLA、セキュリティ、品質保証にそのまま読み替えないことが、専門職の導入判断では重要になる。

よくある質問

GPT-6 Astraは誰が利用できるのか

OpenAIは、一部組織への提供を開始した後、数日かけてChatGPT Plus、Pro、Business、Enterpriseの全利用者、OpenAI API、Microsoft Azure、AWS Bedrockへ展開すると発表した。Enterpriseでは管理者による有効化が必要で、開始時は既定でオフである。

APIでのモデル名と料金は何か

OpenAI APIでのモデル名はgpt-6-astraである。Standard料金は入力100万トークン当たり10ドル、出力100万トークン当たり50ドル。Fast modeは最大2倍の速度を提供し、価格はStandardの2倍とされる。キャッシュの読み書きには別料金がある。

サイバーセキュリティ用途では何ができるのか

OpenAIは、公開時のモデルがセキュアコードレビューやパッチ適用などの防御作業を支援できると説明する。一方で、脆弱性の概念実証エクスプロイト作成など、より高度な作業には応じないとしている。利用組織はモデルの拒否だけに依存せず、権限管理と監視を実装する必要がある。

安全性が高いなら人間の確認は不要か

不要ではない。OpenAIは境界尊重や監視の強化を示したが、追加の安全確認が正当な作業を中断する可能性も認めている。特にデータ更新、送信、インフラ変更、セキュリティ対応では、担当者が確認するゲートを残す運用が求められる。

まとめ

OpenAIのGPT-6 Astraは、コンピューター操作、コーディング、科学、専門業務、サイバーセキュリティで性能向上を掲げ、長時間タスクの文脈保持や安全監視も拡張した。導入の評価軸はモデル単体の正答率から、実行速度、成果物品質、権限逸脱の抑制、停止時の運用を含む業務全体へ移る。

GPT-6 Astraを活用する組織は、まず限定権限・検証環境・人間承認を前提にし、性能評価と安全統制を同じ導入計画で進めることが重要だ。

公式出典・確認日

OpenAI公式情報を2026-09-06時点で確認しています。提供範囲・料金・画面は更新される場合があります。

新しいAIへ乗り換えても、自分の前提や判断を持ち運べる状態をつくる。Agent Memoriesは、記憶をスキルや外部ツールへつなぐAIパートナー基盤を育てています。

AIエージェントの記憶を知る Agent Memoriesを見る

本カテゴリはMiraigent / Agent Memoriesによる非公式編集記事です。OpenAIとの提携・承認・後援を示すものではありません。