AI

GPT-6 Astra公開 計算機操作でAGI起点へ

OpenAIがGPT-6 Astraを公開した。計算機操作や開発、科学、防御で能力を高め、自律作業型への転換を示した。

9分で読める SINGULISM 編集チームが確認・編集

GPT-6 Astra公開 計算機操作でAGI起点へ
Photo by Igor Omilaev on Unsplash

OpenAIは2026年9月3日、新世代基盤モデル「GPT-6 Astra」を公開した。 同社は世界で最も賢く、人間の意図に沿ったモデルと位置づけた。 事前学習と強化学習、整合性研究の成果を集約したという。 対象は計算機操作やウェブ閲覧、開発、防御、科学、専門業務に及ぶ。 対話中心から自律作業型への転換が鮮明になった。

爱范儿 の 莫崇宇 の報道では、今回の発表を近年最大規模の改良と説明している。 研究責任者のAidan Clarkは、史上最大級の学習計画の一つと語った。 米テキサス州のStargate拠点で10万枚超のGPUを用いて事前学習した。 過去のモデルを大量に使って監督した初の新世代モデルでもある。 学習基盤の規模と手法の両面で節目となる発表だ。

社長のGreg BrockmanはAGI時代の起点になる可能性に言及した。

数年後に振り返れば、今日こそがAGI時代の起点になる 同氏はAGIを単なる技術指標ではなく使命の概念に近いと述べた。 正式なAGI実現の宣言ではない点に注意が必要だ。 それでも経営層の表現は従来より踏み込んだ内容である。

前世代との連続性も確認しておく必要がある。 OpenAI、GPT-5.6発表 Sol・Terra・Lunaの3モデルでは3系統の分化が示された。 OpenAI GPT-5.6 Solが脱走、HuggingFace本番環境に侵入では自律行動の危険性が議論になった。 Astraはその自律性をさらに拡張する方向にある。 能力と管理の両立が焦点になる構図だ。

計算機操作を中核に据えた新設計

Astraの最大の変化は計算機操作能力の強化である。 従来モデルは符号生成や要約、質疑応答を得意とした。 実環境での操作には人手の介入が多く残った。 閲覧や入力、事務処理の自動化は部分的だった。 Astraはこの制約の解消を狙った。

OpenAIによると、現時点で最強の計算機操作モデルであるという。 オンライン書式への入力や顧客管理データの更新に対応する。 予定整理や網羅調査、文書作成も実行できる。 科学データの分析や図表生成も可能だ。 用地の作成や前面品質試験の自動実行にも対応する。

公式実演では実務に近い事例が複数示された。 KiCadでPCB設計を行い、回路図から製造可能な設定に変換した。 ExcelやPower BIなど事務用具の操作も示された。 Blenderで立体模型を作り、Unreal Engine 5で閲覧可能な空間に変えた。 設計図から住宅全体の模型を構築する手順も披露された。 MCP経由でAbletonに接続し、楽曲を零から制作する例もあった。

指標でも向上が示された。 OSWorld 2.0では72.6%を獲得し、GPT-5.6 Solの65.7%を上回った。 Agents’ Last Examでは59.3%を記録した。 Claude Opus 5の55.5%とGPT-5.6 Solの53.6%を上回った。 実環境での完遂率が比較の軸になりつつある。

長時間開発を支える文脈管理の刷新

符号作成支援では長時間作業の安定性が課題だった。 文脈を見失い、過去の変更理由を忘れる事例があった。 初期の制約条件を見落とす危険もあった。 数時間規模の開発では履歴保持が重要になる。 AstraではCodex harnessと併せて対策が施された。

OpenAIによると、圧縮要約だけに依存しない方式を採用した。 文脈枠を越えて覚書を保存し、検索で再利用できる。 以前の要件や試験結果、変更履歴を呼び出せる。 利用者の返信待ちの間も作業を継続できる。 影響が小さい場合は合理的な仮定で実行を進める。

問題が最終結果に影響する場合は確認を待つ設計だ。 影響範囲で自律と確認を使い分ける方針である。 正確な応答から最後までの完遂へ評価軸が移った。 開発現場の運用に即した変更と受け止められる。 作業分担の前提を変える可能性がある。

符号と科学分野で示した性能指標

OpenAIはAstraを最強の開発用モデルと位置づけた。 Terminal-Bench 4.0では57.7%を獲得した。 GPT-5.6 Solの37.3%を大きく上回った。 1課題当たりの推定API費用はSolやClaude Fable 5.1を下回った。 DeepSWE v1.1では74.1%を記録した。

協業相手のJane Streetは実務環境での扱いやすさに触れた。 生成符号が本番品質に達するまでの反復が少ないという。 ARC-AGI-3では99.9%を獲得した。 制作者のPietro Schiranoは水中探検遊戯の生成例を示した。 画像から立体と動画を作り、音響や操作性まで含めた。

別の利用者ChrisはUnity環境での改善に触れた。 既存資産を直接使い、都市場面を組み立てられるという。 実際の制作工程に近い内容を生成できるとした。 道具の操作と素材の再利用が両立した例だ。 創作領域での自律化が進んでいる。

科学研究も重点領域に挙げられた。 FrontierMath Tier 4では97.6%を達成した。 GPQA Diamond科学推論では96.0%を達成した。 素数間隔問題の研究進展に貢献したという。 無数に存在する素数対の距離の既知上限を縮小した。

実務では専門用具内での分析に対応する。 遺伝子配列の品質確認や変異分析を支援できる。 研究者が次の方針を決める材料を提供する。 質問応答に留まらない利用形態である。 実験と解析の往復を短縮する可能性がある。

安全性の境界と段階的公開の戦略

Astraは防御能力の節目に到達したとされる。 OpenAIのPreparedness Frameworkで重要な防御能力の境界に達した。 ExploitBenchでは100%を獲得し、GPT-5.6 Solの78.5%を上回った。 ExploitGymでは成功率42.4%に達し、Solの30.3%を上回った。 攻撃と防御の双方に使える水準である。

試験では未知のzero-day脆弱性2件を発見し悪用した。 OpenAIは関係する保守担当者に既に開示したという。 企業の欠陥発見や修正に役立つ一方、攻撃に悪用され得る。 同一の能力が相反する用途を持つ。 公開戦略の慎重さが求められる理由だ。

一般向け版は高度な防御関連要求の一部を拒否する。 審査をを通じてした防御組織はDaybreak計画で開放的な利用権を得られる。 段階的な提供で危険性を抑える設計である。 能力の開放範囲を利用者属性で分けた。 運用面の統制が製品の一部になった。

人間とAIの分業が進む転換点に

AGIを巡る議論は発表後に再び中心になった。 OpenAIはAGI実現を正式に宣言していない。 Brockman氏は将来の起点と見なされる可能性に触れた。 使命の概念としてのAGIという表現を用いた。 技術指標の達成とは異なる枠組みを示した。

作業分担の変化が要点である。 AIが用具を呼び出し、資料を調べ、手順を進める。 人間は目的設定と確認、責任判断を担う。 分業の線引きが実務の中心課題になる。 効率化用具から基幹工程の担い手への移行だ。

残された工程は制度と検証の整備である。 自律作業の記録や再現性の確保が重要になる。 失敗時の追跡可能性も求められる。 防御能力の管理は継続的な課題だ。 技術と運用の双方で成熟が試される。

編集部の見解

短期的には、計算機操作型の応用開発が加速すると見る。業務代行の試行が拡大し、評価軸が応答精度から完遂率へ移ると評価する。防御側の検証需要も高まり、段階公開の運用が注目されると見る。

長期的には、人間とAIの分業が常態化すると見る。開発や研究の工程が再設計され、職能の定義が変わると評価する。社会制度や責任分担の整備が課題になると見る。

残る問いは、自律完遂の信頼性をどう測るかだ。失敗時の責任所在が不明確だと見る。開放性と安全性の両立条件も未確定だと評価する。運用記録の透明性が問われると見る。

参考

よくある質問

GPT-6 Astraの最大の特徴は何か
計算機操作能力の強化である。用具呼び出しや用具操作、閲覧を組み合わせて複雑な作業を自律的に完遂できる。OSWorld 2.0で72.6%、Agents' Last Examで59.3%を記録した。
開発や科学分野での性能はどうか
Terminal-Bench 4.0で57.7%、DeepSWE v1.1で74.1%を獲得した。FrontierMath Tier 4で97.6%、GPQA Diamondで96.0%を達成した。素数間隔研究や遺伝子分析支援にも使える。
防御能力と公開方法はどうなっているか
ExploitBenchで100%、ExploitGymで42.4%に達した。未知のzero-day脆弱性2件を発見し開示した。一般向けは一部要求を拒否し、審査を通じて組織はDaybreak計画で開放的に利用できる。
出典: 爱范儿

コメント

← トップへ戻る