GPT-6 Astra 发布:OpenAI 迈入“AGI 时代”,开发者要关注的六个变化
2026 年 9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。发布会上,OpenAI 总裁 Greg Brockman 用一句 “Welcome to the AGI era” 概括这次升级。不过,OpenAI 同时承认,AGI 并不存在一个可以被精确标记的“瞬间”;Astra 更像是能力长期累积后的一次阶段性确认。
这次发布的特殊之处在于:Astra 早在 8 月的内部安全评估中就触及 Preparedness Framework 的 Critical 网络安全门槛。OpenAI 因此暂停了部分内部活动,并采用企业优先、分阶段放量和默认关闭权限等方式,把模型能力与安全控制一起推向生产环境。
一、从“暂停测试”到“分层上线”
Astra 的发布可以按三个节点理解:
- 8 月 7 日:OpenAI 公布内部评估,Astra 的网络安全能力可能达到 Critical 等级,这是该框架首次接近的最高风险区间。
- 8 月 10 日:经过安全微调的 GPT-5.6-Cyber 面向防御方开放,Daybreak 项目拆分为 Blue(防御)和 Red(受限攻防研究)两条通道。
- 9 月 3 日:GPT-6 Astra 正式发布,成为 OpenAI 首个被归入 Critical 网络安全等级的正式模型。
因此,Astra 并非一次“所有用户同时可用”的发布。模型先向 Daybreak 项目中的审查企业开放,随后逐步扩展到 ChatGPT Plus、Pro、Business、Enterprise,以及 API 和 AWS。企业工作区默认没有 Astra 权限,管理员需要主动开启。
二、基准成绩:推理和漏洞利用能力跃升
公开测试显示,Astra 在部分高难度任务上达到接近饱和的成绩:
| 基准 | GPT-6 Astra | GPT-5.6 Sol | 关注点 |
|---|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% | 抽象推理与新任务泛化 |
| FrontierMath Tier 4 | 98% | — | 高难度数学推理 |
| ExploitBench | 100% | — | 漏洞发现与利用链构造 |
| OSWorld 2.0 | 72.6% | 65.7% | 桌面环境自主操作 |
| Humanity's Last Exam(带工具) | 57.2% | 65% | 低于上一代,能力并非全面提升 |
| Artificial Analysis Coding Index | 67 | — | 略低于 Claude Fable 5.1 的 68.1 |
需要注意,这些高分大多来自 xhigh 或 max 推理档位,代表模型的能力上限,不等于同等成本下的普遍表现。实际选型时,应结合自己的任务集、延迟预算和推理档位进行 A/B 测试。
三、API 参数:百万 Token 上下文,但超长输入会涨价
对开发者更重要的是 API 行为和成本:
- 模型 ID:
gpt-6-astra。 - 支持接口:Responses API、Chat Completions API、Batch API。需要 function calling 时,应使用 Responses API。
- 暂不支持:Realtime API、Assistants API、微调、Embeddings,以及原生图像、视频和音频生成。
- 上下文窗口:约 105 万 Token,最大输入约 92.2 万 Token,最大输出约 12.8 万 Token。
- 标准价格:输入 10 美元/百万 Token,输出 50 美元/百万 Token,缓存输入 1 美元/百万 Token,缓存写入 12.5 美元/百万 Token。
- 超长输入规则:单次输入超过 27.2 万 Token 后,输入和缓存价格翻倍,输出价格上调 50%,并且整个请求都会按新价格计算。
- 批处理价格:Batch/Flex 约为对应标准费率的一半,Fast 档位约为两倍。
- 推理强度:支持
low、medium、high、xhigh、max五档,没有none。可通过configuration_update在同一轮会话中动态调整,并复用已经生成的前缀。
这意味着“支持百万 Token”不等于“应该每次都塞满百万 Token”。对长文档和代码库,分块检索通常比一次性提交全部内容更经济,也更容易控制延迟。
四、Codex 的变化:跨上下文窗口保留可检索记忆
Astra 在编码场景最值得关注的升级,是 Codex 的长会话记忆机制。
过去,当会话超过上下文窗口,系统通常将早期内容压缩成摘要。摘要越压越短,需求细节、测试结果和历史决策就可能逐渐丢失。Astra 可以在跨越上下文窗口时生成可检索笔记,后续直接引用数十轮之前的关键信息,而不完全依赖一份不断压缩的摘要。
对长期重构、连续迭代需求和多步骤 Agent 工作流来说,这种上下文管理改进可能比单项基准提升更有工程价值。不过,团队仍应验证笔记的召回准确率,并保留必要的状态文件和审计记录。
五、开发者接入 GPT-6 Astra 的六项清单
1. 先确认组织权限
企业管理员需要在工作区后台开启 Astra;API 用户则要确认组织已经进入放量名单。权限未开通时,代码本身没有问题也无法调用模型。
2. 从 medium 开始评估
先用较低推理档位验证正确率,再按任务难度提升到 high 或 xhigh,避免一开始就用 max 导致成本失控。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning_effort="medium",
input="分析这段 Python 代码中的并发问题,并给出修复方案",
tools=[...], # 工具调用使用 Responses API
)
# 同一会话中按需提高推理强度
response = client.responses.create(
model="gpt-6-astra",
previous_response_id=response.id,
reasoning_effort="xhigh",
)3. 规避 27.2 万 Token 的价格拐点
使用检索、摘要和分块策略控制单次输入长度。只有在任务确实需要全量上下文时,才考虑承担超长输入的非线性成本。
4. 为高权限工具增加人工审批
Astra 被归入 Critical 网络安全等级后,涉及代码执行、系统命令、外部网络请求和凭证访问的 Agent,都应采用分级授权、最小权限、操作留痕和人工确认。
5. 用业务数据而不是单一跑分做决定
Astra 在 ARC-AGI-3、FrontierMath 上明显领先,但在 Humanity's Last Exam(带工具)上低于 GPT-5.6 Sol。建议准备一组真实任务,比较成功率、成本、延迟和人工返工量。
6. 重新检查长会话工作流
如果团队过去依靠分段提交、状态文件和手工摘要来规避上下文压缩,升级后应重新评估这些做法。它们可能减少,也可能仍然是重要的容错机制,不能只凭发布说明下结论。
六、总结:能力越强,治理越要前置
GPT-6 Astra 的发布同时展示了两条趋势:模型在抽象推理、数学和网络安全任务上出现大幅跃升;另一方面,OpenAI 也必须通过分层放量、企业默认关闭和 Daybreak 审查机制主动控制风险。
对开发者而言,“AGI 时代”是宏观叙事,真正需要落地的是三个问题:Astra 在自己的任务上是否值得更高价格?百万 Token 上下文是否能转化为更少的工程维护?当模型拥有更强的漏洞发现和工具操作能力时,权限边界是否足够清晰?
更稳妥的路径是先在小范围、低推理档位下试用,记录质量与成本,再逐步扩大流量。凡是能够执行代码、调用外部系统或接触敏感数据的 Agent,都应把审批和审计作为默认设计,而不是上线后的补丁。