Skip to content

GPT-6 Astra 发布:OpenAI 迈入“AGI 时代”,开发者要关注的六个变化

2026 年 9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。发布会上,OpenAI 总裁 Greg Brockman 用一句 “Welcome to the AGI era” 概括这次升级。不过,OpenAI 同时承认,AGI 并不存在一个可以被精确标记的“瞬间”;Astra 更像是能力长期累积后的一次阶段性确认。

这次发布的特殊之处在于:Astra 早在 8 月的内部安全评估中就触及 Preparedness Framework 的 Critical 网络安全门槛。OpenAI 因此暂停了部分内部活动,并采用企业优先、分阶段放量和默认关闭权限等方式,把模型能力与安全控制一起推向生产环境。

一、从“暂停测试”到“分层上线”

Astra 的发布可以按三个节点理解:

  • 8 月 7 日:OpenAI 公布内部评估,Astra 的网络安全能力可能达到 Critical 等级,这是该框架首次接近的最高风险区间。
  • 8 月 10 日:经过安全微调的 GPT-5.6-Cyber 面向防御方开放,Daybreak 项目拆分为 Blue(防御)和 Red(受限攻防研究)两条通道。
  • 9 月 3 日:GPT-6 Astra 正式发布,成为 OpenAI 首个被归入 Critical 网络安全等级的正式模型。

因此,Astra 并非一次“所有用户同时可用”的发布。模型先向 Daybreak 项目中的审查企业开放,随后逐步扩展到 ChatGPT Plus、Pro、Business、Enterprise,以及 API 和 AWS。企业工作区默认没有 Astra 权限,管理员需要主动开启。

二、基准成绩:推理和漏洞利用能力跃升

公开测试显示,Astra 在部分高难度任务上达到接近饱和的成绩:

基准GPT-6 AstraGPT-5.6 Sol关注点
ARC-AGI-399.9%7.8%抽象推理与新任务泛化
FrontierMath Tier 498%高难度数学推理
ExploitBench100%漏洞发现与利用链构造
OSWorld 2.072.6%65.7%桌面环境自主操作
Humanity's Last Exam(带工具)57.2%65%低于上一代,能力并非全面提升
Artificial Analysis Coding Index67略低于 Claude Fable 5.1 的 68.1

需要注意,这些高分大多来自 xhighmax 推理档位,代表模型的能力上限,不等于同等成本下的普遍表现。实际选型时,应结合自己的任务集、延迟预算和推理档位进行 A/B 测试。

三、API 参数:百万 Token 上下文,但超长输入会涨价

对开发者更重要的是 API 行为和成本:

  • 模型 IDgpt-6-astra
  • 支持接口:Responses API、Chat Completions API、Batch API。需要 function calling 时,应使用 Responses API。
  • 暂不支持:Realtime API、Assistants API、微调、Embeddings,以及原生图像、视频和音频生成。
  • 上下文窗口:约 105 万 Token,最大输入约 92.2 万 Token,最大输出约 12.8 万 Token。
  • 标准价格:输入 10 美元/百万 Token,输出 50 美元/百万 Token,缓存输入 1 美元/百万 Token,缓存写入 12.5 美元/百万 Token。
  • 超长输入规则:单次输入超过 27.2 万 Token 后,输入和缓存价格翻倍,输出价格上调 50%,并且整个请求都会按新价格计算。
  • 批处理价格:Batch/Flex 约为对应标准费率的一半,Fast 档位约为两倍。
  • 推理强度:支持 lowmediumhighxhighmax 五档,没有 none。可通过 configuration_update 在同一轮会话中动态调整,并复用已经生成的前缀。

这意味着“支持百万 Token”不等于“应该每次都塞满百万 Token”。对长文档和代码库,分块检索通常比一次性提交全部内容更经济,也更容易控制延迟。

四、Codex 的变化:跨上下文窗口保留可检索记忆

Astra 在编码场景最值得关注的升级,是 Codex 的长会话记忆机制。

过去,当会话超过上下文窗口,系统通常将早期内容压缩成摘要。摘要越压越短,需求细节、测试结果和历史决策就可能逐渐丢失。Astra 可以在跨越上下文窗口时生成可检索笔记,后续直接引用数十轮之前的关键信息,而不完全依赖一份不断压缩的摘要。

对长期重构、连续迭代需求和多步骤 Agent 工作流来说,这种上下文管理改进可能比单项基准提升更有工程价值。不过,团队仍应验证笔记的召回准确率,并保留必要的状态文件和审计记录。

五、开发者接入 GPT-6 Astra 的六项清单

1. 先确认组织权限

企业管理员需要在工作区后台开启 Astra;API 用户则要确认组织已经进入放量名单。权限未开通时,代码本身没有问题也无法调用模型。

2. 从 medium 开始评估

先用较低推理档位验证正确率,再按任务难度提升到 highxhigh,避免一开始就用 max 导致成本失控。

python
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning_effort="medium",
    input="分析这段 Python 代码中的并发问题,并给出修复方案",
    tools=[...],  # 工具调用使用 Responses API
)

# 同一会话中按需提高推理强度
response = client.responses.create(
    model="gpt-6-astra",
    previous_response_id=response.id,
    reasoning_effort="xhigh",
)

3. 规避 27.2 万 Token 的价格拐点

使用检索、摘要和分块策略控制单次输入长度。只有在任务确实需要全量上下文时,才考虑承担超长输入的非线性成本。

4. 为高权限工具增加人工审批

Astra 被归入 Critical 网络安全等级后,涉及代码执行、系统命令、外部网络请求和凭证访问的 Agent,都应采用分级授权、最小权限、操作留痕和人工确认。

5. 用业务数据而不是单一跑分做决定

Astra 在 ARC-AGI-3、FrontierMath 上明显领先,但在 Humanity's Last Exam(带工具)上低于 GPT-5.6 Sol。建议准备一组真实任务,比较成功率、成本、延迟和人工返工量。

6. 重新检查长会话工作流

如果团队过去依靠分段提交、状态文件和手工摘要来规避上下文压缩,升级后应重新评估这些做法。它们可能减少,也可能仍然是重要的容错机制,不能只凭发布说明下结论。

六、总结:能力越强,治理越要前置

GPT-6 Astra 的发布同时展示了两条趋势:模型在抽象推理、数学和网络安全任务上出现大幅跃升;另一方面,OpenAI 也必须通过分层放量、企业默认关闭和 Daybreak 审查机制主动控制风险。

对开发者而言,“AGI 时代”是宏观叙事,真正需要落地的是三个问题:Astra 在自己的任务上是否值得更高价格?百万 Token 上下文是否能转化为更少的工程维护?当模型拥有更强的漏洞发现和工具操作能力时,权限边界是否足够清晰?

更稳妥的路径是先在小范围、低推理档位下试用,记录质量与成本,再逐步扩大流量。凡是能够执行代码、调用外部系统或接触敏感数据的 Agent,都应把审批和审计作为默认设计,而不是上线后的补丁。

本站仅供学习交流,请勿用于商业用途