GPT-6 Astra 是 OpenAI 面向 ChatGPT、Codex 与 API 场景打造的执行型 GPT 模型。与只生成文字的传统 ChatGPT 体验相比,Astra 更强调 AI Agent 在浏览器和桌面软件中连续操作、交付文件、调用工具、记忆长任务状态,并在检查结果后继续修正。本文将系统梳理 GPT-6 Astra 的核心能力、评测数据、价格变化、实际应用与安全边界。
GPT-6 Astra 深度解析:ChatGPT 执行系统、Agent 能力与应用
OpenAI 将 GPT-6 Astra[1] 定位为目前最智能、对齐程度最高的模型。它在电脑与浏览器操作、软件工程、网络安全、科学研究和专业工作上刷新了多项官方评测。Astra 的开放仍在分批推进,不同产品、计划和账户的实际可用时间并不完全相同。


模型开始进入真实软件环境,持续执行任务,并根据结果调整下一步。
理解用户意图
→ 操作浏览器与桌面软件
→ 产出文档、表格、演示、网站或代码
→ 检查结果,发现问题并继续修正
→ 跨上下文保存状态、找回早期信息这条工作链由模型、Codex 与 ChatGPT Work 等执行框架,以及工具、权限、沙箱和监控系统共同组成。Astra 的意义,在于模型能力开始与这些环节更紧密地咬合。
模型价格也更贵了:

电脑操作成为核心能力
OpenAI 将 Astra 称为“世界上最好的电脑操作模型”(在 gpt-5.6 sol 中,computer-use 就表现突出,十分擅长解决长链路问题,现在似乎更进一步)。
它可以填写在线表单、更新 CRM、整理日历、浏览资料,在邮件或文档编辑器中撰写摘要;也可以操作科学软件、分析数据、生成图表、搭建网站、执行前端质量检查,以及安装、测试和排查软件问题。
几项电脑操作评测的对比如下:

这些数据来自 OpenAI 公布的模型对比表。其中 OSWorld 2.0 使用无需联网的离线任务子集,采用部分得分,不等同于完整生产环境中的端到端成功率。
在 OSWorld 2.0 的延迟模拟中,Astra 完成单项任务的模拟耗时约为 40 分钟,GPT-5.6 Sol 约为 75 分钟。Astra 得分更高,模拟耗时也减少了约 47%。这里的时间来自评测环境,不是普通用户每次使用时都会得到的实际墙钟时间。

OpenAI 还同步更新了 Codex 的电脑操作框架。Astra 与新框架叠加后,在 Mind2Web 上的任务完成速度约为当前 GPT-5.6 Sol 体验的 1.9 倍。这个数字同时包含模型和执行框架的改进,反映的是整个系统的升级。
电脑操作由此不再只是一个附加工具。它开始成为模型接触工作环境的基础接口:读取屏幕、点击、输入、运行程序、观察反馈,再决定下一步做什么。
从“会操作”到“能交付”
电脑操作让模型能够进入软件,专业训练则决定它能否交出可以直接使用的结果。
Astra 针对专业工作环境进行了定向训练,重点提升多步骤流程,以及文档、电子表格、演示文稿和分析类交付。它更擅长沿用已有模板,理解版式、视觉层级和叙事结构,也会尽量只将当前任务真正需要的信息写入结果,减少无关材料的重复。

在 ChatGPT 的 Sites 功能中,Astra 可以根据提示创建、托管和分享网站、网页应用与游戏。OpenAI 展示的场景还包括 KiCad 电路板设计、Blender 建模、Unreal Engine 场景、Power BI、Excel、法律文档排版和前端质量检查。

BenchCAD 是其中较有代表性的一项。模型需要根据多个角度的渲染图生成 CAD 代码,重新构建三维物体。

在 OpenAI 选用的测试配置下,Astra 的估算 API 成本比 GPT-5.6 Sol 低约 43%,比 Claude Fable 5.1 低约 86%。这组成本数据与具体推理强度、输出长度和测试设置有关,不代表 Astra 在所有 CAD 任务中都固定便宜相同比例。
另一个更接近实际协作的变化,是 Astra 对信息缺口的处理。
指令留有解释空间时,它会根据上下文补齐普通细节;只有当缺失信息可能改变最终结果时,才集中向用户提问。在 Codex 中,它还可以一边等待回复,一边继续处理不依赖答案的部分。用户没有及时回应时,低风险细节可以采用合理假设,重要决定则会停下来等待。
难点不在于多问或少问,而在于分清哪些缺口只影响格式,哪些缺口会改变决定。
Astra 对中途追加要求的处理也有所加强。以往模型容易把补充消息当成新的主任务,逐渐丢失原目标;Astra 会把新要求合并回已有任务,在回答支线问题后继续推进主线。
编程能力并非齐头并进
OpenAI 将 Astra 称为目前最强的软件工程模型。不过,几项主要代码评测的变化幅度并不相同:

Astra 在复杂终端任务和数据库迁移上的进步很明显,DeepSWE 与 FrontierCode 则更接近常规迭代。几项结果放在一起看,它的优势主要集中在需要持续操作、执行和验证的工程任务,并非所有代码基准都同步大幅上涨。
比单次代码生成更值得关注的,是 Astra 如何处理持续数小时甚至更长时间的工程任务。
长任务记忆:笔记加历史检索
长时间调试、大型重构和持续运行的 Agent 经常遇到同一个问题:上下文窗口写满后,系统需要把早期内容压缩成摘要。
每压缩一次,都可能漏掉某个方案为什么失败、某项测试产生了什么结果,或者某个组件存在哪些隐含约束。压缩次数多了,模型也许仍记得项目大意,却可能遗失真正决定下一步的细节。
Astra 在 Codex 中引入了一种新的处理方式:跨窗口工作笔记 + 早期消息与工具输出的历史检索。
模型可以跨上下文窗口维护笔记,保存已经积累的要求、发现与结论。更早的对话和工具输出仍然可以被搜索,某条信息即使没有写入笔记,也有机会从历史记录中重新找回。
这并不会让上下文窗口变得无限。变化发生在长期任务的状态管理方式上:过去主要依赖一份反复压缩的摘要,现在则可以同时使用工作笔记和历史检索。
这项能力目前仍是 Codex 的实验功能,需要在 config.toml 中主动开启。OpenAI 计划在随后几周将其设为 Astra 的默认行为。
长上下文评测也出现了明显提升:

单次 105 万 token 上下文与 Codex 的跨窗口记忆属于两层能力:前者扩大一次请求能够直接容纳的信息量,后者用于维持超过单个上下文窗口的长期工作状态。
其他评测
Astra 在数学与科学评测上的成绩包括:


ARC‑AGI‑3 的 99.9% 需要结合执行条件理解。Astra 并非运行在 ARC‑AGI‑3 默认的通用评测框架中,而是使用了 OpenAI 基于 Responses API 搭建的执行框架,并启用了两项在 ChatGPT 和 Codex 中使用的机制:保留前序推理上下文,以及在上下文过长时进行压缩。前者让模型能够延续此前的判断,后者避免早期操作和观察被直接丢弃。OpenAI 表示,这些设置是为了贴近模型在实际产品中的运行方式,并非针对 ARC‑AGI‑3 特别调优。因此,99.9% 更适合看作 Astra 与 OpenAI 执行框架结合后的系统成绩,不宜直接与 GPT‑5.6 Sol 的 7.8% 当作统一执行条件下的裸模型差距。
两项素数间隔进展
在短素数间隔问题中,过去十余年的已知结果表明,存在无穷多对素数,其间距不超过 246。Julia Stadlmann 随后把上界推进到 240,Astra 又参与建立了 186 的新上界。

在大素数间隔问题中,Astra 还帮助改进了一个超过 80 年没有变化的边界项。OpenAI 同时公开了证明、支持研究、压缩后的推理说明和验证材料:
- 论文 Improved short gaps between primes[2]
- 思维链 Abridged Chain of Thought for Improved Short Gaps between Primes[3]
十项数学与理论计算机科学进展
OpenAI 还单独公布了一组由 Astra 内部版本参与完成的十项数学与理论计算机科学成果,覆盖高维球堆积、编码理论、非 sofic 群、算术电路复杂性、量子复杂性、格密码和极值组合学等方向。
这些结果并不只是模型给出的零散答案。按照 OpenAI 的介绍,Astra 先生成数学论证,人类研究者再借助模型整理成论文,随后由模型进一步生成 Lean 形式化证明。寻找这些解答所消耗的 token,如果按 GPT-5.6 Sol 的 API 价格折算,总成本约为 2000 美元。
目前,相关论文、推理材料和形式化证明都已经公开。OpenAI 也没有把这批结果描述成已经得到数学界最终确认的结论,而是希望研究社区继续验证、讨论,并判断它们在各自领域中的重要性与原创性(Ten advances in mathematics and theoretical computer science[4])。
更值得注意的是,Astra 的科研能力已经不只停留在数学证明。结合电脑操作和代码执行后,它还可以直接进入专业科学软件,检查测序质量、可视化遗传变异、分析细胞追踪数据,并根据结果继续调整分析方向。
这意味着模型正在从“回答科研问题”,进一步进入数据、代码、专业工具和实验结果共同组成的实际研究流程。
网络安全跨过 Critical 门槛
GPT‑6 Astra 是 OpenAI 首个达到网络安全 Critical 能力门槛的模型。这个等级来自 OpenAI 的 Preparedness Framework——一套用于评估前沿模型高风险能力,并据此决定开发、部署和防护要求的治理框架。
Critical 只对应 Astra 的网络安全能力,并不是对整个模型危险程度的综合评级。在该框架目前正式跟踪的三个类别中,Astra 的网络安全能力达到 Critical,生物与化学能力达到 High,AI 自我改进能力则尚未达到 High 门槛。
High 表示模型可能显著放大现实中已有的严重风险路径;Critical 则意味着它可能开启缺少现实先例的新型严重风险路径。对于达到 Critical 的系统,OpenAI 要求防护不仅覆盖对外部署,也要进入模型开发和训练阶段。
相关能力评测包括:

其中 ExploitBench 和 ExploitGym 的能力测试没有加载普通生产环境中的完整安全限制。
拓展阅读
社区案例
3D 场景
刷 X 看到最多的分享是用 Blender[5] 构建各种 3D 场景或游戏。


Astra 编程
Astra 编码能力也到达 Fable 5 水准了,甚至得到了 Fable 5.1 的认可。Astra 具备的多种能力,在 Agent 行动中,将会被无限放大。

卧槽时刻
这可能是最“惊悚”案例,作者被 Astra 代理们的对话吓到了。

职业音乐人
GPT-6 Astra for Professional Musicians[6] 文章来自音乐人兼独立创业者 Michael Wall。他认为,Astra 对职业音乐人的真正价值并不是自动生成歌曲,而是进入音乐工作的完整链条:操作音乐软件、开发专用工具、整理曲库、发布作品、维护网站、汇总经营数据、处理财务,以及制作教学材料。音乐创作只是职业音乐人的一部分,真正消耗时间的往往是创作之外的大量事务。
文章首先展示了三种人机连接方式:一是让 Astra 通过 Computer Use、OSC/UDP、Max for Live 和 Ableton Extensions SDK 操作 Ableton Live;二是把 Codex 嵌入自制的 macOS 音乐软件,让用户通过文字或语音直接编辑和播放音乐;三是把音乐工作站做成 Codex 插件,使 Astra 能在 ChatGPT 中创建和修改音频、MIDI、乐谱、视频、效果器以及本机 AU/VST 轨道。作者的经验是,没有一种接口可以覆盖所有工作,视觉操作、结构化接口和原生控制面板需要组合使用。
Astra 也被用于分析作者过去的创作资料。据其自述,它处理了约 1.1 TB 的 Ableton 工程,并将整理后的 250 GB 数据变成可供插件检索的创作知识;还可以进行数小时的 MIDI 即兴、调用作者常用的音色,并协助嵌入一个 1250 万参数的小型模型。作者对边界说得很清楚:这些实验使用的是自己拥有的音乐资料,主要用于寻找声音、制作乐器和研究技术,他并不需要 AI 替自己作曲,也对来源不明的商业生成音乐保持警惕。
更实际的变化发生在经营环节。作者把音乐发布拆成 14 个步骤,其中只有第 7 步是创作音乐;Astra 更适合处理其余 13 步。在包含 74 张专辑、606 首曲目和大量元数据的曲库中,它发现并修复了约 40 处跨平台不一致,还把一次发布流程从 22 分钟压缩到约 60 秒。除此之外,它还能定期测试购买流程、修复网站问题、汇总各平台播放与收入数据、协助记账,以及把乐器研究制作成交互式教学内容。
这篇文章是一份个人实践报告,不是标准化能力评测。它真正说明的是:当音乐人已经拥有清晰的工作流程、自有数据、可连接的软件和验证机制时,Astra 可以逐渐承担技术与运营工作,把时间还给创作本身。

Mid-turn Steering API
Mid-turn Steering(响应中途引导)允许用户在模型尚未完成回答时追加要求或改变方向。目前仅支持通过 Responses API 的 WebSocket 连接调用 gpt-6-astra,客户端通过 response.steer 提交新指令。
Steering 并不会修改已经输出的内容、撤销已完成的操作,或取消正在执行的工具。response.steer.accepted 只代表指令已进入队列;系统通常会完成当前输出或工具调用,再创建后继响应落实新要求。原响应可能以 response.incomplete 和 reason: "steered" 结束,这属于正常转向,并非执行失败。
它的核心价值,是让长时间运行的 Agent 在执行过程中仍能接受人的实时调整。如果任务正在等待工具结果或审批,转向指令会继续排队;但这些指令只存在于当前 WebSocket 连接中,断线后不会自动持久化,因此应用需要自行记录并处理重连。简而言之,Steering 解决的是“如何改变接下来的行动”,而不是“如何撤销已经发生的行为”。详见 OpenAI 官方文档[7]。
以下是代码示例:
import WebSocket from "ws";
const ws = new WebSocket("wss://api.openai.com/v1/responses", {
headers: {
Authorization: `Bearer ${process.env.OPENAI_API_KEY}`,
},
});
let initialResponseId;
let successorResponseId;
ws.on("open", () => {
ws.send(JSON.stringify({
type: "response.create",
model: "gpt-6-astra",
input: "为任务管理应用制定一份开发计划。",
}));
});
ws.on("message", raw => {
const event = JSON.parse(raw.toString());
if (event.type === "response.created") {
if (!initialResponseId) {
initialResponseId = event.response.id;
// 模型仍在生成时追加要求
ws.send(JSON.stringify({
type: "response.steer",
previous_response_id: initialResponseId,
input: "把范围缩小到一名开发者可以在两周内完成。",
}));
} else {
// API 自动创建的后继响应
successorResponseId = event.response.id;
}
}
if (event.type === "response.steer.accepted") {
console.log("转向要求已进入队列:", event.steer.id);
}
if (
event.type === "response.incomplete" &&
event.response.incomplete_details?.reason === "steered"
) {
console.log("原响应因转向而结束");
}
if (
event.type === "response.completed" &&
event.response.id === successorResponseId
) {
console.log("应用新要求后的结果:", event.response.output);
ws.close();
}
});对应的事件流大致如下:
客户端 → response.create
服务端 → response.created resp_1
客户端 → response.steer previous_response_id: resp_1
服务端 → response.steer.accepted steer_1
服务端 → response.incomplete resp_1,reason: steered
服务端 → response.created resp_2
服务端 → response.completed resp_2References
[1] GPT-6 Astra: https://openai.com/index/gpt-6-astra
[2] Improved short gaps between primes: https://cdn.openai.com/pdf/51126fac-1b68-4128-9666-c908bcc16033/short_gaps.pdf
[3] Abridged Chain of Thought for Improved Short Gaps between Primes: https://cdn.openai.com/pdf/51126fac-1b68-4128-9666-c908bcc16033/short_gaps_abridged_cot.pdf
[4] Ten advances in mathematics and theoretical computer science: https://openai.com/index/ten-advances-in-mathematics
[5] Blender: https://www.blender.org
[6] GPT-6 Astra for Professional Musicians: https://www.soundformovement.com/learn/gpt-6-astra-for-professional-musicians
[7] OpenAI 官方文档: https://developers.openai.com/api/docs/guides/steering