GPT-6 正式发布:数学跑分 97.6%、黑客测试满分,OpenAI 宣布全面进入 AGI 时代

📡 AI新闻 2026-09-12 约 1 分钟阅读

GPT-6 正式发布:数学跑分 97.6%、黑客测试满分,OpenAI 宣布全面进入 AGI 时代 9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。公司总裁格雷格·布罗克曼在发布前的媒体简报会上,用一句 "欢迎来到 AGI 时代"收尾。按照 OpenAI 官方安全博客

💡 你将学到

GPT-6 正式发布:数学跑分 97.6%、黑客测试满分,OpenAI 宣布全面进入 AGI 时代 9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。公司总裁格雷格·布罗克曼在发布前的媒体简报会上,用一句 "欢迎来到 AGI 时代"收尾。按照 OpenAI 官方安全博客

📜 目录

GPT-6 正式发布:数学跑分 97.6%、黑客测试满分,OpenAI 宣布全面进入 AGI 时代

9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。公司总裁格雷格·布罗克曼在发布前的媒体简报会上,用一句 "欢迎来到 AGI 时代"收尾。按照 OpenAI 官方安全博客的说法,这是他们迄今大规模部署的最强模型,也是第一个在自家准备框架里跨过"关键级"网络安全门槛的模型。

跑分高到接近刷满

OpenAI 公布的评测结果里,几个数字已经顶到了考场天花板:

测试项 GPT-6 Astra GPT-5.6 Sol 考的是什么
FrontierMath Tier 4 97.6% 83.0% 研究级数学难题
ExploitBench 网络安全 100% 78.5% 漏洞利用能力
GPQA Diamond 96.0% 94.6% 研究生级科学问答
Terminal-Bench 4.0 57.7% 37.3% 真实软件工程任务

数学和科学类测试基本被刷到了头。OpenAI 还称,Astra 已经参与解决了一些长期悬而未决的数学问题,这次发布又公布了两项关于素数间隔的新结果。

真正的看点是会自己动手干活

比起跑分,OpenAI 这次更强调 Astra 把智力变成了实际操作。官方直接称它是"世界上最好的 computer use 模型":能自己填网页表单、更新客户记录、整理日历、做网络研究再写进邮件,复杂一点的还能分析科学数据、生成图表、搭网站、自主安装和测试软件。

效率数字很直观。在 OSWorld 2.0 的模拟测试里,Astra 得分从 65.7% 升到 72.6%,完成单个任务的时间从约 75 分钟压缩到 40 分钟,缩短了将近一半。而且干这些活不需要写更多字——在最高分设置下,它用的输出 token 比 Claude Opus 5 少约 65%。说白了就是少说、多想、多干活。

黑客能力强到先被限制

网络安全是 Astra 发布前争议最大的部分。ExploitBench 拿满分之外,OpenAI 还用一套只包含 2026 年 6 到 8 月全新漏洞的内部测试集考它,结果任意代码执行成功率达到 39%,上一代 Sol 只有 5.5%。测试过程中,Astra 还真的挖出并利用了两个此前未知的零日漏洞,目前正在向相关项目维护者披露。

能力强到这个程度,OpenAI 自己也踩了刹车。普通用户拿到的版本可以做安全代码审查和漏洞修复,但会拒绝写漏洞利用代码这类高危请求;限制更少的版本只通过 Daybreak 计划,逐步开放给获批的网络安全防御人员。模型也已经通过了美国政府的自愿审查框架。

价格直接涨到 2.5 倍

性能跳了一档,价格也跟着跳。API 定价为输入 10 美元、输出 50 美元每百万 token,是上一代旗舰 GPT-5.6 Sol 的 2.5 倍。想要更快还有 Fast 模式,速度最高到标准模式的 2.5 倍,价格再翻一倍。布罗克曼也提到,行业未来可能转向按任务收费,而不是按 token 计费。

训练成本同样是天文数字。研究副总裁艾丹·克拉克透露,这是 OpenAI"迄今为止规模最大的训练",预训练动用了超过 10 万块 GPU,并且首次大规模让前代 AI 模型参与训练新一代模型。

谁先用上

Astra 目前先向少量参与 Daybreak 计划的组织开放,未来几天逐步推送给 ChatGPT Plus、Pro、Business 和 Enterprise 用户,其中 Pro、Business、Enterprise 还会拿到加强版 GPT-6 Astra Pro。API 模型名 gpt-6-astra,同时上线亚马逊云 Bedrock。

值得留意的是,独立评测机构 Artificial Analysis 首日给出的智能指数里,Astra 拿到 61 分,和自家 Sol 基本持平,落后于 Claude Fable 5.1 的 66 分;它的优势主要在编程智能体的性价比——同样的分数,单任务成本不到 Claude 的一半。官方跑分和独立评测之间这道温差,大概率会是接下来几天的争论焦点。

相关文章
2026-08-25
统一内存三巨头横评:最便宜的 Mac Mini 反而最适合多数人
2026-07-11
MiniMax M3 炸场:编程超 GPT-5.5,百万上下文,但用户不买账?
2026-08-05
Intel重启13代14代CPU生产,目标只有一个:中国DIY市场

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论