GPT-6 发布:「欢迎来到 AGI 时代」

AIGC行业资讯8小时前发布 zhang
1 0
「欢迎来到 AGI 时代」

OpenAI 总裁 Greg Brockman

GPT-6 发布:「欢迎来到 AGI 时代」

刚刚,随着 GPT-6 的发布,我们真正的来到了新的时代

今天凌晨,OpenAI 发布了 GPT-6 Astra,在ARC-AGI-3 打到 99.9%ExploitBench 打到 100%FrontierMath Tier 4 打到 97.6%

难以置信,不可思议的数字

GPT-6 发布:「欢迎来到 AGI 时代」

通过这个模型,你可以制作更为不可思议的场景、网站

GPT-6 Astra 这款模型,今天开始向一小部分组织开放;

未来几天,将陆续向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也会通过 OpenAI API 和 AWS 提供。

价格与 Fable 保持一致:输入 $10/M 输出 $50/M

 

跑分

这里我把所有的跑分都放出来了,感受一下吧….

GPT-6 发布:「欢迎来到 AGI 时代」

跑分对比上篇:Computer Use、专业工作、编程

GPT-6 发布:「欢迎来到 AGI 时代」

跑分对比下篇:科学、网安、对齐、长上下文、抽象推理

工作能力

这个模型的各种能力,都被极大程度的加强了。这里有一些展示,相信很能说明情况

比如通过 Astra 在 KiCad 里做 PCB 布局布线(把电子原理图变成可制造的 PCB,放置元件、布线铜连接)

你可以让他通过现有的资源,去创造游戏

它可以替你处理各种繁琐任务,例如填写在线表格、更新 CRM 中的客户记录,以及整理日历,甚至进行复杂的数据分析

当然,谁能拒绝来一个超炫酷的 Excel World Championship

甚至,还可以操作 FreeCAD 去完成这种零件/设备的渲染

GPT-6 发布:「欢迎来到 AGI 时代」

这个是不是看起来更震撼了

以及配合 Codex 的更新,在 Mind2Web benchmark 上整体任务完成速度比当前 Sol 体验快了 1.9 倍

我们上线当天就把 GPT-6 Astra 接入了 Devin 的 harness,在内部测试 benchmark 上达到了 SOTA。computer use、写作代码库理解开箱即用就有提升:视频明显更容易跟,报告更清晰简洁

Silas Alberti,Cognition SVP Research

 

专业工作

OpenAI 说 Astra 在模板遵循、幻灯片排版、叙事结构上是他们做得最好的模型,能产出直接能用的文档、表格和演示文稿。比如这个海报就排版的很好看

GPT-6 发布:「欢迎来到 AGI 时代」

Astra 的训练特别针对了「只提取相关上下文进输出,不重复无关信息」这件事

GPT-6 发布:「欢迎来到 AGI 时代」

当指令有模糊的地方,OpenAI 说 Astra 比前代更擅长自行判断。它用上下文填补常规空白,只在答案会实质性影响结果时才提问。在 Codex 里可以异步提问,同时继续不依赖回复的工作

Astra 在能力和效率上都给了我们显著优势。它能成功执行我们最复杂的创意工作流,同时 token 用量比其他测试模型少了最多 20%

Alex Mashrabov,Higgsfield AI CEO

 

写代码

从跑分上来看,GPT-6,也就是 Astra 是目前最好的模型了

GPT-6 发布:「欢迎来到 AGI 时代」

同时,随着这次模型更新,Codex 里也新加了一个实验性功能:上下文窗口用完时 Astra 可以做笔记,之前的窗口内容可以回搜,不用每次都压缩进一份摘要

GPT-6 Astra 在我们内部 coding benchmark 和交易直觉 eval 上都比 Sol 有明显提升。agentic coding 时沟通方式更容易跟,代码到生产质量所需的迭代更少

John Crepezzi,Jane Street AI Assistants

Astra 在复杂法律任务上比 Sol 有显著质量提升,能像讲究的律师一样区分文件记录、发现未支持的假设、把缺口转化为具体的起草方向

Niko Grupen,Harvey Applied Research 负责人

 

做科研

数学方向,这款模型也是相当不俗

GPT-6 发布:「欢迎来到 AGI 时代」

同时,Astra 帮助取得了两个关于素数间隔的新结果

第一个是 short prime gaps:此前十多年最好的结果是无穷多对素数间距不超过 246,Julia Stadlmann 最近改进到 240,Astra 帮助推到了 186,证明有无穷多对素数之间的距离不超过 186

第二个是 large prime gaps:改进了一个 80 多年没动过的项。证明和验证材料已公开

安全&对齐

Astra 在 Preparedness Framework 下触达了网安领域的 Critical threshold

OpenAI 还单独做了一个 ExploitBench(2026 年 6-8 月)eval,用最近三个月的 20 个高危 V8 漏洞测。Astra 39.0%,Sol 5.5%。测试过程中 Astra 发现并利用了两个此前未知的 0day 漏洞,OpenAI 正在向维护方披露

专家评估发现,不加安全措施的 Astra 能在加固浏览器上利用未知漏洞实现任意代码执行,能做加固操作系统的提权

同时,OpenAI 也表示说 Astra 是他们对齐做得最好的模型,在 care、task boundaries、transparent communication 三个方面有实质提升

另外 OpenAI 同时提到:Astra 的书面推理比 Sol 更难被监控。原因是 Astra 在简单任务上能用更少的推理步骤解决问题,推理更内隐。复杂任务上仍然难以隐藏推理过程,但 OpenAI 说他们认真对待这个退步,可监控性是研究重点

多少钱,在哪用

这款模型今天开始向一小部分组织开放; 未来几天,将陆续向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,用量包含在现有订阅额度里,可以额外买 credits

Pro、Business、Enterprise 还能用 GPT-6 Astra Pro 版本

模型同时也会通过 OpenAI API 和 AWS 提供

© 版权声明

相关文章

蛙蛙写作