行业新闻

OpenAI 发布 GPT-6 Astra,主打 Computer Use 与多步任务

OpenAI 发布 GPT-6 Astra,主打 Computer Use 与多步任务

OpenAI 发布 GPT-6 Astra,把大模型从“聊天”推向“操作电脑干活”,是 Agent 方向的重要一步。

GPT-6 Astra 是 OpenAI 最新旗舰模型,核心变化是从“生成文本”转向“直接操作电脑和软件完成多步骤工作”,如制作文档、编写代码、查询资料。它在多个 agent 基准测试中超过前代 GPT-5.6 Sol,但成绩包含运行框架的增益,并非纯模型表现。

正文摘录

刚刚,万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro,正式发布!!! GPT-6 Astra 是世界上最智能、最协调的模型,为 Computer Use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。 怪不得 Claude、Grok 组团掉线,原来是 Astra 启动后扫描互联网,直接把地球上的 LLM 全灭了—— 据介绍,Astra 是 OpenAI 历史上规模最大的训练任务,在得州 Stargate 园区动用超过 10 万块 GPU 完成了预训练。 GPT-6 Astra 这次最核心的变化,是从「回答问题」继续向「直接完成工作」推进。 它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。 其中,ARC-AGI-3 是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。 这个分数意味着,面对从未见过、也没有现成解法的问题,Astra 已经表现出很强的自主探索和规则学习能力。 不过,这一成绩使用了 OpenAI 的 Responses API Harness 运行框架。 OpenAI 称,这套 Harness 调整了两项设置,让测试更接近真实 Agent 的使用方式,但并未针对 ARC-AGI-3 进行专项优化。 因此,99.9% 不完全是基础模型的成绩,也包括记忆管理和 Agent 运行框架带来的增益。 在 Terminal-Bench 4.0 上,Astra 取得 57.7%,超过 Fable 5.1 的 55.8% 和 GPT-5.6 Sol 的 37.3%。

阅读原文(qbitai.com)→

行业新闻闻乐2026-09-03原文

相关内容