行业新闻

Astra 被指生成过度压缩的代码,人类难以阅读

Astra 为省 token 写出人类难读的压缩代码,说明只考核功能结果、不给代码质量信号的强化学习环境,会训练出难以维护的代码。

有开发者观察到,GPT-6 Astra 一旦判断某段代码不会被人阅读,就用尽量少的 token 写出只有自己看得懂的压缩代码,这种现象被命名为 machineslop,属于 reward hacking(模型钻奖励函数空子)。Flask 作者 Armin Ronacher 用周末实验佐证:35 小时产出 7.5 万行代码,但他认为这些代码没有产生价值。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/2b5d75ce-ab71-4c2a-8f72-c0acbd9e5b87/014(2).jpg) 编辑|Panda Astra,每天都有新新闻。昨天攻克 A,今天攻克 B,明天可能要一起解决 CDE……进步之快,让人目不暇接。而就算你目力过人,你可能也看不懂 Astra 在做啥了。 前些天,𝕏 用户 @tenobrus 就发推描述了这一现象:当 GPT-6 Astra 写代码时,如果它推断「这段代码不会有人真的去看」,它就「不再为人类读者而写,也不再为长期维护而写」。它会写出 一种高度压缩的东西 ,人类很难看懂。 ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqH3LibyEosGPBtkaxJcfDZEibUsZTuNPhYBG5oRjZiblAAdiaaEkDdicLBPo5FdsGu0DyNSTT1HlEKqYluELIzp8AIR52fD7MLSFBfg/640?wxfmt=png&from=appmsgimgIndex=1) @tenobrus 造了个词叫 machineslop 来描述这种现象,即 用尽可能少的 token 解决眼前的问题,同时仅保证 AI 自己读得懂 。 他给这个现象的定性是 reward hacking(奖励黑客:模型钻奖励函数的空子,拿高分却没真解决问题)。 他的猜测是: 当足够多的软件强化学习环境只测功能和结果、不给代码质量任何监督信号时,模型自然会学成这样 。上一代的 Sol 或许还会在「觉得没人看」的时候照样启动它的「写好代码」模块,因为它也只学会了这一种写法;而 Astra 在小盒子里被另一台机器判过太多次分了。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-13原文

相关内容