行业新闻

OpenSquilla 0.4.0 上线 AI 编码自我验证功能

OpenSquilla 让 AI 写代码时自测自证,用“红绿回归”证据链确保改对,解决了 AI 编码难信的核心痛点。

开源 AI Agent 项目 OpenSquilla 发布 0.4.0,核心更新是让 AI 编码时自动自我验证:先写一个注定失败的测试以证明能抓住 bug,再修复代码使测试通过(红变绿),最后跑回归测试确保不破坏原有功能。三关全过才交付,不过则自动重改。此举解决 AI 编码的信任问题,让 AI 自证改对了。同时通过智能路由将成本降低 60-80%。

正文摘录

开源 AI Agent 项目 OpenSquilla 近日发布 0.4.0 版本,核心更新是推出编码工作流 coding 模式,并首次为 AI 编码引入“ 自我验证 ”机制:AI 不再止步于“我改好了”的口头交付,而是在交回结果前,先用测试为自己跑出一份可复核的、证明“改对了”的证据。 这一机制指向 AI Coding 当前最棘手的瓶颈——信任。过去一年 AI 写代码能力突飞猛进,但“能写”不等于“能信”:多数编码 Agent 改完即交,对错仍要人逐行复核,这也是 AI 编码难以真正无人值守、规模化进入生产环境的关键障碍。把验证内化进 Agent 自身,意味着行业评判 AI 编码的标准,正从“它声称改对了”转向“它能否自证改对了”。 其做法是一条独立的“ 红绿回归证据链 ”:先写一个注定失败的测试给问题定性、证明它真能抓住 bug,再把功能做好让测试由红转绿,最后跑一遍项目原有测试确认没弄坏别处;三关全过才算交付,任一不过直接打回。配套还有默认的自动修复闭环——不通过就自动重改到通过为止,以及隔离施工——改动只在隔离副本里进行、验收合格才落回源码。 在官方的案例演示中,Coding 模式为知名开源项目 micrograd,AI 教育圈顶流、Anthropic 研究员 Andrej Karpathy 的极简自动微分库,新增了“计算正确梯度”的功能——而梯度一旦算错,模型不报错也不崩溃,只会悄悄越学越偏,是最难靠肉眼发现的 bug。演示分两步:先由 AI 走完上述“红→绿→回归”三关、自交证据;再由人把 micrograd 的新功能与行业标准工具 PyTorch 在同一道题上并排比对,前向值与每一个梯度小数点后 10 位完全一致。换言之,不是“AI 自己说对”,而是“它和官方标准答案分毫不差”。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-07-01原文

相关内容