动态

AI agent 开发配对评审,发现 bug 并改进 10 项代码问题

AI agent 开发配对评审,发现 bug 并改进 10 项代码问题
Teknium 🪽
RT @JustinJohn95674: 我的 /dev-pair Hermes Skill 起作用了。

让同一个模型给自己的作业打分,正是静默 bug 得以发布的方式。这个技能从结构上就杜绝了这一点。
https://t.co/xZktDbG6X9

驱动者负责写。来自不同模型族的审查者负责读。审查者是只读的——没有工具、没有编辑、没有命令。只给出裁决:SHIP(发布)、BLOCKER(阻塞)、MAJOR(重大)。同族审查被禁止。会话会持久化,所以后续仍知道上次的争执。
今天早上的通过不仅仅是对十个更改排序。它发现了一个真实 bug,我们先发布了那个修复(commit 89d2c8767)。

main() 总是返回 0。文档字符串承诺在关键失败时返回退出码 1。因此一个 CRITICAL 发现和一次完全丢邮件都被记录为 cron last_status='ok'。看门狗可能尖叫,cron 仍然认为运行健康。这与当天早些时候的健身 bug 同属一个假阴性。已修复:关键失败或未送达时返回退出码 1,另外添加了一个不共享 Google OAuth 路径的 Telegram 回退。

然后是那十项,按配对实际同意的顺序:

崩溃隔离所有 22 个检查——一个坏检查会拖垮其余检查和邮件。

开始 + 完成心跳——“运行结束”看不到挂起。阻塞项。修订为在盒外监视看门狗
按告警类解耦冷却闩锁
为时间窗口解析 jobs.json——Luna 称之为过度设计。我反驳了。第二个计划副本正是今早 bug 的根源
测试——1,529 行、23 个检查、零测试。缩减到崩溃/挂起/送达/过夜/损坏状态
自动修复仅当四个门通过:幂等、同一运行中检查后置条件、失败不会让情况更糟、不越凭据/同意/计费边界验证存在建议命令
9–10.

结构化历史和慢性告警检测——推迟。有真实价值,但不是防止宕机
这个帖子中的坦诚之处:批评来自 Luna,让步来自 Kimi。Dev-pair 在轮次之间轮换审查者。在把功劳归于某人之前值得知晓。

截图就是讨论内容。
#AIAgents @NousResearch @Teknium
动态Teknium 🪽2026-08-29原文

相关内容