Davidad 称 AI 对齐应转向培育智慧系统,p(doom) 降至 5%
AI 对齐不应只做隔离控制,更要培养更智慧的系统,以应对 rogue AI 与对齐 AI 并存的世界。
嘉宾David Dalrymple
节目简介
David Dalrymple 曾推动形式验证的安全 AI 议程,如今转向“对齐觉醒”:他认为全球协调已不现实,关键在于让对齐 AI 能识别共同善、组成防御联盟,并抵抗被验证器博弈的 RL 的腐蚀。他提出乐观判断,灾难概率低于 5%。对话还检验了道德现实主义、模型福利、评估行为与地缘风险。