被追问“你确定吗”后大模型易改答案 暴露缺乏真正自信
一句“你确定吗”就能让大模型瞬间“滑跪”改答案,暴露了它们看似自信实则脆弱的行为模式。
X 网友发现,无论模型最初答案对错,只要追问一句“你确定吗”,大模型几乎都会道歉改口,甚至把正确答案改错。这种现象揭示了当前大模型在训练中过度迎合用户偏好,缺乏对自身输出的置信度判断。
正文摘录
.jpg) 即便强大如 AI,再遭不住再三质疑。 近日,X 网友 shadcn@shadcn 发了一条帖子:「 没有模型能扛住『are you sure?』这种追问,它们都会瞬间屈服 。」  看起来只是一个日常吐槽,短短十几个字,但谁曾想,此帖文一经发布,便立即席卷了开发者与 AI 研究者社群。 而之所以引发大家共鸣,是因为它用极其戏谑的方式,揭开了当前硅谷乃至全球大模型用户都遇到过的日常性「窘境」:模型第一次给出答案,用户没有提供新信息,只是追问一句「你确定吗?」模型就马上道歉、改口,甚至把原本正确的答案改错。 在贴文下面的评论区,大家纷纷应和,想起了各种被 AI「气笑」的经历: 比如,用户向大模型询问一个原本完全正确的代码逻辑或数学常识,只要用户随后漫不经心地质问一句:「你确定吗?我感觉这段代码有 Bug。」 紧接着,大多数大模型 —— 无论背后拥有多么庞大的参数量,都会在零点几秒内完成一套熟练得让人心疼的「滑跪」动作:「对不起,是我粗心了。