微软研究院 Neville:从失败与评估看 AI 系统在真实工作流中的行为边界
微软研究院 AI 交互与学习团队负责人谈:标准基准测试太简单,要看多轮协作和长时程任务里的真实表现,并由此反推该做什么评估。
嘉宾Jennifer Neville、Chad Atalla
话题脉络
- 1:02嘉宾研究领域介绍
Neville研究AI在交互场景与结构化数据中的行为,关注训练数据如何影响系统表现、是否对齐用户真实需求。
Atalla - 2:07入行契机:偶然走进AI
她原本不想学计算机,因对数据的兴趣选了CS专业,偶然接触AI,博士阶段做互连网页数据的挖掘研究。
Jennifer Neville - 6:13学界与工业界研究差异
学界问题更抽象、覆盖多领域以争取DARPA等资助;工业界研究更贴近具体应用,她通过MSR休假来回切换。
Jennifer Neville - 10:19团队使命:真实环境评测
她带领AI Interaction and Learning团队,目标是在真实工作环境中评测并推进AI系统行为的前沿边界。
Jennifer Neville - 12:25把单轮benchmark改多轮
团队把公开单轮benchmark改造为多轮对话,中途加入条件和澄清,发现模型在需求澄清与多轮协作上普遍失败。
Jennifer Neville - 16:35用户日志与隐私限制
通过分析大规模消费者日志提炼主要失败模式,但隐私限制下无法直接查看数据,只能把方法推到受控环境里跑。
Jennifer Neville - 19:47长周期任务与错误累积
长周期agentic任务要追踪用户意图、当前状态与信息相关性,错误会逐轮累积,能否回滚到先前状态仍是开放问题。
Jennifer Neville - 24:01模型难点≠人类难点
对人类难的事未必对模型难,要判断transformer架构在计算上真正难做什么,而不能简单类比人类难度。
Jennifer Neville - 25:04给用户的实用建议
别因一次失败就断定模型做不了,换个问法重试可能得到更好答案;且如今的反馈方式已不同于搜索和推荐系统。
Jennifer Neville - 28:12大模型科学往哪走
关键问题是transformer架构的局限能否靠外层推理与wrapper(封装层)弥补,她对相关研究进展非常乐观。
Jennifer Neville - 33:24人机组队愿景与建议
成功标志是人机组队协作完成工作并创新;给新人的建议是不怕提问,以及系统行为异常时一定要去看数据。
Jennifer Neville - 37:31从儿子学步看算法启发
她观察儿子学走路时的试错与反馈过程,思考这种人与环境的互动如何映射到算法和模型的设计中。
Jennifer Neville
节目简介
微软研究院应用科学家 Chad Atalla 对话 partner research manager Jennifer Neville。她研究的核心是:训练数据点如何影响 AI 系统的行为,以及这与用户真正想要的东西是否对齐。她领导的 AI Interaction and Learning 团队关注真实工作环境中的多轮交互、协作场景和长时程任务,主张先问「我们从系统里想要什么」,再设计贴近实践的评估,而不是只跑简单基准。