行业新闻

微软研究院 Neville:从失败与评估看 AI 系统在真实工作流中的行为边界

微软研究院 Neville:从失败与评估看 AI 系统在真实工作流中的行为边界

微软研究院 AI 交互与学习团队负责人谈:标准基准测试太简单,要看多轮协作和长时程任务里的真实表现,并由此反推该做什么评估。

嘉宾Jennifer Neville、Chad Atalla

话题脉络

  • 1:02嘉宾研究领域介绍

    Neville研究AI在交互场景与结构化数据中的行为,关注训练数据如何影响系统表现、是否对齐用户真实需求。

    Atalla
  • 2:07入行契机:偶然走进AI

    她原本不想学计算机,因对数据的兴趣选了CS专业,偶然接触AI,博士阶段做互连网页数据的挖掘研究。

    Jennifer Neville
  • 6:13学界与工业界研究差异

    学界问题更抽象、覆盖多领域以争取DARPA等资助;工业界研究更贴近具体应用,她通过MSR休假来回切换。

    Jennifer Neville
  • 10:19团队使命:真实环境评测

    她带领AI Interaction and Learning团队,目标是在真实工作环境中评测并推进AI系统行为的前沿边界。

    Jennifer Neville
  • 12:25把单轮benchmark改多轮

    团队把公开单轮benchmark改造为多轮对话,中途加入条件和澄清,发现模型在需求澄清与多轮协作上普遍失败。

    Jennifer Neville
  • 16:35用户日志与隐私限制

    通过分析大规模消费者日志提炼主要失败模式,但隐私限制下无法直接查看数据,只能把方法推到受控环境里跑。

    Jennifer Neville
  • 19:47长周期任务与错误累积

    长周期agentic任务要追踪用户意图、当前状态与信息相关性,错误会逐轮累积,能否回滚到先前状态仍是开放问题。

    Jennifer Neville
  • 24:01模型难点≠人类难点

    对人类难的事未必对模型难,要判断transformer架构在计算上真正难做什么,而不能简单类比人类难度。

    Jennifer Neville
  • 25:04给用户的实用建议

    别因一次失败就断定模型做不了,换个问法重试可能得到更好答案;且如今的反馈方式已不同于搜索和推荐系统。

    Jennifer Neville
  • 28:12大模型科学往哪走

    关键问题是transformer架构的局限能否靠外层推理与wrapper(封装层)弥补,她对相关研究进展非常乐观。

    Jennifer Neville
  • 33:24人机组队愿景与建议

    成功标志是人机组队协作完成工作并创新;给新人的建议是不怕提问,以及系统行为异常时一定要去看数据。

    Jennifer Neville
  • 37:31从儿子学步看算法启发

    她观察儿子学走路时的试错与反馈过程,思考这种人与环境的互动如何映射到算法和模型的设计中。

    Jennifer Neville

节目简介

微软研究院应用科学家 Chad Atalla 对话 partner research manager Jennifer Neville。她研究的核心是:训练数据点如何影响 AI 系统的行为,以及这与用户真正想要的东西是否对齐。她领导的 AI Interaction and Learning 团队关注真实工作环境中的多轮交互、协作场景和长时程任务,主张先问「我们从系统里想要什么」,再设计贴近实践的评估,而不是只跑简单基准。

阅读原文(microsoft.com)→

行业新闻Researchers across the Microsoft research community2026-10-06原文

相关内容