Multimodal Agents by Sierra Sierra 推出的多模态客服智能体,能在语音、文字和图像间自动切换,帮助企业用更自然的对话方式服务客户。 热门评论 PH 用户Sierra 的多模态智能体把语音、文字和视觉带进同一场客户对话,让用户能发挥每种媒介的长处,而不是只能困在一种方式里。语音用来解释你需要什么,视觉用来并排比较选项,文字用来之后回头查看。基于 Sierra 构建的智能体会预判对话每个时刻需要什么,并自动切换模式,不用你重新开始或重复刚才的话。它基于 Sierra 的 MCP UI 集成,所以企业可以设计并托管自己的交互式组件(产品卡片、对比表格、日历、表单),再把它们放进任意对话。组件构建一次,就能在智能体所在的任何地方使用,不用按渠道重建,也不用维护单独版本。更新会立刻同步到所有地方。组件还可以全屏展开,适合任何需要更多空间的内容。核心功能:根据对话上下文,在语音、文字和视觉之间自动切换模式;MCP UI 集成可嵌入自定义交互式组件(产品卡片、对比表格、日历、表单);构建一次的组件可在智能体部署的所有渠道使用;需要更多空间的组件可全屏展开;即时更新,无需重新部署即可同步到所有地方。到 sierra.ai 试试 · 多模态智能体 P.S. 我专门挖掘科技、SaaS 和 AI 领域最新最强的发布,关注即可收到通知 → @rohanrecommendsPH 用户“根据上下文自动切换模式”这部分,我最想看到它能优雅降级——如果智能体判定需要视觉内容,但客户正在打电话、眼前没有屏幕,会发生什么?或者给一个在安静办公室里没法出声回应的人选了语音,又会怎样?客户有没有办法在对话中途覆盖智能体选择的模式,还是这个决定完全由智能体侧说了算?PH 用户我反复想到的一个细节是:由智能体决定什么时候切换,而不是让用户一开始就选好渠道。我在 Callie Care 做 voice AI,打电话来的人常常都是 80 多岁,最难的从来不是语音模型,而是判断语音什么时候不再是合适的界面。我们很多失败案例,都发生在用户需要一个之后还能再看一眼的东西的时候。智能体怎么决定切入视觉?这是基于 intent,还是你们会读取像反复澄清、长时间停顿这样的信号?而当它切回语音时,会带着同一份上下文,还是重新开始这一轮? 热门产品Rohan Chaubey2026-09-15原文 打开互动版
语音用来解释你需要什么,视觉用来并排比较选项,文字用来之后回头查看。基于 Sierra 构建的智能体会预判对话每个时刻需要什么,并自动切换模式,不用你重新开始或重复刚才的话。
它基于 Sierra 的 MCP UI 集成,所以企业可以设计并托管自己的交互式组件(产品卡片、对比表格、日历、表单),再把它们放进任意对话。组件构建一次,就能在智能体所在的任何地方使用,不用按渠道重建,也不用维护单独版本。更新会立刻同步到所有地方。组件还可以全屏展开,适合任何需要更多空间的内容。
核心功能:根据对话上下文,在语音、文字和视觉之间自动切换模式;MCP UI 集成可嵌入自定义交互式组件(产品卡片、对比表格、日历、表单);构建一次的组件可在智能体部署的所有渠道使用;需要更多空间的组件可全屏展开;即时更新,无需重新部署即可同步到所有地方。到 sierra.ai 试试 · 多模态智能体
P.S. 我专门挖掘科技、SaaS 和 AI 领域最新最强的发布,关注即可收到通知 → @rohanrecommends