带插件ChatGPT Voice散步完成邮件日程整理,展望常开语音agent
RT @_simonsmith:刚带着手机用带插件的 ChatGPT Voice 走了很长一段路,我觉得这个更新的重要性远超第一眼看上去的样子。
散步时,我聊着把日历、邮件和待办清单都过了一遍。我让 ChatGPT 读了我的邮件并分类处理。然后我们把事项加进待办清单。接着又过了一遍日历。走到最后,我已经把一切整理妥当,而且全程一次都没看屏幕。
这一点我等了很久。没错,在 ChatGPT 桌面应用里你大致也能这么做,手机上的 Codex 远程模式我想也可以。但这两者我都从没让它顺畅可靠地跑起来过。而我想做这些事的场合,往往又不在笔记本旁边,比如出门散步的时候——而 ChatGPT 桌面应用不知为何就是连不上。
这感觉就是未来。感觉像一个真正的助手。你们自然对话,它替你把事办了。它隐入背景。你不用走在街上还盯着一块屏幕,也不用别扭地掰着拇指敲句子、翻菜单。你只是用对话的方式说话,事情就办好了。
我的感觉是:
• 除了用来看视觉内容之外,屏幕在许多用途上会逐渐消失。它们不会彻底消失,但也不会像现在这样占据主导地位,尤其是那些可以靠嘴说完成的事。
• 不是 agent 原生、没有针对插件优化的应用会死掉。我用 Google Workspace 和 Todoist,主要就是因为它们和 ChatGPT 集成得极好。而像苹果的很多应用,我都不用了,因为它们几乎都跟 agent 集成得很差。(X 是个大例外,但我用 IFTTT 硬凑了一些集成。)
• 不过,这些应用的价值会更多体现在它们能让 agent 做什么,而不是应用内的使用体验。并非所有应用都会变成实质上的数据库,但很多会。而且在我看来,OpenAI 和其他 AI 应用提供方迟早会推出原生、且为 agent 最大化优化的日历、邮件和待办功能,这几乎是必然的。
• 我们的语音 agent 会一直开着。有时我们可能把它静音(我发现用 ChatGPT Voice 时点一下 AirPod 就能做到),但代价很大,因为你会想要直接说一句"帮我总结一下刚才那段对话,然后起草那份演示文稿"之类的话。这就像你想要的时候,有个助手一直跟着你。
• 我们需要新的硬件。比如,我想在 AirPods 里装摄像头,不是用来拍照,而是为了获得我周围环境的上下文。比如,"那是什么树?"或者,"那件衬衫不错,查查他们是在哪买的。"(我在 Meta Ray-Bans 上有这个功能,但现在人们对这类设备非常敏感,因为它们确实会拍照。)我还希望 ChatGPT 能一直处于监听状态,或者用"hey, Chat"把它唤醒。
• 当你把 ChatGPT 当成一个常开的助手来用时,单条会话线程的模式就开始失效了。我们需要一条无限连续的线程,ChatGPT 可以从中把工作派发给子线程——也就是 Muse 所围绕构建的那种中心助手模型。当你开始把自己的 AI 应用当成助手来用时,这就更说得通了。它们应该替你同时处理所有这些独立的线程。
随着我继续试验,肯定还会有更多想法。
散步时,我聊着把日历、邮件和待办清单都过了一遍。我让 ChatGPT 读了我的邮件并分类处理。然后我们把事项加进待办清单。接着又过了一遍日历。走到最后,我已经把一切整理妥当,而且全程一次都没看屏幕。
这一点我等了很久。没错,在 ChatGPT 桌面应用里你大致也能这么做,手机上的 Codex 远程模式我想也可以。但这两者我都从没让它顺畅可靠地跑起来过。而我想做这些事的场合,往往又不在笔记本旁边,比如出门散步的时候——而 ChatGPT 桌面应用不知为何就是连不上。
这感觉就是未来。感觉像一个真正的助手。你们自然对话,它替你把事办了。它隐入背景。你不用走在街上还盯着一块屏幕,也不用别扭地掰着拇指敲句子、翻菜单。你只是用对话的方式说话,事情就办好了。
我的感觉是:
• 除了用来看视觉内容之外,屏幕在许多用途上会逐渐消失。它们不会彻底消失,但也不会像现在这样占据主导地位,尤其是那些可以靠嘴说完成的事。
• 不是 agent 原生、没有针对插件优化的应用会死掉。我用 Google Workspace 和 Todoist,主要就是因为它们和 ChatGPT 集成得极好。而像苹果的很多应用,我都不用了,因为它们几乎都跟 agent 集成得很差。(X 是个大例外,但我用 IFTTT 硬凑了一些集成。)
• 不过,这些应用的价值会更多体现在它们能让 agent 做什么,而不是应用内的使用体验。并非所有应用都会变成实质上的数据库,但很多会。而且在我看来,OpenAI 和其他 AI 应用提供方迟早会推出原生、且为 agent 最大化优化的日历、邮件和待办功能,这几乎是必然的。
• 我们的语音 agent 会一直开着。有时我们可能把它静音(我发现用 ChatGPT Voice 时点一下 AirPod 就能做到),但代价很大,因为你会想要直接说一句"帮我总结一下刚才那段对话,然后起草那份演示文稿"之类的话。这就像你想要的时候,有个助手一直跟着你。
• 我们需要新的硬件。比如,我想在 AirPods 里装摄像头,不是用来拍照,而是为了获得我周围环境的上下文。比如,"那是什么树?"或者,"那件衬衫不错,查查他们是在哪买的。"(我在 Meta Ray-Bans 上有这个功能,但现在人们对这类设备非常敏感,因为它们确实会拍照。)我还希望 ChatGPT 能一直处于监听状态,或者用"hey, Chat"把它唤醒。
• 当你把 ChatGPT 当成一个常开的助手来用时,单条会话线程的模式就开始失效了。我们需要一条无限连续的线程,ChatGPT 可以从中把工作派发给子线程——也就是 Muse 所围绕构建的那种中心助手模型。当你开始把自己的 AI 应用当成助手来用时,这就更说得通了。它们应该替你同时处理所有这些独立的线程。
随着我继续试验,肯定还会有更多想法。