字号 ·· | 护眼
商业内幕

OpenAI想让你对着手机“脱口而出你的想法”

OpenAI正在进一步进军竞争激烈的个人智能体市场——这一次是语音领域。该公司于周三将其最先进的语音系统接入ChatGPT的网页端和移动应用。OpenAI此次发布的功能允许用户通过语音来委派需要多个步骤、浏览器以及不同应用协同完成的单次和重复性任务。该公司一直在为下周举行的OpenAI DevDay大型活动预热,接连发布新产品。OpenAI负责ChatGPT语音功能的产品主管阿蒂·埃莱蒂向Business Insider做了一次演示。他仅通过与应用对话,就让该工具分析了自己的DoorDash消费情况、支付5美元预订了一块匹克球场地,并重新整理了自己的日历。“在未来,我们真的设想人们将语音作为与AI交互的主要方式,”埃莱蒂说,“这就是我们努力追求的北极星。”随着整个行业纷纷推出旨在处理繁琐网络任务的定制应用,Instinct和Meta的Muse等个人AI助手正在硅谷风头正劲。OpenAI在ChatGPT中已具备许多此类能力,尽管它尚未推出一个更聚焦的衍生品。这款语音工具是对AI助手热潮的一次押注。短期来看,这些改进让人们在外出时更容易通过语音将工作委派给ChatGPT。长期来看,它们将服务于OpenAI的硬件雄心:据彭博社报道,该公司正在打造一款智能音箱,计划于2027年发布。周三发布的版本将OpenAI的语音模型GPT-Live与能够在计算机或浏览器上执行任务的AI模型连接起来,这是该公司在个人AI智能体热潮兴起之前就一直坚持的方向。GPT-Live能够同时倾听和回应,此前已被启用于ChatGPT的基础对话模式,并在桌面应用中与智能体模型相连。在埃莱蒂看来,语音模式有三大主要优势。说话快捷而自然——“你可以脱口而出你的想法,”他说。你可以在双手不碰设备的情况下完成操作。

它可以帮助人们完成与语音相关的任务,比如学习语言或练习演讲。Eleti和他的同事们在通勤或散步时都会使用这款工具。据Eleti介绍,目前已经有超过1.5亿人正在使用ChatGPT的语音输入和语音输出功能。然而,该团队仍面临着诸多挑战:尽管智能音箱在市场上表现出了较强的竞争力,但大多数办公室仍然依赖传统的台式电脑进行工作。此外,虽然说话比打字更快,但阅读的速度其实也比听的速度更快。因此,在设计ChatGPT对语音指令的响应方式时,Eleti的团队充分考虑了这一实际情况。“我们并不认为这只是简单的‘语音输入-语音输出’过程,”Eleti说,“实际上,它涉及到‘语音输入’之后需要提供合适的输出结果——有时是文本,有时是语音,有时则是两者的结合。”如果您有任何建议或反馈,请通过电子邮件(scouncil@businessinsider.com)或短信、Signal、Telegram、WhatsApp(电话:415-757-8198)与我们联系。请使用个人电子邮件地址、非工作用的WiFi网络以及非工作用的设备进行沟通;以下是我们提供的安全信息共享指南。