凯时AG

OpenAI的新语音模子, ,,,,先把用户烦到了

作者:沈淑媛
宣布时间:2026-07-21 09:33:34
阅读量:9653

OpenAI的新语音模子, ,,,,先把用户烦到了

上次ChatGPT Voice的代际更新, ,,,,照旧2024年5月GPT-4o宣布时展示的Advanced Voice;;;同年7月, ,,,,它最先向部分Plus用户小规模推出。。。。到GPT-Live宣布, ,,,,已经已往了两年。。。。

这一次, ,,,,OpenAI把full-duplex, ,,,,也就是全双工架构, ,,,,带进了ChatGPT Voice。。。。

已往的AI语音助手, ,,,,大多像一台反映很快的对讲机:用户说完一句, ,,,,模子再回一句;;;模子语言时, ,,,,用户可以打断, ,,,,但系统往往要重新判断、重新组织回覆。。。。

它已经像对话, ,,,,却还不敷自然, ,,,,不像真正的谈天。。。。

GPT-Live要解决的, ,,,,正是这层玄妙的差别。。。。

该功效今天将在ChatGPT上正式启用。。。。但……回声似乎并不算很好?? ?

对ChatGPT Voice的一次补课

在真实谈天里, ,,,,除了打辩说, ,,,,人和人很少是一句接一句、整整齐齐地轮流讲话。。。。我们会停留, ,,,,会犹豫, ,,,,会突然改口, ,,,,也会在对方语言时补一句“等等, ,,,,不是这个意思”。。。。

有时间, ,,,,一声“嗯嗯”“我懂”, ,,,,比一段完整回覆更主要;;;有时间, ,,,,最好的回应反而是先不要语言, ,,,,让对方继续往下说。。。。

已往的AI语音助手, ,,,,最难处理的正是这些细节。。。。

无论是ChatGPT、Gemini照旧我们最熟悉的豆包, ,,,,它们在“谈天”上都很干涩, ,,,,很有人机感。。。。

它们可以回覆问题, ,,,,可以读出文字, ,,,,也可以在用户打断时阻止。。。。但它们通常仍然依赖一个条件:先判断用户是不是已经说完了, ,,,,再决议模子该不应语言。。。。判断一旦蜕化, ,,,,对话就会变得别扭。。。。

用户只是停留了一秒, ,,,,它可能以为问题竣事了, ,,,,急着接话;;;用户说到一半改了主意, ,,,,它可能还在沿着上一句话往下答;;;配景里有人语言, ,,,,它也可能把不属于用户的声音当成输入。。。。

GPT-Live要改善的, ,,,,就是这些很难被包装成“大功效”、但会直接决议体验的小问题。。。。

要明确现在的GPT-Live, ,,,,先要看OpenAI此前的语音系统是怎么事情的。。。。

最早的ChatGPT Voice, ,,,,接纳的是级联语音系统(cascaded voice system)。。。。

简朴说, ,,,,它不是一个模子重新到尾处理语音, ,,,,而是由多个模子接力完成:先把用户的语音转成文字, ,,,,再让大语言模子凭证文字天生回覆, ,,,,最后再把文字转换针言音。。。。

这套方案的利益是容易搭建, ,,,,也能很快把大语言模子接进语音交互里。。。。但它的问题也很显着:语音里的大宗信息, ,,,,会在“语音转文字”的第一步就丧失。。。。

模子天生回覆时, ,,,,它看到的往往只是一段被整理过的文字, ,,,,而不是完整的对话现场。。。。用户的语气、停留、情绪转变, ,,,,并不会进入后面的语言模子。。。。再加上多个模子串联, ,,,,延迟也会被一层层叠加, ,,,,语音助手就很容易酿成“听一句、想一下、再念一句”。。。。

GPT-4o之后, ,,,,OpenAI推出了Advanced Voice, ,,,,最先用原生音频模子直接处理和天生声音。。。。

相比级联系统, ,,,,这是一次显着的前进:模子不必先把所有语音转成文字, ,,,,再绕一圈天生语音;;;它能保存更多音频细节, ,,,,延迟也更低, ,,,,用户可以更自然地打断。。。。

但Advanced Voice仍然没有完全挣脱回合制。。。。

OpenAI在先容GPT-Live时, ,,,,把此前的Advanced Voice称为回合制语音模子(turn-based voice model)。。。。它已经比古板语音助手更自然, ,,,,但仍然要先判断用户是否说完, ,,,,再决议模子是否应该最先回覆。。。。

这个机制在文本谈天里没有问题, ,,,,用户按下发送键, ,,,,就即是明确告诉模子这一轮输入竣事了——但语音谈天并不会有谁人按钮, ,,,,什么时间应该回覆, ,,,,需要由模子自己判断。。。。

用户停留一秒, ,,,,可能是说完了, ,,,,也可能只是还在想;;;用户拖长音, ,,,,可能是在组织语言, ,,,,也可能是酝酿情绪;;;配景里传来别人的声音, ,,,,可能被误判成新的输入。。。。

回合制语音模子最难处理的, ,,,,就是这个界线。。。。

GPT-Live通过两项架构上的刷新, ,,,,去解决这个问题。。。。

第一项刷新, ,,,,是把语音对话从“轮流讲话”推进到full-duplex。。。。

它可以一连听、一连判断、一连天生语音, ,,,,而不但是在用户竣事讲话后才进入回覆状态。。。。

或者说, ,,,,模子在加入一场仍在爆发的对话, ,,,,而不但是回覆一个已经竣事的问题。。。。

凭证官方先容, ,,,,GPT-Live每秒可以做出多次交互决议:是继续语言、继续谛听、暂停、打断对方的话语, ,,,,照旧挪用某个工具。。。。这让它能够举行更自然的互动交流、更好地掌握时间顺序, ,,,,甚至可以实时翻译。。。。

可以看到, ,,,,在用户语言的历程中, ,,,,GPT-Live会给出一些情绪上的回应。。。。就像你和你朋侪煲电话粥, ,,,,总会夹杂着一些“嗯”“哦”的声音。。。。

事实上, ,,,,GPT-Live并不是第一个实验全双工架构的语音模子。。。。此前Kyutai的Moshi、英伟达的PersonaPlex, ,,,,以及一批学术模子, ,,,,已经在探索让AI同时听和说, ,,,,处理停留、插话和短反。。。;;;谷歌的Gemini Live虽然没有强调全双工, ,,,,但也已经在做实时语音对话和原生音频模子, ,,,,偏向上很是靠近。。。。

GPT-Live的差别之处, ,,,,是把“边听边说”的能力带进了ChatGPT这个主流入口, ,,,,并且能和OpenAI的其它模子一起配合。。。。

这就要说到第二项刷新:语音交互层和后台智能之间的分工。。。。

GPT-Live并不但是一个“更会语言的模子”, ,,,,它更像ChatGPT的实时语音交互层:认真听、说、期待、打断、判断何时回应, ,,,,也认真维持对话节奏。。。。

遇到需要搜索、推理或重大使命的问题时, ,,,,它可以把使命交给背后的更强模子处理。。。。

语音模子不必在每一句话里都肩负所有智能压力。。。。简朴问题可以快速回覆, ,,,,重大问题可以挪用更高强度的推理;;;对话层认真坚持流通, ,,,,后台模子认真完成真正的思索和使命处理。。。。

这个架构同样不是很新, ,,,,但不新, ,,,,并不代表欠好用。。。。

我更愿意明确为这是OpenAI对ChatGPT Voice的一次补课:把已往已经在行业里泛起的实时语音交互能力, ,,,,和full-duplex语音连系起来, ,,,,然后塞到ChatGPT里。。。。

评测与评价

GPT-Live的现实效果, ,,,,现在还不适合下太满的结论。。。。

每次宣布新模子, ,,,,OpenAI都很善于围绕新能力重新界说一套评估标准。。。。模子会推理, ,,,,就强调推理;;;模子会写代码, ,,,,就强调代码。。。。

这次它同样给出了一套自己的评估效果, ,,,,包括对中止、期待、短反馈、配景噪音、语音明确等能力的测试。。。。

凭证这套新建的评估标准, ,,,,在5到10分钟的匹配语音对话中, ,,,,评测者显着更偏好GPT-Live-1和GPT-Live-1 mini。。。。

除此之外, ,,,,尚有一些别的榜单, ,,,,或许值得一看。。。。

OpenAI称, ,,,,GPT-Live-1在GPQA、BrowseComp和内部版本的τ?-Voice Telecom上都凌驾Advanced Voice Mode, ,,,,划分对应科学推理、网页搜索和多轮电信客服使命。。。。

但这部分也不可简朴明确成“GPT-Live这个语音模子自己变智慧了”。。。。由于GPT-Live在遇到搜索、推理和重大使命时, ,,,,会把使命交给背后的GPT-5.5。。。。

换句话说, ,,,,官方评估更像是在证实新的ChatGPT Voice系统更强, ,,,,而不是单独证实语音交互层自己已经完成了质变。。。。

并且你们可能已经注重到了, ,,,,它只做了纵向较量(和自己以前的模子作比照), ,,,,横向是一点也没提。。。。

我们无从得知, ,,,,GPT-Live放到整个语音AI行业里, ,,,,究竟处在什么位置。。。。

网友对此的评价较量两极分化。。。。

一部分人以为, ,,,,这次更新具有很是大的潜力, ,,,,若是能用在编程上, ,,,,或许会改变许多人的习惯。。。。

但也有许多网友以为, ,,,,GPT-Live这种一再回应的方式有些令人生厌。。。。

尚有人指出了它现在的问题, ,,,,好比在实时模式下无法盘问到ChatGPT的影象, ,,,,又好比显着是语音功效, ,,,,却在摄像头模式和屏幕共享模式下无法使用。。。。

对, ,,,,是的, ,,,,无法使用。。。。

凭证官方文档, ,,,,GPT-Live现已在全球规模内向所有使用iOS、Android系统的ChatGPT用户以及ChatGPT.com的用户开放。。。。关于Go、Plus和Pro版用户来说, ,,,,GPT-Live-1将成为驱动ChatGPT Voice功效的默认模子;;;而关于免用度户而言, ,,,,GPT-Live-1 mini则将成为默认模子。。。。

在推出时, ,,,,GPT-Live不支持在ChatGPT中举行语音通话、视频通话或屏幕共享功效。。。。官方正在起劲尽快添加这些功效, ,,,,用户仍然可以使用ChatGPT Voice的旧版本, ,,,,包括标准语音模式和高级语音模式, ,,,,这些版本中包括上述功效。。。。

语音助手, ,,,,先要变得不烦人

OpenAI披露, ,,,,每周已经有凌驾1.5亿人通过Voice和Dictation与ChatGPT语言。。。。用户拿它做的事情很日常:腾不脱手时问点日常问题, ,,,,练外语, ,,,,讲睡前故事, ,,,,通勤路上谈天。。。。

这些事情算不上很炫酷, ,,,,却是语音功效最真实的使用场景。。。。

凭证官方文档, ,,,,OpenAI这次把升级拆成了四个偏向:更自然的对话、更智慧的回覆、更好的聆听, ,,,,以及可视化回覆。。。。

更自然的对话, ,,,,对应的是用户可以中途插话, ,,,,可以停下来想一想, ,,,,也可以要求ChatGPT放慢语速。。。。模子会用“嗯嗯”“明确”这类短反馈体现自己在听, ,,,,而不是永远比及用户说完才突然最先输出一大段回覆。。。。

OpenAI还重新处理了ChatGPT里的九种声音, ,,,,让它们更适配GPT-Live。。。。

更智慧的回覆, ,,,,对应的是语音模式和最新前沿模子的毗连。。。。用户可以选择差别推理强度:Instant用来快速回覆, ,,,,Medium和High则给需要更多思索的问题使用。。。。

这个设计着实挺现实的, ,,,,由于语音场景对延迟很是敏感。。。。问一个简朴问题时, ,,,,你可能希望它连忙回覆;;;讨论一个重大问题时, ,,,,又需要它真的多想一会儿。。。。

更好的聆听, ,,,,则是这次升级里最靠克日常体验的一点。。。。用户停马上, ,,,,ChatGPT Voice应该期待, ,,,,而不是急着插话;;;用户要求它先清静听, ,,,,它就应该坚持清静;;;配景里有车声、旁边人语言时, ,,,,它也要更专注于用户自己的声音。。。。

对语音助手来说, ,,,,这些能力听起来不如“推理更强”响亮, ,,,,但往往决议用户愿不肯意继续用。。。。

虽然, ,,,,从首批反馈看, ,,,,GPT-Live还没有完全解决这个问题。。。。有用户以为它的短反馈过多, ,,,,甚至会酿成另一种打搅。。。。但我以为可以给它一点时间。。。。

最后是可视化回覆。。。。OpenAI 提到, ,,,,用户语言时, ,,,,ChatGPT可以展示天气、股票、体育等视觉卡片;;;Voice也继续支持搜索、影象、图片和文件上传。。。。

这说明OpenAI在把语音和屏幕信息重新组合起来:适合听的, ,,,,用声音说;;;适合看的, ,,,,就直接展示。。。。

已往, ,,,,语音更多是文本框的替换品。。。。用户不想打字, ,,,,就对着手机说一句;;;模子天生回覆, ,,,,再把文字念出来。。。。它实质上照旧文本交互的延伸, ,,,,只是把键盘换成了麦克风, ,,,,把屏幕上的文字换成了声音。。。。

但包括GPT-Live在内的、当下的语音助手指向了另一种产品形态:语音不再只是输入输出通道, ,,,,而是AI加入现实使命的实时入口。。。。

GPT-Live的重点并不是要把ChatGPT从文本框里彻底解放出来。。。。更准确地说, ,,,,它是在补ChatGPT Voice的日常使用感。。。。

不过, ,,,,这件事要建设有一个条件:它会不会少打搅用户。。。。

语音助手和文字助手最大的差别是, ,,,,文字可以被忽略, ,,,,可以逐步读, ,,,,也可以随时关掉;;;但声音会直接闯进人的注重力里。。。。它接话太急、短反馈太多、判断错停留, ,,,,用户感受到的就不是智能, ,,,,而是烦人。。。。

GPT-Live的真正磨练也在这里。。。。

这次更新无疑是有价值的, ,,,,它让AI语音助手变得更顺, ,,,,也袒露出了变顺之后, ,,,,它可能碰上什么问题。。。。GPT-Live现在袒露出的问题, ,,,,可能也会是其它AI语音助手未来(或者已经保存)的问题。。。。

我想, ,,,,我们需要一点耐心。。。。(作者/袁心玥)

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论, ,,,,请在这里揭晓您的看法、交流您的看法。。。。

最新文章

热门文章

随机推荐

【网站地图】