核心要点
- 语音 AI 的 “人味” 取决于响应时机而非模型大小,因此更小的实时模型往往听起来更像真人。
- “电话兜住率”(call containment)指标具有误导性,它衡量的是转接情况,而不是客户的问题是否真正得到解决。
- 听起来像人却会编造答案的语音 AI,比保持脚踏实地、基于真实数据的机械式 AI 更糟糕。
2024 年,如果你拨打一家公司的客服电话,被转接到 “语音智能体”,你会在最初的几秒内就知道自己在和机器对话。你的问题与它的回答之间哪怕只有几秒钟的沉默空白,就足以说明电话那头是软件。两年、几十亿美元融资之后,这些破绽正在消失。如今最好的语音 AI 系统已经足够优秀,人们在盲测中认不出它们是 AI,不是偶尔,而是经常。按照大多数通行的定义,我们正在亲眼看着语音 AI 在现实世界中突破图灵测试。
但这个里程碑理应受到审视,因为类似的宣称往往在细节上语焉不详。每当一项技术跨越这样的门槛,它的营销宣称往往跑在工程能力前面,语音 AI 也不例外。我花了将近两年的时间构建文本转语音(TTS)和语音转语音(STS)模型,会见评估供应商的企业买家,他们考察的十多家厂商,宣称几乎如出一辙。其中一些宣称经得起推敲,但大多数还差得远。在与客户交流中,以下是我在语音 AI 领域最常遇到的七个误区。

误区一:更大的模型并不会让语音 AI 更像人
行业默认假设是规模能解决一切:往问题上砸一个更大的语言模型,智能体就会更像人。但事实并非如此,因为人类处理对话的方式不像模型处理提示词 —— 我们会在对方话说到一半时打断,而不是等他说完一整句。一个先等待、再处理、然后才回应的语音智能体,无论输出多么能言善辩,听起来都是机械的,因为暴露它的是响应时机,而不是词汇量。更小的、专门化的模型能够实时处理常规对话,往往听起来更像真人,只在必要时才升级处理,同时保持足够的敏捷,跟得上来电者的节奏。
误区二:”我们处理了 90% 的电话” 通常意味着 “兜住”,而非 “解决”
语音 AI 仍然依赖特定的基准来评估性能,而 “电话兜住率” 很可能是最具误导性的一个。这个指标衡量的是无需人工干预、由语音 AI 处理的电话占比。它之所以能存活至今,是因为几乎没人追问那个显而易见的后续问题:这些被 “兜住” 的电话,问题真的解决了吗?只要客户没有被转接给真人,这通电话就算 “兜住” 了;只有问题真正被解决,才算 “搞定”。厂商喜欢拿兜住率说事,因为它数字更大,但它对 “部署是否有效” 不置一词。企业语音 AI 落地中大部分失望,正是源于这种错位。不妨改问任何一家厂商 “解决率” 是多少,然后看话题怎么变。
误区三:听起来像人却会编造答案的语音 AI,比不会编造、接地气的机械式 AI 更糟
AI 听起来令人信服地像人,有很多值得称道之处,正是这一点让语音交互显得自然而非机械。但真正的目标是把这种人的温度与准确性结合起来,因为一个听起来像人且永远正确的语音,永远会打败一个只是听起来像人的语音。
缺乏知识底座(ungrounded)的语音模型只依赖内部训练记忆,在 15% 到 30% 的真实通话中可能产生幻觉。而将每次响应都锚定在真实客户数据与后端数据之上、不让模型自由发挥的语音 AI 系统,更不可能自信满满地给来电者提供错误信息、误导他们。如果一家厂商解释不清自己的系统如何控制幻觉,那你只听到了半个方案。
误区四:语音的智能在于你不存储什么,而不是存储什么
ChatGPT 的问世给科技行业植入了一个主流观念:更多的参数、更多的训练数据,必然带来更多、更好的智能。但人类智能并不是这样运作的,因此它也不应该是语音 AI 该有的运作方式。我们不会记住听过的每一条信息,我们只保留重要的,其余随它去。今天的超大语言模型恰恰相反:它们把一切都压缩进自己体内,这也是数据中心需求爆炸的原因之一。但对于绝大多数真实世界的语音用例,比如客服、转录、结构化对话等,一个专注的小模型在成本、延迟、往往还有准确性上,都能打败一个万亿参数的通才。
误区五:完全替代人类客服 vs 知道自己的边界
显然,没有人想要一个为了不承认自己不懂,就假装自信的 AI 语音。这也是为什么真正创造价值的部署,模仿的是一位优秀人类员工的做事方式:对熟悉的内容当场处理;一旦遇到陌生领域,或碰上难缠的客户,就举起旗子,让客户短暂、自然地等待,然后升级给更大的模型或真人客服。目标永远不应该是 100% 自动化。理想的配置是这样一个智能体:它能实时识别自身能力的边界,因为这正是它能在大规模部署下保证安全的原因。
误区六:语音不会消灭其他所有界面,它只是增强我们已有的界面
一个常见的假设是:一旦语音 AI 足够好,打字和屏幕就会自然消失。我不认为我们正走向零打字,屏幕也不会消失。人们仍然需要它们来看视频、扫一眼仪表盘,或者进行视觉化的核对。真正在改变的是:我们与机器的大量日常交互将转向语音,就像人与人之间已经发生的那样,叠加在仍然有意义的界面之上。语音不会取代一切;它只是会在比过去多得多的场景里成为默认选项。
误区七:把 LLM 拼接上现成的文本转语音 API,算不上语音智能体
随着语音 AI 成为消费品牌的差异化优势,许多 “语音智能体外壳”,那些为了品牌或计费而叠加在现有基础设施之上的服务在演示中看起来令人惊艳,却很少能扛住真实的客服话务量。把语音转文字、语言模型和文本转语音串在一起,会在每一次交接环节叠加延迟。在规模化场景下真正把系统维系在一起的,并不是 API 层,而是流水线在负载下运行的单元经济性,以及让系统又快又省钱的芯片级优化。这正是大多数 “外壳” 跳过的、不讨喜的硬功夫,也恰恰是定义下一代客户体验的东西。
那条重要的分界线
每一轮炒作周期,最终都会产生自己的筛选机制,用来分辨谁是认真的、谁只是搭车凑热闹。随着语音界面越来越难以与电话那头的人类区分,”被构建成听起来可信的系统” 与 “被构建成真正可信的系统” 之间的差别,将比今天重要得多。那些现在就把它当作一门工程学科、而不是一个营销勾选框来对待的公司,才是当新鲜感消退之后,客户仍然会信任的那一批。
作者:Sudarshan Kamath,Smallest AI 的联合创始人兼 CEO
原文:https://www.unite.ai/voice-ai-myths-enterprise-deployments/
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/71861.html