Podcast Cover

[Thinking Machines 实验室的全双工突破:AI 语音交互如何跨越“机器人延迟”鸿沟]-[Critical Look at AI Interaction Models]

Hard Fork AI · B2 · 2026-05-27

Technology
或在网页版学

📋 Summary

Thinking Machines 实验室的全双工突破:AI 语音交互如何跨越“机器人延迟”鸿沟

在人工智能语音交互领域,长期存在一个阻碍其达到“人类水平”的核心痛点:延迟(latency)。播客《AI Hustle》深入探讨了由前 OpenAI 联合创始人 Mira Murati 创立的 Thinking Machines 实验室推出的一项全新研究项目,该项目旨在通过全双工(full duplex)技术彻底解决这一难题,让 AI 模型能够像人类一样“边听边说”。

核心痛点:从“顺序循环”到自然对话的鸿沟

目前的 AI 语音助手,无论是 11 Labs 还是其他行业的 AI 接待员,大多运行在一种顺序循环(sequential loop)模式中。正如播客中所述,传统代理必须先将用户的句子转换为文本,再分析上下文,最后生成回应。这种链式处理导致了不可避免的滞后:“在你说完话和它开始回复之间,仍然存在一点不自然的延迟(unnatural lag)。”

更糟糕的是,现有的系统缺乏对人类对话节奏的理解。当用户进行自然的停顿时,AI 往往会误判为发言结束而抢先回应;反之,当用户在 AI 长篇大论的中途试图插话或纠正时,当前的语音模式(如 ChatGPT Voice Mode)通常会直接“冻结”或切断自己的回答,造成尴尬的交互中断。播客主持人形象地描述了这种场景:“就像我在说话时,它已经回答了问题的一半……一旦我开始说话,它就好像卡住了,说‘抱歉,我没听清’。”这种体验让用户时刻意识到对面是一个机器,而非真实的交流对象。

技术突破:全双工与毫秒级响应

Thinking Machines 实验室提出的解决方案被称为全双工(full duplex)技术。其核心理念是让 AI 模型在输出的同时 actively taking information(主动接收信息),实现真正的同步处理。这项技术的突破性在于将响应延迟压缩到了毫秒(milliseconds)级别,而非传统的秒级。

播客中指出,这种能力使得 AI 能够应对高难度的对话场景,例如“激烈的争论(heated argument)”或“谈判”,在这些场景中,人们经常会互相打断、语速极快甚至重叠说话。对于传统 AI 模型而言,这几乎是“不可能(impossible)”的任务,但全双工模型却能动态调整回应,甚至在生成长内容的过程中根据新输入的信息实时 pivot(转向)和改变策略。这与 Claude Code 等工具在长任务中允许中途干预的逻辑相似,但 Thinking Machines 将其应用在了对实时性要求极高的语音交互中,实现了"0.4 秒”以内的极速响应,超越了目前 OpenAI 和 Google 的表现。

商业前景与应用重构

这项技术的成熟将极大推动 AI 接待员和客服系统的普及。目前,许多企业对引入 AI 持保留态度,部分原因在于过去的糟糕体验——用户回忆起的是两年前那些“非常机械化(very robotic)”的技术支持电话。然而,一旦解决了延迟问题并赋予了 AI 足够的授权(authorizations)去实际解决问题(如直接退款),用户的接受度将发生质的飞跃。播客观点犀利地指出:“如果它能解决我的问题……我其实更希望跟机器人说话,而不是真人。”

此外,市场推广的策略也需要转变。不应仅仅强调用 AI“替换”人工接待员,而应侧重于赋能:利用 AI 处理那些过去因人力不足而被“搁置(dropping the ball)”的海量请求,将响应时间从数天缩短至瞬间。这种视角的转换(perspective shift)能更好地消除公众对 AI 的抵触情绪。

未来挑战:时间窗口与巨头博弈

尽管 Thinking Machines 的技术令人兴奋,但其面临的竞争压力巨大。Mira Murati 凭借其在 OpenAI 的巨大股权和声誉筹集了 20 亿美元,但产品直到如今才初见端倪。播客讨论了一个关键问题:时机(timing)。Thinking Machines 计划在今年晚些时候进行更广泛的发布,但考虑到 OpenAI 和 Google 的研发实力,巨头们是否会在同期甚至更早推出类似的克隆版本?

如果这项技术壁垒足够高,我们可能会看到像 11 Labs 这样的公司与 Thinking Machines 达成合作伙伴关系;但如果这只是像“推理模型”那样容易被逆向工程的技术,那么巨头们很可能会迅速自行 rollout(推出)同类功能。无论如何,全双工技术的出现标志着 AI 语音交互正从“玩具”走向“实用工具”,真正的人类级对话时代或许已近在咫尺。

🎯Key Sentences

1
I mean, I think this is a great idea.
我的意思是,我认为这是个很棒的主意。
2
there's still a little bit of unnatural lag that happens
仍然存在一些不太自然的延迟现象。
3
Anyways, I think it's a great idea.
总之,我认为这是个很棒的主意。
4
I want to get into some of the technical stuff here
我想深入探讨一些技术细节。
5
that is just pure kind of clout and credibility.
那纯粹就是为了博取名声和信誉。
展开全部

📝Key Phrases

1
latency issue
延迟问题
2
take in all the data
接收所有数据
3
deep dive
深入研究
4
lock in this price
锁定这个价格
5
nitty-gritty details
细枝末节
展开全部

📖 Transcript

Welcome to the ai hustle podcast.
Today on the show we're talking about a brand new um product that is coming out of thinking machines.
It is a ai model that essentially listens while it talks, so similar to a human.
A lot of times we've had this latency issue with things like 11 labs or other of these kind of AI voice receptionists.
There's so many different industries that this applies to, but there's a latency where you speak and it has to try to take in all the data, compute it, think of its response and spit it out to as fast as possible.
And there's kind of a little latency gap.

ListenLeap 带你进入真实语境学习

🎨 内容有趣
🌍 真实语料
📱 随时听看
或在网页版学