Podcast Cover

[Thinking Machines 的 AI 突破:實現擬人化的全雙工語音交互]-[Critical Look at AI Interaction Models]

Hard Fork AI · B2 · 2026-05-27

Technology

📋 Summary

AI 語音交互的技術瓶頸:從「順序循環」到「全雙工」

目前的 AI 語音助手(如常見的 AI 前台接待系統)普遍面臨一個核心技術痛點,即「延遲」(latency)。傳統的語音 AI 運行機制被稱為「順序循環」(sequential loop):系統必須先聆聽用戶的話語、進行轉錄、處理上下文,最後再輸出回應。這種處理方式導致了用戶在說話與 AI 回應之間存在明顯的「不自然停頓」(unnatural lag)。

Thinking Machines 針對這一痛點推出了一項前沿技術,即「全雙工」(full duplex)模型。該技術允許 AI 在說話的同時主動聆聽並處理數據,就像人類在交談時能夠同步思考一樣。這種方式解決了當前 AI 在對話中因無法打斷或同步處理而產生的尷尬感。播客中提到,這與 Claude 的「協作模式」(cowork)概念相似,即 AI 可以在輸出回應的過程中,根據用戶隨時輸入的新信息動態調整其回答,而這種調整的響應速度達到了毫秒級,徹底改變了過去 AI 一旦開始輸出就無法中斷或接收新指令的僵局。

商業背景與市場信任度

Thinking Machines 的創始人 Miri Mirati 在 AI 領域具有極高的個人信譽與影響力,儘管該公司此前長期保持神秘且產品寥寥,但憑藉其深厚的行業背景,成功籌集了大量資金。播客分析認為,Mirati 作為 OpenAI 的早期成員,其個人財富與影響力是支撐該公司高估值的關鍵。對於 Thinking Machines 而言,此次推出的「全雙工」研究項目不僅是一個技術宣示,更是其從「概念產品」走向「實際應用」的重要轉折點。

AI 前台的未來與採用挑戰

儘管技術在進步,但公眾對 AI 語音助手的刻板印象仍是行業普及的一大障礙。許多企業主擔心 AI 會帶來兩年前那種「機器人式」的糟糕體驗。播客建議,企業在推廣這類技術時,應採取一種「賦能」而非「替代」的敘事方式——即強調 AI 能幫助企業解決此前無法處理的客戶支持需求(如處理積壓的請求),而非僅僅是為了削減人力成本。

行業競爭與合作展望

關於該技術的未來,播客提出了兩個觀點:

  1. 巨頭的競爭:如果該技術門檻並非不可逾越,OpenAI 或 Google 等巨頭極有可能在短期內通過逆向工程或自主研發推出類似產品,這將對 Thinking Machines 的先發優勢構成挑戰。
  2. 生態合作:像 Eleven Labs 這類深耕語音技術的公司,若能與 Thinking Machines 達成合作,將極大提升 AI 語音交互的擬人化水平。這種技術的落地關鍵在於「時機」,即在巨頭大規模普及之前,Thinking Machines 是否能通過其 0.4 秒的極低延遲優勢,在市場中建立起足夠的護城河。

總結而言,Thinking Machines 帶來的這項全雙工技術,標誌著 AI 語音交互正從「指令式」向「對話式」轉型。一旦這種擬人化的交互方式與實際的業務授權(如處理退款、執行具體任務)相結合,AI 前台將不再是令人厭煩的篩選機制,而是真正能解決用戶問題的高效工具。

🎯Key Sentences

1
I mean, I think this is a great idea.
我的意思是,我認為這是個很棒的主意。
2
there's still a little bit of unnatural lag that happens
仍然存在一些不太自然的延遲現象
3
Anyways, I think it's a great idea.
總之,我認為這是個很棒的主意。
4
I want to get into some of the technical stuff here
我想深入探討一些技術細節。
5
that is just pure kind of clout and credibility.
那純粹就是為了博取名聲和建立信譽。
展開全部

📝Key Phrases

1
latency issue
延遲問題
2
take in all the data
接收所有數據
3
deep dive
深入探討
4
lock in this price
鎖定此價格
5
nitty-gritty details
細枝末節
展開全部

📖 Transcript

Welcome to the ai hustle podcast.
Today on the show we're talking about a brand new um product that is coming out of thinking machines.
It is a ai model that essentially listens while it talks, so similar to a human.
A lot of times we've had this latency issue with things like 11 labs or other of these kind of AI voice receptionists.
There's so many different industries that this applies to, but there's a latency where you speak and it has to try to take in all the data, compute it, think of its response and spit it out to as fast as possible.
And there's kind of a little latency gap.

ListenLeap 带你學習真實語境

🎨 內容有趣
🌍 真實語境
📱 隨時收聽
或在網頁版學習