
AI 的需求卻恰恰相反:它需要持續(xù)感知物理世界——見你所見,聽你所聞,隨時(shí)在場(chǎng),而非等你解鎖屏幕才醒來(lái)。
當(dāng) AI 真正成為一種基礎(chǔ)能力,它遲早要從屏幕里破殼而出,尋找屬于它自己的形狀。這將是一個(gè)漫長(zhǎng)的探索和演化過(guò)程。
「AI 器物志」欄目由此而來(lái),愛范兒想和你一起持續(xù)觀察:AI 如何改變硬件設(shè)計(jì),如何重塑人機(jī)交互,以及更重要的—— AI 將以怎樣的形態(tài)進(jìn)入我們的日常生活?
這是「AI 器物志」的第 19 篇文章。
過(guò)去兩年里,AI 最明顯的變化不只是模型變聰明,而是它的定位從少數(shù)人的專業(yè)工具,轉(zhuǎn)變成了日常生活的基礎(chǔ)能力。
如今,我們更是習(xí)慣了在走路、開車、做飯甚至摸魚期間,隨時(shí)隨地向 AI 發(fā)出指令。

只不過(guò)隨著頻率提高,以 PC 時(shí)代鍵鼠交互為主的人機(jī)交互方式正在逐漸暴露出短板——
「手動(dòng)打字」需要用戶先有一個(gè)想法,再將散亂的思緒組織成連貫語(yǔ)言,還要在敘述中保持一定的邏輯關(guān)系,才能將腦袋里想的變成 AI 能夠理解的提示。

而在鍵盤的另一邊,手機(jī)時(shí)代所主導(dǎo)的「語(yǔ)音輸入」就幾乎沒有這樣的桎梏。
畢竟講話和打字最大的區(qū)別,就是語(yǔ)音允許人們一邊輸出,一邊思考、補(bǔ)充和修正,相比鍵盤輸入更接近思維原本發(fā)生的方式。

對(duì)于絕大多數(shù)沒有受過(guò)系統(tǒng)寫作訓(xùn)練的普通人來(lái)說(shuō),語(yǔ)音遠(yuǎn)比文字輸入更接近「真正的自然交互」。
這種廣泛的需求之下,自然也催生出了一批圍繞語(yǔ)音入口展開的產(chǎn)品。
比如勢(shì)頭正盛的 Plaud,主打的就是將錄音、轉(zhuǎn)寫和總結(jié)包裝成完整工作流;
成為樣板產(chǎn)品的 Typeless 則負(fù)責(zé)刪除語(yǔ)氣詞、進(jìn)行格式清洗后「幫你成文」。


這些產(chǎn)品的形態(tài)各不相同,押注的卻是同一件事:
下一代 AI 入口,未必要求用戶坐下來(lái)、打開應(yīng)用并認(rèn)真打字。
嘿,AI
「自然語(yǔ)言交互」聽上去非常先進(jìn),但它先進(jìn)的地方其實(shí)是溝通效率,技術(shù)原理上并沒有什么驚天地泣鬼神的地方。
門檻最低的方案,就是一副 TWS 耳機(jī)加手機(jī)上的 AI,就能組成一個(gè) 24 小時(shí)在線的虛擬副手。

畢竟耳機(jī)本來(lái)就在耳朵里,手機(jī)系統(tǒng)與第三方 app 也有現(xiàn)成的語(yǔ)音轉(zhuǎn)寫、快捷指令和跨應(yīng)用輸入。
不需要任何專用硬件,就可以把你散碎的命令傳達(dá)給任何一個(gè) AI 模型。
更殘酷的是,它的速度、兼容性和跨設(shè)備能力,仍然優(yōu)于市面上大多數(shù)號(hào)稱「開創(chuàng)先河」的專用 AI 硬件——

然而現(xiàn)實(shí)情況是,這套近乎無(wú)門檻的組合,真正的瓶頸不在手機(jī)、而在麥克風(fēng)對(duì)環(huán)境人聲的處理。
就拿 AirPods 為例,由于 AirPods 的麥克風(fēng)策略強(qiáng)調(diào)聲音自然度、不愿意給人聲降噪,在多人環(huán)境里經(jīng)常會(huì)出現(xiàn)將周圍說(shuō)話的聲音一并采集到轉(zhuǎn)成文字的問題。
這對(duì)于打電話或者發(fā)語(yǔ)音沒什么,但對(duì)于 AI 輸入,一旦提示詞「夾生」,就很容易得到完全不相關(guān)的回答:

如果往更深層看,這意味著在 AI 成為「主流使用場(chǎng)景」的當(dāng)下,耳機(jī)好壞的評(píng)價(jià)標(biāo)準(zhǔn)正在改變——
過(guò)去耳機(jī)比的是音質(zhì)、延遲和降噪,未來(lái)除了前面這些,更要比較人聲降噪的強(qiáng)度、準(zhǔn)確性和分離能力。
甚至我們可以說(shuō),耳機(jī)麥克風(fēng)正在從逐漸被人遺忘的通話配件,一舉變成了最前端的 AI 控制器。

語(yǔ)音指揮的第二條路線,則是智能眼鏡。
盡管智能眼鏡總是強(qiáng)調(diào)「給人生加上一塊 HUD」,但從商品化結(jié)果來(lái)看,唯一成功的智能眼鏡仍是以語(yǔ)音、拍照和開放式音頻為核心的基礎(chǔ)款。

這背后的原因倒不復(fù)雜:眼鏡顯示系統(tǒng)會(huì)犧牲重量、續(xù)航和成本,更需要從 0 培養(yǎng)一套全新的用戶使用習(xí)慣。
而「看見什么問什么,AI 講給你聽」,本身就足夠構(gòu)成一個(gè)相對(duì)清晰的 AI 賣點(diǎn)了。

但智能眼鏡的問題在于,它的「無(wú)感」更多存在于宣傳片里。
畢竟當(dāng)一副帶攝像頭的眼鏡持續(xù)朝向別人時(shí),對(duì)方很難判斷設(shè)備是否正在拍攝或者收音,這種不確定性本身就會(huì)制造社交壓力。
再加上受限于體積和續(xù)航,智能眼鏡的麥克風(fēng)陣列、通話降噪和揚(yáng)聲器效果,不一定比成熟的 TWS 耳機(jī)更好。

更重要的是,在目前智能眼鏡的銷售模式中,這類產(chǎn)品往往與品牌客戶端和云端模型深度綁定,用戶在模型選擇、數(shù)據(jù)遷移和跨設(shè)備切換方面缺乏自由度。
最簡(jiǎn)單的例子就是 Meta。
Meta Ray-Ban 智能眼鏡在各個(gè)方面都比較平衡,卻強(qiáng)制用戶連接 Meta AI,不能作為藍(lán)牙音頻設(shè)備直接喚醒 Siri 或者其他智能助手。

這種程度的綁定讓智能眼鏡雖然成為了「語(yǔ)音 AI 交互」的代表性產(chǎn)品,卻很難成為那個(gè)主流產(chǎn)品。
第三條路線,則是 2026 年以來(lái)逐漸興起的道路——為語(yǔ)音輸入 AI 制造獨(dú)立硬件入口。
比如剛剛 OpenAI 與 Work Louder 聯(lián)名的的 Codex Micro,就是一塊面向 AI 智能體的外置控制臺(tái)。
并且上面專門設(shè)置了一個(gè)用于語(yǔ)音輸入的 push-to-talk(PTT)按鍵:

盡管 Codex Micro 本身沒有麥克風(fēng),PTT 需要調(diào)用電腦連接的其他收音設(shè)備,但這種設(shè)計(jì)依然具有象征意義:
語(yǔ)音輸入已經(jīng)不再只是 UI 中的一個(gè)小圖標(biāo),而開始逐漸獲得類似鼠標(biāo)右鍵、手機(jī)拍照鍵或者鍵盤指紋一樣的穩(wěn)定的物理位置。
將語(yǔ)音輸入單獨(dú)作為一個(gè)按鍵設(shè)置,基本上承認(rèn)了這種 AI 交互方式的高頻屬性——甚至對(duì)某些用戶可能比 26 個(gè)字母鍵都要更高頻。

而 PTT/TNT 更進(jìn)一步的設(shè)想,就是徹底擺脫屏幕。
愛范兒之前爆料過(guò),OpenAI 正在規(guī)劃的若干硬件產(chǎn)品中,就包括一個(gè)無(wú)屏的便攜設(shè)備,通過(guò)語(yǔ)音、攝像頭和環(huán)境傳感器理解用戶所處的情境。

如果 OpenAI 真的這樣設(shè)計(jì),無(wú)異于承認(rèn)了曾經(jīng) Humane AI Pin 的道路。
當(dāng)然,背后有 ChatGPT 和 Codex 做背書,OpenAI 的徽章肯定會(huì)比 Humane 的更實(shí)用。
與此同時(shí),面對(duì) AI 語(yǔ)音交互最難繞開的兩個(gè)問題:公共場(chǎng)合說(shuō)出個(gè)人安排的尷尬,以及嘈雜環(huán)境中的識(shí)別失真,研究者們也有了一些奇思妙想。
比如近期出現(xiàn)的一些「超聲波舌部動(dòng)作識(shí)別」設(shè)備,通過(guò)抵在下頜的超聲波探頭讀取舌頭運(yùn)動(dòng),再用機(jī)器學(xué)習(xí)將其解碼為語(yǔ)言:

另一些研究則嘗試把傳感器裝進(jìn)眼鏡或頭顯,通過(guò)面頰、顴骨和口部的細(xì)微運(yùn)動(dòng)識(shí)別無(wú)聲指令——之前被蘋果悄悄收購(gòu)的 Q.ai 就是研究這個(gè)方向的。
這些裝置距離消費(fèi)級(jí)產(chǎn)品仍然很遠(yuǎn),識(shí)別范圍、準(zhǔn)確率和佩戴體驗(yàn)也存在明顯限制,但方向已經(jīng)足夠清晰。
未來(lái)的「語(yǔ)音輸入」未必真的需要發(fā)出聲音——所謂語(yǔ)音交互,最終可能演化為對(duì)人類發(fā)聲動(dòng)作、口型乃至面部肌肉活動(dòng)的直接識(shí)別。

幫我算算 token 用量
歸根結(jié)底,為什么語(yǔ)音輸入能夠在 AI 時(shí)代獲得超越鍵盤的聲望,還是因?yàn)槿祟惒皇羌兇獾摹敢曈X動(dòng)物」。
換言之,人們雖然習(xí)慣于用眼睛接收信息,但并不擅長(zhǎng)用視覺信號(hào)發(fā)送信息。
在傳遞信息這件事上,我們?nèi)匀蛔裱?30 萬(wàn)年前的習(xí)慣:發(fā)出「咕咕嘎嘎」的聲音就是要比打手勢(shì)效率高。

用語(yǔ)音指揮 AI,看似是一種相對(duì)低效的使用方式——人在講話時(shí)經(jīng)常重復(fù)、跑題,表達(dá)也很難稱得上精煉。
但它最大的特點(diǎn),就是消弭了 AI 的工具感。
無(wú)論用戶潛意識(shí)里把 AI 當(dāng)作下屬、秘書還是同伴,以對(duì)話作為交流媒介,始終比填寫命令框更接近人類本源的協(xié)作方式 :

傳統(tǒng) STT 工具只負(fù)責(zé)把聲音轉(zhuǎn)換成文字,最終模型用來(lái)計(jì)費(fèi)的只有轉(zhuǎn)換后的文本輸入與輸出 token;
而 Typeless 之類的「文本清洗」工具還要額外調(diào)用模型,對(duì)口語(yǔ)進(jìn)行整理和改寫,再把整理后的內(nèi)容發(fā)送給另一個(gè) AI,中間又疊加了一層 token 消耗。

而當(dāng)各家的多模態(tài)模型進(jìn)入「原生音頻」的階段之后,由于需要持續(xù)處理聲音、上下文、語(yǔ)氣、打斷和輸出,一個(gè)工作階段內(nèi)的 token 消耗量往往是純文本的 10 倍或更高。
雖然與高清圖片和視頻處理相比,語(yǔ)音處理的總 token 成本依然不算離譜,但它已經(jīng)不再是一個(gè)可以忽略的附屬功能。
尤其在長(zhǎng)時(shí)間實(shí)時(shí)對(duì)話中,用戶很難像輸入文字那樣主動(dòng)控制信息長(zhǎng)度,模型卻必須持續(xù)維持連接、理解上下文并生成反饋。

這一點(diǎn)幾乎成為了最近 AI 廠商們的一種「陽(yáng)謀」——
畢竟鼓勵(lì)語(yǔ)音交互一方面好處多多,另一方面更是將 token 消耗量推上一個(gè)新臺(tái)階,沒有廠商會(huì)和收費(fèi)過(guò)不去。
因此,對(duì)于模型廠商以及配件品牌來(lái)說(shuō),未來(lái) AI 業(yè)務(wù)的競(jìng)爭(zhēng)不只是能不能聽懂人話。
更關(guān)鍵的是,誰(shuí)能以更低延遲、更少冗算和更透明的計(jì)費(fèi),調(diào)和好不同模態(tài)業(yè)務(wù)之間巨大的成本差異。
畢竟讓人們開口對(duì) AI 講話并不難,真正難的是讓人們想要一直說(shuō)下去。