从 WebRTC 创造者到 OpenAI Realtime AI 负责人:Justin Uberti 谈人机实时语音的架构重构丨Voice Agent 学习笔记
前几代的架构通常是这样:它给人一种实时的感觉,但实际上发生的是,系统会在你说话时缓冲你的音频,等待轮次检测器判断"哦,他们说完了」,然后一次性把所有音频喂给模型,说:去转写、生成、把文本给我。NLP 是一把挺重的锤子,在双讲场景(double‑talk scenario,AI 和用户同时说话)中,AEC(回声消除,Acoustic Echo Canceller)为了不让系统听到自己的回声,会用「重
所有评论(0)