腾讯研究院判断,中国"AI陪伴"市场在3—5年内可达千亿级别;头豹研究院给出更陡的曲线——2025至2028年,中国AI情感陪伴市场规模预计从38.66亿元跃升至595亿元,年复合增长率148.74%,资本、大厂、创业公司正密集涌入。

但热潮之下短板很清楚:单次对话能聊得流畅,"长期记忆"和复杂环境下的稳定连接却普遍做不好,行业普遍将"长期记忆"列为最突出的技术短板。换言之,模型早已不是门槛,把模型、设备、网络、云端串成一条常年不掉线的链路才是。这篇讲的就是这套决定体验下限的链路——端云协同架构。

一、为什么Demo跑通不等于产品可用

Demo和真实产品之间,隔着的是环境差异。

做Demo的时候,工程师手里的环境是理想的:手机连着满格WiFi,人凑在设备跟前十几厘米说话,房间里安静,就一个人,Prompt也是精心调过的。在这种条件下,任何架构都能跑得不错。

真实用户的环境完全不是这样,网络是波动的,地铁站、老房子、地库信号都不同;孩子不会贴着设备说话,经常隔两米还边跑边喊;家里可能同时开着电视、有人聊天;设备要连续运行几小时甚至几天,而不是演示那三分钟。

这些差异单独看都不致命,叠在一起就会让体验崩塌。更麻烦的是,它们不是靠换一个更强的模型就能解决的——模型再聪明,音频传不上去、传上去卡三秒、断线后连不回来,用户感知到的就是"这东西不好用"。

二、五层职责划分:设备端、传输层、AI服务层、IoT平台、APP层

在大量实际项目里反复验证下来,一套成熟的 AI 陪伴系统通常可以拆成五层,每一层职责分明,谁也别抢谁的活。

设备端干"靠近用户"的活:本地唤醒、麦克风阵列降噪、端侧简单指令处理、动作与灯光控制。它的核心是低延迟、永远在线,直接决定用户"喊它答不答得了"。

传输层最容易被低估:负责音频流稳定上行、回应下行,以及连接管理、断线重连、加密与多设备隔离。这一层做不好,前面再强也白搭。

AI 服务层是智能所在:ASR 转写、LLM 理解与角色决策、TTS 合成,再加 RAG 检索、Memory 记忆和 Agent 工具调度。算力与知识库都放在云端。

IoT 平台层是运营底座:设备激活绑定、OTA 升级、用户权限、日志与数据分析。规模上来之后,稳定的设备管理与运营能力,才是服务十万家庭的底气。

APP 层是用户入口:配网绑定、角色切换、多设备联动、会员与内容、消息推送。它把前面四层的能力,变成用户每天真正用得上的东西。

这五层不是教科书理论,大量项目里那些"设备莫名其妙不说话""一次升级变砖一批"的事故,才把这套分工一点点磨出来。

三、一次AI对话背后的系统时间轴

理解架构最好的办法,是跟着一次对话走一遍。

当孩子喊出"小贤小贤,讲个霸王龙的故事",一问一答的背后,同时调动了端侧音频算法、云端语音处理、意图识别、知识检索、大模型生成、长期记忆、情感计算和内容安全等多项能力。

设备先通过端侧唤醒词检测判断是否在被呼叫,唤醒后由麦克风阵列采集声音,并在本地完成 3A 前处理——AEC 回声消除、ANS 环境降噪、AGC 自动增益控制,把电视声、空调声和设备自身播放声过滤掉。这一步决定了产品"听不听得清、会不会把自己的声音当成指令",往往比单纯比模型参数更影响体验。

处理后的音频以流式方式上传云端,云端再做增益增强、VAD 语音活动检测和端点判断,识别孩子何时说完,避免过早截断或长时间等待。

当音频越过端云边界,便进入由语音识别、意图理解、知识检索、大模型生成与语音合成串成的流水线,Memory 与 OTA 则在其中各司其职、彼此配合。

以同一个"讲个霸王龙的故事"为例,系统的回答也并非千篇一律:对喜欢冒险的孩子,可以生成充满探索感的故事;对腼腆的孩子,则采用更温和、有安全感的表达。AI 陪伴的核心,不是让设备多说几句话,而是让它逐步理解用户,在长期互动中形成连续、一致且有温度的关系。

在理想环境下,从孩子说完到听到第一个字,整条链路应控制在约两秒内。但真正决定感受的,不是某一个模型的单项速度,而是唤醒、采音、端侧 3A、网络传输、云端增强、ASR、意图识别、知识检索、大模型生成、TTS 和设备播放之间能否高效协同——任一环节延迟,用户都会直接感知。

面向儿童和家庭的产品,内容安全不能只做生成后的单点过滤,而要贯穿整条链路:对用户输入、意图识别结果、RAG 检索内容、大模型生成内容和最终语音输出做多层控制,结合年龄分级、敏感话题识别、不良内容拦截、风险意图处置、知识库治理与隐私保护,降低不适宜内容、错误引导和敏感信息泄露的风险。

这也是集贤科技持续打磨端云一体化能力的原因:端侧解决"听得清、唤得醒、响应稳",云端解决"听得懂、答得好、记得住、有情感",内容安全体系确保每次交互都在可管理的边界内。

这些优化单独看只是几十毫秒、一次准确率或一层策略;整合进同一套端云协同架构后,决定的却是用户是否觉得产品自然、可信,以及它能否从一台会说话的设备,成长为有性格、记忆与情感连接的 AI 陪伴伙伴。

四、ASR、LLM、TTS、RAG、Memory、OTA怎么协同

这几样东西不是各干各的,是一条数据流水线。

用户语音经设备端降噪后上传,ASR转成文字,文字进入AI服务层,先做意图理解,需要查角色专属知识时触发RAG检索——比如孩子问"昨天你给我讲的那本书后来怎么了",RAG要去Memory里翻出昨天的对话记录,再结合知识库回答。LLM生成回复时,会参考Memory里的用户画像和事件记忆,保证这次回答和之前的互动连贯。生成结果经TTS变声音,传回设备端播放,同时动作指令让设备做出表情或动作。

Memory 在这套系统中扮演着“记忆中枢”的角色。它不只是保存信息,还需要判断哪些内容值得记忆、何时调用,以及在什么边界内使用。例如,用户主动表达“我更喜欢简洁一点的回答”,在获得授权后,系统可以将其沉淀为偏好记忆,并在后续交互中自动调整表达方式。

OTA则是这条流水线的"更新通道"。角色人设要改、Prompt要优化、安全策略要升级,都不该让用户重新买一台设备。好的OTA灰度的、可回滚的:先推给一小批设备验证,没问题再扩大,出问题立刻退回到上一个稳定版本。如果OTA设计得粗糙,一次失败的推送就能让成千上万台设备变砖。行业内因OTA设计粗糙导致批量设备异常的情况并不少见,这也促使我们在 MarsGate 平台上对 OTA 做了更重的投入。

五、异常治理:真实工程里最磨人的部分

前几节讲的是理想路径。真实世界里,最耗工程师精力的恰恰是异常情况。

弱网和断线: 孩子走到阳台,WiFi信号掉了一半,音频上传开始丢包。这时候系统要有重传和队列,短时抖动靠本地缓存扛过去;如果是长时间断线,设备得进入降级模式,明确告诉用户"我现在网络不太好",而不是卡死或乱答。重新连上后,会话状态要能恢复,不能孩子说半句,回来之后AI完全忘了前文。这套弱网处理策略,我们在自己的方案里打磨了很多轮,没有捷径,只能在各种真实网络环境下反复测、反复调。

打断处理与状态同步: 当 AI 正在播放内容时,用户可能随时说“暂停一下”“换一个话题”或直接提出新的问题。此时,设备既要通过回声消除和语音检测区分用户声音与自身播放声音,又要快速停止当前播放,并将打断指令同步到云端,终止仍在进行的大模型生成和 TTS 合成。如果端侧停止了播放,但云端任务仍在继续,旧音频就可能再次进入播放队列;如果新旧请求的状态没有隔离,还可能出现两段回答重叠、上下文错位或指令重复执行。为解决这些问题,需要在端云之间建立完整的会话轮次标识、任务取消、状态机控制、缓存清理和超时回收机制,确保每一次打断都及时、准确且可恢复。

多用户数据隔离: 一台设备背后是一个家庭,十万台设备背后是十万个家庭。用户A的画像、偏好,绝不能串到用户B那里。这要求在设备标识、用户身份、存储分区和访问控制上做全链路隔离,传输过程加密,存储按租户分库或加标签。这是合规的底线,也是信任的基础。

六、大模型是大脑,端云协同是神经系统

回到一个反复出现的问题:为什么Demo做得出、产品做不出?

因为Demo只需要大脑亮一下,产品需要整条神经系统常年无故障地工作。模型决定了产品"聪不聪明",端云协同决定了产品"稳不稳、快不快、连不连得上、能不能持续升级"。

行业里一个常见误区,是把精力过度集中在"选哪个模型"上,而低估了传输层重连策略、设备端降噪质量与平台层OTA机制对体验的决定性作用。结果就是模型很聪明,产品很糟糕。一个越来越清晰的行业判断是:真正决定 AI 产品体验与商业成败的,往往不是搭载了哪一种大模型,而是由感知、连接、调度、记忆与安全共同构成的“神经系统”是否成熟。

七、已有的实践:怎么搭这套端云协同

讲完通用架构,说说目前落地的效果比较好的案例。

按照端云协同分五层来组织:设备端跑唤醒、降噪和本地控制,用的是自研的端侧处理和声学算法,包括环境降噪、回声消除和轻量级的端侧指令识别能力——这些不是实验室算法,是经过多轮结构-算法联调和量产验证才稳定下来的。往上的 MarsGate AI 通过自研的 AI Agent 平台做推理、角色调度、记忆管理和内容生成;底下的 MarsGate PaaS 负责设备激活、OTA、用户管理和运营数据分析,最上层的 MarsGate APP 作为多端互联的用户入口,完成设备绑定、角色配置和会员支付等闭环。

这种分法的好处,在量产和长期运营阶段才看得清。比如一次角色配置更新,通过MarsGate的OTA能力灰度推送到一部分设备,观察互动质量和报错率,没问题再扩量;如果某批次设备反馈异常,可以定向回滚,不影响其他用户。再比如连接稳定性,MarsGate在设备侧做连接状态监控和自动重连,平台侧做在线率和异常告警,运营团队能在用户投诉之前发现一批设备掉线。

数据隔离在这套架构里也不是事后补课。设备标识、用户身份、对话数据在采集和存储环节就按家庭维度做了隔离,传输加密,敏感数据按合规要求处理。必须通过 ISO/IEC 27701(隐私信息管理体系)与 ISO/IEC 27001(信息安全管理体系)双认证,并完成 GDPR 合规审计。对面向儿童的产品来说,数据隔离出不起任何事,这部分做不扎实,前面的体验再好也撑不住。

给做硬件的团队一个实在建议:在立项阶段就把端云协同当成和产品定义同等重要的事来设计,而不是等样机跑通了再去补传输层和平台层。补上去的东西,往往就是后面线上事故的根源。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐