一、回顾:2023—2025年AI大模型创新发展趋势简述


2023—2025年,为AI大模型赛道市场的重要成长期,其大体遵循:“技术奇点与市场扩容—场景渗透与市场释放—生态形成与价值创造”的成长路径。
其一,为技术奇点与市场扩容。2023年,ChatGPT奠定了可投放市场,且可进行行业技术评估的成熟生成式大模型样态,生成式人工智能迎来新的技术奇点。业界聚焦于基于科研资助,积极开展技术验证、深入潜在市场挖掘并探索多元化商业路径。新商纪发表文章,认为2023年,是AI大模型由纯粹科技热潮向商业变革转变的一年。一方面体现在市场规模的扩大;另一方面是国内外大模型创企的纷纷入局,形成全球商业竞争的“热循环”,其既包含国际层面,OpenAI、微软(Copilot)、谷歌(Gemini)三足鼎立格局,又包含国内层面,百度文心一言、阿里通义千问、字节跳动火山方舟等数十个大模型相继推出,以及初创企业如智谱AI、百川智能获得大额投资支持;
其二,为场景渗透与市场释放。2024年,大模型规模化发展驱动行业进入“深水区”,亟需定制化方案培育和细分市场的发展路径开拓。呈现出B端和C端市场精耕细作的局面,驱动“从通用场景到垂直领域”全面渗透的发展局势;
其三,为生态形成与价值创造。2025年,图像/视频生成、智能办公、娱乐互动等垂直场景蓬勃发展,《2025年AI应用市场洞察报告》显示,2025年上半年全球生成式 AI 应用下载量近 17 亿次,应用内购买收入达 19 亿美元,下载量环比增 67%。此时,“参数竞赛”、“刷榜比拼”不再是唯一潮流,行业焦点已经从技术焦点转向价值创造,如,促进“模型即服务”(MaaS)商业模式的发展,以及成为全球实体经济的带动性产业;
对后续的AI大模型产品研发来说,兼顾行业共识、场景需求,并找到自己产品的生态位都至关重要。2025年11月18日,谷歌推出的新一代AI大模型Gemini 3,无疑是激发了AI圈的又一次研讨“涌浪”。Gemini 3实现了对先前AI大模型产品优势的集成与缺陷调优。更是进一步勾画了未来AI大模型研发的趋势与愿景,Gemini 3 预训练负责人称:“我们不再只是构建模型,而是构建 AI 系统。”对Gemini 3技术创新、应用拓展等方面进行剖析,可以加深对AI大模型产品的深入理解。

二、Gemini 3的技术架构创新

(一)形成全新的系统工程观,重视数据效率

Gemini 3团队形成的系统工程观为模型设计与研发提供了领先的观念引领。他们不再只是统筹关注研发对象,即“模型”,而是以更加系统的眼光剖析对模型训练的最根本组成——数据的使用效率问题。

The MAD Podcast 主持人 Matt Turck 在采访 Gemini 3 预训练负责人Sebastian Bourjou时谈到了这个问题。Sebastian Bourjou表示,目前大模型的数据训练正在面临由“无限数据”到“有限数据”的范式转变。这是因为模型训练的数据广泛依赖于网络数据资源,在这个过程中,既要保证数据的多样性,即覆盖多领域、多语言、多格式的数据,以增强模型泛化能力;又需要捕捉高质量数据,以提高模型认知能力。Sebastian Bourjou表示,“数据的增长速度可能跟不上我们对规模的渴求了。”对Gemini 3 来说,数据预训练必须保质保量。

目前而言,研究界已经对模型数据“提质增效”进行方案研讨,如,数据增强(data augmentation/Generative Data Refinement)。这是通过在保持语义一致的前提下,引入多样化的数据样本,实现高质量地“扩充样本数量”。这就如同人类通过多个视角来理解事物一样,AI模型通过更丰富,更多样的数据来学习核心特征。Gemini 3出现前,Google DeepMind也一直很关注AI数据枯竭的危机,提出的生成式数据精炼(Generative Data Refinement, GDR),这是通过将强大的生成模型变为智能转换器,将脏数据转化为干净数据。而在Gemini 3来临时,负责人表示,其主要是通过对技术架构进行创新,使得模型在相同的数据量下获得更好的结果。这无疑是对数据提质增效的又一次技术跃迁。

谷歌一以贯之,并不断深化的数据驱动、数据效率思维并非其独有的模型训练思维。早在GPT-4.5 发布时,OpenAI团队就已经指出数据效率的关键性和预训练的重要性。但其团队成员也指出,GPT系列的数据效率提升,更多涉及对数据训练方式的优化,而其模型对于数据的洞察力和深度理解力仍然有限。(Founder Park,2025.4.14)对比之下,就更体现出Gemini 3对数据效率思维实践落地的深入性和发展性。进一步而言,Gemini 3通过建立数据—架构的互促关系,使得数据使用效率与质量问题提升到产品的发展战略层面,以数据需求为基点思考技术创新与优化。


(二)技术架构剖析

1.底层支撑:模块化 Transformer + 优化 MoE 架构

Gemini 3的底层架构基础仍然是Transformer。我们知道,ChatGPT等传统、成熟的生成式大模型都是以Transformer为架构,这是因为这类模型都需要通过Transformer架构的编码器、解码器实现语义理解、时序处理、空间感知的模块化功能,执行诸如文本理解、视频分析等功能,这种通过多个任务模块实现多元化智能服务的功能过程,就是AI大模型的泛化。Gemini 3的一切能力迭代也是在“泛化”的基础上完成的,因此在架构创新之前,需要夯实对 Transformer的运用。

在此基础上,增加了MoE 架构(专家混合模型)。MoE 架构是指通过条件计算和稀疏激活机制来提升模型容量的神经网络架构。其核心思想是将模型的容量分布在多个专家网络中,每个专家网络负责处理特定的子任务。(专家混合模型(MOE)推理优化技术全景:从模型到硬件的深度解析,知乎,1.17)MoE模型由三个关键部分组成。一是宏观专家网络。由多个小型神经网络连接而成,各指向特定数据;二是门控网络。对数据—专家进行智能调度和对接,决定哪个数据匹配哪个专家;三是稀疏激活。按需激活适配的专家数量。

MoE 架构是对神经网络作用的进一步优化。具体方面可以包括:一是节省参数使用。理想化的模型使用是用更少的参数完成更多的任务,使得模型有余力进行技术迭代。MoE 架构架构下,Gemini 3总参数量达万亿级,每次推理仅激活150-200亿参数,激活占比约2%。二是通过专家分工handle复杂任务。Gemini 3暂无固定共享专家,采取专家灵活配置的游戏规则,单个token激活专家数量随任务复杂度动态调整。DeepMind CEO 德米斯·哈萨比斯特别强调:“16 个专家模块的动态协同优化。”这些专家包含数学推理专家、多模态处理专家等,对不同任务进行精准激活。(谷歌Gemini 3大模型深度解析,矿山百通—矿山领域的AI专家,11.27)。三是专家调用的灵活变动。对每一次任务调用的专家数量是不同的。面对复杂、长文本任务,需要调动多模块,多个专家协同参与;而对于单个Token的简单任务则无需调用过多的专家资源。

2.内容处理优化:原生融合与跨模态协同

我们知道,多模态技术是实现生成式人工智能内容生成、应用泛化的基础,Gemini 3同样不例外,但Gemini 3对大模型的多模态精度和灵活性提出了更高的要求。具体来说,Gemini 3在多模态方面进行的技术优化可以概括为如下特征:

(1) 原生多模态技术优势被拉至新高度

首先,何为“原生”的多模态?我们可以通过类比的方式加以理解:当下,在技术应用层面,人们正在转变思维,将实现“AI+”为技术创新与赋能的重点转向将实现“AI原生”为技术创新与赋能的重点。“AI+”是将AI作为技术模块叠加在原有的数字技术底座之上,而“AI原生”则是完全基于AI技术形成完整、全新的技术底座,更能够形成完整的AI技术链路。以此类推,原生多模态旨在让模型从训练初期就具备同时处理和理解多种模态数据(如文本、图像、音频、视频等)的能力,依赖于单一的、统一·的模型主体(unified model body)。

中信证券研究认为在模型的技术架构方面引入原生多模态的理念和实践,有益于在多模态内容生成的过程中实现更深度的信息融合,具备更优的扩展性。特别是对于音视频处理,模型能力实现由“静态图像”向“实时动态视频+语音”交互演进。Sebastian Bourjou指出,原生多模态(Natively Multimodal)与单纯的专门模型的拼接是不同的,是使用同一个神经网络处理文本、图像、音频、视频。其带来的跨模态理解能力是巨大的,远远超过了它的成本。有研究指出,模型的原生设计之所以重要,在于:一是更少的信息损耗,传统模型的做法是,把图像“翻译成摘要文本”给语言模型看。 而原生模型是,语言模型“自己直接看图”;二是更深的内容理解与输出。原生多模态之下,模型可以自主学习视觉呈现背后的文本因果关系、文本后的视觉物理含、音频后的物理关联,等等。

(2)跨模态注意力机制驱动跨模态协同

跨模态的注意力机制实现了模型的跨模态协同。注意力机制是大模型理解语义关联的核心,Gemini 3 设计“局部-全局交替注意力”的复合机制,实现多模态 Token 间的细粒度语义对齐,解决传统模型“跨模态关联不精准”的痛点。

局部-全局交替注意力主要采用 5:1 的局部与全局注意力层交替模式——每 5 个局部注意力层(窗口大小 1024 Token)后插入 1 个全局注意力层。这种设计既减少了长序列(如 10 小时视频、100 万 Token 文档)推理时的 KV 缓存内存占用,又能保障全局语义的连贯性,使模型能一次性处理超长多模态序列并保持高准确率。

“协同”即既共生统一,又彼此分离协作。这使得Gemini 3形成了“全模态统一”与“多模态协作”相结合的生成式大模型内容生产的技术架构与体系分工的创新范式。使得Gemini 3能够在这种原生设计中不断自主优化其无监督训练方法,最大化增强不同模态之间的关联度与交互信息实现融合,既开拓了Gemini 系列产品的认知边界,也为人类基于其开展新的技术实践、场景创新给予了无限可能。

3.动态调度与应用微调:智能资源分配与推理优化

Gemini 3将AI大模型“系统化”、“代理化”提升到新高度的原因在于其在只能资源配置与逻辑推理能力方面的性能升级。 Gemini 3 实现“效率-性能平衡”的关键,核心是“按需分配计算资源”,主要包含三大技术组件:

(1)强化动态资源调度

作为架构的“智能大脑”,引入“thinking_level”(思考层级)参数,可根据任务复杂度动态调整算力分配。通俗地理解,如,在进行日常闲聊,非正式对话时,调用更少的智能资源,契合低阶思考等级,减少数据、算力消耗;在高精度工作,处理博士级推理(GPQA Diamond 测试)时,启用高思考等级,利用起所有冗余算力,实现“精益求精”。这样的动态资源调度有三个优势:一是涌现可控。在特定规模阈值(如千亿参数、万亿 token)后,稳定出现思维链、多模态理解等能力,例如 Gemini 3 在 MMMU - Pro 达 81.0% 准确率,原生多模态能力随规模同步跃升。二是精准执行Scaling Law。可预测、可评估的思考层级使得Gemini 3 的性能更具有外推性,使得其每一次技术升级后的产品迭代都是一个可评价、可参照的模型样本,这使得Gemini系列获得了更好、更稳定的性能迭代链路,并使得技术更新加速。此外,将安全性、正确性、效率性融入 Scaling Law,亦可以更好地研究针对模型幻觉、深度伪造等技术应用性问题的解决方案。

(2)促进推理链路优化

Gemini 3 通过简化指令解析流程、强化任务优先级判断,实现推理效率的大幅提升。在“Extra High”深度推理模式下,该模块仍能将端到端延迟控制在 50-80 毫秒的“零感知等待”级别。我们常说的“世界模型”,是一种深度推理的体现。Sora、Vidu等视频生成模型是专攻可视化模块的深度推理的体现。它们在视觉生成方面无限贴近,乃至实现“世界模型”的深度理解和推理效能。通过“世界模拟器”,端对端的增强学习并进行后训练,实现应用端对物理世界的映射和“以假乱真”的虚拟世界的建构。Gemini 3作为通用性、工具性、代理性的新一代大模型产品,也具备这样的深度推理能力。它可以感知到用户输入文本中的场景化画面,感知背后的光影变化,情绪动态乃至用户的潜在需求,采取角色、语气切换的方式,提供用户满意的问答结果和解决方案。

(3)提升上下文缓存能力

针对高频交互场景(如连续对话、重复指令查询),对历史数据进行智能缓存,重复指令的处理速度可再提速 50%,同时进一步降低令牌消耗,显著优化多轮交互体验。虎嗅网的研究报道称,目前正值大模型行业“军备竞赛”的火热之时,从最初的8k Token上下文窗口,到随后的32k、128k,大模型的上下文交互和会话能力不断提升,但在诸如电商客服等场景中,即便接入了顶流模型,支持超长文本,一旦对话超过十几轮,博学的AI依然会展现出“健忘”的一面。当用户试图追溯之前的对话细节,提醒“基于我一开始说的预算”,模型总是开始顾左右而言他(大模型的“健忘症”有药了,虎嗅APP,12.1)。而Gemini 3不仅可以存储上下文,还能够深度理解上下文中的语义关系和逻辑结构,可以基于上下文快速定位关键信息,并进行多步推理、关联分析和生成连贯的输出。此外Gemini 3的缓存成本仅仅定价为每百万token 0.2-0.4美元,也为持续提升上下文缓存提供了便利。

三、Gemini 3带来的应用服务冲击与拓展

(一)Gemini3对应用服务的冲击
1.“效率优先”奠定了后续模型厂商关注的重点,必须打破烧钱“内卷”

Gemini3的研发理念、研发设计、研发执行与研发feedback都将“效率”一词贯穿始终。这会涉及两个方面的“效率优先”。一方面是厂商的研发与迭代效率,即研发效率;另一方面是使用过程中Gemini3的运行效率和输出效率,即程序效率。

Innovation Endeavors合伙人Davis Treybig在发布的2025年基座模型深度研究中提及,目前大模型正面临着一场空前的效率革命。这是因为长期以来人们追求的只是模型的“先进”。而构建最先进的基础模型,往往是一场资本与算力的豪赌,数据显示,前沿模型的训练成本正以惊人的速度膨胀,(如,2020年,GPT-3—450万美元;2025年,Llama 4—预计将超过3亿美元),但现实是,哪怕是最为前沿的模型,也面临着空前的价值折旧(最先进的模型也会在6—12个月的时间内被颠覆)。因此,人们必须思考这种研发周期冗长、算力消耗巨大、模型规模庞大的研发模式的合理性和持久性。正因如此,Gemini系列团队将“效率优先”贯穿于整个研发过程。据新智元12月23日报道,Gemini3 Flash打破了业界参数及正义的想法,即认为更大的模型,更多的参数量必然带来更强的智能表现。仅用极小参数,就实现轻量级规模、通关基准测试,涉及复杂推理和超长上下文的任务的「Pro」级模型。“效率优先”也将成为众厂商的研发共识。

在定价方面,硬科技媒体智东西于8月23日研究报道称,如果想实现大模型的价格继续下探,就需要在不牺牲效果的前提下,进一步降低压缩训练与推理的单位成本。这种预想在Gemini3,及其衍生产品上实现了。12月17日发布的Gemini3“轻量模型”的价格只有Claude的五分之一和GPT的四分之一,但其在编码上超过 Claude Sonnet 4.5,在推理和多模态上全面碾压,和 GPT-5.2 也互有胜负。这也印证了模型“效率优先”与“成本降低”之间的直接关联。2025腾讯ConTech大会上,腾讯新闻何毅进又一次重申,在保持技术领先的同时,真正解决成本、效率、落地的最后一公里的重要性,打破烧钱“内卷”,是当前AI赛道务实者的必然选择。

(二)Gemini3对应用服务的拓展
1.Gemini3对MaaS(模型即服务模式)的开拓

MaaS是指模型即服务模式。中国信通院以“MaaS,大模型赋能的主要途径”为题对MaaS与大模型的关系进行了分析:一方面,MaaS是将AI模型及其相关能力打包、形成可迁移的、可重复使用的服务,形成一套可建构、部署、监控、调用的模型服务;另一方面,大模型发展推动MaaS模式的增益。使得这种模式由局部散点落地转向全流程赋能,形成巨大市场需求。Gemini3系列模型的特点是其模型化和代理化特征,同时其原生多模态框架使得它可以掌握多个领域、多个方面的应用服务。因而Gemini3类模型的接入有利于使得MaaS模式由“模型调用” 升级为 “智能代理驱动的全栈 MaaS”即通过Gemini 3 的智能代理(Agent)能力,使 MaaS 服务从 “单一能力输出” 转向 “端到端任务执行”。

变化维度 具体表现 MaaS 价值提升
能力封装 支持 Generative UI 生成可交互组件(如动态图表、计算器),API/SDK(软件开发工具包) 直出应用级功能 缩短 “模型到应用” 的开发周期,降低前端开发成本
任务编排 自动拆解复杂任务、调用外部工具(如预订、数据查询),支持多 Agent 协同 适配政务、金融等复杂场景,提升 MaaS 的业务渗透率
多模态融合 原生支持文本 / 图像 / 视频 / 3D 空间理解,端到端处理多模态输入输出 拓展工业质检、医疗影像等垂直场景的 MaaS 落地
超长上下文 百万 token 窗口 + 长期记忆,支持长文档分析、企业知识库管理 满足法律、科研等长文本场景的 MaaS 需求

Gemini3类模型嵌入MaaS后,对其模式的影响会涉及这些方面:一是形成全新的技术与能力评估基准。原生多模态与智能代理成为 MaaS 标配会倒逼其他厂商升级模型的工具调用、多模态统一处理能力,否则将被市场淘汰;谷歌推动 MaaS 接口的协议与兼容性优化,如效仿OpenAI的Model Context Protocol (MCP)协议,促进大模型与外部数据及工具交互的标准化,为AI模型与不同数据源和工具提供统一接口。降低开发者的跨平台适配成本。同时,推理效率与能耗比成为核心指标:Gemini 3 基于 TPU 优化推理,单位算力吞吐量提升,促使 MaaS 服务商在 “性能 - 成本 - 能耗” 间寻求平衡。二是可能加剧MaaS生态格局的马太效应。头部厂商(谷歌、OpenAI)主打全栈 MaaS,中小厂商转向垂直场景(如政务、医疗)或轻量化模型服务,避免正面竞争。谷歌推出轻量化模型(如 Nano Banana Pro),同时开放部分 API 权限,平衡生态开放与商业闭环,会影响 MaaS 的 “开源 - 闭源” 服务组合策略。三是加速MaaS 向高价值场景渗透。智能代理能力使 MaaS 能处理基层政务工单、工业机器人控制、金融风控等复杂任务,推动 AI 从 “辅助工具” 变为 “核心生产力”,同时,Generative UI(定制化用户界面)、动态多模态交互等能力,让 MaaS 服务可直接生成应用组件,适配教育、零售等快速迭代的行业需求。

2.Gemini3驱动形成“人人皆可创新”的生态繁荣

上一次我们提及AI圈公认的“人人皆可创作”的大模型产品,还是视频生成(文生视频模型)垂直赛道的“开路先锋”Sora。时至今日,Gemini3也凭借其强大的多模态演化与创造、服务能力成为众多极客的“造梦者”。“人人皆可创新”的生态繁荣自然涌现。目前而言,AI大模型的技术研发目的已经由创企的“技术秀”和赋能AI原生本身赛道纵深发展,转变为普惠于用户的多样化需求,以技术通俗化促进更多对AI技术感兴趣、想尝试、想创新的人融入到这场AI智能变革中来,AI创新“平民化”、“草根化”是未来AI大模型发展的重要方向。

进一步而言,《中国信息化周报》于7月发布的文章称:开源大模型是AI时代的“新战场”。认为“开源”是促进开发者研究大模型底层技术逻辑与应用落地的重要路径。一方面,大模型权重开放有利于用户将模型文件下载至本地服务器进行自主控制与决策,服务行业内模型测试与评估;另一方面,基于开源可以实现模型的平台与生态工具开放。开发者基于应用需求建构研讨社区,对开发框架、工具库、API等进行工具、经验共享。谷歌为服务广大开发者需求,提出构建生产级AI Agent的目标,即Gemini 3提供兼顾“意识—感知—交互—沟通—决策”的全流程的Agent服务。并辅之以6大开源框架,能够包含深度搜索、多Agent系统、浏览器自动化、企业应用和有状态Agent等场景。(Gemini 3驱动的真实世界Agent示例:6个开源框架集成实战,AI帝国,12.21)将这些开源框架结合看待,有利于开发者形成构建系统化Agent工作流的意识,把用于解决碎片化问题的Agent服务,结合起来并形成一套通用性的,持续生产价值的Agent体系。

有人比喻说,Gemini 3的功能不亚于一个APP,有的时候,甚至要超越单一APP的功能。更有人坦言,下载Gemini 3后,想要果断卸载过于冗余的软件。目前Gemini 3多个端口是免费的,同时发布即可用。其平台包括Gemini App的移动端会话界面、Google AI Studio(Web 端模型测试与 API 管理平台)以及Vertex AI(云开发者一站式AI平台)。基于Gemini 3的Agentic Coding大幅飞跃,用户无需人均IT开发者或是很懂行,也能拥有专享化服务并设计个性化项目。

3.Gemini3的用户由智能终端使用者转变为应用玩法设计者

对于Gemini 3的用户群体,我们更愿意将他们称作玩家。目前而言,Gemini 3的玩法是多样性的,最明显的突破点是它将人机交互提升到了一个更高的维度。我们所熟知的基础人机交互包括语言—语言交互,即聊天Chatbot的交互模式;语言(文字)—语言、文字、音频、图像交互,即多模态的交互模式。而Gemini 3可以在这些交互模式的基础上,进一步构建技术栈复杂、工程化与创意性结合的3D沉浸式,高度互动的虚拟交互产品与应用。目前,Gemini 3的“头号玩家”们已经通过大胆创造,形成了一批商业化案例。其中,有用户通过Gemini 3,结合Raymarching 分形、实例化粒子和音频可视化等前沿技术,形成了效果炫酷的产品——音频响应粒子渲染 Mandelbulb 分形。更有用户通过Gemini 3复刻了Three.js 版《我的世界》生存模式,通过使用 Gemini API 创建 3D 积木应用。然而,最绝的是Gemini 3可以自主编程,并构建能够人—机交互的3D粒子交互系统。当然,这种绝美的“指尖烟花”的背后是更加天马行空的用户“创作者”,及其精准prompt的杰作。

四、Gemini 3下的应用发展挑战及其应对

Gemini3的技术迭代、创新与应用拓展为AI大模型的产业增值提供了新视野和新方向,但在展望未来的同时,也许明确其面临的挑战并寻找相应的治理之策,是实现“AI向善”发展的必由之路。具体而言,可以从技术维度和商业与社会维度拆解其应用发展挑战与应对。

1.技术本身的发展挑战
(1)数据隐私泄露问题

诚然,谷歌在模型预训练阶段进行的数据提纯与数据隐私保护是精细化的。其负责人在接受相关采访时提及了合成数据(Synthetic Data)一词,是通过算法、数字模型和人工智能技术生成、模仿真实数据的具有统计属性的人工数据。这使得模型的知识库中充斥高质量数据,且减少因为真实数据而引发的行业、企业、个人隐私的泄露。但在内容生成和智能交互方面,如果完全依赖合成数据,不再哺育真实数据,则会弱化大模型的泛化能力。因此,在Gemini3的深度人机交互的过程中,必然在问答中,文字输入中纳入真实数据。由于Gemini3具备超长记忆,能够记住多轮对话中用户的需求。这些真实数据也就不可避免地进入了大模型的“思维树”中,形成反哺其思维链的外部数据。但在面对用户方面,Gemini3在做到广泛开源的同时,其数据隐私保护还是远远不够的。对于跨境、跨域使用来说,Gemini3是不限国家无需绑卡的。且仅对付费版(Vertex AI)提供更高级的安全保障,而对于用户广泛使用的免费版(Google AI Studio),暂无全面的数据隐私保护协议,规章,仅局限于对用户隐私保护的口头提醒。因此,随着Gemini3使用范围愈发广泛,数据隐私泄露是一个重要问题。

(2)模型幻觉问题

对大语言模型而言,模型幻觉是一个老生常谈的问题。Gemini3系列模型亦不例外。对于AI大模型而言,高功能往往意味着高幻觉,这是因为它具有更强的自主推理能力。在针对最新发布的Gemini 3 Flash的测评中,其知识储备的绝对值准确率高达 55%。但尽管它如此“博学”,Gemini 3 Flash 的幻觉率高达 91%。

不仅如此,基于原生多模态的模型幻觉更加具有隐蔽性且不易察觉。在我们惊叹于Gemini3基于对文本的逻辑分析得到精美绝伦的图表、图像时,它可能已经为了追求更专业、更美观而颠覆了真实世界应有的逻辑。如,绘制“商用喷气客机剖面图”时,为了追求布局美观,而将整个机体像是“综合了波音 + 空客 + 科普图片”的混合体(Gemini 3 的“高保真幻觉”:一场精致的视觉伪证,慢教育,11.29)。

基于以上,Gemini 3 如同一个为了取得更好的成绩而故意作弊的孩子,人类对其内容生成的纠偏与审查不再局限于对错,而是需要对其生成逻辑进行理性评估,人类必须由协同执行者转变为理性决策者,以应对这样的“幻觉”问题。

2.对商业社会的发展挑战
(1)过度“军备竞赛”催生市场疲软

目前而言,几大厂商之间的“军备竞赛”已经陷入白热化,Gemini 3发布后,谷歌一度居于AI圈榜单前列,在技术先进性、场景落地性方面独占鳌头。因Gemini 3吸引大额投资,同时客观上而言,其模型产品会在一段时间内对其他厂商形成较大冲击,且难以突破,使得一大批AI创企陷入了产品周期推迟,资本上升的困境。而OpenAI为巩固其地位,于12月12日紧急推出GPT-5.2以秀肌肉,但就其测评而言,GPT-5.2缓慢的响应速度和偶尔的长时间思考使人挫败。2025年Gartner 的研究显示,曾引发 “百模大战” 的大语言模型已站在期望膨胀期与幻灭低谷期的交界地带。如若仍持续这种盲目的模型储备与技术更新的军备竞赛,则会无限放大用户理想期待与实际应用的差值,致使大模型赛道面临发展疲软。

(2)技术价值转化与成本控制的双重困境

尽管Gemini 3 Flash版本大幅降低了推理成本,但应用的商业落地仍面临“价值难量化、成本易失控”的困境。一方面,多数应用仍停留在“辅助工具”层面,未能深度融入核心业务流程,导致商业价值难以量化。例如,部分企业仅将Gemini 3用于文档生成、简单问答等场景,未能依托其多模态与深度推理能力实现业务流程优化,如生产故障预判、客户需求精准匹配,难以形成可持续的商业模式。另一方面,隐性成本易被忽视导致预算失控,除官方令牌调用费用外,跨境链路运维、数据预处理、应用重构等隐性成本较高,且Gemini 3的思考模式(thinking mode)默认开启时,输出令牌量可能膨胀3-5倍,进一步推高使用成本,挤压企业利润空间。此外,同质化竞争激烈,大量应用集中于通用工具类场景,诸如文本创作、图像生成,缺乏差异化价值,难以形成竞争壁垒。

(3)人机交互深化亟需标准化约束

人机交互的深入必然伴随技术伦理的重要性提升。Gemini 3等大模型的诞生让“开放”、“开源”、“公正”、“平权”受到关注。在大模型规制方面,通过加强标准化约束是加强人工智能对齐,避免算法偏见等潜在伦理道德风险的有益之策。诸如,IEEE制定的《伦理一致性设计》(Ethically Aligned Design,EAD)、《信息技术 人工智能AI系统和AI辅助决策的偏见》、《信息技术 人工智能 伦理和社会问题概述》等治理标准。我国《人工智能伦理治理标准化指南》同样强调人工智能可解释性、鲁棒性、公平性等价值判断。Gemini 3不只是提供帮助的智能工具,对更多人来说它已成为朝夕相伴的“智能伙伴”,因此在加强标准化约束的同时,还对约束的灵活性提出更高要求。促进人机互动“标准化+深度”,进一步促进AI增强人类认知、提供决策支持、维护知识平权。

(4)“垄断式”生态亟待打破

对AI大模型赛道而言,“百花齐放”的研发与应用生态有益于长期发展。但头部企业的“全能模型”范式极大地积压了对单一问题形成解决方案的“中间件”式应用(如单纯的图表生成工具)的生存空间。而依赖头部企业,如谷歌、OpenAI的衍生应用或对其功能的复刻与优化虽然能够快速起步,但却也面临技术同质化。一旦面临技术路线的变更、政策调整或成本变动,依赖龙头企业的其他企业将会面临更大的生存危机与风险。也正因如此,我国在加强本土化模型自主研发与应用落地的过程中,注意到了多元化生态建设的重要性。《2025年中国大模型行业发展研究报告》也指出,我国正在致力于建设基于消费者、企业、设备、政府的创新驱动—基础强化—场景牵引—安全治理的生态体系,并培育各头部企业的差异化发展路径。但在全球范围内,“垄断式”生态仍占主导,这将是AI大模型赛道长期存在的发展挑战。

3.对开发者建言

对于开发者而言,我们可以做出如下的尝试与努力,服务于产品研发与生态适应,促进AI大模型赛道的长期健康发展。

 (1)明确差异化开发定位

竞争从单点模型能力,转向 “模型+算力+生态+数据”的全栈能力。谷歌的TPU算力、产品分发网络和数据飞轮,构建了几乎无法复制的壁垒。因此,需在巨头布局的缝隙中,聚焦巨头无暇顾及或需要深度定制化的细分行业、小众专业或本地化需求。极致性价比的Gemini 3 Flash,可能将AI服务推入“水电煤”式的公用事业模式。这压缩了仅靠调用来盈利的空间,迫使企业必须在垂直解决方案、专业服务或生态绑定上寻找价值。

(2)重视模型框架、架构的设计与研发

谷歌的模型研发提供了一个重要观点:与模型的局部性优化相比,优化或创新模型架构是目前阶段和后续很长一段时间更重要的目标和创新路径。谷歌DeepMind CEO在接受访谈时指出,真正的AGI需要“全能模型”。但要实现模型超前的思考、规划、推理能力,必须在架构设计方面动心思。同时创建对现实世界物理规则、直觉物理理解,以及多个领域的认知的综合性测评集。并形成更精妙、复杂的基准。形成架构+基准+测评的框架体系。此外,要重视原生模型设计,规避模型的模块化拼接,形成底层统一 tokenizer,将图像、音频、视频等模态转为与文本同构的 token,共用嵌入层与注意力机制,而非独立编码后拼接。注意路由效率与专家负载,避免无效计算,融入负载均衡机制,加入专家容量限制与负载平滑损失,避免少数专家过载。

(3)践行负责任的AI开发

AI大模型的技术研发和应用场景拓展必须遵循技术创新+伦理规范的开发模式,实现负责任的AI开发。首先,落实主动合规。与其他大模型产品一样,Gemini 3也具备相应的“数据”、“幻觉”问题。开发者需在自身模型研发过程中,注意防止偏见、幻觉问题。将隐私保护、算法安全内置于产品设计初期,而非事后补救。通过规避“训练后加过滤器”,加强“训练中学会安全”促使“让模型可靠”;其次,重视人机协同系统的设计。将大模型定位为增强人类能力的“副驾驶”,而非完全替代,重点解决高重复性、附加值低的任务,释放人类创造力;第三,加强透明与教育。向用户清晰说明AI的能力边界、数据使用方式。对免费开源渠道进行数据隐私保护方案的设计—制定—公开,并积极参与行业标准与伦理规范的研讨。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐