2025年是夹杂着惊喜与挑战的一年,AI圈发展的不确定性增加,对未来的预测也更加困难。机器之心发布了一篇关于 Sebastian Raschka对AI大模型2025年发展的总结复盘,我认为有一定前瞻性和可参考性。因此想要盘一盘。

Sebastian Raschka认为大模型对Scaling Law 的执行已经由“参数堆积”式强化转变为“推理优化”式强化。他认为推理模型实现了大模型发展的又一次迈进,同时认为我国的推理大模型代表DeepSeek R1 奠定了“大模型推理技术发展将成为技术创新重点”的关键趋势,并将大模型推理推理能力向前推进了一个新点位。然而,“推理”热潮也使得各大厂商狂刷模型推理能力和更新产品迭代,业界对模型推理能力的对比评估还不充分。因此,在年末,Sebastian Raschka聚焦于推理模型这个话题,渴望以硬核工程视角对于:推理模型带来了怎样的技术革新?推理模型带来了怎样的行业风向?面对这样的变化,从业者、开发者应如何应对的问题?......等等问题重新盘活,为2026年锚定发展方向。

本文适合想要对推理模型进行了解的行业小白,也请科技大神光顾并给予指点!

一、何为推理模型?

首先,什么是推理模型?我们可以从模型架构、推理逻辑和推理结果三个角度来理解。

一是在模型架构层面。推理模型是在传统大语言模型的基础上优化推理技术,并使其成为重要的技术创新。在硬件支撑方面,通常依赖GPU、TPU等高性能计算设备,加速矩阵运算和并行运算。运行在Linux等操作系统上时,借助容器技术(如Docker)实现环境隔离和部署标准化,部分系统支持GPU直通或虚拟化技术,以灵活分配硬件资源。在模型框架方面。PyTorch、TensorFlow等提供模型定义、训练和推理接口,同时需要附有专用的推理引擎,如Transformer、MoE优化推理引擎,实现算法优化、硬件适配。

分而论之:

1.基础架构:Transformer 及其变体(通用推理的基石)

Transformer 的自注意力机制是实现推理的核心,通过计算 token 间的关联权重,捕捉文本、代码等序列数据中的逻辑关系(如因果、条件、递进)。针对推理场景的优化变体包括:

线性注意力(Linear Attention):将标准注意力的O(n2)复杂度降至O(n),解决长文本推理(如数学证明、法律条文分析)的算力瓶颈,典型代表如 FlashAttention-2、Linear Transformer。

因果注意力(Causal Attention):强制模型仅关注前文 token,适配逻辑链的单向推导(如数学计算步骤、程序代码生成),避免未来信息泄露干扰推理过程。

分层注意力(Hierarchical Attention):先对段落、句子等大粒度单元建模,再聚焦 token 级细节,适配文档级推理任务(如合同审核、论文摘要逻辑梳理)。

2.进阶架构:稀疏化与混合专家(MoE)架构(高性价比推理)
针对通用大模型参数量过大、推理成本高昂的问题,稀疏化架构通过动态激活部分网络提升效率,是当前推理模型的主流演进方向:

混合专家模型(Mixture-of-Experts, MoE):将模型拆分为多个 “专家子网络” 和 1 个 “门控网络”,门控网络根据输入任务的类型(如数学推理、常识推理),仅激活适配的专家子网络,未激活的专家不参与计算。例如,GPT-4 采用 MoE 架构,参数的激活率仅为10%-20%,在千亿参数规模下实现高效推理

动态稀疏架构:通过训练自动裁剪冗余参数,仅保留对推理任务关键的权重矩阵,例如,清华的 Z1 模型采用动态思考窗口机制,根据问题难度调整稀疏度。

3.前沿架构:多模态融合与推理—记忆—规划一体化(复杂场景适配)

为突破单一模态(如文本)的推理局限,适配自动驾驶、医疗诊断等复杂任务,推理模型架构向多模态、多能力融合方向发展:

多模态融合架构:通过跨模态注意力机制,实现文本、图像、语音、表格等数据的语义对齐,例如,GPT-4V、文心一言 4.0 的多模态版本,可通过医疗影像病历结合文本推理出疾病类型,根据工程图纸与自然语言指令生成施工方案。

推理—记忆—规划一体化架构:融合记忆网络(Memory Network)、强化学习(RL)与符号推理,构建 由长期记忆到逻辑规划,再到分步执行的能力闭环。例如,AlphaGeometry 结合神经网络与符号推理引擎,解决国际数学奥林匹克竞赛题;微软的 ToolFormer 模型,可自主调用计算器、搜索引擎等工具,辅助完成复杂推理任务。

二是推理逻辑。在推理逻辑方面,我们可以看到为何推理模型相较其他模型具备独特性。推理模型的成长可以类比人类思考能力的成长。人的思考能力是具有阶段性的,每一个阶段的思考能力对应相应的行为表现。传统模型对应基础思考能力。模型的答案输出的丰富度基于架构师、开发者向模型预训练过程投喂了多少数据,答案的输出是从知识库中直接抽取定向内容,直接形成未经加工的答案;推理模型对应结构化思考能力。这时,架构师、开发者将关注点由数据训练的资源扩充转向计算能力的优化。推理模型会根据任务需求进行步骤化的思考,如我们最常使用的开源模型DeepSeek系列,它会在正式回答前复述用户需求,先自我模拟推理过程,比对不同答案,最终给到正式答案。这种分层递进的形式体现出结构化的思考能力。

推理模型的推理逻辑是对人类解决复杂问题思考过程的一种学习和参照。人类解决复杂问题通常采取分步骤的方式,在遇到卡点时,需要返回推理过程进行过程验证。推理模型的推理过程同样是分步骤的思考过程,同时,不论在底层算法推理还是在表层结果推理,其推导过程都是被保留的,能够供给之后的合理性查验和推理过程验证。

三是推理结果。推理模型的结果适用于数学运算、逻辑推理、工程落地等任务执行,同时推理模型也能够作为相对可靠的智能助手,跟进企业项目的实际进展,许多推理模型的长期记忆能力使得它们能够与项目团队一起思考战略方案,并提出具有洞察性的观点和方案。需要注意的是,推理模型给出的答案和知识库的原始素材有不一致性,因此人类智慧的介入与审查必不可少。

对比维度 基础架构(Transformer 及其变体) 进阶架构(稀疏化、MoE 等) 前沿架构(多模态融合、推理—记忆—规划一体化)
核心定义 以 Transformer 自注意力为基础,包含线性、因果、分层注意力等变体,需要全参数的激活,激活参数较多 通过动态激活子网络或参数剪裁实现计算稀疏化,提升推理效率,激活参数较Transformer而言更少 融合多模态对齐、记忆网络、工具调用与符号推理,形成感知—记忆—推理—执行的一体化能力
核心优势 1. 通用性强,适配文本、代码等多任务,预训练与微调生态成熟;2. 训练稳定,梯度传播路径清晰;3. 推理延迟稳定,适合实时交互场景;4. 可解释性基础好,思维链(CoT)适配性强 1. 参数效率高,MoE 架构可扩展至万亿参数,推理仅激活少许专家,成本骤降;2. 动态适配任务难度,简单任务少激活参数,复杂任务多激活;3. 平衡模型容量与推理成本,适合大模型规模化部署 1. 突破单模态局限,实现文本 + 图像 + 语音 + 表格等跨模态推理;2. 融合外部工具(如计算器和搜索引擎)与符号规则,提升复杂任务准确性;3. 推理—记忆—规划闭环,适配医疗诊断、自动驾驶等强决策场景(AI Agent的典型高价值应用场景)
关键技术特征 1. 全参数激活,推理成本随参数规模线性增长;2. 依赖预训练数据,复杂推理易出现幻觉 1. 门控网络需优化路由策略,避免专家负载失衡;2. 训练与部署工程复杂度高,需适配稀疏计算硬件 1. 跨模态语义对齐难度大,需解决模态间语义鸿沟;2. 工具调用与符号推理的协同逻辑复杂,调试成本高;3. 推理速度较慢,适合高精度、低实时性场景
典型代表 GPT-3.5、文心一言 3.0、Llama 2、FlashAttention-2 GPT-4 、智谱 GLM-4 、DeepSeek R1、Z1 模型 GPT-4V、AlphaGeometry、微软 ToolFormer、文心一言 4.0 (多模态能力提升)
部署要求 低—中,适配主流 GPU/CPU,无需特殊硬件,开发门槛低 中—高,需支持稀疏计算的硬件(如昇腾 910B),部署工具需适配 MoE 调度 高,需多模态数据处理硬件、工具接口适配,适合云端或高性能边缘计算平台
商业化落地 架构使用趋于成熟;主要落地如C端智能聊天服务,B端通用 API 服务的文本生成、文档生成、文生图等 通过架构升级实现低参数消耗、高业务产出;落地快速增长,推理代工类业务;以及实现行业大模型定制(如金融、制造);定制化模型服务成为主流 逐步落地,聚焦高价值行业(医疗、汽车、能源),以定制化项目为主
架构重要性评价 最基础模型架构;能够支撑通用大模型的基础服务;是架构优化的基石 适配于业务领域多任务特点和效率提升需求;通过专家分工提升模型性能与垂直行业的适配性 与AI Agent智能体概念普及与企业级AI研发和应用落地协同进步;从架构出发培育更“类人”的大模型服务体

二、Sebastian Raschka对2025年推理模型发展的洞察

2025年,大模型的发展进入精进与深耕时期,这也使得专注于垂直领域和深度思考的推理模型获得了相较通用模型而言更多的关注。他认为DeepSeek提出的RLVR 与 GRPO强化学习范式的提出是推理模型发展的重要时刻,基于此,他认为2025年推理模型的发展主要聚焦于这几个方面。

一是对LLM后训练的强化。DeepSeek的RLVR是对模型的后训练。其原理是面对复杂问题的处理,如果实际问题情境和任务需求产生变化,无需让大模型重新回到预训练阶段开展从0到1的数据收集、预训练等冗长过程,而是直接在已经预训练完成的系统的基础上进行后训练。进一步而言,是对模型进行多轮微调和对齐。Sebastian Raschka指出,“DeepSeek R1 和 RLVR 的重要性在于,它们允许我们在大量数据上对 LLM 进行后训练,这使它们成为通过在后训练期间扩展算力来改进和解锁能力的绝佳候选者。”在今年,甲子光年智库也有发文指出,随着基础大模型在通用能力上的边际效益逐渐递减、大模型技术红利向产业端渗透,AI的技术范式也开始从原来的注重“预训练”向注重“后训练”转移。而后训练的价值主要集中于三个方面:一,知识精炼。能够修正预训练阶段的知识偏差与事实错误(微调);二,能力对齐:使模型输出符合人类价值观和任务需求(强化学习);三,推理增强:赋予模型多步推理、逻辑验证等高级认知能力(规模拓展)。

                            后训练方法分类图谱 图源:《A SURVEY ON POST-TRAINING OF LARGE LANGUAGE MODELS》

二是兼顾LLM生成推理的过程性评估和结果质量。过程性评估是指在 RLVR 训练期间评判 LLM 的解释,也就是推理过程中阶段性答案的准确性也要作为模型生成结果成功的奖励依据;结果质量则是强化模型的“推理时扩展”,即在训练后,花费稍多的时间与金钱让 LLM 生成更加准确的答案。尽管今年研究人员、开发者在推理模型“过程奖励”与“推理时扩展”的进展不如预期,Sebastian Raschka仍认为兼顾LLM生成推理的过程性评估和结果质量具有必要性,并会在2026年有进一步的研究进展与技术创新。特别是“推理时扩展”,DeepSeekV2-Math 论文所示,它将模型在具有挑战性的数学竞赛基准测试中的表现推向了金牌水平。海外模型Grok 4在“人类最后的考试”取得38.6%的准确率,亦成为DeepSeek的强力对手。

另外,DeepSeek GRPO范式的数字改进也让模型过程性评估后的调优、修改更加容易。Sebastian Raschka坦言,“采用了GRPO其中一些或多项修改后,糟糕的更新不再破坏我的训练运行,我也不再需要定期重新加载检查点。”同时,哪怕是及其短小的运行,也能够获得客观的收益。

三是重视LLM 架构的效率调整。Sebastian Raschka指出,未来的很长一段时间,Transformer架构还将是最底层、最主流的模型架构。今年,开放权重 LLM 或多或少都收敛于使用混合专家 (MoE) 层,以及至少一种“效率调整”的注意力机制。

四是促进工具使用与LLM训练结合。Sebastian Raschka认为大模型训练与工具使用相结合已经成为大势所趋,即便可能伴随幻觉问题。实质上,更广泛的开源生态并不意味着更多的工具使用。这是因为研究人员、开发者需要对工具使用的范式、工具使用的程度、可纳入工具范畴的门槛与标准以及工具使用访问权限进行深入考究。Sebastian Raschka做了这样一个比喻:“你会信任一个新实习生拥有这种级别的系统访问权限来做这件事吗?”但他也表示,大模型调用外部工具会在未来更加普遍。

结合目前的使用现况,我们大致能够接触到的大模型工具调用可以分为这些类别:

工具类型 核心功能 典型示例 对应场景
计算工具 完成加减乘除、函数运算等复杂计算 计算器函数、Python代码解释器 数学题求解、财务数据核算
信息获取工具 获取实时、动态或特定领域的信息 搜索引擎、天气API、股票API、新闻API 实时天气查询、股价追踪、热点新闻汇总
代码工具 代码生成、调试、运行与解释 GitHub Copilot、代码解释器 程序开发、代码错误排查、脚本生成
文档/数据处理工具 解析文档、分析表格、处理结构化数据 PDF解析工具、Excel分析工具、数据库查询工具 合同审核、销售报表分析、企业知识库查询
多模态工具 处理图像、音频、视频等多模态数据 图像识别API、语音转文字工具、文生图模型 医疗影像分析、语音内容转写、创意图像生成
自动化工具 执行自动化任务、跨平台协同操作 邮件发送工具、日程规划工具、Zapier(跨应用集成) 自动发送会议纪要、行程预订、多平台数据同步

五是既定基准测试无法反映真实世界的能力和实用性。Sebastian Raschka认为推理模型的能力无法被既定的、原始的基准测试而完全判定。由于推理模型会面对更加复杂的计算工程,以及在推理过程中不断学习新的知识,优化自身的能力边界。因此面对推理模型,需要不断生成适配的、新的基准测试集。有趣的是OpenAI创始团队成员AndrejKarpathy在其年终总结中也表示:“2025年,我对各类大语言模型的基准测试的态度是默然与不信任,基准测试极易被RLAR技术或简易的合成数据生成手段针对性破解。”

六是LLM的使用存在“一体两面”性,需重视使用限度。Sebastian Raschka指出大模型推理性增强,在编程、写作、研究方面的工作中起到了可观的促进作用,大幅度提升工作效率,但在深度研究性工作中,人的价值仍是无可替代的。也即“这个过程可能涉及 LLM 来提高清晰度、检查技术正确性、探索替代方案或运行小型实验,但核心工作仍然取决于人类的判断和专业知识。”人类作品相较AI生成可能永远不完美,但却永远存在精进与改进的空间,而这个空间会促成更多头脑风暴和人与人之间的智慧交流。另外,Sebastian Raschka也指出,过度使用大模型会导致职业倦怠。我们应该更多地把它视为合作伙伴而不是替代品,才能够更好激发创造力。

三、基于Sebastian Raschka对推理模型发展的预测,未来,如何促进这类模型技术创新与应用落地?

加强模型的Token管控及其工程化落地。输入Token的冗余会增加模型的计算负担与延迟,通过输入压缩可在不损失关键信息的前提下,减少处理的Token数量。如,将长文本渲染为高清图像,通过多模态模型的视觉编码器转换为视觉Token(信息密度更高);对多轮对话历史、长文档输入进行剪枝,仅保留与当前查询相关的内容;多轮对话场景中,对相同的系统指令须避免重复计算。在工程落地方面,优化方案的落地需结合场景需求进行选型,并建立全链路监控机制,确保延迟与Token消耗的优化效果可持续。

Gemini系列开创了推理模型低价、低门槛、高性能的范例,廉价、可靠、低延迟的推理需要被重视。推理模型的下一步,需要打破消费级推理模型和企业级推理模型之间的“认知鸿沟”和“技术鸿沟”。在认知层面,人们普遍认为消费级推理模型是低门槛、低成本、高易用性、轻量级,而企业级推理模型是高可靠性、高并发、强定制化、规模化。但在未来,我们必须接受企业级AI应用落地也能够具备低门槛、低成本的特点。在技术层面,智能部署的平权化、黑箱的透明化问题都需要被注意。

除数学和编码的基础推理领域,推动医学(化学、生物学交叉、融合领域)、金融、法律领域的RLVR尝试。推理模型的可解释性优势在高价值场景中尤为关键,在医疗诊断中,推理模型不仅能给出疾病判断,还能展示“症状—指标—病症”的推理链条,帮助医生验证逻辑;在金融风控、法律分析等合规敏感场景,外显的推理步骤可满足相关法规对“决策可追溯”的要求,而传统模型因无法提供逻辑依据,难以通过监管审查。此外,当推理结果出现错误时,用户可直接定位错误的中间步骤并修正,实现实时纠错。

促进推理模型工具调用安全性评估与工具使用访问权限标准设置。Sebastian Raschka在对2026年的预测中指出,开放权重社区将缓慢但稳定地采用具有本地工具使用和日益增强的代理能力的 LLM。此时,模型本身和工具调用的安全性问题仍然需要被考虑。若本地工具的权限管理不严格,攻击者可能获取管理员权限,执行删除模型文件、修改配置、禁用安全功能等危险操作,导致模型服务中断或数据丢失。用户误操作或缺乏安全意识也可能引发风险,例如在部署过程中误输入敏感数据、未正确配置访问控制策略等。因此,促进推理模型工具调用安全性评估与工具使用访问权限标准设置仍需被考虑。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐