登录社区云,与社区用户共同成长
邀请您加入社区
本章聚焦 Agent 开发刚需能力,不讲空洞理论,全部贴合实战场景,包含思维链提示、结构化 JSON 输出、模型微调极简方案、Prompt 注入防御,所有代码简短可直接运行,附带官方溯源链接。
很自然。但现在别只看前向传播。看那条 Identity Path。即使 (x_l) 通过 Residual 直接加到了后面:最终它还是要经过:Norm也就是说:从这一层到下一层,并不是存在一条完全绕开子模块和 Norm 的直接 Identity Path。这个细节对于深层网络的优化很重要。于是另一种布局开始变得特别有意思。
Normalize 是纯数据预处理手段,不属于网络可训练层,核心作用是把数据映射到固定区间、统一量纲,消除特征尺度差异,无任何可学习参数,训练时不更新权重。Normalize:工具,预处理用,无参数;BatchNorm:CV 专用,靠批次,怕小 batch;LayerNorm:NLP 标配,靠单样本,稳;RMSNorm:LN 精简版,大模型通用,更快更优。RMSNorm。
本文用生活化比喻和实例解析Transformer核心原理。Transformer如同"超级翻译官",通过自注意力机制(查询-键-值系统)理解词间关系,像图书馆找书般匹配信息。关键设计包括:1)位置编码给词排顺序;2)编码器-解码器分工(读/写);3)并行处理整句信息。以"我喜欢猫"翻译为例,展示其先理解语义再生成输出的工作流程。相比传统RNN,Transfo
用最通俗的方式解释大模型的工作原理:它不是"查答案"而是"造句",逐字预测生成回答。详解Token计费、训练vs推理的区别、模型大小与GPU显存的关系、Prompt的三种角色,帮助运维工程师建立对大模型的正确认知。
2017年,Google的研究团队在论文《Attention Is All You Need》中提出了Transformer模型架构。这一架构彻底改变了自然语言处理(NLP)领域,并迅速成为现代大语言模型(如GPT、BERT、T5等)的核心基础。与之前的循环神经网络(RNN)和卷积神经网络(CNN)相比,Transformer完全基于注意力机制,尤其是自注意力(Self-Attention),实现
从DeepSeek R1到GLM-5.2,从Qwen 3到Kimi K3,国产开源MoE模型在过去一年完成了从追赶到并跑再到局部领跑的三级跳。它不是全能冠军,但在编程和Agent赛道上,已经坐到了全球最靠前的位置。2.8万亿参数、100万token上下文、原生视觉理解、Arena代码榜第一——这些标签叠加在一起,让国产开源模型第一次在规模+能力+开放三个维度同时站到了世界之巅。当然,K3距离全面超
人类最后考试已不够用,伯克利牵头、250 多位行业专家参与的研究团队开始给AI上难度, Agents' Last Exam(智能体最后的考试,ALE)诞生。AI 飞速进步,各类问答基准几乎天天刷新 SOTA,人类最后考试(HLE)上,刚发布的最强 Claude 模型已经接近 65%,问答类基准已被刷爆了。人类最后考试已不够用,伯克利牵头、250 多位行业专家参与的研究团队开始给AI上难度, Age
SFT微调实战:方法对比与应用指南 本文深入解析大模型监督微调(SFT)的核心技术与工程实践,重点对比全参微调、LoRA和QLoRA三种方法的优劣及适用场景。主要内容包括: SFT定位:作为预训练与对齐间的关键环节,解决模型对话能力和业务适配问题 方法对比: 全参微调效果最好但成本最高(70B模型需840GB显存) LoRA通过低秩适配降低显存需求至1/3,支持多任务热切换 QLoRA进一步量化基
首先看一下谷歌的开篇论文这篇论文是计算机视觉领域具有的开山之作,由谷歌研究团队(Google Research, Brain Team)在2020年提出,并在2021年的 ICLR 会议上发表。它首次成功地将自然语言处理(NLP)领域大火的架构,直接应用到了图像识别任务中,打破了卷积神经网络(CNN)在视觉领域的长期统治地位。CNN和注意力在。
我有个朋友是做后端的老程序员,最近想转大模型训练方向,跟我说想了解一下昇腾 NPU 的算子生态。他对 PyTorch 熟悉,但没接触过 CANN,问了我一个问题:“ops-transformer 这个仓库到底解决了什么问题?我给他讲了大概二十分钟,最后他跟我说:"你能不能用五句话概括?"我试了一下,发现做不到——因为这个仓库解决的不是一个问题,而是串联起了一整条链路上的多个问题。但我可以换一种方式
摘要:ATB(AscendTransformerBoost)是昇腾CANN生态中的Transformer加速库,通过算子融合技术优化大模型在昇腾NPU上的推理性能。它解决了算子调度开销大、显存碎片浪费和MoE模型支持差三大痛点,将Transformer层计算融合为1-2个Kernel,调度开销从5ms降至0.1ms以下。ATB支持Attention加速、MoE优化、FFN/LayerNorm融合和
基本上,量化任务可被视为分别为权重和输入寻找最优的低比特量化区间。为了保持注意力机制的功能性,我们在传统的量化目标中引入了一种排序损失(ranking loss),旨在量化后保持自注意力结果的相对顺序。此外,我们深入分析了不同层的量化损失与特征多样性之间的关系,并通过利用每个注意力图和输出特征的核范数,探索了一种混合精度量化方案。本文研究了面向视觉Transformer模型的后训练量化方法,采用混
Transformer模型是自然语言处理领域的革命性突破,其核心创新在于自注意力机制和并行化处理能力。该模型由编码器和解码器组成,通过嵌入层将离散符号转化为连续向量,并引入位置编码保留序列信息。自注意力机制能有效捕捉长距离依赖关系,多头注意力则进一步增强了模型的表达能力。Transformer不仅主导了NLP领域,还扩展到计算机视觉等多个AI子领域。随着BERT、GPT等变体的发展,Transfo
MiniGPT-4是多模态大模型发展史上的一个里程碑式的工作。多模态大模型的能力上限,是由语言模型决定的。简单就是美:有时候最简单的架构反而能取得最好的效果数据质量 > 数据数量:3500条高质量数据带来的提升,超过了500万条低质量数据站在巨人的肩膀上:充分利用已经训练好的单模态模型,可以大大降低多模态模型的训练成本MiniGPT-4的开源也极大地推动了多模态大模型的研究和应用。现在,任何人都可
Transformer相比RNN的三大优势:1)自注意力机制实现任意位置直接交互,解决RNN长距离依赖问题;2)信息传递无损耗,保持原始语义完整性;3)并行计算能力大幅提升训练效率。这三个质变使Transformer在自然语言处理领域实现突破性进展,成为当前大模型的核心架构。文章通过"喝汤"的生动类比,形象解释了RNN的顺序处理缺陷和Transformer的全局视野优势,指出其
索引类型核心原理速度内存占用准确率推荐场景Flat (无索引)暴力计算慢低100%小数据量 (<1万) 或 调试HNSW图结构极快高高大多数 AI 应用的首选IVF聚类划分快中中内存受限的中大型数据PQ向量压缩快极低低亿级以上超大规模数据。
从1920年代的专用字体模板匹配,到1970年代的通用字体模式识别,再到2010年代的深度学习两阶段架构,OCR技术已经走过了近百年的发展历程。而生成式与Transformer式OCR的出现,标志着OCR技术进入了一个全新的时代——文档智能时代。在这个时代,OCR不再是简单的"像素转文字"工具,而是成为了连接现实世界与数字世界的智能接口。它不仅能"看清"文字,还能"看懂"文档的内容、布局和逻辑;不
Token是大模型处理文本的最基本单位。用户输入的文字不会直接交给模型,而是需要经过Tokenizer(分词器)进行编码。从 Transformer 到 Agent,大语言模型的技术栈正在快速演进。理解这些核心概念,不仅能帮助你更好地使用 AI 工具,也能为深入学习 AI 技术打下坚实基础。记住这个核心逻辑LLM 是"大脑",Token 是"语言",Context 是"记忆",RAG 是"知识库"
根据过去一周的检索结果,AI领域在LLM、Agent、多模态及推理优化方向迎来多项重要更新。
本文从一段极简Transformer训练代码出发,沿词嵌入、自注意力、损失优化三条数据流,还原大模型安全边界的由来。训练将损失从1.4081压低至0.0010的过程表明,语义学习在物理层面仅是向量方向的数值调整——模型完整吸收人类语言知识后,安全对齐以概率抑制剂的形式暴力叠加于完整知识库之上,知识未被删除,抑制剂可被干扰或绕过,这是安全困境无法根除的结构性根源。文章推演出输入过滤层的词表裂隙、注意
本文用通俗易懂的方式解释了Transformer模型架构的核心原理,包括自注意力机制、多头注意力、位置编码等关键组件。文章对比了Transformer与RNN的优劣,并介绍了编码器和解码器在理解和生成任务中的作用。最后总结了Transformer为何如此重要,它已成为现代AI的基石,广泛应用于NLP及其他领域。对于想入门大模型学习的小白程序员来说,本文是绝佳的收藏入门资料。
摘要 Midscene.js 是一套基于视觉识别的UI自动化运行时系统,其核心创新点在于将传统UI自动化流程重构为四个层次:视觉理解、设备执行、结果校验和报告记录。与传统的基于元素定位的自动化工具不同,Midscene采用"先识别屏幕内容再操作"的模式,通过截图让AI模型判断目标位置,再转换为设备坐标执行操作。该系统特别适用于selector不稳定、自绘界面复杂、弹窗变化频繁以
摘要: Java程序员转型大模型应用开发需突破八大核心概念,包括Transformer架构、自注意力机制、预训练与微调范式等底层原理,并完成从面向对象到数据驱动思维的转变。需掌握Python生态、数据处理、工程化部署及大模型应用框架(如LangChain),同时结合领域知识形成差异化竞争力。转型核心是复用Java工程化经验,重点突破大模型技术栈,逐步实现从后端开发者到大模型应用专家的跃迁。
如果你刚刚看完上面的项目演示,应该已经有一个直观感受:用户不需要写 SQL,直接用自然语言提问,系统自动返回「分析结论 + 可视化图表」
AI时代,Java工程师真的要被淘汰吗?答案当然是不。但我们确实需要学点新东西。Spring AI已经把AI对接做得非常友好了。如果你用过Spring Data JPA、RestTemplate、WebClient,你会发现 Spring AI 的风格完全一致——熟悉的注解,熟悉的Fluent API,熟悉的Spring味儿。今天我就用真实项目代码,手把手教大家如何用 Spring AI 的Cha
这周如果你是 AI 编程工具的活跃用户,可能需要花时间消化这些更新。Claude 用户:试试 Opus 4.7 的 xhigh 模式,/ultrareview 对代码审查很有用Cursor 用户:Canvases 值得探索,特别是需要可视化场景Windsurf 用户:Devin Cloud 集成后,复杂任务可以丢给云端 Agent 跑通用建议:选一个主工具深入使用,而不是每个都尝鲜。
Claude 在3月份就上线了computer use功能,Cursor 在4月初发布了为Agent 设计的全新版本 Cursor 3,OpenAI 的这次更新可以称是 Agentic AI 浪潮的最新信号。过去AI只能生成代码,而现在则可以看屏幕、点鼠标、敲键盘、跑长任务、并行执行和多Agent协作。于是,前端迭代、测试、PR、JIRA跟进、周报生成都被自动化,普通人也能干复杂工作。大家准备好迎
后端+大模型应用开发,绝对是当前程序员圈最稳、最有前景的技术成长路线,没有之一!现在企业迫切需要的,不是只会调参、搞算法研究的研究员,而是能把大模型真正接入真实业务、落地产生价值的工程师——而这,正是后端工程师的核心优势所在。主流的大模型应用方向(RAG和Agent),本质上都是后端工程能力的延伸,技术栈也绝非只有Python一种。对后端程序员来说,系统学习大模型应用开发,不仅能快速掌握前沿技术,
本文探讨了为何相同模型在 Chat 界面与 Coding Agent 中表现迥异。核心在于 Coding Agent 的 6 大组件:实时仓库上下文、Prompt 结构与缓存复用、结构化工具与权限、上下文缩减、对话记忆与恢复、委托与子 Agent。这些组件通过优化上下文管理、工具调用和缓存策略,显著提升了模型在代码任务中的表现。文章强调 Harness(套件)设计比模型本身更重要,并提供了针对不同
AI时代开发者不被淘汰的转型指南,小白&程序员必看(附四周落地计划)最近和300多位开发者深入交流后发现,有70%的人都在陷入同一个焦虑:AI大模型飞速发展,代码能自动生成、需求能快速落地,我们会不会被彻底淘汰?其实我也曾有过这种深夜恐慌,疯狂刷各种AI工具教程,生怕自己被行业抛弃。。
文章摘要: 本文聚焦人工智能领域的基础研究与提示词(Prompt)工程优化,强调理论基础与实用技巧并重。专栏“强基固本”致力于夯实AI学科的数理基础,同时通过分析优秀案例(如GPTs、字节扣子等平台)探讨Prompt设计的进阶方法。文章提出从现有优质案例中逆向学习Prompt编写技巧,并提供具体操作示例,包括如何提取隐藏提示词、优化文本风格转换等实用策略,旨在帮助读者提升大模型应用、训练及微调中的
RAG = 检索增强生成,让AI能回答你的业务问题工作流程:向量化 → 检索 → 生成比微调更便宜、更实时应用:企业知识库、智能客服、文档检索企业落地大模型,RAG是必修课。对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?答案只有一个:人工智能(尤其是大模型方向)
Agent Harness 到底是一个新概念,还是旧概念的新包装?老实说,两者都有。上下文管理、状态持久化、错误重试、任务分层——这些在分布式系统、微服务架构、DevOps 领域都有成熟的实践。Agent Harness 并没有发明什么全新的东西。「模型是不确定的。传统软件的每一行代码都是确定的,你调一个函数,返回值是可预测的。但 Agent 不是。它的每一次推理都可能给出不同的结果,它会"遗忘"
层归一化可以确保每个层的输出具有一致的均值和方差,从而稳定训练过程。 残差连接是通过将一层的输出直接传递到更深层来跳过一个或多个层的连接,它能帮助缓解在训练深度神经网络(如大语言模型)时遇到的梯度消失问题。 作为 GPT 模型的核心模块组件,Transformer 块融合了掩码多头注意力模块和使用 GELU激活函数的全连接前馈神经网络。 GPT 模型是具有许多重复 Transformer
1。
梳理完这五个时期,其实能清晰看到AI的进化逻辑——从“能学”(理论奠基),到“能看”(单点突破),再到“能懂”(全域转折)、“能举一反三”(泛化拓展),最后朝着“能理解世界”(前沿探索)稳步迈进。这不是一份严谨的学术报告,只是我这段时间学习、思考后,对AI发展的个人理解。没有复杂的术语,没有高深的理论,只想把AI的发展脉络,用最易懂的方式分享出来。AI的发展还在继续,从简单的感知机到复杂的世界模型
核心定义RAG(Retrieval-Augmented Generation,检索增强生成)是一种结合大语言模型(LLM)与信息检索技术的AI生成框架,核心逻辑为:先从外部知识库精准检索相关信息,再将检索结果作为上下文喂给大模型,由大模型结合检索内容生成精准、事实性强的回答,彻底解决大模型“幻觉”、知识过时、专属知识库无法接入的核心痛点。核心价值痛点RAG解决方案大模型幻觉(生成虚假信息)基于真实
不讲从0-1的推导原理背景是的直接添加在上[12]⏟word−embedding+[0.30.6]⏟positional−embedding=[1.32.6]\underbrace{\begin{bmatrix} 1\\ 2\end{bmatrix}}_{word-embedding}+\underbrace{\begin{bmatrix} 0.3\\ 0.6\end{bmatrix}}_{pos
摘要 本文系统梳理了大语言模型(LLM)、视觉语言模型(VLM)和多模态大模型(MLLM)的技术路线。首先明确了概念区别,指出当前主流是将视觉能力"外挂"到LLM上的MLLM架构。重点分析了Transformer成为基础架构的原因,以及如何将图像patch与文本token统一表示。文章将主流模型分为纯LLM、视觉编码器+LLM和多模态系统三类,并详细解读了参数规模、上下文长度、
• ✅句子窗口检索:用单句建索引(精准),用窗口送 LLM(完整),两全其美• ✅结构化递归检索:给文档贴元数据标签,先路由后检索,大规模知识库的救星• ✅安全意识用了eval(),生产环境要换成元数据过滤方案阶段方向要掌握的入门跑通基础 RAGLlamaIndex 基本用法,向量索引,Top-K 检索进阶本文两种技术高级混合检索 + 重排序密集向量 + 稀疏向量 + Reranker 三件套。
可作如下类比: 想象一位画家在创作连环画——每一帧画面都需承接前一帧(甚至前几帧)的情节与构图,才能合理延续故事。同理,自回归模型在每个时间步的输出,都依赖于此前一个或多个时间步的输出结果。这种逐词/逐帧递进、环环相扣的生成方式,使各时间步之间形成强序列依赖,因而特别适用于时间序列预测等任务。
大多数想深入AI的开发者,一看到“Transformer”这个词就本能地退缩。它总被包装成只有顶尖研究员才能驾驭的黑盒,仿佛里面藏着什么高深的魔法。我起初也是这么想的——2017年论文《Attention is All You Need》刚出来时,我以为它一定依赖某种复杂的循环机制才能处理长文本。直到我把整个架构从输入到输出拆到不能再拆,才发现真相残酷又解气:它根本没有魔法,每个零件都简单到离谱,
摘要:本文基于 Java 技术栈,从系统设计与工程落地角度,拆解 7 种主流 AI Agent 产品形态的适用边界、核心原理、统一平台架构、生产级代码骨架与高并发治理方案。文中示例以 Java 17 + Spring Boot 为主,适合架构师、后端工程师、AI 平台工程师直接参考。
本篇文章用“会议室里相互对视”的生动比喻,通俗地解释了 Transformer 如何用自注意力机制替代 RNN 的串行记忆,从而实现并行计算与长距离上下文理解。
本文题为《Amultimodal transformer system for noninvasive diabetic nephropathy diagnosis via retinal imaging》,由Zheyi Dong,Xiaofei Wang,Sai Pan等共同完成,作者单位包括中国人民解放军总医院第一医疗中心肾脏科、中国人民解放军总医院第三医疗中心高级眼科、英国剑桥大学临床神经科