登录社区云,与社区用户共同成长
邀请您加入社区
词向量(Word Embedding)是自然语言处理中的基础技术,将词语映射为低维实数向量以捕捉语义关系。经典模型包括Word2Vec(CBOW/Skip-gram架构)、GloVe(融合全局统计)和FastText(引入子词信息)。训练过程涉及预处理、超参数调优等步骤,评估分内在(词相似度/类比)和外在(下游任务表现)两类。静态词向量存在一词一义、上下文无关等局限,现逐步被动态上下文模型(如BE
摘要: BERT(2015-2025)从静态词向量演进为动态语义理解的核心技术,彻底改变NLP领域。2018年诞生的BERT通过Transformer和遮蔽语言模型(MLM)实现深度双向理解,衍生出RoBERTa、ALBERT等优化版本。2025年,BERT进化为RAG(检索增强生成)的核心编码器,支持万亿级知识检索,并通过eBPF实现内核级语义安全审计。同时,1.58-bit极速编码使其能部署在
摘要: 数据清洗技术经历了从规则脚本(2015-2018)到AI增强(2019-2022)再到LLM语义修复(2025)的智能化跃迁。2025年的核心技术包括:LLM驱动的语义纠偏、eBPF内核级实时质量审计、生成式模型的自愈能力,实现了从“人工找错”到“系统自愈”的质变。关键技术突破体现为:清洗维度扩展至多模态数据、延迟从批处理升级为实时流式处理、安全机制下沉至操作系统内核层。这十年演进使数据清
过去十年的演进轨迹,是将规划算法从一个**“死板的数学计算器”重塑为“赋能全球物理智能化、具备内核级权限感知与实时安全自愈能力的数字决策大脑”**。你在纠结如何写出完美的 Cost Function 来让车左转时不压线。你在利用 eBPF 审计下的生成式规划系统,放心地让 AI 操纵复杂的机械或车辆,并看着它在内核级的守护下,安全、丝滑且极具智慧地与物理世界进行博弈。
摘要: 轨迹预测技术十年(2015–2025)经历了三大阶段: 物理模型期(2015–2018):依赖卡尔曼滤波等数学方法,但无法处理复杂意图; 深度学习期(2019–2023):通过LSTM、GNN等捕捉交互,实现多模态预测; 世界模型期(2025):整合生成式AI与eBPF内核级安全审计,实现实时博弈与超视距协同预测。 2025年的技术突破包括:端到端生成预测、eBPF强制安全熔断、LLM社会
过去十年的演进轨迹,是将目标检测从一个**“静态图像处理工具”重塑为“赋能全球数字化治理、具备内核级安全感知与实时物理重构能力的数字视网膜”**。你在为模型能准确框出一只“猫”而兴奋。你在利用 eBPF 审计下的检测系统,放心地让 AI 接管繁琐的安全生产监控,并看着它在内核级的守护下,精准、安全地“读懂”这个复杂世界的每一个脉络。
空间智能建图十年演进(2015-2025):从基础SLAM发展到生成式神经重建与内核级安全闭环。早期以稀疏点云为主(ORB-SLAM2/LOAM),2019年后引入语义分割和NeRF连续表示,实现高保真重建。2025年突破包括:1)生成式补全地图,通过空间大模型预测残缺场景;2)eBPF内核审计保障空间数据安全,阻断结构注入攻击;3)4D动态建图支持实时物体追踪。技术跨越体现为:地图精度从厘米级到
VLA模型十年演进:从机械控制到具身智能(2015-2025) VLA(视觉-语言-动作)模型是具身智能的核心技术,其发展经历了三个阶段:2015-2021年的模仿学习阶段,机器人只能执行简单任务;2022-2023年的大模型注入阶段,谷歌RT系列实现动作指令编码;2025年进入原生具身时代,模型具备物理常识和实时安全控制能力。关键技术突破包括:动作Token化、eBPF内核级安全审计、世界模型嵌
摘要: 视觉语言模型(VLM)在2015-2025年间经历了三大技术跨越:从早期的特征对齐(如CLIP)到冻结骨干与Adapter爆发(如LLaVA),最终发展为2025年的原生全模态统一认知。2025年的VLM具备4D时空推理能力,通过eBPF内核审计实现安全交互,并依托1.58-bit压缩技术实现端侧部署。其核心突破在于从“静态图像识别”升级为“实时物理感知”,成为兼具高信度与安全性的“数字视
摘要: 2015-2025年,算法工程化(MLOps)经历了从实验室手动调参到工业级自动化流水线的革命性演进。早期(2015-2018)以Docker和K8s解决环境一致性问题;中期(2019-2022)通过MLOps工具链实现AI生产闭环;2025年进入“自适应工程”时代,依托eBPF内核调度、Auto-Engineering和LLMOps,实现秒级部署、动态资源调度及内核级安全监控。十年间,算
摘要:2015-2025年是AI基础设施从通用云计算向AI原生智算范式转变的十年。经历了三个技术阶段:虚拟化云原生期(2015-2018)聚焦容器化和K8s;算力中心期(2019-2022)以GPU为核心,突破网络和存储瓶颈;2025年进入智算原生时代,实现eBPF内核调度、CXL 3.0内存池化等突破。基础设施演变为具备自愈能力、内核级安全审计和极致能效管理的智能系统,支持万亿参数模型的训练。核
本文系统介绍了Word2Vec技术,包括其核心概念、Skip-Gram和CBOW两种模型架构,以及构建自定义模型的完整流程。文章通过具体代码示例展示了从数据预处理到模型训练的实现过程,并提供了词相似度和词类比两种评估方法。同时分析了Word2Vec在语义捕捉方面的优势与多义词处理等局限性,最后列举了其在文本相似度计算、情感分析等NLP领域的实际应用场景,为初学者提供了全面的技术指南。
*RAG(Retrieval-Augmented Generation,检索增强生成)**是一种结合信息检索技术和 AI 内容生成的混合架构,可以解决大模型的知识时效性限制和幻觉问题。简单来说,RAG 就像给 AI 配了一个 “小抄本”,让 AI 回答问题前先查一查特定的知识库来获取知识,确保回答是基于真实资料而不是凭空想象。从技术角度看,RAG 在大语言模型生成回答之前会先从
摘要: LangChain从2022年开源至今(2015-2025),已从简单的链式LLM工具框架跃升为支持万亿级多模态VLA Agent的智能平台。中国厂商(阿里、百度、华为等)快速跟进并领跑,推动框架效率提升1000倍+,渗透率超60%。其演进分为三阶段:2015-2021年手工调用期;2022-2023年模块化Agent元年;2024-2025年多模态VLA自进化时代,融合量子鲁棒技术,实现
Diffusion模型十年演进摘要(2015–2025) 2015年Diffusion模型仅作为学术概念萌芽,2025年已发展为支持电影级8K视频、10分钟长时序生成的多模态AI引擎。中国从早期跟随(2017)到全球领跑(Kling/Vidu等),推动技术跨越:2019年DDPM框架成熟,2021年实现高分辨率图像生成,2023年进入文本到视频爆发期(Sora/Kling)。2025年核心突破包括
摘要: 2015-2025年,AutoML从Google初代实验发展为万亿级多模态大模型驱动的智能自进化系统,效率提升超10万倍。中国从跟随者跃升为全球领跑者,华为、阿里、百度等企业推动技术迭代:2015-2018年以手工NAS为主;2019-2022年多保真并行优化实现千倍效率突破;2023-2025年进入VLA自进化时代,量子加速+意图级自适应实现秒级调优。AutoML渗透率从<5%增至
摘要: 2015-2025年,模仿学习从依赖小样本行为克隆(BC)的学术研究,发展为多模态VLA大模型驱动的产业核心技术。中国从跟随DAgger/GAIL到领跑全球,宇树、银河通用等企业推动训练效率提升百万倍,零样本泛化率从70%跃升至99%以上。演进分为三阶段:2015-2018年以BC+DAgger为主;2019-2022年实现多任务万级并行模仿;2023-2025年进入VLA自进化时代,实现
摘要: 2015年Word2Vec作为静态词向量代表主导NLP领域,准确率70-80%。2019年起,BERT等预训练模型实现动态句向量(准确率90%+),中国厂商百度ERNIE、华为盘古崛起。2023年后,多模态大模型(如CLIP、通义千问)实现视觉语言联合嵌入,准确率突破95%。至2025年,VLA自进化模型(DeepSeek-Embed等)融合量子计算,实现全域动态意图理解,中国在万亿参数训
本项目基于RAG技术开发了一个法律文书智能解读系统,旨在解决法律文书专业术语难懂、咨询成本高的问题。系统采用三级缓存架构(Redis、MySQL、RAG引擎)实现高效检索,通过BM25算法和混合检索策略提升匹配精度。核心技术包括: 使用BGE-M3模型进行文本向量化,支持稠密和稀疏向量检索 采用LangChain框架整合文档处理流程 部署BERT微调模型进行意图识别 实现四种检索策略(直接检索、H
人工智能服务 AIService。
作者国籍机构(2013 年时)核心贡献捷克Google提出了高效训练词嵌入的方法 CBOW 和 Skip-gram。Kai Chen中国Google核心架构开发者。美国GoogleGoogle 大神,支持模型的大规模并行实现。信息项详情论文题目发表年份2013 年出版刊物核心命题如何高效地将海量单词映射到低维、稠密的向量空间中,使向量的几何关系能代表语义关系?词向量本质上是一串固定长度的数字。向量
砍掉了计算昂贵的非线性隐藏层。使用 Hierarchical Softmax 将输出层的计算复杂度从线性级降为对数级。利用 CBOW(上下文测中心词)或 Skip-gram(中心词测上下文)作为“假想任务”来训练权重,这些权重最终就是我们想要的词向量。Word2Vec 论文中之所以出现 100 万这样巨大的词表,是因为当时还没有广泛应用子词分词技术,必须“死记硬背”每一个单词的每一个形态。正如论文
http://blog.csdn.net/pipisorry/article/details/76147604word2vec简介深度学习在自然语言处理中第一个应用:训练词嵌入。Google 的 Tomas Mikolov 在《Efficient Estimation of Word Representation in Vector Space》和《Distributed ...
从词嵌入的基本概念出发,介绍了Word2Vec、GloVe和BERT等主要方法的原理和特点。
摘要:本文系统梳理了RAG(检索增强生成)技术的核心概念及应用实践。首先介绍RAG的基本原理和系统架构,分析其通过实时检索外部知识库增强生成模型能力的特点。随后深入探讨检索技术演进,对比稠密嵌入(BERT、BGE-M3)和稀疏嵌入(TF-IDF、BM25)的优劣,并验证混合检索策略的优越性。进一步探讨结构化索引方法(RAPTOR和GraphRAG)在处理复杂知识时的表现。最后提出Agentic R
词向量是自然语言处理(NLP)的“地基”——它将人类语言中的词转换为计算机能理解的数值向量,让模型学会“理解”词语间的语义关联。作为最经典的词向量模型,Word2Vec(2013年由Google提出)至今仍是NLP入门的核心知识点,也是后续学习BERT、GPT等大模型的前置技能。本文从现象观察(为什么词向量重要?)、技术解构(Word2Vec怎么工作?)、产业落地(企业怎么用?)、实战代码(程序员
文章是"向量数据库POC指南"系列之二,重点讲解在大模型落地过程中如何科学选择embedding模型。文章介绍了embedding的本质、三类向量特性对比、评估模型的八大要素(如上下文窗口、分词方式、向量维度等),并对Word2Vec、BERT、BGE-M3等主流模型进行了分析。最后提供了实施建议,强调应根据业务场景选择最适合的模型,而非追求单一最优解。
总而言之,Mirix 给我的感觉,是惊喜远大于其现有的瑕疵。它不是一个遥不可及的未来概念,而是一个已经可以下载、可以运行、可以亲手体验的“未来工具”。它让我们真实地瞥见了“通用人工智能助理”时代的一缕曙光。虽然离成为人人可用的成熟产品还有很长的路要走,但 Mirix 所展示出的方向和潜力,足以让我这个数字世界的“老兵”感到兴奋。最后,附上项目链接,强烈推荐有动手能力的同学亲自尝试一番:如果你拥有这
摘要:本文介绍了基于Word2Vec词向量技术的三国人物关系分析案例。通过jieba分词工具处理《三国演义》文本,使用Word2Vec模型训练获得人物词向量,实现人物语义关系挖掘。实验结果显示,与曹操最相似的人物包括孙权、袁绍等,相似度在0.43-0.5之间。技术方案包含完整的数据预处理、模型训练和相似度计算流程,可扩展应用于推荐系统、文本分析等领域。文中还提供了模型参数优化建议和常见问题解决方案
2024.11.13阶段性总结方案挑选从简单到复杂,简单方案有简单方案的优点,有时候杀鸡不需要牛刀。面对一个场景,不知道怎么选方案或模型时,可以优先用Glove或者Fasttext完成词向量训练,使用词向量平均的方式来获得句向量,成本非常低,快速在应用中构建出一个基准模型,后期若发现应用中存在着多义词、或者或句子中词的顺序敏感的场景,则可以考虑换用bert类的方法进行微调或者直接使用专门的嵌入模型
使用text2vec模型,把文本转成向量。使用text2vec训练好的模型权重进行文本编码,不重新训练word2vec模型。利用pytorch在cuda上加速聚类计算。
如果w1和w2两个单词词义相近,那么w1和w2两个单词的向量表达应该是类似或相近的。word2vec尝试去表达单词之间的关系。
Word2vec处理文本任务首先要将文字转换成计算机可处理的数学语言,比如向量,Word2vec就是用来将一个个的词变成词向量的工具。word2vec包含两种结构,一种是skip-gram结构,一种是cbow结构,skip-gram结构是利用中间词预测邻近词,cbow模型是利用上下文词预测中间词这两种模型有三层,输入层,映射层,输出层,隐藏层是线性结构,所以相对于语言模型训练较快。...
qquad本文主要介绍如何使用Python中的spacy、jieba、gensim等库,通过使用Word2Vec和Doc2Vec模型生成中文词向量和句向量。\qquad其中,spacy是一个用于自然语言处理的库,支持多语言,其中包括中文。jieba是一个中文分词库,可以将中文文本分词。gensim是一个开源的Python库,用于处理文本数据,其中包括生成词向量和句向量的Word2Vec和Doc2V
word2vec1 算法的基本思想2 举例说明2.1 构造训练数据2.2 数字化表示单词对2.3 定义网络结构2.4 隐藏层2.4 输出层3 直觉的启示4 下篇预告本文是一篇翻译的文章,原文链接是:http://mccormickml.com/2016/04/19/word2vec-tutorial-the-skip-gram-model/如果你的英语很好,强烈建议直接阅读原文。这篇文章写的...
利用gensim的Word2Vec训练原始语料。得到分词后的结果和训练出的语料集。
LDA2vec:Christopher Moody在2016年一月提出的一种新的主题模型算法。学习资源如下github:https://github.com/cemoody/lda2vecPPT分享:http://pan.baidu.com/s/1gewC1mbLDA2vec与LDA的简单比较:http://www.datasciencecentral.com/profiles/b
word2vec算法中skip-gram的实现
词向量词向量,顾名思义,就是把一个单词或词语表示成一个向量的形式,这是因为在计算机中无法直接处理自然语言,需要把它转化为机器能够理解的语言,比如数值等。最简单的方式是把一个个单词表示成one-hot的形式。例如有三个句子:我/喜欢/小狗/喜欢/喝咖啡我/不喜欢/喝咖啡你/喜欢/什么/东西词汇表为:我、你、喜欢、不喜欢、小狗、喝咖啡、什么、东西然后对每一个词做one-hot编码:“我”就是[1
概述在信息爆炸时代,人们迫切希望从海量信息中获取与自身需要和兴趣吻合度高的内容,为了满足此需求,出现了多种技术,如:搜索引擎、推荐系统、问答系统、文档分类与聚类、文献查重等,而这些应用场景的关键技术之一就是文本相似度计算技术。因此了解文本相似度的计算方法是很有必要的。文本相似度定义文本相似度在不同领域被广泛讨论,由于应用场景不同,其内涵有所差异,故没有统一、公认的定义。Lin从信息论的角度...
在搜索领域query的处理变得越来越重要,其中分类就是很重要的一环,对query分类是比较难的工程,因为query普遍较短,含有的信息(熵)很少,所以很难进行分类,普遍的方法是对query进行扩展,例如抓取搜索引擎的结果,或是直接将query扩展到对应的doc,然后对doc进行分类,对doc分类就变得容易了,而且准确率比较高,最近看到word2vec很火,使用的是无监督的机器学习,也就是不需要标注
输入3个【=】 +【回车键】,即可。输入3个【#】 +【回车键】,即可。输入3个【*】 +【回车键】,即可。输入3个【~】+【回车键】,输入3个【-】+【回车键】
前言最初听闻word2vec还在读研了。当时挺感兴趣的,不过一直忙于毕业事项,没好好研究下,对word2vec也只是概念上的了解,直到这两天有空才能专门学习下这方面的知识。知识不经过整理很容易忘记,尤其像这种算法类的,一次性理解透彻~~至少对我这水平的来说还是比较困难,必须经过多个阶段学习才行,每个阶段都做好总结,这样有利于下个阶段的学习。本文主要从我的学习经历介绍下word2vec,还是以实践为
介绍文本结巴分词使用,词向量转化方法进行文本处理方便模型使用
链接: https://pan.baidu.com/s/1Y6wsmeYoS4tAJx9kAWPAYQ?pwd=1314 提取码: 1314。通过网盘分享的文件:大模型相关资源。--来自百度网盘超级会员v6的分享。
1:首先选中所要调整的字符或者数字。2:如下图所示,点击半角或者全角。
清洗数据
它的输入是一个整数,代表词汇表中的单词索引,输出是与之对应的词向量。词嵌入矩阵可以是预训练的(如使用 Word2Vec 或 GloVe 生成的词向量),也可以是随机初始化的,让模型在训练过程中学习优化。关系总结:词嵌入是一种将词映射到向量空间的技术,Word2Vec 是实现词嵌入的一种方法,而 nn.Embedding() 是在 PyTorch 框架中创建和管理词嵌入矩阵的工具。词嵌入(Word
待分类数据为已经分词的文本文档,其中每一行代表一篇文章,分词较为粗糙,未进行停用词过滤,使用停用词过滤后效果应该会有明显提升。1、加载数据# -*- coding: utf-8 -*-import sysreload(sys)sys.setdefaultencoding('utf-8')def loadData(fileName):#读取分词数据,存储在list列表里,每个
《娜璋带你读论文》系列主要是督促自己阅读优秀论文及听取学术讲座,并分享给大家,希望您喜欢。前一篇介绍了两个作者溯源的工作,从二进制代码和源代码两方面实现作者去匿名化或识别。这篇文章主要介绍六个非常具有代表性的向量表征算法,它们有特征词向量表示、文档向量表示、图向量表示,以及两个安全领域二进制和日志的向量表征。通过类似的梳理,让读者看看这些大佬是如何创新及应用到新领域的,希望能帮助到大家。