登录社区云,与社区用户共同成长
邀请您加入社区
## 小孙女·全连接层(Fully Connected Layer)—— 做最终决定的“陪审团”经过好几轮“卷积→ReLU→池化”的重复(通常是5~13轮,越往后特征图越小、通道数越多),我们得到了一堆浓缩的、高级的特征图——比如“胡须存在的概率”“三角形耳朵的匹配度”“毛茸茸纹理的强度”。好了,今天的课就到这里。这个过程很像人类学习:婴幼儿并不知道“猫”的定义,但听大人指了100次“猫猫”,他的
说明,以下内容右chatgpt生成,为了个人多次深刻理解,现记录下来,供反复理解。
它是计算机视觉里,专门用来训练和测试图像分类模型的「公开标准图片数据集」,相当于给 AI 做 “看图认东西” 练习题的题库。项目具体内容通俗理解本质大量标注好的图片集合给 AI 做 “看图认类别” 的练习题库规模6 万张图片(5 万训练 + 1 万测试)训练用 5 万张题,考试用 1 万张题类别10 个固定类别飞机、汽车、鸟、猫、鹿、狗、青蛙、马、船、卡车图像大小32×32×3(像素)很小的彩色图
在日常工作中,我专注于并行计算领域,主要依托GPGPU、NPU等高算力芯片进行开发。当前,高算力与AI已深度融合,计算与人工智能二者相辅相成:底层计算为实现通用算法与算子提供基础,而AI模型则能反哺并优化传统算法的决策效率与性能。为系统构建这方面的知识体系,我在公司导师的推荐下,跟随up主“霹雳吧啦Wz”的CNN系列视频进行学习,并通过博客记录学习过程,融入自己的理解与总结。图中展示了VGG网络的
在日常工作中,我专注于并行计算领域,主要依托GPGPU、NPU等高算力芯片进行开发。当前,高算力与AI已深度融合,计算与人工智能二者相辅相成:底层计算为实现通用算法与算子提供基础,而AI模型则能反哺并优化传统算法的决策效率与性能。为系统构建这方面的知识体系,我在公司导师的推荐下,跟随up主“霹雳吧啦Wz”的CNN系列视频进行学习,并通过博客记录学习过程,融入自己的理解与总结。以上就是今天要讲的内容
真实的图片是 RGB 三彩的,而且我们不可能只找“猫耳”,我们还要找“猫眼”、“猫胡须”、“垂直边缘”、“水平边缘”。所以必须引入**通道(Channel)**的概念。值得注意的是,net.eval() 后,会关闭BatchNorm,net.train() 下,会打开 BatchNorm。,我们其实关心的是“它正上方的一个像素”、“它右下角的一个像素”,而不是“全图第 5 行第 10 列的像素”。
摘要:本项目基于阿里云平台开发文章自动评价系统,通过微调通义千问模型实现对输入文章的多维度评分。流程包括:1) 阿里云账号注册与PAI平台配置;2) 数据收集、清洗和标注;3) 模型训练环境搭建;4) 使用LoRA等高效微调技术训练模型;5) 部署为在线服务并集成可视化操作界面。系统最终可输出标准化的文章评价结果,客户无需技术背景即可通过简单界面操作完成全流程。
### 📌 补充关键证据(来自原论文)- 实验显示:**同等深度下,ResNet训练误差显著低于Plain Net(无残差)**,证明退化是优化问题;- 移除残差连接后,Plain Net-34 比 ResNet-34 训练误差高约10%;- 强制 Plain Net 学习恒等映射(如用线性层替代非线性)仍无法达到 ResNet 效果 → 证实**结构设计本身赋予了优化优势**,而非仅靠技巧。
本文通过对比传统CNN与新型NCT架构的代码实现,深入解析了两种AI模型的本质差异。CNN采用层级过滤机制,通过卷积核提取局部特征、池化降采样和全连接分类实现图像识别;而NCT则模拟人类意识过程,包含多模态编码、跨模态整合、注意力选择、预测编码和意识度量等创新机制。文章详细解读了CNN的实现代码,包括卷积层设计、池化操作和全连接结构的工作原理,为后续理解NCT架构奠定基础。通过代码级别的对比分析,
卷积神经网络(CNN)作为深度学习革命的先锋,其“局部连接、权值共享、层次化表达”的设计思想精妙绝伦,在计算机视觉领域建立了不可磨灭的功勋。尽管当前面临着Vision Transformer等新架构的挑战,但CNN并未止步。通过与注意力机制深度融合、持续向轻量化演进、积极探索自监督学习,CNN正不断焕发新的活力。它的未来不在于被完全取代,而在于作为经过千锤百炼的强大基础模块,融入更复杂、更高效、更
**摘要:**2010-2015年是AI影像技术的萌芽期,以AlexNet、GAN和DeepArt为代表的技术突破奠定了现代AI电影制作的基础。这一时期,深度学习三要素——算力(GPU)、算法(CNN/RNN/GAN)和数据(大数据)完成历史交汇,使AI从实验室走向好莱坞。CNN赋予AI图像识别能力,RNN实现语音转文字,GAN开启“无中生有”的生成可能。AI初步应用于老片修复、音频降噪和视频分析
这篇文章围绕一套可直接运行的 CNN 代码展开,便于对照实现与输出结果。
图像分类作为计算机视觉的基石,其技术发展推动了整个领域的进步。从传统方法到深度学习,特别是CNN的出现,使图像分类性能得到了质的飞跃。更高效的模型架构设计自监督与半监督学习方法多模态融合技术可解释性与可信AI掌握CNN原理和实践方法不仅是图像分类的基础,也是理解更复杂视觉任务(如目标检测、图像分割、视频分析)的关键。随着技术的不断发展,图像分类将继续在各个领域发挥重要作用。
MobileNet系列是专为移动设备设计的轻量化神经网络。其核心创新包括:V1引入深度可分离卷积,将标准卷积拆分为深度卷积和逐点卷积,计算量可减少8.4倍;V2提出线性瓶颈和逆残差结构,解决低维信息损失问题;V3结合神经架构搜索技术,加入通道注意力机制。MobileNet通过宽度和分辨率乘数实现精度与效率的平衡,已成功应用于果蔬识别、垃圾分类等移动场景。该系列网络从V1到V4不断优化,推动了AI在
在深度神经网络中,退化问题指的是:随着网络层数的增加,模型在训练集上的准确率达到饱和后,反而出现迅速下降的现象。这种下降并非由过拟合导致(过拟合时训练准确率仍很高,只是测试准确率下降),而是由于深层网络难以优化,导致训练误差升高。典型现象在CIFAR-10数据集上,一个20层的普通网络(plain network)训练误差较低;而一个56层的普通网络,训练误差反而比20层网络更高,测试误差也更高。
摘要:卷积神经网络(CNN)通过分层特征提取处理图像:卷积层用局部感知的"印章"方式检测边缘/纹理特征;池化层压缩特征图保留关键信息;全连接层整合特征进行分类。相比传统神经网络,CNN利用权值共享和局部相关性显著提高效率,广泛应用于人脸识别、医疗影像和自动驾驶。典型模型如LeNet、AlexNet到152层的ResNet不断加深网络能力。CNN对图像旋转/缩放不敏感的特性源于其
一、引言:锂电池剩余寿命预测的核心价值与技术挑战在新能源汽车、储能系统、便携式电子设备等领域,锂电池作为核心能量来源,其剩余寿命(Remaining Useful Life, RUL)预测直接关系到设备运行安全性、维护成本与用户体验。传统基于经验的寿命评估方法(如固定周期更换、容量阈值判断)存在精度低、资源浪费等问题,难以满足复杂场景下的动态管理需求。
AI大模型:python舆情分析系统 情感分析 CNN算法 LSTM算法 卷积神经网络网络 可视化 Django框架 Echarts可视化 毕业设计✅
本项目开发了一个基于TensorFlow深度学习CNN算法的垃圾分类识别系统。系统采用ResNet50预训练模型,通过图像数据预处理、模型训练(准确率达99.83%)和系统集成等步骤实现高效垃圾分类。项目包含完整源码、开发文档、论文及部署教程,为环保领域提供了AI解决方案。该系统可显著提升垃圾分类效率,减少人工成本,具有实际应用价值。
本文介绍了AlexNet模型的训练配置与实现细节。主要内容包括:1) 初始化配置支持GPU优先的设备选择策略;2) 训练设置采用SGD优化器,学习率0.001,配合多阶段学习率调度;3) 训练流程包含梯度裁剪和早停机制;4) 评估功能计算总体及类别准确率;5) 提供训练曲线可视化功能。实验部分展示了在CIFAR-10数据集上的训练示例,简化版AlexNet可获得约80-83%的测试准确率。最后给出
本文为王万良《人工智能导论(第5版)》的笔记,该图书为国内大学广泛采用的《人工智能》课程教材。笔记涉及的主要章节包括绪论、知识表示与知识图谱、搜索求解策略、智能计算及其应用、专家系统与机器学习、人工神经网络及其应用、智能体与多智能体系统、自然语言处理及其应用。
Mermaid 渲染失败: Parse error on line 2:... A[CANN架构] --> B[算子库(ops)]A --> C[运行时架构说明算子库(ops):包含基础算子实现(如ops-nn中的Pooling),支持Ascend NPU原生指令集运行时(RT):管理计算图执行与内存分配编译器:将AI模型编译为NPU可执行格式,优化算子融合与流水线设计理念CANN采用分层解耦。
昇腾 CANN 提供的ops-nn仓库是构建高性能 CV 应用的基石。它不仅仅是一组算子的集合,更是昇腾硬件架构、TBE 编程模型以及深度学习算子优化经验的结晶。通过深入理解和利用ops-nn中对卷积、矩阵运算等核心 CV 算子的精细化优化,特别是其在算子融合、数据布局和多核并行调度方面的设计,我们能够最大限度地挖掘昇腾 AI 处理器在处理复杂视觉模型时的计算潜力。持续关注和贡献于CANN 组织中
本文将重点介绍卷积神经网络的基本结构及原理,包括神经元、连接方式、激活函数以及神经网络模型的建立等方面,主要用于自己学习理解,部分内容参照了鱼书以及AI辅助生成,不足之处还请指正。
本文系统介绍了五种里程碑式CNN架构的发展历程与技术特点。以1998年LeNet-5为起点,重点分析了2012年AlexNet的突破性创新,包括ReLU激活函数、Dropout和数据增强等关键技术。通过Mermaid图表直观展示了各网络层级结构,并提供了参数计算示例。这些经典架构奠定了现代深度学习的基础,其设计思想至今仍深刻影响着计算机视觉领域的发展。文章采用技术细节与实现代码相结合的方式,完整呈
本文总结了卷积神经网络(CNN)的基本原理和完整前向流程。CNN通过局部感受野和参数共享高效提取图像特征,主要包含卷积(提取局部模式)、激活(引入非线性)、池化(下采样保留显著特征)、展平(转为向量)和全连接层(综合特征分类)等模块。文章详细解释了卷积核运算、padding防止边缘信息丢失、多卷积核生成特征体、ReLU激活函数、最大池化等核心概念,并推荐使用CNN Explainer工具进行交互式
传统序列模型(CNN/RNN/LSTM)与大语言模型(GPT/BERT)并非替代关系,而是互补关系:传统模型是序列数据处理的基础,解决了“从0到1”的序列特征提取问题,在低算力、小数据场景仍不可替代;大模型是语言理解的革命,通过Transformer和预训练范式解决了“从1到100”的通用语义建模问题,在复杂语言任务中展现出碾压性优势。作为开发者,需根据任务需求、数据规模、算力资源三者平衡选型:在
与分类任务的核心差异:分类任务标签为“类别整数”,回归任务标签为“10个连续坐标值”,需将标签转为浮点型(与模型输出数据类型匹配)。标签文件格式(train.txt/test.txt):每行11个元素,第一个为图片相对路径,后10个为坐标值,示例:000001.jpg 32 28 48 29 39 45 30 52 48 51self.imgs = [] # 存储图片完整路径self.labels
与LeNet有相同之处,也有很多区别;比如适用大尺寸的图像所以使用11X11这种大尺寸的卷积核使用Relu激活函数,对比tanh/sigmoid激活函数,训练更快且避免梯度消失dropout随机使得一些神经元失活防止过拟合(用在全连接层)LRN局部归一化:正则项,防止过拟合# input_size还必须是元组,使用列表就会报错,,,,AlexNet中使用了dropout,resnet丢弃dropo
是的,CNN的掩码可视化是理解PPO动作意图的“X光片”。确认智能体是否在看正确的地方(比如看路而不是看UI)。结合环境常识,从关注点反推动作(看到左边有奖励 -> 动作是左转)。如果动作错误,看可视化能帮你发现是CNN看错了(特征提取错误)还是PPO算错了(策略错误)。如果你想具体实现这种可视化,可以使用Grad-CAM技术,将热力图叠加在原始游戏画面上,然后运行训练好的PPO模型,观察每一帧的
本文系统综述了图像分割领域十年的技术演进。回顾了以 U-Net 为基石的 CNN 黄金时代,奠定编解码架构标准;解析了以 Swin-UNETR 为代表的 Transformer 时代,突破全局感知瓶颈;探讨了 SAM 与 MedSAM 引领的大模型纪元,开启提示驱动新范式。全文旨在梳理从像素级分类到“分割一切”的关键里程碑与未来趋势。
本文基于YOLOv8深度学习框架开发了一套智能化鸟类识别系统,旨在解决传统人工监测效率低、专业性要求高等问题。系统支持图片和视频上传识别,提供多类别检测结果及置信度分析,并集成鸟类百科数据库展示详细物种信息。技术实现涵盖前端交互、后端服务和YOLOv8推理引擎,具有识别记录管理、模型训练优化等功能模块。该系统可应用于生态保护、科研教育等领域,为生物多样性监测提供高效工具,降低专业门槛,促进AI技术
本文提出了一种名为 Mesorch 的新型架构,用于图像篡改定位任务。该模型创新性地引入"介观"概念,通过并行结合 CNN(捕捉微观纹理)和 Transformer(提取宏观语义),并辅以频域双流增强与自适应加权模块,实现了多尺度特征的高效融合。实验表明,Mesorch 在多个基准数据集上达到 SOTA 性能,同时通过二次剪枝策略大幅降低计算成本(FLOPs 减少约50%)。该
本项目完整展示了计算机视觉在医疗领域的一个应用实例,通过构建CNN模型实现了肺炎X光片的自动检测。为了让读者更容易了解人工智能项目如何实施,整个实例的实现完全按照AI项目周期的6个阶段而设计,并且给出每个阶段详细的任务说明,代码实现以及知识点解释。并且给出了改进建议。
残差网络(ResNet)是一种通过引入“快捷连接”来构建极深卷积神经网络的架构。其核心思想是“残差学习”。残差在数学和统计学中,残差指的是观测值与预测值之间的差值。在ResNet中,理想的"观测值"设为H(x)基准预测值设为B(x)=x(即输入和输出相同,什么也不改变)残差传统网络:让多层网络直接学习一个目标映射H(x)。残差网络:让多层网络学习一个残差映射,而最终的输出仍是。这里的x就是通过快捷
摘要:卷积核的初始值通过随机初始化策略(如高斯分布或Xavier初始化)生成,以避免对称性问题。在训练过程中,网络通过反向传播和梯度下降算法不断调整卷积核权重,使其逐渐特化为检测特定视觉特征的探测器。低层卷积核最终会学习到类似Gabor滤波器的边缘、纹理等基础特征,而深层卷积核则能识别更抽象的语义模式。整个过程体现了深度学习数据驱动、端到端学习的核心思想,但深层网络的可解释性仍存在挑战。
卷积神经网络(Convolutional Neural Network, CNN)是一种专门为处理具有类似网格结构的数据(如图像、视频、音频频谱图)而设计的。
本文探讨了GraphRAG技术在工业级问答系统中的应用。相比传统RAG技术,GraphRAG通过构建知识图谱解决上下文碎片化、语义理解表层化和可解释性不足等问题。文章详细介绍了GraphRAG的核心组件(实体识别、关系抽取、图构建、图检索和答案生成)及其优势,并提出了私有数据集成方案,包括数据预处理、访问控制和增量更新机制。最后给出了基于LangChain和Neo4j的代码实现框架,展示了从查询解
MobileViT 首次实现了 “轻量化 CNN 的效率 + ViT 的性能” 的完美结合,其核心创新在于将 Transformer 重构为 “全局卷积”,让模型同时具备局部特征提取与全局依赖建模能力。实测证明,MobileViT 在图像分类、目标检测、语义分割等任务中均超越同量级 CNN 和 ViT 模型,且训练简单、 latency 低,完全适配移动端资源约束。随着移动端 AI 算力的提升和
本文介绍了一个完整的CNN图像分类项目实战,从Kaggle获取猫狗数据集,采用模块化思想构建项目结构。项目分为配置文件(config.py)、数据处理(dataset.py)、模型定义(model.py)、工具函数(utils.py)、训练脚本(train.py)和可视化(visualize.py)六个模块。重点讲解了自定义Dataset类的实现方法、简单CNN模型的设计,以及数据预处理流程。通过
摘要: 卷积神经网络(CNN)作为视觉领域的核心特征提取方法,通过局部连接、参数共享和空间结构保留,高效解决传统全连接网络的参数量爆炸、平移不变性差等问题。2026年主流CNN仍包含卷积层、池化、残差连接等经典组件,并涌现Depthwise Separable、大核卷积等优化技术。经典模型如ResNet、MobileNet持续演进,ConvNeXt等现代架构刷新性能。学习路径建议从原理理解到动手实
(如 28×28→784×1),完全破坏了像素的空间位置关系 —— 它无法区分 “左上角的像素和相邻像素” 与 “左上角的像素和右下角的像素” 的差异,只能学习到无结构的特征。每个卷积核对应一个可学习的偏置值,在步骤 2 的点积结果上加上偏置,公式:output=点积结果+b偏置的作用是调整特征图的整体数值范围,提升模型的拟合能力。计算:0×1+0×0+0×(−1)+0×1+1×0+2×(−1)+
十多年前曾经在学校选修过一门神经网络的课程,使用神经网络的算法实现阿拉伯数字0-9的识别。没有想到今天人工智能能发展到这个程度,甚至两三年前感觉还可能马上会遇到下一个瓶颈。希望后续能逐步回顾下部分人工智能的经典算法,更好的理解神经网络的内在机制。
多模态大模型是融合了多种模态信息处理能力的人工智能模型,其核心在于能够对文本、图像、音频等多种模态数据进行深度学习与智能处理。多模态数据融合机制跨模态表示学习:通过深度学习技术,将不同模态的数据转换为统一的表示空间,使得不同模态的信息能够在同一框架下进行交互和融合。多任务学习:通过设计多任务学习框架,同时优化多个模态的预测任务,提升模型对多模态数据的理解和表达能力。深度神经网络架构编码器-解码器结
本项目实现了基于 MobileNet 轻量级卷积神经网络的手写汉字识别系统,支持200 个手写汉字类别的识别。项目采用 PyTorch 作为深度学习框架,PyQt5 构建图形界面,是一个典型的深度学习应用系统。核心技术栈:深度学习框架:PyTorch模型架构:MobileNet(轻量级 CNN)GUI 框架:PyQt5图像处理数据处理数据准备:确保数据集格式统一(运行to_rgb.py数据划分:自
在自动化数据采集与逆向工程中,验证码识别始终是核心的技术屏障。本文记录了一个从底层数字图像处理(DIP)到前沿多模态大模型(MLLM)的全栈实验历程。项目针对62类全字符集,自主构建了具备“域对齐”特性的数据集生产线,攻克了字符粘连切分、ASCII标签对齐等核心痛点。通过对比KNN (HOG)、SVM (RBF)、Optimized CNN及Granite 3.2 Vision大模型,量化分析了不
【AI 学习】解密卷积神经网络:从原理到实践
注释:这代码能跑,但你不是在做AI,是在"手搓卷积"!你得手动写卷积、池化、反向传播,100+行代码,还容易出错。就像用算盘算AI,能算但算得慢。痛点实录:为什么这坑能要命?注释:这代码能跑,但你不是在用C#,是在"跨语言打酱油"!你得在C#里调Python,还得处理进程间通信。就像用C#写代码,但每次调用都得叫个Python小弟来帮忙。痛点实录:为什么这坑能让你崩溃?注释:这代码能跑,但你不是在
卷积神经网络(CNN)是深度学习的核心模型,专用于处理图像、视频等网格数据。其核心思想是通过局部连接、权重共享和池化操作提取空间层次特征,显著减少参数量并提升模型鲁棒性。典型结构包括卷积层、激活函数、池化层和全连接层。经典架构如LeNet-5、AlexNet、VGGNet和ResNet不断演进,解决了梯度消失等问题。CNN在图像分类、物体检测等领域广泛应用,并扩展到非视觉任务。实现上可使用PyTo