登录社区云,与社区用户共同成长
邀请您加入社区
雅典娜提供表面缺陷、产品异物、装配工艺和智能工位SOP等模型能力,并通过异常方案库、缺陷样本库、模型版本管理、规则模板、接口适配器和质量知识库,形成可复制的场景底座。工业相机、工位摄像头及其他智能终端采集现场图像后,AI模型完成缺陷识别、分类、定位和量化判定,覆盖划痕、裂纹、脏污、破损、色差,异物、错料、漏料、混料,以及装配错位、漏装、反装、标签与字符完整性等检测任务。特别是在多品种、小批量生产模
DINOv2自监督视觉模型为服装制造业AI质检带来突破性解决方案,有效解决传统方法依赖海量缺陷样本和泛化能力差的核心痛点。该技术仅需单张良品图片即可实现高精度异常检测,通过Patch级密集特征提取与相似度比对,实现像素级缺陷定位。相比传统深度学习方案,DINOv2具备零样本学习、分钟级部署、跨缺陷泛化等优势,在MVTec-AD基准测试中AUROC达96.6%。其“知识驱动”范式显著降低数据需求,支
AI智能相机革新传统字符质检模式,通过深度学习技术实现印刷字符的精准识别与自动分选。系统可高效检测位置偏移、内容错误等细微缺陷,彻底解决人工质检易疲劳、标准不统一的行业痛点,实现100%全检管控,大幅提升产品合规性与外观品质。相比传统人工目检,AI方案具有稳定性高、精度准、效率快等优势,有效杜绝不良品流入市场。
磨削纹的规律纹理在低角度平行光下与微裂纹的线性特征在灰度值和纹理方向上的差异被专项模型捕获。背光从密封件下方照射,透射光穿过飞边后在密封件轮廓外围形成白色高亮区域,正常轮廓的边缘在背光下呈现清晰锐利的剪影。密封件集团设备运行中积累的各缺陷分类数据与产线工艺参数的关联分析显示,微裂纹检出率的升高与硫化温度的漂移正相关。特定波长单色光下的色差使氧化斑与正常基体在图像的RGB通道上呈现可识别的差异。漫反
摘要 本项目基于i.MX6ULL嵌入式Linux系统,实现了摄像头图像采集、存储和AI识别功能。系统使用OV5640摄像头进行图像采集,通过设备树和驱动配置实现硬件控制。驱动部分采用I2C通信和V4L2框架,支持分辨率、帧率等参数调整。采集的图像可本地存储,并通过QT界面进行查看和管理。为在嵌入式设备上实现AI识别,系统采用了NCNN轻量级推理框架结合Opencv进行图像处理。项目完整代码已开源,
不仅慢,而且不同人看的标准不一样,同一根光纤,上午的质检员说合格,下午的可能就判不合格了。整个对焦过程是动态的、实时的,每一根光纤插进去,系统都重新对一次焦,确保不管端面在什么位置,拍出来的图像都是清晰的。而支撑光纤端面完好的,是一套从光学成像到AI分析的完整技术链条,先把端面拍清楚,再用算法读懂它,最后用数据驱动它持续改进。其次是缺陷的尺寸实在太小。AI驱动的图像分析,它不需要人工设定“划痕长什
本文基于一个学生课堂行为检测数据集,详细介绍了从数据集理解、标注类别分析到 YOLO11 模型训练和验证的完整流程。该数据集虽然样本量不大,但覆盖了 12 种常见课堂行为,适合用于智慧课堂场景下的目标检测方案验证。通过训练实验,我们发现 YOLO11 在举手、阅读、书写等特征明显的行为上表现较好,而在低头、转头等细微动作上仍有提升空间。建议后续从增加样本量、优化数据增强策略和选择更大模型等方面进行
摘要: Shell脚本为TVA智能体(多模态视觉AI)构建了资源动态调度系统,通过实时监测CPU、GPU、内存、磁盘IO和网络带宽等硬件资源,自主调整任务优先级、释放闲置资源,实现负载均衡。该系统以毫秒级响应适配业务波动,在高负载时优先保障核心视觉推理任务,低负载时优化资源利用率,尤其在分布式集群中实现节点间任务迁移,避免资源浪费。全自动化调度无需人工干预,显著提升系统稳定性、降低硬件损耗与运维成
AI智能体视觉检测技术(TVA)正推动工业智能化升级。相比传统机器视觉的静态识别局限,TVA通过"感知-决策-执行"闭环赋予机器主动感知与逻辑推理能力。在汽车制造中实现动态螺栓紧固与密封胶涂敷,解决柔性生产难题;在精密电子领域突破无序抓取瓶颈,实现抓取与质检同步;在智慧物流中赋予AMR语义级避障能力,提升仓储效率。TVA技术的核心在于"主动适应"与"
本次项目成功的关键,在于我们跳出了“用AI识别物体”的常规思维,创造性运用AI进行“行为意图识别”。通过聚焦于手部动作这一更可靠、更前置的判定信号,我们构建了一套真正意义上的过程防错系统。方案的可复用性极强:对于其他多步骤、多物料的装配、检测、点检等SOP流程,只需在SOP-AI软件中重新定义流程步骤与对应的监测区域地图,即可快速适配,无需改动硬件。这为制造业客户提供了一种柔性化、数字化的通用型防
IBM 是全球领先的混合云、人工智能及企业服务提供商,帮助超过 175个国家和地区的客户,从其拥有的数据中获取商业洞察,简化业务流程,降低成本,并获得行业竞争优势。从轮胎到门把手,从车门到其他零部件,这些需求本质上共享着相似的“底层模板”,但由于原有系统是供应商提供的“一体机”,缺乏自主训练模型能力,赛力斯不得不依赖供应商为每个新需求开发定制化的检测模型。层面,基于AI大规模视觉分析能力,MVI提
AI不会淘汰摄影师,只会淘汰拒绝拥抱AI的摄影师。传统摄影师升级AI影像生成师,本质上是职业价值的重构——从“靠体力换收益”到“靠创意赚价值”,从“单一变现”到“多元增收”,从“受限于场景”到“无界拓展”。其商业变现能力的提升,不仅源于AI工具带来的效率革命,更源于自身核心审美与商业洞察的价值释放。
摘要: 2026年,尽管大模型盛行,90%的工业AI仍依赖边缘设备上的小模型(<100M参数),但传统优化器(SGD/Adam)面临收敛慢、泛化差等难题。YOLO26创新性融合大语言模型的Muon优化思想与SGD,推出MuSGD混合优化器,通过两阶段更新(前期Muon快速收敛,后期SGD微调)、分层参数处理及动态动量策略,显著提升训练效率。实验显示,MuSGD使YOLO26-nano训练耗时
例如,在汽车黑灯工厂的车身制造环节,AI智能体视觉检测系统(TVA)能够实时检测车身焊接的虚焊、漏焊、焊瘤等缺陷,检测速度与生产节拍同步,一旦发现缺陷,立即反馈至焊接机器人,调整焊接参数,避免批量缺陷的产生;AI智能体视觉系统(TVA)作为智能检测的核心技术,凭借其全场景适配、高精度检测、动态学习的优势,能够贯穿黑灯工厂生产全流程,打破各环节的检测壁垒,实现从原材料管控到成品验收的全链条赋能,成为
机器视觉(MV)展示了视觉技术在工业精度的极限,视频流视觉(VSV)拓展了时间维度的感知能力,而智能体视觉(TVA)则代表了视觉技术从虚拟世界走向物理世界、从感知走向行动的未来趋势。在工业界与学术界,计算机视觉(CV)、机器视觉(MV)、常规AI视觉(AIV)、视频流视觉(VSV)以及智能体视觉(TVA)这五个术语常被交替使用,但它们在技术侧重、应用场景及本质逻辑上存在显著差异。可以说,CV是理论
第五届机器视觉、自动识别与检测国际学术会议(MVAID 2026)定于2026年4月24至26日在武汉隆重举行。MVAID 2026将围绕“机器视觉”与"自动识别与检测”等相关最新研究领域,为来自国内外高等院校、科学研究所、企事业单位的专家、教授、学者、工程师等提供一个分享专业经验,扩大专业网络,面对面交流新思想以及展示研究成果的国际平台。
中国新能源产业正从技术领先向质量管理跃升,检测数据正成为核心竞争力。
本文介绍了一套用于羊行为识别的计算机视觉数据集,包含约4500张已标注图片,覆盖"活动"、"进食"和"躺卧"三类核心行为。数据集采用YOLO格式标注,结构清晰规范,适用于智慧养殖、畜牧业数字化管理等AI应用场景。文章详细阐述了数据特点、使用建议和实战经验,指出该数据集在农业AI领域具有显著应用价值,可直接用于YOLO模型训练和行为识别项目
摘要: 私有化部署大模型(如LLaMA、BERT)是企业平衡数据安全与算力成本的关键方案。通过本地化部署,企业能严格管控敏感数据,满足合规要求(如GDPR),但需应对高昂的GPU成本和运维复杂度。优化策略包括: 硬件选型:混合云架构,本地处理敏感任务; 模型压缩:量化、剪枝降低资源消耗(代码示例展示PyTorch量化BERT模型); 高效框架:FastAPI/TorchServe提升推理效率; 动
摘要:本文探讨如何利用大模型(如GPT、BERT)优化A/B测试,提升转化率。传统A/B测试效率低且随机性强,而大模型通过用户行为预测、智能细分、自适应测试设计和结果预判,显著缩短测试周期并提高精准度。核心策略包括:1)基于聚类的用户细分;2)动态调整测试参数;3)早期结果预测;4)个性化内容生成;5)因果推断分析。代码示例展示了用户聚类和转化率预测的实现,实际案例证明该方法可缩短测试周期50%,
苏州某公司裁撤 120 名传统视觉工程师、某汽车零部件厂商用 8 万年薪的操作工替代 50 万年薪的算法工程师、边缘 AI 视觉让产线技术员 3 天就能完成模型调优……2026 年的机械视觉行业,正在经历一场残酷的洗牌,70% 的 “调参侠” 即将被淘汰,只有掌握核心能力的人才能拿到高薪!
本文是面向 AI 开发者的 ModelScope(魔搭社区)SDK 入门实操教程,基于 Anaconda 与 VS Code 工具链,完整覆盖从环境搭建到功能验证的全流程,可复现、低踩坑。教程详解了 Anaconda 独立 Python 环境的创建激活、ModelScope SDK 镜像加速安装、VS Code 解释器配置,以及汽车品牌公开数据集加载验证的核心代码,同时梳理了环境缺失、模块报错、网
准备好借助Edge Impulse加速您的边缘AI开发了吗?本文将引导您快速上手Edge Impulse——从模型创建到部署——帮助开发者将原始数据迅速转化为可执行的边缘智能。
本文对比评测了5款主流AI视觉防拍照软件:1. 羽翼软件采用端到端动态图卷积网络技术,能预判偷拍行为并0.05秒内响应,支持多目标追踪和抗遮挡识别,识别准确率达96.5%;2. VisionCapturePro依托云端大模型,识别准确率99.2%但依赖网络;3. SnapGuardAI通过显卡驱动控制防截屏,对物理拍照无效;4. LensWatchEnterprise分析光学反射特征,需环境适应期
AI视觉技术助力甘蔗种植业实现智能化升级。传统人工分选存在效率低、误差率高、标准不统一等问题。智能视觉解决方案通过高精度图像采集和深度学习算法,实现了甘蔗种茎节数和长度的精准检测,分选效率提升10-20倍,准确率远超人工水平。为农产品加工行业树立了智能化标杆,推动行业高质量发展。
本系统成功实现了 A\与人工势场法的优势互补:A\提供可靠的全局骨架,人工势场法则赋予路径平滑性与动态适应能力。代码结构严谨,注释详尽,不仅适用于教学演示,也为实际机器人导航系统提供了可复用的技术框架。未来可进一步集成运动学约束、多智能体协同或学习型势场等高级功能,提升系统在复杂现实场景中的鲁棒性。A星算法 A*算法自己研究编写的Matlab路径规划算法Astar算法走迷宫可自行设置起始点,目标点
通过对五款主流终端电脑视觉感知防拍屏软件的深度解析,我们可以清晰地看到,视觉防拍技术正经历从“简单的手机检测”向“深度的行为意图理解”的快速演进。羽翼屏幕防拍照软件所代表的“时空双流网络+三级联动响应”模式,在识别精准度、响应速度和策略灵活性上表现突出,适合对主动防御要求极高的研发中心和涉密部门;而SafeGuard Vision Elite、ClearSight AI、VisionGuard P
本文介绍了一个基于YOLO26和PyQt5的学生课堂行为智能检测系统。该系统可实时识别6种典型课堂行为(举手、阅读、写作、使用手机、低头、睡觉),具备图片/视频/摄像头多源输入能力。系统采用模块化设计,包含界面层、核心层和数据层,支持模型训练、评估及数据格式转换。技术亮点包括多线程架构、主题切换和快捷键操作。应用场景覆盖智慧教室监控、教学评估和课堂管理,具有较高的工程实用性和扩展潜力。项目提供完整
比如Dijkstra可能走出"蛇形走位",而A*的路径可能更接近直线,但由于网格精度限制,最终统计参数相同。但有意思的是,这次仿真中两者的路径长度和转折次数完全一致,说明地图可能存在对称结构,或者障碍物布局让两种算法殊途同归。更骚的是遍历节点数:Dijkstra翻牌子499个节点,A*只宠幸了185个,这差距简直像极了我上班和摸鱼时的效率对比。1.5,虽然可能找到次优解,但能进一步压缩计算时间——
我们完成了基于YOLOv11的钢材表面缺陷检测从数据到部署的全流程实践。整个过程不仅涵盖了模型训练、损失监控与性能评估的核心技术环节,更展现了AI为传统工业质检带来的精准与效率提升。
摘要:针对开发者容易分心摸鱼的问题,作者开发了一款基于计算机视觉的离线"AI监工"FocusGuard。系统采用Python+ONNX Runtime实现,核心技术包括:1) YOLOv11-Nano检测手机(COCO ID 67);2) MediaPipe手势识别(支持剪刀手切换休息模式);3) 多线程架构分离UI与推理任务。通过模型轻量化(2GB→40MB)、跳帧策略和状态
机器视觉系统的应用,比大家普遍认知的更加普及、更加广泛,在我们的AI视觉赋能智慧农业系列解决方案案例中,这一点会体现的更加充分。今天我们给大家分享的案例就是其中非常有代表性的一个场景——辣椒的分选。
随着生成式AI技术的飞速发展,图像局部篡改手段日益精细,各种伪造内容在视觉上愈发逼真,给内容真实性验证带来了严峻挑战。现有检测方法局限于物体级伪造,对更精细或更广泛的内容束手无策。针对这一领域痛点,厦门大学与腾讯优图实验室联合推出了大规模场景感知局部伪造检测数据集 BR-Gen 与基于伪造特征放大的检测模型 NFA-ViT。该研究已被人工智能顶级会议 AAAI 2026 接收,为解决复杂场景下的伪
很多开发者在做仓储智能项目时,会陷入“单一技术选型”的误区——要么只用RFID做盘点,要么只用YOLO做目标检测,最终导致项目落地效果不佳。事实上,RFID与YOLOv8的融合,是“互补短板、放大优势”的最优解,二者的核心适配逻辑的是“RFID管批量、YOLOv8管精准”。
派尼珂Pnioke 4K会议摄像机NK-UHDVC5012XW采用索尼1/2.8英寸857万像素CMOS传感器,支持4K/60fps超高清视频输出。具备20倍光学变焦、61.5°广角视野,配备HDMI、SDI、USB3.0等多种接口,支持PoE供电和AI人形跟踪功能。产品采用广播级画质处理技术,支持H.265/H.264编码,内置OLED显示屏,可显示IP地址和分辨率信息。适用于政企会议、远程教育
摘要:派尼珂Pnioke NK-UHDV5012XAT是一款专业4K双目语音跟踪云台摄像机,搭载1/2.8英寸851万像素CMOS传感器和12倍光学变焦镜头,支持4K/30fps超高清输出。产品采用AI智能跟踪技术,具备实时跟踪、舞台跟踪等4种跟踪模式,内置6麦克风阵列实现声源定位跟踪。支持H.265/H.264编码、POE供电、255个预置位存储,配备HDMI/USB3.0/3G-SDI/IP等
在现代机器人研发中,如何平衡超低延迟、高精度与边缘侧有限算力之间的矛盾是核心挑战 。本文深入探讨了机器人视觉感知系统的边缘AI架构设计,通过对比分析 Jetson Orin、RK3588 等主流计算平台的性能与适用场景,为开发者提供科学的硬件选型指南
本文提出了一种名为 WaveFormer 的全新视觉骨干网络,旨在解决现有 Transformer 计算复杂度高以及基于“热传导”物理模型容易导致特征过度平滑的问题。核心思想是将特征图视为一种空间信号,利用**欠阻尼波动方程(Underdamped Wave Equation)来建模其随网络深度的演化过程。通过推导该方程在频域的闭式解,作者设计了 波传播算子(WPO),实现了频率与时间的解耦,使得
VisionForgeSDK是基于YOLOv8和OpenCV的新一代AI视觉检测工具包,提供12种智能检测功能(如火灾、垃圾、人脸识别等)。支持Python/C#/Java多语言开发,具备高精度、实时性强的技术优势,适用于智慧工地、智能安防等场景。相比传统方案,该SDK在检测精度、处理速度和易用性方面表现更优,提供简洁API和跨平台支持,帮助开发者快速构建视觉检测应用。
本文介绍了一套基于YOLOv8的金属锈蚀智能识别系统,实现了从算法到工程落地的完整闭环。传统人工检测存在效率低、风险高、主观性强等问题,该系统通过无人机采集+深度学习视觉技术实现智能化检测。采用目标检测而非分割,在保证精度的同时兼顾工程部署便捷性。系统采用标准工业AI五层架构,包含图像采集、预处理、YOLOv8推理、结果分析和PyQt5可视化交互模块。YOLOv8的Anchor-Free架构、高效
AI视觉检测与预测性维护助力制造业降本增效 摘要:本文探讨AI技术在制造业中的两大核心应用——视觉检测与预测性维护。传统制造业面临质量控制难、设备维护被动等挑战,AI技术通过智能视觉检测实现精确高效的产品缺陷识别,预测性维护则通过数据分析提前发现设备故障隐患。文章详细介绍了AI视觉检测的技术原理和应用场景,并提供了基于OpenCV和Java的简易视觉检测系统代码示例,展示了如何通过图像处理和机器学
本文介绍了一个基于YOLOv8的焊缝表面缺陷智能检测系统,该系统通过深度学习技术解决了传统人工检测效率低、一致性差等问题。系统采用标准工业AI架构,包含数据集模块、模型训练模块、推理服务模块和可视化界面模块,支持图片/视频/摄像头实时检测。项目详细展示了YOLOv8模型训练流程、推理核心代码实现以及PyQt5可视化界面设计,具备工程化部署能力。该系统可显著降低质检成本、提高检测稳定性,为工业视觉检
桌面智能助手项目添加OCR模块进行文字识别,为AI添加上看电脑的“眼睛”,经验分享和问题总结。
提出了一种新颖的“代理注意力”范式。它引入一小组“代理令牌”(Agent Tokens)来负责聚合和广播全局信息,旨在平衡Transformer中Softmax注意力的强大表达能力和线性注意力的计算效率。
【AI即插即用CV涨点模块开源】 本文介绍了一个专为CV任务设计的即插即用模块开源仓库(GitHub链接),提供SOTA模型创新模块、论文精读及实现代码。重点解析了AAAI 2025论文《PConv-SDLoss》的创新: PConv风车形卷积:通过不对称填充和十字卷积核(1×3和3×1)模拟红外小目标的高斯分布特性,参数量减少22%的同时扩大177%感受野; SD Loss动态损失:根据目标尺寸
本文提出了一种轻量级主干网络LWGANet,针对遥感图像处理中的空间冗余和通道冗余问题进行了优化。通过设计轻量级分组注意力模块(LWGA)将特征解耦为不同尺度的子空间,并结合Top-K全局特征交互模块(TGFI)实现稀疏计算,显著降低了计算成本。实验表明,LWGANet在场景分类、目标检测等四大任务的12个数据集上均优于现有轻量级模型,同时保持极低的参数量(1.72M)。该方法的核心创新在于异构分
摘要: IUGC 2025比赛聚焦产时超声图像中胎儿生物测量自动化,提出多种创新方案解决传统阴道检查的局限性。Top1方案采用MAE辅助知识蒸馏和TransUNet架构,结合跨设备适应和半监督学习;Top2方案提出两阶段半监督集成框架,通过粗定位和局部精修实现高精度AoP测量;Top3方案基于无噪声学生范式,利用MixUp增强和DenseUNet提升关键点检测性能。这些方法通过热图回归、设备域适应
本项目基于 YOLOv8 构建了一个面向建筑工地的钢筋智能检测系统,能够实现高精度的钢筋目标识别与数量自动统计,并通过 PyQt5 提供直观的可视化界面,支持图片、视频及实时摄像头多种输入方式。系统不仅具备快速推理和稳定检测能力,还提供完整的训练流程与数据集,便于二次训练和模型迭代。整体方案实现了从算法感知到工程应用的闭环,为智能工地管理、施工监控和建筑科研提供了高效、可扩展的视觉 AI 支撑。
摘要:ComfyUI是一款开源节点式AI工作流工具,通过模块化设计实现StableDiffusion等模型的可视化操作。文章以"漫画转真人"为例,解析三大核心组件:K采样器(图像生成引擎)、VAE编解码(数据转换桥梁)和提示词系统(创作指令)。详细拆解8个关键节点的连接逻辑,包括模型加载、提示词设置、图像处理流程等,并重点讲解采样步数、CFG值等参数的优化技巧。该工具支持拖拽式