登录社区云,与社区用户共同成长
邀请您加入社区
指挥中心/值班室的可视化上墙把解码、推理、渲染串成一条不卡顿的流水线。
YOLO室内壁球场黑色壁球目标检测数据集聚焦于室内运动场景中的目标识别任务,尤其适用于壁球运动相关的视觉分析需求。从名称可推断,该数据集主要用于检测在壁球场环境中使用的黑色壁球,其应用场景可能包括智能体育监控、运动员动作分析、自动计分系统开发等。该数据集的构建旨在为基于YOLO模型的目标检测任务提供专门的数据支持,尤其针对低光照条件下的小尺寸目标检测问题,具备一定的实际应用价值。数据集包含共计51
本文基于一个学生课堂行为检测数据集,详细介绍了从数据集理解、标注类别分析到 YOLO11 模型训练和验证的完整流程。该数据集虽然样本量不大,但覆盖了 12 种常见课堂行为,适合用于智慧课堂场景下的目标检测方案验证。通过训练实验,我们发现 YOLO11 在举手、阅读、书写等特征明显的行为上表现较好,而在低头、转头等细微动作上仍有提升空间。建议后续从增加样本量、优化数据增强策略和选择更大模型等方面进行
在农作物与杂草识别场景下,Mosaic + HSV 色域增强 + 随机水平翻转是综合性价比最高的增强组合,可同时提升检测精度与场景泛化能力。若算力与训练时间有限,可优先启用 Mosaic 与 HSV 增强,以较小的计算成本获得大部分性能收益。
在前面的专栏实战中,我们先后完成了AI水体智能提取NDVI植被覆盖度反演两大生态遥感核心项目,掌握了遥感AI解译、地物统计、时序分析的标准化落地流程。本期正式进入城镇人工地物遥感实战高精度建筑物提取 + 多年城市建成区扩张动态分析。建筑物是城市遥感的核心骨架,建成区范围、建筑密度、新增建设用地规模,是衡量城镇化进程、城市扩张、国土空间变化的核心指标。传统建筑提取手段弊端显著:传统阈值分割极易与裸土
数据涵盖日间/夜间、多样天气及动态行驶状态,精准标注7类关键交通元素(含头盔佩戴、行人安全等),所有标注经交通法规验证,支持复杂多目标检测。标注类别名称(注意yolo格式类别顺序不和这个对应,而以labels文件夹classes.txt为准):["bamaxian","buxing","chepai","jidongche","motuoche","toukui","wutoukui"]对应中文类
模型先在小批量人工标注数据上训练,初测后再去预测未标注的数据,把预测中置信度低的结果送回去让人工修正。:定义一个函数 f(即后续的算法),使得 f(像素矩阵) = 标签(如:狗的位置[ x1, y1, x2, y2 ])。模型学习:当看到某个坐标区域内的像素RGB排列呈现流线型、高光反射特征时,它输出的结果就应该匹配“car”这个标签。:不同的标注员看同一张图,对于“什么是猫”、“猫的边界在哪里”
YOLOv11作为实时目标检测的标杆框架,在通用场景(如自然图像中的行人、车辆)中表现卓越,但在(如拥挤人群、密集车辆)与为解决上述问题,本文提出,通过集成与,实现“目标检测+密度估计+小目标增强”的端到端解决方案。GMM建模目标空间分布,提升密度估计精度;LMM强化局部特征匹配,解决小目标与密集目标的漏检问题。改进后,YOLOv11在(Shanghai Tech数据集),同时保持实时性(推理速度
YOLO11是 Ultralytics YOLO系列实时物体检测器的最新版本,重新定义了在尖端准确度、速度和效率方面的可能性。在前几代 YOLO 版本的显著进步基础上,YOLO11 在架构和训练方法上引入了重大改进,使其成为广泛计算机视觉任务的灵活选择。Bytetrack多目标跟踪是一种tracking-by-detection范式的简单高效的数据关联的跟踪方法BYTE。
AI防爆摄像机结合船舶偏航逆行检测算法,为港口航道安全管理提供高效解决方案。该系统通过高清防爆摄像机实时捕捉航道画面,利用深度学习算法快速识别、跟踪船舶轨迹,并与预设航道规则对比,可在500毫秒内完成偏航或逆行行为的判定与告警。防爆设计适应港口特殊环境,多机位部署与算法迭代优化显著降低漏检率。目前该技术已在多个港口应用,提升了异常事件发现效率,减轻人工负担,但极端天气和小型船只检测仍存在挑战。该方
这篇论文《Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models》提出了一个专门用于评估视觉语言模型(VLMs)在分布外目标检测任务上表现的基准数据集,并系统性地探索了多种微调策略。以下是基于论文内容的详细解析,重点会放在微调策略及其效果上。
多模态Agent研究前沿综述 当前研究聚焦于将多模态大模型与Agent规划能力结合,以突破单一模型的被动响应局限。最新成果如FusionAgent和LCVN框架展现了三大创新方向: 动态模型选择:通过强化学习实现样本级最优模型组合(如FusionAgent的ACT分数融合方法); 语言条件导航:华盛顿大学提出的LCVN任务结合扩散模型与自回归架构,实现开放环路的语言引导导航; 世界建模优化:引入扩
矿山运输系统AI平台通过视觉检测和多模态感知技术实现洒煤识别与堵煤预判。采用深度学习算法实时分析皮带运行状态,结合振动、声学等多源数据预测堵塞风险。
本文介绍了一个面向农业虫害识别的大规模昆虫目标检测数据集,包含34156张图像和102类昆虫标注(YOLO格式)。该数据集针对智慧农业需求,覆盖多种作物害虫,具有小目标检测难度高、类别多且差异细微的特点。数据集结构规范,可直接用于YOLOv5/YOLOv8等主流框架训练。文章详细说明了数据特性、标注格式和使用方法,并提供了训练参数建议和优化策略,包括提高分辨率、类别平衡处理等。该数据集适用于农业病
因此,设计一套“粗簪化”的AI模块产品线,覆盖从入门型到旗舰型的不同算力等级,同时保持统一的接口标准和通信协议,是一种常见且合理的工程策略。本文以Tofu系列AI识别跟踪模块为例,从算力、接口、算法、功耗等维度进行技术对比,探讨边缘AI模块的选型思路。然而,不同场景对算力、功耗、体积、接口的需求差异巨大——一台固定安装的安防相机和一架无人机吊舱,对AI处理单元的要求完全不同。全系列标配人、车、船、
摘要:本文介绍了SpringAI在目标检测中的应用,重点分析了R-CNN、SSD和YOLO等主流算法的特点及适用场景,对比了预训练模型和自定义模型的优缺点。通过Java代码示例展示了SpringAI实现目标检测的具体流程,包括图像加载、检测服务和结果输出等环节。针对检测不准确和漏检问题,提出了增加训练数据、数据增强、调整模型参数和使用非极大值抑制等解决方案。这些内容为开发者使用SpringAI进行
本文提出了一种基于《新概念英语》第一册课头的短视频自动生成系统。该系统采用Python开发,通过模块化设计实现课文内容获取、语音合成、视频编辑等功能。核心模块包括: 1)内容获取模块从JSON文件读取课文数据; 2)语音合成模块使用edge-tts生成自然语音; 3)视频合成模块利用moviepy整合背景、音频和字幕; 4)字幕生成模块通过分段合成实现精准同步。 系统具有一键生成、高质量音频输出和
在目标检测领域,数据增强策略对模型性能的影响至关重要。YOLOv8作为当前最先进的实时目标检测器,内置了Mosaic和MixUp等高级数据增强技术,这些技术通过组合多个图像显著提升了模型的泛化能力和鲁棒性。然而,许多研究者和工程师往往直接使用默认超参数,忽视了针对特定数据集进行调优的潜力。本文深入探讨了Mosaic和MixUp数据增强的工作原理,系统分析了各超参数对模型性能的影响,并提供了详细的调
近年来,PINN与强化学习的融合研究展现出显著进展。通过将物理规律、守恒约束等先验知识注入智能体学习过程,研究者成功实现了策略学习从"盲试"到"有规可依"的转变。15篇顶会顶刊文献显示,该融合路线通过PINN压缩RL搜索空间,同时利用交互拓展PINN应用边界,形成了可复用的方法论。代表性工作包括:利用PINN构建电网物理模型替代器提升训练效率50%;将PIN
基于 Electron 构建的目标检测系统桌面应用,采用现代化深色主题设计,实现图像/视频目标检测、AI 对话、系统监控、数据可视化大屏等功能
本文介绍了一个基于Electron+FastAPI+YOLO的目标检测桌面应用开发方案。该项目通过整合YOLO目标检测、大语言模型对话和系统监控等功能,实现了图像/视频智能分析、AI问答等核心能力。文章详细阐述了技术选型(Electron跨平台、FastAPI高性能后端)、UI设计理念(深色主题+玻璃拟态)以及功能实现方案(包括视频转码、CORS处理等关键技术难点)。该应用具有可视化操作界面、批量
未来,不会孤立发展,而是会更深度地与其他传感技术、人工智能及网络信息技术融合,向着更智能、更坚韧、更融合的方向演进,以适应未来复杂多变的高技术战场环境。目前,可见光技术正朝着更高分辨率、更智能化的自动目标识别(ATR)、以及与其他传感器(如红外、激光、雷达)深度融合的方向发展,形成多光谱/多模复合制导系统以提升抗干扰和全天候作战能力。智能化和自主学习:AI深度融入成像、处理、识别、决策全链条,实现
YOLO26边缘部署技术通过模型量化、剪枝、知识蒸馏和算子优化等策略,显著提升了在嵌入式设备上的运行效率。实验表明,优化后的YOLO26n-Edge在树莓派4上达到8FPS,功耗仅5W;在Jetson Nano上实现22FPS;高端手机芯片上可达50FPS。该技术有效解决了边缘设备计算资源受限、内存容量小、功耗限制等挑战,为低功耗边缘计算场景提供了高效的AI推理方案。
本文介绍了一个专注于电缆损坏识别的目标检测数据集,包含约1300张高质量图像,涵盖电缆断裂和雷击损伤两类故障。数据集已按训练、验证和测试集划分,采用YOLO格式标注,可直接用于主流检测模型训练。文章详细分析了数据特征、标注质量和类别分布特性,并提供了模型训练建议和参数配置。该数据集适用于无人机电力巡检、智慧电网故障预警等场景,通过结合深度学习算法可显著提升电力设备智能巡检效率。虽然数据规模不大,但
YOLO26训练策略详解:优化目标检测性能的关键技术 摘要: YOLO26通过创新的训练策略显著提升了目标检测性能。该策略采用300个epoch的渐进式训练,划分为预热(0-3 epoch)、早期(4-50)、中期(51-150)和后期(151-300)四个阶段。核心创新包括:1)渐进式余弦学习率调度,结合预热阶段;2)动态损失权重调整,逐步平衡分类与回归任务;3)阶段化数据增强策略,从基础Mos
本文详细介绍了一套功能完整、技术先进的“基于深度学习的安全帽佩戴识别检测系统”。该系统旨在解决工业生产、建筑工地、电力巡检等高风险场景下的人员安全监管难题。系统核心采用当下最前沿的YOLO系列目标检测模型(集成YOLOv8、YOLOv10、YOLOv11及YOLOv12),实现了对“安全帽”(helmet)和“头部”(head,即未佩戴安全帽)两类目标的高精度、实时检测。项目不仅构建了强大的算法后
本文介绍了一个集成了最新计算机视觉技术与现代Web开发框架的综合性教师课堂行为识别与分析系统。该系统旨在通过非侵入式手段,自动识别和记录教师在课堂教学中的关键行为模式,为教学评估、教师专业发展与教育研究提供客观、量化的数据支持。系统的核心采用以YOLOv8为基准,并兼容至前沿的YOLOv12系列模型的目标检测算法,确保了对“翘腿”、“指导学生”、“看屏幕”、“讲授/提问”、“使用手机”、“书写”等
本项目设计并实现了一个集成了前沿深度学习技术与现代化Web开发框架的施工现场安全智能检测与管理系统。系统核心采用最新的YOLO系列目标检测模型(包括YOLOv8, YOLOv10, YOLOv11, YOLOv12),构建了一个高精度、高效率的施工现场安全隐患实时识别引擎。通过引入DeepSeek大语言模型的智能分析能力,系统不仅能够识别目标,更能对复杂场景进行逻辑推理与风险描述,极大地提升了安全
本系统的核心检测能力依赖于一个高质量、大规模的专用疲劳驾驶数据集。该数据集专注于驾驶员的面部状态,为模型的精准训练提供了坚实基础。
摘要:YOLOv8*-Face系列提供5种人脸检测模型(n/s/m/l/x),涵盖不同规模需求。模型复杂度递增,参数量从3.2M到68.2M,精度逐步提升但速度降低。其中YOLOv8m在精度与速度间取得最佳平衡,WIDERFace测试AP达0.907。轻量级YOLOv8n适合移动端(>30FPS),而YOLOv8x适用于高精度云端场景。实际测试显示并非模型越大性能越好,YOLOv8m在多数场
研发更轻、更强、更耐久的囊体材料(如高分子复合材料、纳米涂层),以支持更高高度(平流层)、更长航时(数月乃至数年)的驻空。深度融合人工智能(AI),实现载荷数据的在轨实时处理、自动目标识别(ATR)和智能决策,减少对回传带宽的依赖和人员操作负担。实现多个系留平台(不同高度、不同类型)与自由飞无人机、地面系统的组网协同,构建立体化、网络化的侦察、监视、通信体系(如“空天地一体化”指挥系统)。高速有线
密集场景MOT会因为相互遮挡与冗余检测导致特征丢失、累计误差,出现 ID switch 和误匹配传统轨迹-检测二分图有一对一匹配限制在“频繁出现相似目标”的密集场景容易失败提出 Hypergraph Random Field (HRF),引入两类超节点,分别为trajectory hypernodes和domain hypernodes将 tracking 抽象为图,图中包含三类节点:①当前帧检测
Java+YOLO搭建商用级收费AI检测API,核心是「技术+商业」结合:技术保证高可用/低延迟,商业保证计费精准/安全可控;计费是商用核心:必须用Redis原子计数保证实时性,MySQL落库保证可对账,误差控制在0.1%以内;安全是底线:JWT+请求签名双重鉴权,限流防恶意调用,避免计费损失;监控是保障:全链路监控+异常告警,避免服务宕机/计费异常无感知;成本控制是盈利关键:批量推理提升GPU利
AI Agent 迎来真正的爆发期以 Moltbot 为代表的新一代 Agent 框架,凭借“自主思考、工具调用、任务执行”的能力,让 AI 从“对话工具”进化为“可执行的数字员工”。但在企业私有化部署过程中,现实挑战随之而来:模型调优复杂、本地算力受限、API 密钥与数据安全风险高企,让不少企业止步于概念验证。作为亚马逊云科技核心级服务合作伙伴,我们给出的标准答案是:Moltbot on Ama
是腾讯优图实验室(Tencent Youtu Lab)开源的轻量级多模态视觉语言模型,拥有,基于 Youtu-LLM 构建。本镜像部署的是,使用 llama.cpp 进行高效推理。
该GBM模型模拟了包含四种不同矿物的岩石材料:石英(shiying)、长石(jiachangshi)、斜长石(xiechangshi)和云母(yunmu)。每种矿物具有不同的物理特性和力学参数,通过分层建模的方式构建了一个真实的岩石微观结构模型。
该数据集包含18万张高质量图像,全面覆盖厨房环境中与卫生安全相关的场景与目标,共划分为14个检测类别。该数据集为AI研究者与开发者提供了一个高质量的厨房食品卫生与安全检测任务起点。无论你是刚入门的深度学习初学者,还是希望优化模型性能的研究者,该数据集都能助你快速构建高精度的检测系统。
这套方案我给朋友的超市用了快3个月,运行极其稳定,临期商品的检测准确率能到96%,后续加了“货架空货检测”“通道杂物堆积检测”,都是改一行文本就搞定,完全不用重新开发,朋友说省了十几万的定制开发费用。很多做计算机视觉的朋友,总觉得目标检测必须标数据、训模型,其实不是的。现在多模态大模型的能力已经足够强,把YOLO的定位能力和CLIP的图文泛化能力结合起来,就能用极低的成本,搞定绝大多数定制化检测需
核心模块选型方案选型核心原因目标检测YOLOv12s对比YOLOv8/v10,v12的C2f-Attn骨干网络对监控场景的小目标、遮挡目标检测精度更高,推理速度比v8快35%,ultralytics官方一键训练导出,上手门槛极低多目标跟踪DeepSort试过ByteTrack、OC-SORT,在监控常见的遮挡、光线变化场景下,DeepSort搭配微调后的ReID模型,ID切换率比ByteTrack
AI深度学习视觉系统方案。定位、分割、分类、检测。支持无监督模型、小样本训练模型定制。神经网络、开源框架、底层算法开发。支持opencv、halcon、vm深度学习开发。多年视觉项目开发与落地经验。承接珠三角地区项目,优质项目可考虑全国地区。包括软硬件方案、开发、安装调试。在当今数字化飞速发展的时代,AI深度学习视觉系统宛如一颗璀璨的明星,在众多领域大放异彩。今天就来和大家详细聊聊我所参与的AI深
建筑工地安全AI技术通过智能监控系统实现安全帽、反光衣、危险行为的实时检测。文章详细介绍了数据标注的核心方法,包括安全装备状态识别、危险行为时序标注、场景上下文理解等关键技术。通过多个实战案例展示了AI系统在大型建筑、高空作业、基坑工程中的应用效果,显著降低了事故率。TjMakeBot平台提供了专业标注工具,助力构建高质量工地安全数据集,推动智慧工地建设,保障建设者安全。
摘要:本文设计了一个融合YOLOv11目标检测与DeepSeek多模态理解的遥感地理空间目标检测系统。系统采用Vue3+SpringBoot+Flask技术栈,结合MySQL数据库和FFmpeg视频处理工具,实现对NWPU遥感数据集中飞机、运动场地等目标的智能检测。系统支持图像/视频批量检测、实时分析、结果可视化及AI建议功能,具有检测精度高、界面友好等特点,可应用于城乡规划、灾害监测等领域。通过
通过本次重构,系统完成了从“静态检测工具”到“自进化智能终端”的架构升级。闭环验证:打通了从Detection->Feedback->Review->Training->的全链路。精度提升:实测表明,针对特定站点的环境干扰(如特定色温的灯光误报),通过采集 20-50 张样本并进行 50 Epoch 的加权微调,即可有效消除误报,且未显著降低原有召回率。后续计划引入模型版本控制功能,支持一键回滚至
从表中可以看出,基于重要性的剪枝依赖人工设计的重要性评价准则,在低压缩率下尚能保持精度,但随着剪枝比例提升,精度会出现明显下降;而基于搜索的剪枝将剪枝视为结构搜索问题,通过强化学习、演化算法、可微分搜索等策略自动优化通道配置,能够在更高压缩率下更稳定地保持模型精度。其中,DMCP、AutoSlim 等可微分搜索剪枝方法,在搜索效率与性能上均表现突出,成为当前结构化剪枝的主流发展方向。
介绍了人体姿态估计、动作识别、时序动作检测和运动轨迹标注四大核心任务,详细阐述了17点关键点方案及其在足球、篮球、网球等运动中的应用。文章提供了专业的标注策略,包括关键点定位原则、可见性标注、运动模糊处理和多人场景处理方法。通过足球比赛分析、健身指导APP和游泳技术分析三个实战案例,展示了AI在体育领域的应用效果。此外,还介绍了TjMakeBot体育标注工具的功能特性,包括姿态标注、动作标注和运动
多模态医学影像智能处理研究进展 随着单模态医学影像性能接近极限,多模态融合成为突破关键。近期研究围绕模态融合、缺失模态应对和临床适用性展开:1)BrainMVP框架通过跨模态重建和对比学习实现缺失模态下的高效预训练;2)半监督分割方法利用多阶段融合和对比互学习提升标签稀缺时的性能;3)改进的模态丢弃策略结合可学习token增强缺失模态的泛化能力;4)区域文本一致性增强技术(RBTCA)通过文本-图
为验证改进方法的有效性,本文基于自制汽车中控屏小目标数据集开展对比实验,实验环境、数据集构建、实验设计及结果分析均贴合工程实操,所有实验数据均为本人实测,杜绝AI生成式虚假数据,同时总结实验过程中的调优坑点,为后续开发者提供参考。实验过程中遇到多个工程实操坑点,耗时较长,总结如下,帮助后续开发者避坑,提升开发效率:模块适配坑:替换C3k2_GCConv模块后,模型出现loss不收敛的问题,排查后发
yolo目标检测是计算机视觉避不开的一个强大模型,以其强大的可并行能力以及简单的结构甚至可以运用于实时检测。本文会从yolo的基本框架算法逻辑开始讲起,也就是yolov1,直至构建一个可以识别目标的模型项目。
边缘计算与轻量化模型对数据标注质量要求极高。相比云端大模型的容错性,边缘端小模型对噪声零容忍,需要精细化的标注策略。关键策略包括:1)提高标注精度至IoU 0.9以上,严格处理模糊、遮挡和极小目标;2)根据部署场景剪裁数据,平衡难易样本配比;3)采用克制的数据增强,避免过度复杂的变换。通过智能门铃和无人机巡检案例说明,优质的标注数据能显著提升模型性能,减少误报和漏检。TjMakeBot提供自动化数
摘要:本文深入探讨了目标检测模型中NMS(非极大值抑制)后处理的硬件加速优化方法。通过分析ops-cv中non_max_suppression.cpp的实现,详细介绍了如何利用aicpu_sort硬件单元加速排序计算,并结合YOLOv8案例提供完整的IoU阈值调优方案。实验数据显示,优化后的NMS在NPU上可实现3-5倍的性能提升,同时保持检测精度稳定。文章还包含环境配置、调优策略、常见问题解决等