HiEve:一个以人为中心的复杂事件数据集
1.文章信息
本次介绍的文章题目为Human in Events: A Large-ScaleBenchmark for Human-centric Video Analysis in Complex Events,是2020年在arXiv网站上的一篇文章,本文提出了一个集合了各种以人为中心的复杂事件的数据集供挑战者研究。
本数据集团队为上海交通大学电子工程系林巍峣老师联合意大利、美国的学者共同提出。
2.摘要
随着现代智慧城市的发展,以人为中心的视频分析面临着现实场景中多样复杂事件的挑战。一个复杂的事件与密集的人群、反常的个人或集体行为有关。然而,受限于现有监控视频数据集的规模,现有的分析方法很少报告它们在此类复杂事件中的表现。为此,文章提供了一个新的大型数据集名为Human-in-Events简称HiEve的视频数据集,旨在用于理解各种现实事件中,特别是人群和复杂事件中的人类动作、姿势和动作。它包含了大量姿态数(>1M),最大数量的复杂事件动作标签数(>56k),以及最大数量的长期持续轨迹(平均轨迹长度>480)。
文章团队对最近的视频分析方法进行了广泛的实验,证明HiEve对于以人为中心的视频分析是一个具有挑战性的数据集。该数据集旨在推动以人为中心的分析和理解复杂事件的尖端技术的发展。
3.关于HiEve数据集
HiEve数据集与其他数据集相比,在多目标追踪、姿态估计与追踪、动作识别等领域均可以很好地发挥科研价值。HiEve与现有数据集的比较如下图

其中。“NA”表示不可用。“~”表示近似值。“traj.”表示轨迹,“avg”表示平均轨迹长度。总的来说,与这些数据集相比,HiEve数据集具有以下独特的特征:
-
HiEve数据集涵盖了广泛的以人类为中心的理解任务
-
HiEve数据集具有更大的数据量
-
HiEve数据集可用于各种拥挤复杂事件下的挑战性场景(如用餐、地震逃生、地铁下车、碰撞等)
收集工作
在YouTube上收集了一些异常场景(如监狱)和异常事件(如打斗、地震) 共32个视频序列,大多超过900帧,总长度33分18秒,分为训练和测试集的19和13个视频精心制作。数据集包含9个不同的场景:机场,餐厅,室内,监狱,商场,广场,学校,车站和街道,不同场景的视频帧数分布如下图

对于每个场景,文章保留几个在不同站点捕获的视频,以及发生的不同类型的事件,以确保场景的多样性。通过手工检查,避免了数据冗余。为了保护相关人员和单位的隐私,文章对视频中的人脸和关键文字进行了模糊处理。
注释工作
首先,对所有移动的行人(如跑、走、打、骑)和静态的人(如站、坐、躺)标注边界框。每个人一个唯一ID,直到它移动出相机的视野。
其次,为整个视频中的每个人注释姿势(遮挡严重和边界框区域小于500的人除外)。每个身体的注解姿势包含14个关键点:鼻子,胸部,肩膀,肘部,手腕,臀部,膝盖,脚踝。共定义了14种行为类别:独自行走、一起行走、独自跑、一起跑、骑马、坐着聊天、独自坐着、排队、独自站着、聚集、战斗、摔倒、上下楼梯走、蹲伏鞠躬。
HiEve的挑战性
-
人数多
-
更关注拥挤场景
-
存在几种轨迹断开的情况:
(1)一个物体暂时移出相机屏幕,然后在一段时间后移动回来
(2)一个物体被前景物体或某些障碍物长时间严重遮挡,注释者无法分配一个近似的边界框
4. 复杂事件有很多并发事件,难度再升级
数据集相关的四个挑战
-
多人运动跟踪
-
人群构成估计
-
人群构成跟踪
-
个体动作识别
4.数据集下载链接
链接一: http://humaninevents.org.(官方网站)
链接二:https://gas.graviti.cn/dataset/hello-dataset/HiEve
Attention
如果你和我一样是轨道交通、道路交通、城市规划相关领域的,可以加微信:Dr_JinleiZhang,备注“进群”,加入交通大数据交流群!希望我们共同进步!
完
点个
在看
你最好看
更多推荐

所有评论(0)