ViT | vit算法中各种超参解释
·
- patch_size:表示输入图像被分成的小块的大小,一般为 16x16,且image_size需要能够被path_size整除;
- num_layers:表示transformer模块的层数,一般为12;
- embedding_dim:表示每个patch被嵌入到向量空间中后的维度,一般为768;
- num_heads:表示transformer模块中多头注意力机制的头数,一般为12,且embedding_dim需要能够被num_heads整除;
- mlp_dim:表示transformer模块中全连接层的维度,一般为3072;
- dropout:表示在训练过程中,每个神经元以某个概率被随机失活的概率,一般为0.1;
- learning_rate:表示训练过程中的学习率,需要根据具体任务和数据集进行调整;
更多推荐


所有评论(0)