一文带你读懂计算机视觉(图1)

  最近,我已经阅读了很多与计算机视觉相关的资料并做了大量实验,这里介绍了在该领域学习和使用过程中有意思的内容。

  adam geitgey 主页 有很多计算机视觉方面的有趣文章,比如 链接 有完整的人脸检测/对齐/识别流程

  这些是自2000年以来在opencv中出现的旧的计算机视觉方法。在这篇论文:中做了介绍。

  这是一种机器学习模型,专门用于目标检测的特征提取。Haar分类器速度快但准确度低。

  HOG是一种用于目标检测的提取特征的新方法:它自2005年开始使用。该方法基于计算图像像素的梯度。然后将这些特征馈送到机器学习算法,例如SVM。这种方法具有比Haar分类器更好的精度。

  目前用于人脸检测的最好和最快的方法,基于通用的mobile net架构。请参阅:

  这里有2篇文章介绍了实现它的最新方法。这些方法有时甚至也提供了目标的类别(实现目标识别):

  最近深度学习的迅速发展,可以看到许多新架构取得了很大成功。使用许多卷积层的神经网络就是其中之一。一个卷积层利用图像的2D结构在神经网络的下一层中生成有用信息。有关什么是卷积的详细说明,请参阅:

  基于卷积的深度神经网络在目标识别任务上取得了很好的效果。ILSVR会议一直在ImageNet(一个有许多图片的数据集,包括猫,狗等物品标签)上举办竞赛。

  要正确地训练ResNet,需要使用数百万张图像,并且即使使用数十个昂贵的GPU,也需要花费大量时间。

  为了避免每次都要在这些大数据集上进行重新训练,找到一些其他代替方法是十分重要的,而迁移学习和嵌入embeddings就是这样的方法。

  解决该任务的历史方法是将特征工程应用于标准机器学习(例如svm),或把深度学习方法应用于目标识别。

  这些方法的问题是它们需要每个人的大量数据。实际上,数据并不总是可以得到的。

  谷歌研究人员在2015年推出了Facenet它提出了一种识别人脸的方法,而不需要为每个人提供大量的人脸样本。

  然后采用现有的计算机视觉架构,例如inception(或resnet),再用计算脸部的嵌入层替换目标识别神经网络的最后一层。

  对于数据集中的每个人,(使用启发式方法)选择三张脸(负样本,正样本,第二正样本)并将其馈送到神经网络。这产生了3个嵌入embeddings。利用这3个嵌入,计算triplet loss,这使得正样本与任何其他正样本之间的距离最小化,并且最大化位置样本与任何其他负样本之间的距离。

  最终结果是每张脸(即使在原始训练集中不存在的脸)现在也可以表示为一个嵌入embedding(128维的向量),该嵌入与其他人的脸部嵌入有很大距离。

  然后,这些嵌入可以与任何机器学习模型(甚至简单的诸如knn)一起使用来识别人。

  关于facenet和face embeddings非常有趣的事情就是使用它你可以识别只有几张照片或者只有一张照片的人。

  训练非常深的神经网络(如resnet)是非常耗费资源的,并且还需要大量的数据。

  计算机视觉是高度计算密集型的(在多个gpu上进行数周的训练)并且需要大量数据。为了解决这个问题,我们已经讨论过为人脸计算出通用的嵌入embeddings。另一种方法是采用现有网络并在其他数据集上重新训练,训练时仅仅训练其中的几层。

  这是一个教程:codelab tutorial。它建议你重新训练一个初始模型,从而去训练未知的花类。

  近年来,图像分割可能是一项令人印象深刻的新任务。它包括识别图像的每个像素。

  该任务与目标检测有关。实现它的其中一种算法是mask r-cnn,有关详细信息,请参阅此文章:

  生成式对抗网络,是由ian goodfellow提出,这个网络架构分为2部分:判别器和生成器。

  判别器检测一张图片是否属于某个类别,它通常是在目标分类数据集上进行预训练。

  在学习期间调整生成器的权重,目标是使生成的图像与该类的真实图像尽可能相似,以至于判别器无法区分出来。

  要训练大型模型,需要用到大量资源。实现这一目标有两种方法。首先是使用云服务,比如google cloud或者aws。第二种方法是自己组装一台带有GPU的计算机。

  Ownphotos是一个令人惊叹的用户界面,允许您导入照片并自动计算脸部嵌入,进行目标识别和人脸识别。

  正如我们这里所见,上述视觉领域各方面的实现中诞生了许多新的有趣的方法和应用。

  我认为人工智能最有趣的,在各领域尤其在视觉领域中,是学习可再使用的算法。让这些方法适用于处理越来越多的任务而不需要更多算力资源和数据 :

  嵌入 (例如facenet): 使识别许多类而无需对这些类进行训练成为可能