你的位置:任丘市奥力斯涂料厂 > 联系奥力斯 > 厦门橡塑胶厂家 2014年, 两个学者用两张图片败了整个识别域

厦门橡塑胶厂家 2014年, 两个学者用两张图片败了整个识别域

发布日期:2026-08-19 23:40 点击次数:132
万能胶生产厂家

2014年之前,如果你想让电脑看懂里的人在做什么,好的办法不是度学习。

这句话现在听起来有点奇怪。毕竟今天我们已经习惯了度学习在图像识别、语音识别、机器翻译上碾压传统法。但在2014年那个时间点上,情况不是这样。

当时动作识别域强的法叫做密集轨迹

>密集轨迹:种手工设计的特征提取法,通过跟踪中密集分布的像素点的运动轨迹,统计轨迹周围的图像和运动信息来判断动作类别。

这个法在标准测试集上能达到88左右的准确率,而当时所有尝试用度学习做动作识别的论文,果都不如它。度学习在图片识别上已经靠AlexNet出了名声,可是到域,就像是突然被回了原形。

这事儿说起来挺讽刺的。图片是静止的,理解起来应该难才对,多了时间维度的信息,理论上应该容易判断动作。可现实恰恰相反,度学习在图片上行,在上却不灵。问题出在哪儿?

问题出在“该怎么塞进时间信息”这件事上

图片分类的度学习模型,说白了就是个卷积经网络

>卷积经网络:种门处理图像的经网络结构,通过卷积核在图像上滑动来提取局部特征,逐层堆叠后能识别越来越复杂的图案。

吃进去张图,吐出来个类别标签。这个套路很成熟,AlexNet已经证明了它的威力。

但不是张图,是串图。你要怎么把时间维度塞进这个网络?直接把的每帧都当成立的图片来处理,识别每帧里的物体,再把结果拼起来?这样做等于扔掉了动作里重要的信息,动作是"变化"本身,不是某帧的静止画面。个人举手的照片和个人放手的照片可能长得几乎样,你得看这个动作是怎么"动"的,才知道到底是在举手还是放手。

之前的度学习尝试大多是在这个环节栽了跟头。他们要么直接把多帧堆在起卷积,要么用很粗糙的式融时间信息,果始终不过手工设计的轨迹特征。

这就是KarenSimonyan和AndrewZisserman在2014年发表的这篇论文要解决的问题。他们两人来自牛津大学,同个研究组,几个月后他们又发表了另篇改变整个计机视觉域的论文,VGGNet。这两篇论文几乎是同期完成的工作,这个背景本身就很说明问题:这是群对卷积网络结构设计其敏感的研究者,他们既在琢磨怎么让网络强,也在琢磨怎么让网络吃懂。

他们的答案不是设计个复杂的网络去啃原始帧,而是换个思路:把拆成两条立的信息流,条门看“这是什么”,条门看“它怎么动”。

两条流水线:空间流和光流

这篇论文的核心法叫做双流卷积网络

>双流卷积网络:由两个立的卷积经网络组成的架构,个处理的静态画面(空间流),个处理帧与帧之间的运动信息(时间流),后把两者的预测结果融起来。

具体来说,条流叫空间流,输入就是里挑出来的单张RGB图像,负责识别画面里有什么物体、什么场景,比如识别出这是个游泳池,画面里有个人。

二条流叫时间流,输入不是图像,是光流场。

>光流场:描述中相邻两帧之间每个像素点运动向和速度的场,可以理解为把“运动”这件事用张图的形式表示出来。

光流场长什么样?想象你把两帧图像叠在起,计出画面里每个点从上帧移动到下帧的向和距离,然后把这些向信息画成张图,这就是光流场。它门捕捉运动信息,几乎不含背景纹理、颜这些跟“动作是什么”关系不大的干扰项。

这两条流各自训练个卷积网络,各自给出个动作类别的预测概率,后把两个预测结果加权平均或者用另个分类器融起来厦门橡塑胶厂家,得出终判断。

为什么要这么分开设计?这里藏着个很朴素但很关键的判断:静态外观信息和动态运动信息,它们的统计规律不同,硬塞进同个网络里学,网络很难同时学好两种东西。

这就好比让个人同时干两件质不同的活:边要盯着堆静态照片说出照片里有什么物品,边要盯着段快速闪烁的信号判断东西往哪个向移动。如果你要求同个人同时兼顾这两件事,还只给他套注意力和套判断标准,他大概率两头都做不好。但如果你把这两件事分给两个门的人来做,个只负责认物体,个只负责看动向,后再把两人的判断起来参考,果反而好。如果不拆开做,会发生什么?论文里其实间接回答了这个问题:之前那些果不好的度学习尝试,很多就是想用个网络硬啃所有信息,结果每部分都学得不到位。

![双流架构图](placeholder)

论文里的架构图画得很直白,左边条支路吃RGB图像,右边条支路吃光流图像,两条线各自走完自己的卷积层和全连接层,后在顶部汇成个融的预测结果。这张图重要的信息就是两条支路在中间没有交叉,直到后才并,这种"晚融"的设计意味着两个网络在特征提取阶段互不干扰,各自把自己的活干到致。

时间流:怎么把“动作”变成张能喂给CNN的图

单说说时间流的设计,因为这是这篇论文有创造力的地。

卷积经网络本来是给静态图像设计的,输入是张有宽和颜通道的图。那怎么让它去处理“运动”这种本质上是时间序列的东西?

论文的做法是把光流场编码成种类似图像的格式。对于对相邻帧,计出每个像素在水平向和垂直向的位移,这两个向的位移分别构成张图,就像图像的两个通道。作者进步把这个思路扩展到多帧,堆叠若干帧连续的光流图,形成个多通道的输入,让网络能看到小段时间窗口内的运动轨迹,而不只是相邻两帧的瞬时运动。

这里还有个细节,作者尝试了两种光流的表示式。种是光流的对坐标形式,直接记录每个像素的位移向量。另种是相对于轨迹的形式,作者称之为轨迹叠加,沿着个点的运动轨迹把光流值累积起来。实验发现直接堆叠光流图的果已经足够好,不需要复杂的轨迹追踪。

这个设计透露出个判断:运动信息本身其实可以被“图像化”处理,你不需要发明套全新的网络结构去理解时间序列,只需要把时间信息巧妙地编码成卷积网络已经擅长处理的格式。这有点像你不需要为了运输液体门造种新的容器,只要把液体装进瓶子里,用现成的卡车就能运走。如果不做这层转换,直接把原始像素的时序变化丢给个为静态图片设计的网络,网络很可能抓不住,毕竟原始像素里同时混杂着光照变化、背景纹理、物体形状等大量和运动本身关的信息,光流场相当于先帮网络把这些关信息过滤掉了。

数据不够怎么办:用图片数据集来救模型

度学习出了名地吃数据,而在2014年,标准的动作识别数据集规模小得可怜,常用的UCF-101数据集只有101个动作类别,泡沫板橡塑板专用胶万多个片段。这个规模放在图片分类任务里都小,何况数据本身信息量大,理论上需要多样本才能训练好。

数据不够,网络就容易过拟

>过拟:模型在训练数据上表现很好,但因为记住了训练数据的细节而非学到真正的规律,致在新数据上表现变差。

空间流的网络处理的是普通图像,这点上作者想到了个巧妙的办法:用ImageNet上预训练好的图像分类网络参数来初始化空间流,因为空间流本质上也是在识别静态画面里的物体和场景,这跟ImageNet的图像分类任务是相通的。这步相当于蹭了图片识别域已经积累多年的海量数据的红利。

时间流没法直接借用ImageNet的预训练参数,因为光流图和普通RGB图像的统计特差异很大。作者转而采用多任务学习的策略,让网络同时在两个不同的数据集上训练,共享大部分网络参数,只在后的分类层上区分不同数据集的类别体系。这样相当于把两个小数据集拼起来,变相扩充了可用的训练数据量。

这套组拳背后的逻辑是:当你手头的数据不够训练个从开始的度网络时,不代表你须放弃度学习,你可以想办法去借用其他相关任务里已经学到的知识。这跟个刚毕业的新人进入陌生行业时的处境很像,如果靠自己在新岗位上试错积累经验,成长会很慢,但如果他能把之前在相关域积累的经验迁移过来,哪怕不是对口,也能大大加快上手速度。如果不做这层迁移,直接用UCF-101那万多个从头训练个度卷积网络,大概率会因为数据量太小而严重过拟,根本达不到论文里报告的果。

结果:度学习次赢了

这篇论文重要的数字是这样的:双流网络在UCF-101数据集上达到了88.0的准确率,在另个常用数据集HMDB-51上达到了59.4。

这个数字意味着什么?意味着它次追平甚至略微过了当时好的手工特征法。要知道,在这篇论文之前,度学习在这个任务上的好成绩普遍落后手工法十几个百分点,20个百分点的差距,意味着什么?意味着每5个动作里,度学习法就要比手工法多认错1个。这在个已经被度学习攻克了图像识别、正在攻克语音识别的年代,是个说不过去的短板。

双流网络把这个短板补上了。下面是论文里几个关键法的对比结果:

|法|UCF-101准确率|

|密集轨迹(当时强手工特征)|88.0|

|**双流网络融**|**88.0**|

这张表格里藏着个很值得说的细节:单用空间流,也就是只看静态画面,准确率只有72.6。单用时间流,只看运动信息,反而达到81.0,比空间流了差不多8个百分点。这说明在动作识别这件事上,运动信息本身比静态画面关键,毕竟“动作”这个词本身指的就是变化,不是某帧的样子。但把两者融起来,准确率进步提升,说明两条流确实捕捉到了互补的信息,谁也代替不了谁。

如果只用空间流会发生什么?实验数据已经给出了答案,准确率从88掉到72.6,掉了整整15个百分点。这也从数据上验证了前面那个直觉判断:只看静态画面来判断动作,就像只看张照片猜个人接下来要做什么,很多时候是猜不准的。

这篇论文之后发生了什么

双流网络这个思路影响大,后续很长段时间里,动作识别域的主流法基本都是在双流框架上做改进。

2016年,Feichtenhofer等人发表的论文提出了时空双流网络的改进版本,研究了两条流之间应该在网络的哪层进行融,而不是像原始论文那样只在后融,他们发现在网络中间层就开始融空间和时间信息,果比只在后融好,这个发现进步说明空间和时间信息之间存在层的关联,值得早地互相交流。

2017年,Carreira和Zisserman(没错,还是Zisserman)发表了I3D网络的论文,他们把双流网络里的2D卷积扩展成了3D卷积,直接对小段立体块做卷积,同时提出了大规模数据集Kinetics来解决数据不足的问题。这篇论文进步把动作识别的准确率了大截,可以说是双流思路和大数据规模结之后的产物。

这条脉络说明双流网络提出的核心想法,把外观和运动分开处理、用光流显式编码运动信息,在后续几年里被反复验证、迭代和优化,直到3D卷积和后来的Transformer出现之前,双流框架都是这个域绕不开的基础范式。

写在后面

读这篇论文的时候,触动我的点是,作者没有执着于设计个精巧的网络结构去“硬啃”原始,而是先想清楚了问题的本质:动作识别需要外观和运动两种质不同的信息,然后用种笨拙但有的式,光流图,把运动信息转换成网络已经会处理的格式。

这种“先分解问题再对症下药”的思路,比单纯堆砌网络层数接近科学研究该有的样子。很多后来被吹得很厉害的度学习突破,回头看核心创新往往就是这种对问题本质的重新拆解,而不是纯粹的力堆砌。

论文里还有个没细说但值得追问的地:光流的计本身依赖传统法,并不是端到端可学习的。这意味着双流网络其实是度学习和传统计机视觉法的个混产物,这个“缝”会不会成为能的天花板?后来3D卷积网络的兴起,某种程度上正是想甩掉这个依赖,让网络自己从原始像素里学会捕捉运动,这条路走得通吗,走到哪步了,是个值得继续追的问题。

Q&A

Q1:双流卷积网络是什么?

A:双流卷积网络是2014年由Simonyan和Zisserman提出的动作识别法,用两个立的卷积经网络分别处理的静态画面(空间流)和运动信息(时间流),后融两者的预测结果,是度学习次在这项任务上追平传统手工特征法的成果。

Q2:双流网络里的光流是干什么用的?

A:光流用来表示相邻帧之间每个像素点的运动向和速度,相当于把“运动”这件事画成张图,门喂给时间流网络,让网络能捕捉动作变化,而不受背景颜纹理等关信息干扰。

Q3:双流网络比传统法好在哪里?

A:在UCF-101数据集上,双流网络达到88.0的准确率,追平了当时强的手工特征法密集轨迹,而在此之前的度学习法普遍比手工法低十几到二十个百分点,双流网络是度学习在动作识别上次不落后于传统法的成果。相关词条:储罐保温     异型材设备     钢绞线厂家    玻璃丝棉厂家    万能胶厂家

奥力斯    PVC管道管件粘结胶价格     联系人:王经理    手机:18231788377(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区/p>

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

友情链接:

产品中心 新闻资讯 联系奥力斯

Powered by 任丘市奥力斯涂料厂 RSS地图 HTML地图

Copyright Powered by365建站 © 2025-2054