测试集的错误率一口气降到15%,与其他团队的结果相差11%以上,我大概也会怀疑是不是斯坦福的评测伺服器被黑客入侵了。」
台下响起了一阵善意的笑声,原本质疑的气氛缓和了一些。
「但很遗憾,我们的黑客技术并不足以攻破斯坦福的防火墙,况且,我们实验室伺服器的电费已经严重超支了,实在没有余力再去发起一次分布式拒绝服务攻击。」
「大家肯定会想,既然不是作弊,那麽QIet究竟是怎麽做到目前的结果。」
「其实答案很简单,我们抛弃了过去十年里,整个计算机视觉界认可的人工特徵提取路线。」
下面的学者研究院们听到这一句话立刻譁然了起来。
现在,整个学术界对图像识别的主流认知,全都是基於SIFT、HOG等人工设计的算子,再配合支持向量机或者费舍尔向量进行分类,大家比拼的是谁设计的特徵提取器更细致。
而现在,这个年轻的东方人竟然在ImageNet的舞台上,公然宣称他们把这些行业基础全扔了?
「荒谬!」
史丹福大学的一位资深教授忍不住说道:「不用人工特徵,你们拿什麽去理解物体的边缘,纹理和几何结构?难道指望机器自己去长出眼睛来吗?」
「没错,我们就是让机器自己长出眼睛。」
「我们复活了那个在学术界几乎快要被扫进历史垃圾堆的技术,人工神经网络,确切地说,是卷积神经网络CNWN。」
「CNN?」佩罗宁皱着眉说。
「杨力昆在90年代搞的那个LeNet?」
「那玩意儿不是只能识别手写邮政编码吗?面对ImageNet:这种上百万张,上千个分类的复杂现实图片,神经网络那可怜的拟合能力和让人绝望的计算效率,根本就走不通嘛!」
「是的,就是杨力昆先生所提出的LeNet,大家都知道深度神经网络有三大难题,梯度消失导致的无法收敛,参数过多导致的严重过拟合,以及惊人的计算量。」
「我设计的QInet一共包含5个卷积层,3个全连接层。」
「首先,是关於梯度消失和收敛速度的问题,传统神经网络喜欢用Sigmoid或者Tanh
作为激活函数,但这两种函数在输入值较大时,梯度会趋近於零,导致深层网络在反向传播时根本无法更新参数。」
「在座的各位想必都被那种训练了三天三夜,损失函数纹丝不动的痛苦折磨过。」
台下的研究员们不由自主地点头。
这苦他们确实都吃过。
「我们的解决方案其实非常简单,直接弃用了复杂的双曲正切和逻辑函数,采用f()=ma(0,)。」
「我们称之为ReIu,也就是修正线性单元。」
「在相同的网络结构下,使用ReIu的QInet,其收敛速度比使用Tanh的网络快了6倍!
35
然而,外行看热闹,内行看门道,台下的学者研究员们,都听懂了他的意思。
f()=a(0,),这个在数学上几乎可以说是初中水平的单侧仰制函数,竟然能带来6
倍的收敛速度提升?这意味着什麽?
这意味着在大规模工程实践中,计算效率将获得质的飞跃!
「那过拟合呢?」一位M1T的教授追问,「120万张图,8层网络,6000万个参数,参数比的样本还多——我是说,这麽大的模型,你怎麽保证它不是把训练集背下来了?」
这个问题问到了点子上,全场再次安静。
「确实会有这种的担忧,所以为了防止它在测试
-->>(第3/5页)(本章未完,请点击下一页继续阅读)