苹果机器学习博客姗姗来迟,不过第一篇文章就给紧缺训练数据的研究者们发糖互联网+

雷锋网 2017-07-20 09:02
分享到:
导读

要保持图像的标注   美化网络美化之后的图像是要作为别的模型的训练数据的,苹果的研究员们让网络把美化前后的图像进行对比,设计了一种提高图像真实性的美化网络。

雷锋网 AI 科技评论按:苹果一出手就要解决人工智能的瓶颈问题,野心不可谓不大,但是效果也不可谓不好,最近的一篇机器学习方面的论文就巧妙地解决了训练数据收集方面的大问题,不仅已经被CVPR2017收录,刚刚上线的APPle Machine Learning Journal(机器

  雷锋网 AI 科技评论按:苹果一出手就要解决人工智能的瓶颈问题,野心不可谓不大,但是效果也不可谓不好,最近的一篇机器学习方面的论文就巧妙地解决了训练数据收集方面的大问题,不仅已经被CVPR2017收录,刚刚上线的APPle Machine Learning Journal(机器学习日记)网站上的第一篇博文也就是这篇论文的介绍。

  7月19日刚刚上线的“苹果机器学习日记”网站,相比其它硅谷IT公司的 AI 研究院 Blog 可谓是姗姗来迟,大家等待苹果正式加入知识开放、动作迅速的 AI 研究大家庭已经很久了。不过让人欣喜的是,第一篇博文就能帮苦于没有大量训练数据的研究者们解决不小的麻烦。雷锋网(公众号:雷锋网) AI 科技评论对论文的主要内容介绍如下。

  苹果要降低准备训练数据的成本对于现阶段的各种人工智能来说,用数据对它们进行训练是一个必不可少的环节,而且数据的质量会极大地影响人工智能的表现。比如以4:1击败李世石的 AlphaGo 是用海量的人类棋谱训练的,李世石当时也评价AlphaGo 的棋风有一些人类的影子;而接近两个月前以 3:0 战胜柯洁的 AlphaGo Master 版就是用海量的 AlphaGo 高质量自我对局训练的,去年抛出“狂言”的柯洁今年只能甘拜下风。

  人工智能要先看过很多猫的照片,同时还要告诉它每一张照片里都是猫围棋之外还有一个典型的人工智能应用是图像识别,人工智能要先学习过成千上万张人类分好的、已经标注过“猫”的猫咪照片,才能学会识别其它图片里的猫。业内训练图像识别系统一般用的都是一百万张级别的带标注图像,而财大气粗的谷歌上周刚刚雄辩地证明了如果用别人的300倍那么多的图像(3亿张),可以让识别正确率进一步上升。只是如此数量的图像已经没办法让人类亲自标注了,谷歌也是用了各种手段才凑出了这么多的图像。

  “凑更多的图像”,或者说数据增补,有一种常见的方法是设计一个图像模拟器,让它仿照手里已有的、分好类的真实图像,生成同类的图像,新生成的图像就还是带有标注的,可以用于人工智能模型的训练。这种方法的成本就比人低多了,但是用图像模拟器生成的图像往往不如原有的图像真实,训练出的模型效果就不理想。

  选对思路很重要:提高图像真实性所以苹果的机器学习研发团队就琢磨了,既然我能轻松地生成带有标注的图像,然后它们的真实性不够好,那我直接在这些图像的基础上提高真实性行不行呢?整篇论文要解决的就是这个问题。

  基于提高真实性的思路,他们仿照GANs(对抗性生成式网络)的模式,设计了一种提高图像真实性的美化网络。这种美化网络里包含一个“美化器” R 和一个“鉴别器” D,美化器要想办法把现有的生成的图像变得更真实,然后把经过这种美化以后的图像拿给鉴别器看;鉴别器则掌握着一批真实图像,参考真实图像鉴别美化以后的图像是不是真的。

  美化器的目的是输出更真实的图像来骗过鉴别器,让它分不出来真伪;鉴别器则要不断提高自己的姿势水平,不能被美化器骗过了。这两个角色会交替更新,美化器输出的图像越来越逼真,鉴别器的鉴别能力也水涨船高。最终等到鉴别器怎么都区分不出来真实的图像和美化后的图像了,这个美化网络就学习完成了。

  如图是美化网络的示意图,图像模拟器生成的图像经过美化器 R 的处理以后变得更真实了,鉴别器 D 起到促进美化器 R 进化的作用。

  苹果论文中的美化网络范式与 GANs 有类似之处,都是利用鉴别器 D 的对抗性促进网络输出图像质量的提升;不过 GANs 是使用一个生成器 G 从输入向量完全生成一张新图像,苹果论文的美化网络中把生成器 G 换成了美化器 R,只是对已有图像做一些美化调整。

  另一方面,苹果的机器学习研发团队提出这种美化网络的目的既然是为了降低“凑图像”的成本,他们可没有忘了把降低成本的目的执行到底。还记得刚才我们说鉴别者网络要手握一批真实图像做参考吗,假如这批用作参考的真实图像也全都是有标注的,这部分人工费就还是要出。能不能把这笔钱也省了呢?苹果的研究员们告诉你,能!鉴别器参考用的图像可以是没有标注的!

  网络设计提高真实性的想法很好,要怎么引导美化网络的学习从而得到理想的效果呢?苹果的研究员们动了这些小心思

  关键点1:用新设计的鉴别器避免图像出现瑕疵

  以往基于 GANs 的研究中,由于生成器 G 和鉴别器 D 之间是一面对抗一面交替迭代更新的,这就会导致生成器 G 倾向于过分强化图像中的某一些特征,鉴别器 D 也跟着去重点关注这些特征,结果就会造成像素的漂移、在图像中形成瑕疵。这些瑕疵最终会成为网络学习结果的一部分,就降低了输出图像的真实性。

  由于苹果论文的美化网络同样具有“边对抗边交替迭代更新”的特点,GANs 上出现的这个问题也很容易出现在美化网络里。苹果的研究员们仔细研究以后对传统的鉴别器 D 做了一些调整,它不再像以往的方法那样对图像进行整体鉴别,而是把整幅图像看作许多小块,然后分别对所有小块的像素特征进行分类,然后统计每个块的对抗失真损失;图像偏离真实图像越远,损失就越大。这种图像分割的做法虽然限制了鉴别器的感受野和识别容量,但是对图像细节的关注更多、更平均,对它对抗的美化器从每幅美化后的图像接收到的对抗失真损失反馈也是多个局部值的总和,从而能够获得更大的提升,训练后生成图像的效果更好。

  局部对抗性失真损失的示意图。鉴别器对每幅图像输出一个与原图同大小的概率表。对抗性失真损失的损失函数就是来自所有局部像素块的交叉熵损失的和

  关键点2:要保持图像的标注

  美化网络美化之后的图像是要作为别的模型的训练数据的,那么如何保证美化前后的图像对应的标注保持不变呢?以这篇论文中所使用的数据库为例,图像中眼睛注视的角度在美化前后不能有明显变化,不然就前功尽弃了。

  为了保持图像标注,苹果的研究员们让网络把美化前后的图像进行对比,根据两幅图像间的区别设立一个“自我正则L1损失”(self-regularization L1 loss)项;图像间区别越大,损失项就越大。

  这样,上文提到的“局部对抗性失真损失”、与这项“自我正则L1损失”组合起来,构成了学习过程的优化目标:让这两项损失的组合最小。这样网络输出的图像就又有高真实度,又能够保持标注不变。

  关键点3:给鉴别器加上记忆功能

  抽象一点讲,模拟器生成+美化器美化后的图像并不是真正的真实图像,但是只要这样的图像的特征分布与真实图像的特征分布相同,鉴别器就区分不出来,就达到了引导美化网络学习的目的了。

图像 鉴别 美化 苹果 网络
分享到:

1.TMT观察网遵循行业规范,任何转载的稿件都会明确标注作者和来源;
2.TMT观察网的原创文章,请转载时务必注明文章作者和"来源:TMT观察网",不尊重原创的行为TMT观察网或将追究责任;
3.作者投稿可能会经TMT观察网编辑修改或补充。


观点约架