Merge pull request #102 from HuangQinJian/master

modify  chap9
This commit is contained in:
scutan90 2018-10-31 22:41:25 +08:00 committed by GitHub
commit e5defe5ee9
No known key found for this signature in database
GPG Key ID: 4AEE18F83AFDEB23
3 changed files with 16 additions and 20 deletions

View File

@ -13,6 +13,11 @@ readme.md---->章节维护贡献者信息
modify_log---->用来记录修改日志
第 * 章_xxx.md---->对应章节markdown文件
第 * 章_xxx.pdf---->对应章节生成pdf文件便于阅读
<----qjhuang-2018-10-31---->
1. 删除9.1.4重复问题
2. 修改标题格式
其他---->待增加
2. 修改readme内容
3. 修改modify内容

View File

@ -5,7 +5,7 @@
**负责人(排名不分先后):**
电子科大研究生-孙洪卫wechatsunhweeemailhwsun@std.uestc.edu.cn
电子科大研究生-张越wechattianyuzy
华南理工研究生-黄钦建()
华南理工研究生-黄钦建(wechatHQJ199508212176emailcsqjhuang@mail.scut.edu.cn
中国农业科学院-杨国峰()
**贡献者(排名不分先后):**

View File

@ -41,7 +41,7 @@ FCN对图像进行像素级的分类从而解决了语义级别的图像分
下图是语义分割所采用的全卷积网络(FCN)的结构示意图:
<center><img src="./img/ch9/figure_9.1.2_1.jpg"></center>
**9.1.3全卷积网络举例?**
**9.1.3 全卷积网络举例?**
&emsp;&emsp;
通常CNN网络在卷积层之后会接上若干个全连接层, 将卷积层产生的特征图(feature map)映射成一个固定长度的特征向量。以AlexNet为代表的经典CNN结构适合于图像级的分类和回归任务因为它们最后都得到整个输入图像的一个概率向量比如AlexNet的ImageNet模型输出一个1000维的向量表示输入图像属于每一类的概率(softmax归一化)。
@ -54,18 +54,9 @@ FCN对图像进行像素级的分类从而解决了语义级别的图像分
&emsp;&emsp;
2FCN与CNN的区别在于把于CNN最后的全连接层转换成卷积层输出的是一张已经Label好的图片, 而这个图片就可以做语义分割。
&emsp;&emsp;
3CNN的强大之处在于它的多层结构能自动学习特征并且可以学习到多个层次的特征 较浅的卷积层感知域较小,学习到一些局部区域的特征 较深的卷积层具有较大的感知域,能够学习到更加抽象一些的特征。高层的抽象特征对物体的大小、位置和方向等敏感性更低,从而有助于识别性能的提高, 所以我们常常可以将卷积层看作是特征提取器。
3CNN的强大之处在于它的多层结构能自动学习特征并且可以学习到多个层次的特征 较浅的卷积层感知域较小,学习到一些局部区域的特征较深的卷积层具有较大的感知域,能够学习到更加抽象一些的特征。高层的抽象特征对物体的大小、位置和方向等敏感性更低,从而有助于识别性能的提高, 所以我们常常可以将卷积层看作是特征提取器。
**9.1.4为什么CNN对像素级别的分类很难**
&emsp;&emsp;
1存储开销很大。例如对每个像素使用的图像块的大小为15x15然后不断滑动窗口每次滑动的窗口给CNN进行判别分类因此则所需的存储空间根据滑动窗口的次数和大小急剧上升。
&emsp;&emsp;
2计算效率低下。相邻的像素块基本上是重复的针对每个像素块逐个计算卷积这种计算也有很大程度上的重复。
&emsp;&emsp;
3像素块大小的限制了感知区域的大小。通常像素块的大小比整幅图像的大小小很多只能提取一些局部的特征从而导致分类的性能受到限制。
**9.1.5全连接层和卷积层如何相互转化?**
**9.1.4 全连接层和卷积层如何相互转化?**
&emsp;&emsp;
**两者相互转换的可能性:**
@ -86,12 +77,12 @@ FCN对图像进行像素级的分类从而解决了语义级别的图像分
&emsp;&emsp;
3最后一个全连接层也做类似的令其F=1,K=1000最终输出为[1x1x1000]。
**9.1.6 FCN的输入图片为什么可以是任意大小**
**9.1.5 FCN的输入图片为什么可以是任意大小**
&emsp;&emsp;
对于CNN一幅输入图片在经过卷积和pooling层时这些层是不关心图片大小的。比如对于一个卷积层outputsize = (inputsize - kernelsize) / stride + 1它并不关心inputsize多大对于一个inputsize大小的输入feature map滑窗卷积输出outputsize大小的feature map即可。pooling层同理。但是在进入全连接层时feature map假设大小为n×n要拉成一条向量而向量中每个元素共n×n个作为一个结点都要与下一个层的所有结点假设4096个全连接这里的权值个数是4096×n×n而我们知道神经网络结构一旦确定它的权值个数都是固定的所以这个n不能变化n是conv5的outputsize所以层层向回看每个outputsize都要固定那每个inputsize都要固定因此输入图片大小要固定。
**9.1.7把全连接层的权重W重塑成卷积层的滤波器有什么好处**
**9.1.6 把全连接层的权重W重塑成卷积层的滤波器有什么好处**
&emsp;&emsp;
这样的转化可以在单个向前传播的过程中, 使得卷积网络在一张更大的输入图片上滑动,从而得到多个输出(可以理解为一个label map)。
@ -120,7 +111,7 @@ FCN对图像进行像素级的分类从而解决了语义级别的图像分
&emsp;&emsp;
相较于使用被转化前的原始卷积神经网络对所有36个位置进行迭代计算优化模型然后再对36个位置做预测使用转化后的卷积神经网络进行一次前向传播计算要高效得多因为36次计算都在共享计算资源。这一技巧在实践中经常使用通常将一张图像尺寸变得更大然后使用变换后的卷积神经网络来对空间上很多不同位置进行评价得到分类评分然后在求这些分值的平均值。
**9.1.8反卷积层理解**
**9.1.7 反卷积层理解**
&emsp;&emsp;
Upsampling的操作可以看成是反卷积(deconvolutional)卷积运算的参数和CNN的参数一样是在训练FCN模型的过程中通过bp算法学习得到。反卷积层也是卷积层不关心input大小滑窗卷积后输出output。deconv并不是真正的deconvolution卷积的逆变换最近比较公认的叫法应该是transposed convolutiondeconv的前向传播就是conv的反向传播。
@ -135,7 +126,7 @@ Upsampling的操作可以看成是反卷积(deconvolutional),卷积运算的
<center><img src="./img/ch9/figure_9.1.8_2.png"></center>
<center>上图中的反卷积input feature map是3×3, 转化后是5×5, output是5×5</center>
**9.1.9跳级(skip)结构**
**9.1.8 跳级(skip)结构**
&emsp;&emsp;
对CNN的结果做处理得到了dense prediction而作者在试验中发现得到的分割结果比较粗糙所以考虑加入更多前层的细节信息也就是把倒数第几层的输出和最后的输出做一个fusion实际上也就是加和
@ -143,7 +134,7 @@ Upsampling的操作可以看成是反卷积(deconvolutional),卷积运算的
&emsp;&emsp;
实验表明这样的分割结果更细致更准确。在逐层fusion的过程中做到第三行再往下结果又会变差所以作者做到这里就停了。
**9.1.10模型训练**
**9.1.9 模型训练**
&emsp;&emsp;
1用AlexNetVGG16或者GoogleNet训练好的模型做初始化在这个基础上做fine-tuning全部都fine-tuning只需在末尾加上upsampling参数的学习还是利用CNN本身的反向传播原理。
@ -200,7 +191,7 @@ learning rate0.001。
最后一层反卷积固定位bilinear插值不做学习。
<center><img src="./img/ch9/figure_9.1.10_6.png"></center>
**9.1.11 FCN缺点**
**9.1.10 FCN缺点**
&emsp;&emsp;
1得到的结果还是不够精细。进行8倍上采样虽然比32倍的效果好了很多但是上采样的结果还是比较模糊和平滑对图像中的细节不敏感。
@ -660,7 +651,7 @@ $$
&emsp;&emsp;
对于给出bounding box标记的训练图像该方法先使用CRF对该训练图像做自动分割然后在分割的基础上做全监督学习。通过实验发现单纯使用图像级别的标记得到的分割效果较差但是使用bounding box的训练数据可以得到较好的结果在VOC2012 test数据集上得到mIoU 62.2%。另外如果使用少量的全标记图像和大量的弱标记图像进行结合,可以得到与全监督学习(70.3%)接近的分割结果(69.0%)。
**9.9.4统一的框架**
**9.9.4 统一的框架**
&emsp;&emsp;
Learning to Segment Under Various Forms of Weak Supervision (CVPR 2015)