正在打开第三讲…
课堂播放器需要 JavaScript;以下链接直接提供每页解释、图解、出处与实验。
P1 训练结束后,网络留下了什么?
P2 类别答案,不等于中间表示
P3 图片已经很多,答案从哪里来?
P4 同一个瓶颈,两种研究与产业选择
P5 文字演示了一种答案来源
P6 没有类别标签,不等于没有学习目标
P7 目标可以扩展,训练还要做得出来
P8 同一张图,可以给出两个相关视图
P9 “正例”说的是关系,不是类别
P10 一次对比,就是一次有答案的选择
P11 为什么不能把所有图片都映射成同一个向量?
P12 训练时比较 z,使用时读取 h
P13 该忽略颜色,还是该保留颜色?
P14 比较更多候选,代价在哪里?
P15 MoCo:字典里保存的是特征
P16 两个编码器,不同的更新方式
P17 把一次学习完整走通
P18 方法不是一条封闭的家谱
P19 另一条路线:根据可见内容预测缺失
P20 十六个图块,只有四个进入编码器
P21 解码器补位置,目标来自原图
P22 能补图,不等于每项任务都读得好
P23 冻结读出和微调,在问不同的问题
P24 学到表示之后,新任务提出了什么要求?
P25 同一张图,四种不同的答案
P26 位置还在特征图里吗?
P27 R-CNN:让已经会看图的网络看一个区域
P28 候选区域不是已经识别出的物体
P29 许多重叠区域,为什么要重复卷积?
P30 不同大小的区域,怎样读成固定结构?
P31 Fast R-CNN:把区域放回共享计算中
P32 Faster R-CNN:让候选区域也成为预测
P33 位置怎样成为可学习的目标?
P34 三个框,并不代表三只杯子
P35 检测错在哪里,要分开看
P36 FCN:另一条路线,直接为像素作预测
P37 输出变细,不意味着信息自动变多
P38 让细位置与深层语义重新配合
P39 两个同类对象,需要两份身份
P40 Mask R-CNN:区域内部,也保留二维结构
P41 三个像素的偏移,为什么会伤到轮廓?
P42 连续位置的数值,怎样从四个邻点得到?
P43 同一只杯子,换一个区域就换一份局部目标
P44 两种布局,如果已经变成同一个数
P45 多一个通道,和多几个像素不是同一回事
P46 SAM:把“分哪一块”交给提示
P47 可复用表示,还要经过任务训练
P48 从物体位置,走向可以说出来的任务
P49 同一幅画面,语言提出不同的问题
P50 2014—2016:几条准备已久的路线相遇
P51 图像描述:视觉内容怎样成为一句话?
P52 认识一个物体,为什么未必会把它说出来?
P53 一句话里的词,指向图中的哪一部分?
P54 VQA:问题决定此刻需要哪一项信息
P55 区域表示与语言预训练,有了可连接的部件
P56 CLIP 选择的任务:先学哪幅图与哪段话相配
P57 一张相似度矩阵,连接训练和使用
P58 用文字组织类别,而不是重做一张固定标签表
P59 匹配还可以变成图文检索
P60 图文数据不是一堆没有来历的图片
P61 前两张图都选对,究竟说明了什么?
P62 把位置与关系拆开,解释才会分叉
P63 GLIP:不只说相关,还要指出区域
P64 把视觉表示接入一个已经会说话的模型
P65 连接层与任务使用方式,都需要训练
P66 回看这段历史:留下来的不是一个网络名字
P67 同一句描述,为什么可以有很多张正确图像?
P68 下一讲:怎样学习可能性,并产生一个样本?