Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification (ECCV2020)

视觉特征-自监督-同源不同crop视图一致性【2023-04】:DINOv2(无监督学习鲁棒视觉特征)【12 亿张互不重复的图像】【判别式自监督方法】【交叉熵损失+iBOT损失】 近期,自然语言处理领域在大量数据上进行模型 Pretraining 取得的突破,为计算机视觉中类似Foundation Model 的发展开辟了道路。这些模型能够生成通用视觉特征,即无需微调即可跨图像分布和任务发挥作用的特征,从而大幅简化图像在任何系统中的使用。本研究表明,现有的 Pretraining 方法,尤其是自监督方法,如果在来自多样化来源的充足精选数据上进行训练,便能够产生此类特征。我们重新审视了现有方法,并结合不同技术,从数据规模和模型规模两方面扩展我们的 Pretraining。 阅读详情

近来零样本学习文章大多基于生成模型,这篇文章也是在 GAN 的基础上更进一步来提高性能的。本文基于 VAE-GAN,作者说其他人用带 decoder 的模型,在训练之外就把 decoder 丢掉了,这很不好,因此作者倡议在训练、特征生成和分类都使用语义嵌入解码器 semantic embedding decoder (SED)。另外,使用的 feedback loop。创新点有两个,归纳起来就是

  • 提出 semantic embedding decoder (SED),并设计 feedback module (for GZSL) 来在训练阶段、特征生成阶段使用 SED ,并依此调整生成器的潜在特征 表示。这是首次提出 feedback module 在 ZSL 任务中,反馈机制思路来源于 [1];
  • 在分类阶段提出 discriminative feature transformation,同时使用 SED 的潜特征和对应的视觉特征类来减少对象类别之间的歧义性;
  • 在几个数据集上进步明显,同时在 视频的zero-shot action recognition 进行了实验,效果也很显著。

创新之处就是 添加 SED 将视觉特征转化为语义嵌入并构建循环一致性损失,使用反馈机制指导特征生成,使用特征变换来指导分类。
[1] Firas Shama, Roey Mechrez, Alon Shoshan, and Lihi Zelnik-Manor. Adversarial feedback loop. In ICCV, 2019
1. Preliminaries: f-VAEGAN

即引用 f-VAEGAN-D2,该方法结合 VAE 和 GAN,该方法的 VAE 的 decoder 作为 GAN 的 generator。如下图所示,f-VAE 包含一个 encoder,将视觉特征映射到潜特征 zzz,也包含一个 decoder (同时作为 f-WGAN 的条件生成器)将 zzz 重建成 xxx。EEE 和 GGG 都受到 aaa 的约束(属性特征),优化下列公式

LV=KL(E(x,a)∥p(z∣a))−EE(x,a)[log⁡G(z,a)](1) \mathcal{L}_{V}=\mathrm{KL}(E(x, a) \| p(z \mid a))-\mathbb{E}_{E(x, a)}[\log G(z, a)] \tag 1 LV​=KL(E(x,a)∥p(z∣a))−EE(x,a)​[logG(z,a)](1)
p(z∣a)p(z|a)p(z∣a) 是先验分布,为 N(0,1)N(0,1)N(0,1) ,logG(z,a)logG(z,a)logG(z,a) 是重建损失。后面的 f-WGAN 的 loss 如下
LW=E[D(x,a)]−E[D(x^,a)]−λE[(∥∇D(x~,a)∥2−1)2](2) \mathcal{L}_{W}=\mathbb{E}[D(x, a)]-\mathbb{E}[D(\hat{x}, a)]-\lambda \mathbb{E}\left[\left(\|\nabla D(\tilde{x}, a)\|_{2}-1\right)^{2}\right] \tag 2 LW​=E[D(x,a)]−E[D(x^,a)]−λE[(∥∇D(x~,a)∥2​−1)2](2)
其中 x^=G(z,a)\hat x = G(z,a)x^=G(z,a) 是生成特征,x~\tilde{x}x~ 是从 xxx 和 x^\hat xx^ 的连线上随机采样的。则 f-VAEGAN 优化方法如下:
Lvaegan=LV+αLW(3) \mathcal{L_{vaegan}} = \mathcal{L}_V + \alpha \mathcal{L}_W \tag 3 Lvaegan​=LV​+αLW​(3)
f-VAEGAN 由于有公式 1 的第二项,能够在训练时对生成的特征进行循环一致性约束,然而却没有在 semantic embeddings 添加循环一致性约束。其他方法如GDAN 添加了循环一致性约束,然而只在训练阶段使用,在特征生成和分类阶段都抛弃了。

而本文引入 semantic embedding decoder (SED) 来在 semantic embeddings 上对所有阶段强制使用循环一致性约束。生成器模块将语义嵌入转换为特征实例,而 SED 将特征实例转化为语义嵌入,生成器和 SED 构成了互补。如下图,Dec 即表示 SED,用于重建嵌入 a^\hat aa^,通过循环一致性损失 LR\mathcal{L}_RLR​ 约束,同时通过反馈模型 FFF 将 Dec 的浅层特征反馈到 GGG 的浅层特征来实现改进的特征合成。
在这里插入图片描述

2. Semantic Embedding Decoder

语义嵌入的循环一致性损失 cycle-consistency 同通过 L1 重建损失来表示,即
LR=E[∥Dec⁡(x)−a∥1]+E[∥Dec⁡(x^)−a∥1] \mathcal{L}_{R}=\mathbb{E}\left[\|\operatorname{Dec}(x)-a\|_{1}\right] +\mathbb{E}\left[\|\operatorname{Dec}(\hat{x})-a\|_{1}\right] LR​=E[∥Dec(x)−a∥1​]+E[∥Dec(x^)−a∥1​]
因此训练 TF-VAEGAN 的 loss 变为 Ltotal=Lvaegan+βLR\mathcal{L}_{total} = \mathcal{L}_vaegan + \beta \mathcal{L}_RLtotal​=Lv​aegan+βLR​。

**Discriminative feature transformation ** 作者建议在分类阶段使用 SED 的潜在特征作为有用的信息源,来减少不同类别特征实例之间的歧义性,如下图 a 所示,将视觉特征和 DEC 重建的潜特征 hhh 拼接再输入分类网络进行分类。

在这里插入图片描述

3. Feedback Module

f-VAEGAN 没有在属性空间中使用一致性损失,导致真实的视觉特征和生成的视觉特征存在一定的语义gap,因此作者引入了 feedback loop 来迭代的优化特征生成(训练阶段和特征生成阶段),如下图所示。feedback module FFF 如上图 b 所示,glg^lgl 是 GGG 的第 lll 层输出,x^f\hat x^fx^f 是反馈部分,优化如下
gl←gl+δx^f g^{l} \leftarrow g^{l}+\delta \hat{x}^{f} gl←gl+δx^f
其中 x^f=F(h)\hat x ^f = F(h)x^f=F(h), hhh 是 Dec 的潜层,δ\deltaδ 控制着反馈机制。注意,文章 [1] 中使用鉴别器 D 的潜层作为反馈输入,而在 ZSL 中由于 unseen class 不可见,unseen class 特征生成和鉴别将不足以提供可靠的反馈,因此不适用 D 的潜层,而使用 Dec 的。

Training strategy 原始的反馈机制是 两阶段 的,先训练 G 和 D,然后训练 F。而本文使用交替训练策略,即交替训练 G 和 F。G 的训练策略不变,F 的训练过程中使用两个子迭代,如上图 b 所示。

注意在 transductive setting 中,同 f-VAEGAN-D2 一样,使用一个额外的 unconditioanl discriminator D2。
在这里插入图片描述

Experiments

下图为 inductive 和 transductive 的 ZSL 和 GZSL 的实验结果,注意到这里的原始特征使用的使用 ImageNet 预训练的 resnet101 提取的,特征提取网络的参数是固定的。

在这里插入图片描述

特征提取网络的参数不是固定的,经过了 fine-tuned,可以看到效果明显增加。
、在这里插入图片描述

下面为一些消融实验。

在这里插入图片描述

Meta-Learning with Latent Embedding Optimization LEO 思想 MAML 虽然可以通过少量梯度下降就能找到适应新任务的最优参数,然而对extreme low-data regimes在高维参数空间上操作时,还是过于不便。而LEO 则通过学习关于模型参数的a data-dependent latent generative representation,并在这种低维的latent space 中执行基于梯度下降,可以一定程度上绕过这些痛点。LEO 算法能够捕获数据中的不确定性,将基于梯度的自适应优化过程,从模型参数的高维空间中分离出来,并通过实验... 阅读详情

相关推荐

TensorFlow-VAE-GAN-DRAW:使用TensorFlow(深度卷积生成对抗网络(DCGAN),变分自编码器(VAE)和DRAW:用于图像生成的递归神经网络)实施的生成方法的集合

TF-VAE-GAN-DRAW ,和TensorFlow实现。 跑 VAE / GAN: python main.py --working_directory /tmp/gan --model vae 画: python main-draw.py --working_directory /tmp/gan 深度卷积生成对抗网络在使用默认参数的10个星期后产生了不错的结果。 ###去做: 更复杂的数据。 添加 用空间变压器层替换当前的注意力机制

ECCV20 Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification

生成零样本-语义一致性保持,借鉴超分辨的特征增强

一亩高粱 803

Python-一个简单易用的方式来可视化嵌入Embeddings

一个简单易用的方式来可视化嵌入Embeddings

[CVPR 2019] f-VAEGAN-D2: A Feature Generating Framework for Any-Shot Learning

直推式生成零样本

一亩高粱 1237

Latent Embeddings for Collective Activity Recognition

个人总结: 第一次看到这个方面的论文,方法上还是用了后验概率来建立模型,不过代码并没有开源,具体细节还要商榷。 摘要 提出的问题:传统的手工定制的特征只能定义有限范围内的关系。在一个集体内,个体之间复杂的依赖关系不能很好地建立模型。 解决方法:通过在特征空间(feature space)嵌入潜在变量(embedding latent variable),利用深度学习框架学习特征映射函数。 ...

physuleo的博客 598

分布式存储系统关于GDPR条例中的数据清除原则

文章目录前言HDFS存储系统数据的完全删除基于加解密的输入输出流的数据保护方案 前言 关于GDPR是什么,可能许多同学之前并不太了解,至少笔者在之前也是不清楚的。GDPR全称为通用数据保护条例,General Data Protection Regulation。它是一项来自欧盟的关于计算机数据保护相关的条约,旨在规范系统如何收集,管控用户私人数据的种种行为。但是当前的一些存储系统并没有完全符合...

走在前往架构师的路上 2812

Paper Reading: f-VAEGAN-D2: A Feature Generating Framework for Any-Shot Learning

Paper Reading Note URL: http://openaccess.thecvf.com/content_CVPR_2019/papers/Xian_F-VAEGAN-D2_A_Feature_Generating_Framework_for_Any-Shot_Learning_CVPR_2019_paper.pdf TL;DR 本文是CVPR2019的一篇文章,构建了一种VAE+...

外婆家的大灰狼 2441

UE4 Instanced Mesh 半透明渲染顺序不对解决

以绿色方块为Instanced Mesh为例。 正确的半透应该是这样的: 这是一般蓝图Actor方块,其半透是正常的。 然而Instanced Mesh因为过多,UE4不给你缓存正确的渲染顺序。所以,在不改代码的情况下,想解决Instanced Mesh半透问题,是不可能的。不正确的半透如下: 注意到错误发生在Instanced Mesh的方块与方块之间。 但我就是要解决,...

qq_41524721的博客 4833

探索元学习的深度——Latent Embedding Optimization的奇妙之旅

探索元学习的深度——Latent Embedding Optimization的奇妙之旅 在快速适应新任务的时代,元学习成为了人工智能领域的热点。今天,我们将焦点对准一个卓越的开源项目:Meta-Learning with Latent Embedding Optimization(简称LEO)。该项目基于Rusu等人的论文,即将于ICLR 2019上展示其创新成果,而今天我们有幸能够直接接触并探...

gitblog_00171的博客 617

探索未来:零样本分类的革命性进展

探索未来:零样本分类的革命性进展 在人工智能的广阔天地中,零样本学习(Zero-Shot Learning, ZSL)一直是研究的热点。今天,我们将介绍一个在ECCV 2020上引起广泛关注的开源项目——Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification。这个项目不仅在技术上取得了突破...

gitblog_00404的博客 396

Speedtree学习笔记(案例)——拥有多种材质的植物如何导入使用(以草为例)

注:Speedtree无论保存还是导入模型其存储路径不可有中文。 第一步拆分草的模型 根据所需的材质去拆分(例:假若草的果实,茎秆和叶子是不同的材质那么就需拆分为三份;假若画的全部颜色及材质一样就没有必要去拆分模型) 第二步导入草的模型 在Mesh面板中依次导入草的模型——Do nothing additional right now 第三步扩大草的生长区域范围(可省略)...

L人青的博客 5094

论文阅读问题总结(二):Meta-Learning With Latent Embedding Optimization

1.本文提出得主要想解决的问题是什么? 作者在本文中提到了基于梯度的元学习技术(尤其是学习到公共初始化参数随后通过调整初始化参数来适应特定任务的元学习方法:MAML, Reptile)使用特定任务的小样本数据集来通过梯度下降调整高维参数使得泛化困难(我的理解是小样本调整高维参数的适应过程容易过拟合)。 2.本文作者试图如何解决上述问题? 1.设计模型使每个待解决的特定任务的初始化参数与此任务的训练集相关,使用Relation Network将每个任务的初始化参数引入数据集之间的相关性。 2.学习一个高维模型

qq_32599109的博客 853

Genesis物理引擎实战指南:轻量级确定性刚体仿真核心

刚体物理仿真作为机器人控制、嵌入式运动学验证和确定性游戏开发的基础技术,其核心在于数值稳定性、跨平台可复现性与约束求解精度。本文围绕线性互补问题(LCP)求解、半隐式欧拉积分和零依赖C++实现三大关键技术展开,解析如何在无GUI、低算力环境下构建可单步调试、帧级可控的确定性仿真系统。重点覆盖碰撞检测数学建模、关节局部坐标系绑定、质量-惯性张量一致性校验等工程落地关键点,适用于STM32、树莓派及教育实验场景。内容深度结合Genesis Physics Engine的源码实践,直击‘穿模’‘NaN’‘关节发软

ciya3282的博客 780

vae 和gan的引入 以及生成模型的一些定义

m0_71395104的博客 197

探索未来视觉识别:TF-Vaegan——零样本学习的革命性框架

探索未来视觉识别:TF-Vaegan——零样本学习的革命性框架 tfvaegan项目地址:https://gitcode.com/gh_mirrors/tf/tfvaegan 1、项目简介 TF-Vaegan是一个基于深度学习的开源项目,专为解决零样本(Zero-Shot)和广义零样本(Generalized Zero-Shot)学习中的挑战而设计。这个项目由 ECCV 2020会议发表的一篇论...

gitblog_00016的博客 602

腾讯混元3D世界模型2.0实战:从AI生成到Unity/UE引擎集成全指南

生成式AI正在重塑3D内容创作流程,其核心原理是通过大语言模型理解自然语言描述,并驱动多阶段生成流水线自动创建3D资产与场景。这项技术为游戏开发、虚拟仿真和数字孪生领域带来了革命性的效率提升,能够将传统需要数周的美术协作流程压缩至几分钟。在实际应用中,开发者需要掌握本地环境部署、模型推理优化以及生成资产与主流游戏引擎的集成工作流。本文以腾讯开源的混元3D世界模型为例,详细解析如何将AI生成的场景通过插件高效导入Unity和Unreal Engine,并针对光照烘焙、材质调整、性能优化等工程实践问题提供解决方

cnracht8153的博客 765

【论文翻译】异构社交网络语义用户搜索的子图增强路径嵌入

异构社交网络语义用户搜索的子图增强路径嵌入 语义用户搜索是异构社交网络中的一项重要任务。它的核心问题是测量网络中两个用户对象之间的接近度。最先进的解决方案通常采用基于路径的方法,该方法使用连接查询用户和目标用户的对象序列来测量它们的接近度。尽管他们成功了,我们断言路径作为低阶结构不足以捕捉两个用户之间丰富的语义。因此,本文引入了一个新的子图概念——语义用户搜索的增广路径。具体来说,我们考虑对从查询用户到目标用户的一组对象路径进行采样;然后,在每个对象路径中,我们用共享子图实例替换其每两个相邻用户之间的线性

Mrong1013967的博客 861

二元交叉熵:分类模型概率校准的数学根基

二元交叉熵(BCE)是二分类任务中实现概率校准的核心损失函数,其本质源于最大似然估计与KL散度,确保模型输出具备真实可解释的概率意义。相比均方误差(MSE)或Hinge Loss,BCE强制优化预测分布与真实伯努利分布之间的信息差异,使p=0.8真正对应约80%的正例发生率,支撑风控、医疗、推荐等高信度场景的阈值决策。它不只影响训练收敛,更决定部署后概率的业务可信度——这正是Focal Loss等变体无法替代其基础地位的根本原因。理解BCE,就是理解分类模型如何从‘打分器’进化为‘概率契约签署者’。

congli3478的博客 691

## 作为多目标优化的多任务学习:寻找帕累托最优解+组合在线学习:实时反馈玩转组合优化-微软研究院+用于组合优化的强化学习:学习策略解决复杂的优化问题

组合在线学习:实时反馈玩转组合优化 看似无比困难的权衡问题,如今组合在线学习就能帮你“算出”最优解,轻松破解传统组合优化问题。本文中,我们邀请到微软亚洲研究院资深研究员陈卫为大家多面解读组合在线学习的奥妙之处。 什么是组合在线学习?大家都曾有过这样的经历,在我们刷微博或是阅读新闻的时候,经常会看到一些自动推荐的内容,这些信息可以根据你对推送的点击情况以及阅读时间等来调整以后的推送选择。再比如,手...

古月哲亭 1万+

ImageNet零样本准确率首次超过80%!OpenCLIP:性能最强的开源CLIP模型

点击下方卡片,关注“CVer”公众号AI/CV重磅干货,第一时间送达点击进入—>CV微信技术交流群转载自:新智元 | 编辑:LRS【导读】开源模型OpenCLIP达成ImageNet里程碑成就!‍‍虽然ImageNet早已完成历史使命,但其在计算机视觉领域仍然是一个关键的数据集。2016年,在ImageNet上训练后的分类模型,sota准确率仍然还不到80%;时至今日,仅靠大规模预训练模型的...

阿木寺的博客 5268

数学之美 | 图论和网络爬虫

文章目录概述图论网络爬虫分析BFSDFSBFS + DFS参考资料 概述 这篇文章主要给大家介绍一下计算机算法中非常重要的一部分——图论,以及它在生活中的应用——网络爬虫。   图论 离散数学是当代数学的一个重要的分支,也是计算机科学的数学基础。它又包括四个分支,而图论便是其中一支,另外三个分别是:数理逻辑、集合论、近代数学。 图论中的图由一些节点和边构成,比如下面这张图 。 在图论中一个很基础...

小小酥梨的博客 2031

Latent Embeddings for Zero-shot Classification

CVPR2016Latent Embeddings for Zero-shot Classification本文还是针对 zero-shot classification 问题。以前基于 structured embedding frameworks 解决这个问题的思路主要如下:首先将 图像和 类别信息映射到某些多维向量空间。 一般图像的嵌入信息( Image embeddings )通过 CNN

cv_family_z的博客 2965

Excel VBA--按某一列拆分数据到多个文件

首先,将需要拆分的sheet命名为“明细”,接下来运行此代码,按提示操作即可。 在这里插入代码片 Sub chaifen() '定义变量类型 Dim sht, sh1, sh2 As Worksheet Dim k, i, j As Integer Dim irow As Integer Dim col As Integer Dim str As String '程序开始是要求输入按哪一列拆分数...

weixin_43650026的博客 5296

TFVAEGAN 开源项目教程

TFVAEGAN 开源项目教程 项目介绍 TFVAEGAN 是一个基于 TensorFlow 的变分自编码器(VAE)和生成对抗网络(GAN)的结合模型。该项目旨在通过结合 VAE 和 GAN 的优势,提高生成模型的性能和多样性。TFVAEGAN 主要用于图像生成和处理任务,特别是在需要高质量和多样性输出的场景中表现出色。 项目快速启动 环境准备 首先,确保你已经安装了以下依赖: Python ...

gitblog_01086的博客 420

tfvaegan训练日志零样本分类网络

CUB:鸟类细粒度数据集,200各类别,每个类别312纬属性。SUN:细粒度的场景数据集。AWA1:动物图像数据集。50个类别,85维属性。AWA2:AWA1的复杂变体,从公共网络来源收集了37322张图片。

5233的博客 533

C# WinForm 基于DirectShow.dll编写的程序,可边预览边保存视频,音频和图片

基于微软的DirectShow.dll的二次开发1.自动识别连接的摄像头跟麦克风且可以对其进行选择(默认选中第一个)2.可录制wmv和avi两种格式的视频并且都带有音频,avi可以录制的分辨率和帧数进行选择,wmv默认进行了淸晰度优化如不喜欢可去除代码中有相关提示3.可在预览点开之后进行拍照,也可边录制视频边拍照4.添加了视频和音频的压缩功能(酌情使用)这次二次开发发现C#对DirectShow的相关信息太少,这次做完也不敢藏私共享出来,还望大家指正

[CVPR 2018]Discriminative Learning of Latent Features for Zero-Shot Recognition

文章目录背景贡献模型The Image Feature Network(FNet)The Zoom Network(ZNet)The Embedding Network(ENet)Prediction实验 背景 作者认为当前(2018年前)zero-shot研究的核心主要是在视觉空间和语意空间中学习合适的映射关系,而忽视了学习ZSL问题中 有判别力的表示。几乎所有的模型都有着相似的范式,即通过手工...

剑启郁兰的博客 1046

老版QQ原生表情gif动态

这是老版的QQ表情,不过全是动态的的,Windows照片查看器是不会动的,可以右击用浏览器打开查看,再说一遍是老版的,只是分享给宁愿用老版也要动态的人。

上一篇: [MacOs]用外置硬盘制作MacOs系统盘
下一篇: matebook x pro 显示不流畅问题的解决
评论 2
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

个

红包个数最小为10个

元

红包金额最低5元

当前余额3.43元 前往充值 >
需支付:10.00元
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付元
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值