Latent Embeddings for Collective Activity Recognition

Meta-Learning with Latent Embedding Optimization LEO 思想 MAML 虽然可以通过少量梯度下降就能找到适应新任务的最优参数,然而对extreme low-data regimes在高维参数空间上操作时,还是过于不便。而LEO 则通过学习关于模型参数的a data-dependent latent generative representation,并在这种低维的latent space 中执行基于梯度下降,可以一定程度上绕过这些痛点。LEO 算法能够捕获数据中的不确定性,将基于梯度的自适应优化过程,从模型参数的高维空间中分离出来,并通过实验... 阅读详情

个人总结:

第一次看到这个方面的论文,方法上还是用了后验概率来建立模型,不过代码并没有开源,具体细节还要商榷。

摘要

提出的问题:传统的手工定制的特征只能定义有限范围内的关系。在一个集体内,个体之间复杂的依赖关系不能很好地建立模型。

解决方法:通过在特征空间(feature space)嵌入潜在变量(embedding latent variable),利用深度学习框架学习特征映射函数。

嵌入的潜在变量包含了:

  1. 个人-集体之间互动的全局关系
  2. 通过联合建模,容纳更多范围内个体的上下文信息

另外在嵌入过程中,还利用了注意力机制,实现更为紧凑的表示(compact representation)。

介绍

我们通过将潜在变量嵌入在特征空间中来来推断拥有复杂依赖的潜在变量,而不是用人为定义的传统图模型。

两方面优点:

  1. 使用嵌入式的方法,模型可以对更为复杂的集体结构进行建模,而不是对个人-个人之间逐对建模。
  2. 个人与集体之间的非线性依赖关系可以通过在深度框架中有区分的学习过程推断出来。

为了获得更为精确的集体活动表示,在嵌入的过程中,为每一个个体设定不同的影响系数,一个注意力机制被引入去修正上下文结构。

h_{i}:捕捉person i 局部的person-group之间的互动。表示第 i 个个体的隐藏变量

h_{scene}:通过整合所有的局部互动信息,挖掘全局互动。表示第 i 个scene场景的隐藏变量

为了有效的建模复杂的依赖,我们学习嵌入在特征空间的潜在变量的表示。

我们的方法

不采用直接推断潜在状态的方法,我们利用嵌入的潜在变量(已经在深度神经网络当中参数化)在一个全局的视角去表征结构信息,然后利用person-group互动建模来进行集体活动识别(collective activity recognition)工作。

Modeling Collective Activity with Latent Variable

  变量定义:

x_{i}:表示person i 的可见变量,i\epsilon\upsilon _{p}

\upsilon _{p}:集体场景涉及的所有个人

x_{scene}:一个scene可见变量

后验概率:

表示:隐藏变量 h{_{i}} 捕捉到了person i 与group之间的互动信息。

表示:从一个全局的视角,h_{scene}捕捉到所有的集体场景内的互动。

基于潜在变量,联合考虑局部person-group 的互动和全局context两方面,完成collective activity识别。

 

公式一:u^{_{i}^{(t)}} as the embedding of latent variable h_{i}, 可以表示 “the local person-group interaction" 这中局部person-group 交互

通过一下方式来构造它:

  1. 联合考虑person i 的一元的图像特征x_{i}
  2. person i 的所有邻居的平均表面特征
  3. 上一步的嵌入式全局场景u{_{scene}^{(t-1)}} , 其实就是全局上下文信息
  • 其中:N(i) 表示 person i 的所有邻居们,N(i) \epsilon \nu _{p} 
  • ";" 表示向量垂直连在一起
  • \sigma () 表示线性修正单元(RELU)
  • \lambda 表示更新步值

同样的,是 the embedding of latent variable h_{scene}^{(t)}, 其作用是从一个全局的角度捕捉集体交流(collective interaction)。可以将其看作是全局关系的表示,因为它把个体和它附近的局部关系以非线性依赖的形式建模。

公式二:

通过一下方式来构造它:

  • global image feature 全局图像特征x_{scene}
  • 池化所有人的低层特征,即
  • 平均累计嵌入式的个人,即

公式三:基于嵌入式的潜在变量,我可以定义后验概率,y表示一个活动标签名。

  • 其中\o表示一个激活函数,本文设置为softmax

公式四:使用了cross entropy 交叉熵损失函数来评判模型输出与实际注释的一致性。

  • 其中\theta是模型参数,需要被学习到。
  • K是activity 的标签数
  • y_{k}=1,如果这一帧图像属于类k;否则为0

公式五:引入注意力机制

公式六:在一个集体情景里,给定个体的关联之后,我们可以测量起源于individual i 的个人-集体之间交互的重要程度。

  • 其中\tau是softmax函数的温度参数。

公式七:考虑到给定集体情景里所有的个体,我们可以构造嵌入式的场景方程如上。

实验

For feature representation, we used the feature maps obtained in the “pool5” layer of two-stream ResNet-50 net
(pretrained on the UCF101 action set [21]) as our twostream feature.

使用了ResNet-50

 

 

 

 

 

 

 

 

 

 

 

 

VLA-2025-03:GR00T N1【骨架:Eagle-2;端到端双系统VLA:S2 VLM+S1 DiT+FM;数据:单/双臂+人形,机器人+人类+仿真+神经共592.9M帧/8375.7小时】 通用机器人需要多功能的躯体和智能的头脑。近年来,人形机器人的发展在构建人类世界中通用自主性的硬件平台方面展现出巨大潜力。一个基于海量多样化数据源训练的机器人基础模型,对于使机器人能够推理新情况、稳健应对现实世界的多变性以及快速学习新任务至关重要。为此,我们推出了GR00T N1,一个面向人形机器人的开放基础模型。GR00T N1是一个具有双系统架构的视觉‑语言‑动作(VLA)模型。视觉语言模块(系统2)通过视觉和语言指令来解读环境。随后的扩散Transformer模块(系统1)实时生成流畅的电机动作。 阅读详情

相关推荐

视觉特征-自监督-掩码特征预测【2024-04】:V-JEPA【潜空间】【≈90%多块时空掩码】【上下文目标块预测】【特征空间预测≠像素重建】【EMA目标编码器+停梯度】

Adrien Bardes 1,2,3, Quentin Garrido 1,4, Jean Ponce 3,5,6, Xinlei Chen 1, Michael Rabbat 1, Yann LeCun 1,5,6, Mahmoud Assran 1,†, Nicolas Ballas 1,† 1 FAIR at Meta, 2 Inria, 3 École normale supérieure, CNRS, PSL Research University, 4 Univ. Gustave Eiffel

u013250861的博客 220

探索元学习的深度——Latent Embedding Optimization的奇妙之旅

探索元学习的深度——Latent Embedding Optimization的奇妙之旅 在快速适应新任务的时代,元学习成为了人工智能领域的热点。今天,我们将焦点对准一个卓越的开源项目:Meta-Learning with Latent Embedding Optimization(简称LEO)。该项目基于Rusu等人的论文,即将于ICLR 2019上展示其创新成果,而今天我们有幸能够直接接触并探...

gitblog_00171的博客 617

Meta-learning with latent embedding optimization【论文笔记】

Gradient-based meta-learning techniques are both widely applicable and proficient at solving challenging few-shot learning and fast adaptation problems. However, they have practical difficulties when operating on high-dimensional parameter spaces in extrem

Xie_learning的博客 1818

论文阅读问题总结(二):Meta-Learning With Latent Embedding Optimization

1.本文提出得主要想解决的问题是什么? 作者在本文中提到了基于梯度的元学习技术(尤其是学习到公共初始化参数随后通过调整初始化参数来适应特定任务的元学习方法:MAML, Reptile)使用特定任务的小样本数据集来通过梯度下降调整高维参数使得泛化困难(我的理解是小样本调整高维参数的适应过程容易过拟合)。 2.本文作者试图如何解决上述问题? 1.设计模型使每个待解决的特定任务的初始化参数与此任务的训练集相关,使用Relation Network将每个任务的初始化参数引入数据集之间的相关性。 2.学习一个高维模型

qq_32599109的博客 853

Latent Embeddings for Zero-shot Classification

CVPR2016Latent Embeddings for Zero-shot Classification本文还是针对 zero-shot classification 问题。以前基于 structured embedding frameworks 解决这个问题的思路主要如下:首先将 图像和 类别信息映射到某些多维向量空间。 一般图像的嵌入信息( Image embeddings )通过 CNN

cv_family_z的博客 2965

Python-一个简单易用的方式来可视化嵌入Embeddings

一个简单易用的方式来可视化嵌入Embeddings

深度学习:zero-shot-learning(三)LatEm_cvpr2016

https://blog.csdn.net/u011070272/article/details/73730244 https://blog.csdn.net/cv_family_z/article/details/52066547 Latent Embeddings for Zero-shot Classification _cvpr2016 图像嵌入信息 image embeddings...

weixin_41108334的博客 877

Recurrent Modeling of Interaction Context for Collective Activity Recognition

Recurrent Modeling of Interaction Context for Collective Activity Recognition

Latent Embedding Feedback and Discriminative Features for Zero-Shot Classification (ECCV2020)

近来零样本学习文章大多基于生成模型,这篇文章也是在 GAN 的基础上更进一步来提高性能的。本文基于 VAE-GAN,作者说其他人用带 decoder 的模型,在训练之外就把 decoder 丢掉了,这很不好,因此作者倡议在训练、特征生成和分类都使用语义嵌入解码器 semantic embedding decoder (SED)。另外,使用的 feedback loop。创新点有两个,归纳起来就是 提出 semantic embedding decoder (SED),并设计 feedback module

剑启郁兰的博客 1294

什么是潜在变量,什么是隐含特征

潜在变量可以用来表示数据中的一些隐藏属性或特征,对数据的生成过程进行建模。总结起来,隐含特征是用来描述观测数据背后存在的但不直接可见的特征,而潜在变量是一种未观测到的变量,可以通过观测数据和模型来进行推断。总结起来,潜在变量是对数据生成过程中未知或隐含的变量进行的假设或推断,而隐含特征是这些潜在变量所代表的具有意义的特征。潜在变量(latent variable)和隐含特征(latent feature)是在机器学习和统计建模中常用的概念,用于描述数据中未直接观测到但对数据生成和表示具有重要影响的因素。

JesonNb的博客 2645

dynamic modeling of wind farm interaction

dynamic modeing of wind farm

终于有人把Embedding讲明白了

导读:如果要总结深度学习大获成功的原因,那至少有两样东西必须入选:一样当然是很“深”的神经网络模型,这也是深度学习的“深度”的由来,另一样就是Embedding。在深度学习中,Embedd...

华章IT官方博客 4135

基于PID优化和矢量控制装置的四旋翼无人机(Matlab&Simulink实现)

基于PID优化和矢量控制装置的四旋翼无人机(Matlab&Simulink实现)内容概要:本文详细介绍了基于PID优化和矢量控制装置的四旋翼无人机控制系统的设计与Matlab&Simulink实现方法。通过建立四旋翼无人机的动力学模型,结合PID控制算法进行姿态调节,并引入矢量控制策略提升飞行稳定性与响应精度。文中涵盖了系统建模、控制器设计、参数整定及仿真验证全过程,重点展示了如何利用Matlab/Simulink工具对俯仰、横滚、偏航和高度四个自由度进行闭环控制仿真,分析了PID参数优化对系统动态性能的影响,同时探讨了矢量控制在多输入多输出非线性系统中的应用优势。该研究为无人机飞控系统的开发提供了完整的理论支持与实践参考。; 适合人群:具备自动控制理论基础、Matlab/Simulink仿真技能及相关工程背景的高校研究生、科研人员及从事无人机控制系统开发的工程师。; 使用场景及目标:①用于教学与科研中理解四旋翼无人机飞行控制原理;②为无人机飞控系统的设计与优化提供可复现的仿真平台;③支持进一步研究先进控制策略(如LQR、MPC)在无人机中的应用。; 阅读建议:建议读者结合文中提供的Matlab代码与Simulink模型文件同步操作,逐步完成建模与仿真过程,并尝试调整PID参数以观察系统响应变化,加深对控制理论实际应用的理解。

Meta-Learning with Latent Embedding Optimization (LEO)论文阅读

1. 论文阅读 Meta-Learning with Latent Embedding Optimization该文是DeepMind提出的一种meta-learning算法,该算法是基于Chelsea Finn的MAML方法建立的,主要思想是:直接在低维的表示zzz上执行MAML而不是在网络高维参数θ\thetaθ上执行MAML。 2. 模型及算法 如图所示,假设执行N-way K-shot的...

Liekkas_Javey的博客 3283

生成潜在最近邻的非对抗图像合成

背景 这是Facebook的一篇论文。生成对抗网络GAN在图像生成方面得到广泛的应用,其他VAE、流模型在应用都有一些差距。Wasserstein距离虽然极大提升GAN的效果,但理论上存在训练不稳定和模式丢失的问题。Facebook融合两种对抗方法的优势,提出本文GLANN的模型。 无条件生成模型通过给定有限的数量的训练样本学习得到生成整个图像分布的函数。其中,GAN具有以下优点: 1.能有效训练...

rosefun96的博客 9352

Cadence IC5141保姆级教程:Bandgap电路四大仿真(稳定性/噪声/启动/PSRR)完整流程与调参心得

本文提供Cadence IC5141中Bandgap电路的四大仿真(稳定性仿真、噪声仿真、启动仿真、PSRR仿真)的完整流程与调参心得。从原理图检查到ADE L配置,详细解析各仿真步骤的关键参数设置与优化策略,帮助工程师高效完成电路设计与性能调优。

weixin_30399821的博客 1049

【论文笔记】Embedding of Embedding (EOE) : Joint Embedding for Coupled Heterogeneous Networks

扫论文的笔记 只是一个比abstract 详细一点点的简介Applications visualization link prediction multi-class classification and multi-label classification. Particularly, multi-class classification and multi-label classificat

Preke的专栏 2257

FPGA中参数化SPI接口设计与Verilog实现

SPI(串行外设接口)作为嵌入式系统的核心通信协议,通过全双工、高速率特性在FPGA与Flash、ADC等外设交互中占据重要地位。参数化设计通过抽象时钟极性、数据位宽等可配置维度,采用分层架构实现硬件复用,显著提升开发效率。Verilog实现需重点处理跨时钟域同步和可配置帧结构,结合AXI总线集成与UVM验证方法学,可构建适应工业控制、物联网网关等场景的高可靠SPI解决方案。

ciya3282的博客 703

论文阅读笔记《Meta-learning with Latent Embedding Optimization》

核心思想   本文提出一种基于参数优化的小样本学习算法(LEO),与MAML,Meta-SGD算法相比,本文最重要的改进就是引入了一个低维的隐空间(Latent Space)。为了方便理解本文,我们首先回顾一下MAML算法,其目标是通过元训练得到一个好的初始化模型θ\thetaθ,使得模型能够通过少量样本的微调训练就能快速的适应任务需求,得到任务Ti\mathcal{T}_iTi​对应的模型参数θi′\theta_i'θi′​。为了实现这一目标,MAML算法通过两个层次的训练,内层循环(inner loop

深视 4799

Group|Collective Activity Recognition

Group Activity Recognition venue:CVPR:  2016 Zhiwei Deng, Arash Vahdat, Hexiang Hu, Greg Mori: Structure Inference Machines: Recurrent Neural Networks for Analyzing Relations in Group Activity Rec

ily156401的博客 1133

MiniOSD DIY记

最近迷上了航模,研究了很多东西,感觉路走的长了还是适当要停下脚步休息下总结下。 这次DIY的是一块OSD设备,主要用于航模图传的叠加显示,原理也很简单就是atmel atmega328p+MAX7456芯片,网上卖的成品基本上都是一个原理图。 原理图 我按照我自己的需要做了适当的更改,去掉了DC-DC电路,直接用5V输入,因为摄像头都是5V的,所以DC-DC不是很有必要,体积上更加小了点, 打...

memoff的博客 7606
上一篇: CUDA编程:SM(Streaming Multiprocessing)
下一篇: Patch Normalization Regularization
physuleo
博客等级 码龄12年 32粉丝 18原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

个

红包个数最小为10个

元

红包金额最低5元

当前余额3.43元 前往充值 >
需支付:10.00元
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付元
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值