图相似性相关论文阅读总结

SimRank--基于结构的相似度度量方法学习笔记 详见:Glen Jeh 和 Jennifer Widom 的论文SimRank: A Measure of Structural-Context Similarity∗一、简介 目前主要有两大类相似性度量方法: (1) 基于内容(content-based)的特定领域(domain-specific)度量方法,如匹配文本相似度,计算项合的重叠区域等; (2) 基于链接(对象间的 阅读详情

记录一下数据集下载网址:

 http://snap.stanford.edu/data/

SimRank 是在有向图中测量顶点对间相似性的重要措施。

SimRank 是一个评估任意两个对象之间相似性的模型,核心思想是:如果两个对象的引用是相似的,那么这两个对象也是相似的。它的定义有两种:

(1),

其中NI(u)表示结点u的所有入邻居结点,c是一个属于(0,1)的阻尼系数。

(2),

另一种定义是基于随机冲浪匹配模型的。


其中T是一条随机路径的长度;

Pft(u,v,w)表示两个随机冲浪者u和v在时刻t都到达顶点w的概率;

Iw表示顶点w的初始相似性,通常为1.

基于SimRank的相似性相关问题分为以下四种:

单一顶点对SimRank:计算给定两个顶点之间的相似性分数;

单源SimRank:给定一个顶点v,计算v和图中所有其它顶点之间的相似性分数;

全对SimRank:计算所有的顶点对之间的相似性分数;

SimRank连接:给定一个阈值,找出所有相似性分数大于阈值的顶点对。

对不同的问题有不同的处理方法,以下是针对不同问题采取不同技术所达到的时间复杂度:


具体所在论文:Efficient SimRank Computation via Linearization.

(一).An Efficient Similarity Search Framework for SimRank over Large DynamicGraphs-2015-VLDB;

1,问题定义:在一个大的动态图上进行相似性搜索

2,背景:推荐系统

比如有两个顾客买东西,一个买了鸡蛋,面粉,小苏打;另一个买了小苏打,鸡蛋,白糖;通过相似性搜索,发现她们之间有相似性,所以可能面粉是对第二个顾客的一个好的推荐。

3,运用到的知识:

Simrank:一个评估任意两个对象之间相似性的模型,核心思想是:如果两个对象的引用是相似的,那么这两个对象也是相似的。

Monter-Carle simulation:是一个模拟技术,通过随机取样来评估一个数值。

CRS:一个行压缩格式,通过三个数组val,col_lind,row_ptr来表示一个矩阵。

Log-implementation:没有实际改动单向图,而是用log来表示这些改动,logbuffer中猜测是表示单向图中更新后的现存的边,以前的单向图中的边时过时的。当buffer满了后就重构一次。

4,我们这个算法的核心思想是通过单向图为每一个顶点维持一个路径的集合。

5,单向图存在的依赖性问题,是在查询中通过重新取样Rq个路径来消除的,这个使得我们算法精确度比较高。

6,本文还介绍了一个top-k相似性搜索算法,是指找一个固定顶点的top-k个相似顶点,猜想有没有一次性求出每一对顶点的相似性,最后在从所有对中选出top-k个相似对?

(二).Scalable SimRank Join Algorithm-icde-2015;

1.      什么是SimRank Join?

就是找出所有大于等于阈值的顶点对。

2.      过程?

1)  对SimRank进行线性化,求出对角改正矩阵D,(这是难点)

2)  通过GS算法求出近似SimRank矩阵

3)  在用GS算法求近似SimRank矩阵时,用到了随机阈值的方法来减少内存的使用。

4)  对已经求出的SimRank矩阵进行验证。


论文阅读笔记】模型的相似性 论文提出了柏拉表征假设(Platonic Representation Hypothesis),认为随着AI模型(特别是深度神经网络)的规模、数据和任务多样性增加,不同模型的表征方式正在收敛到一个共享的、反映现实统计模型的表征,称之为柏拉表征。这种表征类似于柏拉《洞穴寓言》中描述的理想现实,捕捉了生成观测数据的世界事件联合分布。 阅读详情

相关推荐

论文阅读+实战:SimGNN:A Neural Network Approach to Fast Graph Similarity Computation

相似性搜索是最重要的基于的应用程序之一,例如查找与查询化合物最相似的化合物。相似度/距离计算,例如编辑距离(GED)和最大公共子(MCS),是相似度搜索和许多其他应用程序的核心操作,但在实践中计算成本很高。作者受最近神经网络方法在几种应用(例如节点或分类)中取得成功的启发,提出了一种基于神经网络的新方法来解决这个经典但具有挑战性的问题,旨在减轻计算负担的同时保持良好的性能。

m0_49832700的博客 7662

基于随机游走路径的分布式SimRank算法* (2014年)

SimRank算法是一种常用的相似性度量模型,它基于的拓扑结构信息来衡量任意两个对象之间的相似程度。随着数据规模的不断增大,中式SimRank算法已不适用,而已有的分布式SimRank算法在运行效率和扩展性等方面存在缺陷。针对上述问题,提出了一种两阶段的基于随机游走路径的分布式SimRank算法。第一阶段基于BSP(bulk synchronous parallel)模型建立随机游走路径索引信息,支持新路径的动态添加,并通过阈值过滤尽可能减少生成路径的数量;第二阶段利用第一阶段生成的索引信息,提出了基

论文阅读笔记1——反事实公平性(更新ing

因果推断下的公平性研究方法有很多,本笔记的论文阅读都是基于的反事实公平性相关的研究论文。

Vee_Lee的博客 2291

SimRank算法

simrank算法Java实现,包含实现算法引用的两个jar包:fastutil-6.5.15.jar、webgraph-3.4.0.jar,自行导入

初识simrank

simrank 1. simrank的基本思想 基于结构的相似度计算方法,如果两个实体相似,那么跟它们相关的实体应该也相似。就如下,如果a和c相似,那么A和B应该也相似,因为A和a相关,而B和c相关。 基本公式: 直接使用上面的迭代公式很难展开并行计算,数量稍微大一些(比如上十万)时在单机上跑时间和空间开销非常大。所以给出矩阵形式 例1.计算1中节点SimRank相似度,其中c=0.6 根据定义,每个节点跟自己相似度为1,由于节点1没有入边,因此节点1与任何节点相似度为0 s(2,3)=c1∗

weixin_45768308的博客 3725

Graph Embedding

表示节点u和节点v在k阶邻居下的距离khop邻居表示k跳邻居。S(s):合S中每个元素的度的有序序列。

weixin_45847320的博客 1473

算法—杰卡德相似度

论算法—杰卡德相似度 1.算法 是一种表示两两对象之间的抽象数据结构,使用顶点与边进行表示,计算就是在基于数据上进行有目的性和针对性的计算过程,指解决一系列问题和发现潜在的数据价值,而算法是计算中用于解决指定问题的核心。 2.相似度算法-杰卡德 杰卡德相似度使用杰卡德系数(Jaccard Index)进行衡量,用于比较有限样本之间的相似性与差异性。杰卡德系数值越大,样本相似度越高。杰卡德系数的计算公式如下: 3.数据应用 数据中,顶点与顶点之间采用边的方式连接,那么任意一个顶点的邻接顶

sinat_38401853的博客 5665

论文阅读】-- Comparing Similarity Perception in Time Series Visualizations(比较时间序列可视化中的相似性感知)

许多处理时间序列数据的领域专家面临的一个共同挑战是如何识别和比较相似的模式。此操作是高级任务的基础,例如检测重复出现的现象或创建相似时间序列的群。虽然存在自动测量来计算时间序列相似性,但通常需要人工干预来直观地检查这些自动生成的结果。可视化文献已经研究了相似性感知及其与折线自动相似性度量的关系,但尚未考虑替代视觉表示(例如地平线和色域)是否会改变这种感知。受神经科学家如何评估癫痫样模式的启发,我们进行了两项实验,研究这三种可视化技术如何影响脑电信号的相似性感知。

zijin-jdd的博客 1529

相关论文阅读与总结

1. Adaptive Structural Fingerprints for Graph Attention Networks ——注意力网络的自适应结构化指纹(ADSF) 1.1 解决的问题 本文是对注意网络(GAT)的一个扩展。传统的GAT计算注意力权重时只会利用一跳邻居的节点特征,如果利用高阶邻居的节点特征会引起过平滑的问题。因此,本文解决的主要问题是如何在GAT中利用丰富并且高阶的结构化信息。 1.2 提出的方法 传统的GAT:已知节点iii和它的一跳邻居jjj的特征分别为hih_ihi​和h

I'm not perfect, but I keep trying. 1088

simrank算法实现 java

simrank 算法实现 及 相应文件 社会计算课程实践

短文本相似性建模中相关性匹配及语义匹配的研究——EMNLP2019论文阅读笔记

Bridging the Gap Between Relevance Matching and Semantic Matching for Short Text Similarity Modeling 论文笔记 论文链接在这里 摘要 强调信息检索中的相关性和语义相关性存在差别。为了填补这一差距,作者提出了HCAN (Hybrid Co-Attention Network),包含:(1)CNN...

gxsHeeN的博客 1437

[论文阅读] (27) AAAI20 Order Matters: 基于神经网络的二进制代码相似性检测(腾讯科恩实验室)

《娜璋带你读论文》系列主要是督促自己阅读优秀论文及听取学术讲座,并分享给大家,希望您喜欢。前一篇文章介绍Excel论文可视化分析基础知识。这篇文章将带来AAAI20腾讯科恩实验室的经典工作——Order Matters,提出语义感知(Semantic-Aware)神经网络来实现二进制代码相似性检测,希望这篇文章对您有所帮助。一方面自己英文太差,只能通过最土的办法慢慢提升,另一方面是自己的个人学习笔记,并分享出来希望大家批评和指正。这些大佬是真的值得我们去学习,献上小弟的膝盖~fighting!

杨秀璋的专栏 5157

论文阅读】不完全多视聚类的自引导部分传播

本文从传播的角度解决了IMVC的挑战性问题

Redivulous的博客 1071

论文阅读】保留传递性的表示学习:连接局部连通性与基于角色的相似性

摘要 本文提出统一Transformer网络(UGT),通过整合局部和全局结构信息解决现有表示学习模型的局限性。UGT创新性地构建虚拟边连接结构相似的远距离节点,结合k跳邻域采样捕捉长距离依赖关系。模型采用自注意力机制编码结构距离和转移概率,并通过自监督预训练任务融合多尺度结构特征。实验表明,UGT在各类下游任务中显著优于基线模型,并达到3d-WL同构测试的表达能力。该方法为结构分析提供了统一表示框架,代码已开源。 关键词:Transformer、表示学习、结构保持、局部连通性、角色相似性

u013471607的博客 101

Graph

邻接矩阵(稠密) 邻接表(稀疏

vuscity的博客 478

Simrank-语义相关度查询

simrank算法 simrank的主要工作是查询上的一对结点的相似性。主要有两种理解方式 一、按照定义理解 直接按照上式就是v1和v2的相似度的(递归)定义,它是由彼此的父节点定义的。因为衰减因子c,他们总比彼此的父节点的相似度更低。 1.1算法 1.2 剪枝 只考虑一定范围距离内的节点,如果节点之间非常遥远则直接认为节点的相关度为0. 二、按照随机游走解释 d(a,b):从a节点随机游走到b节点所需的步数的期望。 m(a,b):从a节点、b节点同时出发,随机游走,相遇所需步数的期望。 下为在积方

Yinger_2000的博客 1685

SimRank协同过滤推荐算法

我只是一名搬运工,以下内容来自:刘建平Pinard https://www.cnblogs.com/pinard/p/6362647.html 前言   在协同过滤推荐算法总结中,我们讲到了用模型做协同过滤的方法,包括SimRank系列算法和马尔科夫链系列算法。现在我们就对SimRank算法在推荐系统的应用做一个总结。 1. SimRank推荐算法的论基础   SimRank是基于论的,如...

霖的博客 1055
上一篇: Trie树和后缀树讲解及应用
下一篇: 探讨C++内存回收
dota爱好者
博客等级 码龄16年 89粉丝 109原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值