PageRank

一、算法来源

PageRank是对网站进行排名(节点排序问题)的一种算法。
Google的创始人拉里·佩奇和谢尔盖·布林于1998年在斯坦福大学发明了这项技术。
核心思想:认为万维网中一个页面的重要性取决于指向它的其他页面的数量和质量。
1. 如果一个网页被很多其他网页链接到的话说明这个网页比较重要,也就是PageRank值会相对较高
2. 如果一个PageRank值很高的网页链接到一个其他的网页,那么被链接到的网页的PageRank值会相应地因此而提高

二、算法原理

初始时刻,赋予每个节点(网页)相同的PR值,然后进行迭代,每一步把每个节点的PR值平分给它所指向的所有节点。
每个节点新的PR值为它所获得的PR值之和。于是得到节点 vi v i 在t时刻的PR值。

PRi(t)=j=1najiPRj(t1)koutj P R i ( t ) = ∑ j = 1 n a j i P R j ( t − 1 ) k j o u t

其中 a a 表示邻接矩阵,aji={1,0},1表示 j j i有边,0表示无。 koutj k j o u t 表示节点 j j 的出度。
迭代直到每个节点的PR值到达稳定。
举个例子
这里写图片描述
PR(A)=PR(B)2+PR(C)1

这里写图片描述

把上面的PageRank公式改写为矩阵形式

PR(t)=MPR(t1) P R ( t ) = M ∗ P R ( t − 1 )

Mij=aijkoutj M i j = a i j k j o u t

2.1 终止点问题

有些网页不存在指向其他网页的链接,那么多次迭代之后,导致所有网页的PageRank都变为0.
怎么理解 ??
这里写图片描述

上图网页c没有指向外部的链接,最终将会导致各个网页的PageRank都变为0.
这里写图片描述

2.2 陷阱问题

陷阱问题是有些网页只存在指向自己的链接,那么多次迭代之后,这将导致这个网页的PageRank为1,而其他网页的PageRank为0.
这里写图片描述

这里写图片描述

2.3 改进PageRank

把PageRank模拟成,一个悠闲的上网者,上网者首先随机选择一个网页打开,然后在这个网页上呆了几分钟后,跳转到该网页所指向的链接,这样无所事事、漫无目的地在网页上跳来跳去,PageRank就是估计这个悠闲的上网者分布在各个网页上的概率。
假如我们遇到上述两个问题,采取的解决办法就是关闭当前网页,重新打开一个网页。
对上边公式做一个小小的修正。(有概率随机打开一个网页,这时候打开所有网页的概率均等)

PRi(t)=cj=1najiPRj(t1)koutj+(1c)1N P R i ( t ) = c ∑ j = 1 n a j i P R j ( t − 1 ) k j o u t + ( 1 − c ) 1 N

N N 是节点总数。
写成矩阵形式????? 推的不对啊??
A=cM+(1c)NeeT

PR(t)=APR(t1) P R ( t ) = A ∗ P R ( t − 1 )

其中 e e 是元素全部为1 的列向量。

三、PR值的计算

PR值的计算 过程就是一个Markov 过程。

3.1 幂迭代法

首先给每个页面赋予随机的PR值,然后通过$PR(t) = A*PR(t-1)不断地迭代PR值。小于给定阈值停止。

3.2 特征值法

当上面提到的Markov链收敛时,必有:
P=AP
推出P为矩阵A特征值为1对应的特征向量。

3.3 代数法

P=AP P = A P

P=[cM+(1c)NeeT]P P = [ c M + ( 1 − c ) N e e T ] P

P=(eeTcM)11cNe P = ( e e T − c M ) − 1 1 − c N e

这公式怎推的??

四、时间复杂度 Map-reduce

五、TrustRank

参考文献
【1】https://www.cnblogs.com/rubinorth/p/5799848.html
【2】https://www.cnblogs.com/futurehau/p/6062769.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值