EN
返回档案库

案例库 · 研发与科研 · 技术决策 · 1997–1999

HITS算法排名页面依据的是谁链接谁,而非页面自身内容

Kleinberg的HITS算法为每个页面赋予两个分数——权威度和枢纽度,使得相互认可的页面无需自述即可提升排名。

康奈尔大学

解法

在互联网早期,通过文本搜索处理宽泛查询时常常失败:哈佛大学的主页并未最突出地使用“哈佛”这个词,而搜索引擎的主页也未提及“搜索引擎”。乔恩·克莱因伯格认为,超链接编码了人类对权威的判断。

他的HITS算法将页面分为两类:枢纽——指向许多优秀来源的页面,以及权威——被许多枢纽指向的页面。从聚焦的子图出发,算法交替更新两类分数:权威继承枢纽的权重,枢纽继承权威的权重。

由于迭代收敛于链接矩阵的主特征向量,算法在数学上稳定,并能浮现出相互强化的小群体。克莱因伯格于1998年在SODA会议上首次提出该算法,并于1999年发表了期刊版本。

生效的原因

  • 链接编码了文本无法表达的人类认可
  • 枢纽/权威双重性捕捉了两种不同角色
  • 特征向量迭代收敛于稳定的排名
  • 宽泛查询需要结构,而不仅仅是词频
取得的成效枢纽为权威投票,然后权威再为枢纽投票聪明

可借鉴之处

当内容无法说明问题时,通过认可来评判——并同时为认可者打分。只要迭代至收敛,相互强化就能将众多嘈杂的链接转化为稳定的排名。

后续进展

HITS成为与PageRank并列的标准链接分析方法,影响了搜索、推荐和引文分析;枢纽/权威的术语现已成为网络科学的一部分。

资料来源

发现哪里写错了?告诉我们。

相关案例