收录域名

首页 | |

TF-idf算法

<p>   TF-idf算法其实是一种用户资讯检索与资讯探勘的常用加权技术,常常被SEOER们应用到,而很多人或许不太知道,其实最直观的了解就是“网站关键词密度”。
  直接切入主题,TF-idf算法到底是如何计算的:
  公式:
  TF:词频
  IDF:逆文本频率指数
  TF-IDF=TF*IDF
  我们举例说明,TF词频的意思,是指一个词出现在页面中的次数,如果一篇文章的总词语数是200,而“网站优化”这个词出现了4次,那么这个词频TF=4/200,也就是0.02。
  而IDF也就是很文件频率,指这个词在多少页面出现过计数为N,文件总数计数为M,那么IDF=lg(M/N)。假设“网站优化”在2000个页面出现,总文件数为1亿,那么文件频率IDF=lg(100000000/2000)=4.69897,那么计算最后的TF-IDF=0.02*4.69897=0.0939794。
  这只是一个判断一个页面的相关度的问题,而在SEO网站优化中,并不只是判断TF-IDF的值加分,我们需要一个识别度高的词来为
下一页»

2014-04-21 | Tags: | seo教程 | 查看评论(0)

Powered By Z-Blog  触屏版 | WAP版 | 电脑版