【问题标题】:What method should I employ to extract keywords from a URL?我应该采用什么方法从 URL 中提取关键字?
【发布时间】:2011-02-18 19:36:51
【问题描述】:

我正在提取关键字。系统将 URL 作为输入,输出应该是描述 URL 内容的关键字。我们现在只考虑文本部分。我想知道我可以使用哪些方法从 URL 中提取关键字以及它们如何相互比较。欢迎提出建议和重定向。

【问题讨论】:

  • 您使用什么语言?不同语言的不同方式...
  • 我认为这些技术不会依赖于所选择的编程语言。但是,如果他们这样做了,那么我可以使用 C、python、lisp,并且一个朋友可以使用 php 和 java/.NET。
  • 您是在查看单个 URL,还是查看整个域中的多个 URL?
  • 那么输入将是一个 URL。现在,如果 URL 类似于 intosimple.blogspot.com/2011/03/…,那就更容易了;但如果是intosimple.blog.com,则必须细分任务。

标签: python c seo lisp


【解决方案1】:

我觉得你可以用这个方法

使用 urllib (http://docs.python.org/library/urllib2.html?highlight=urllib2#module-urllib2) 读取站点,然后删除标签并创建站点的平面文本

然后检查哪个单词使用得更多。然后创建前十名(或计数)

【讨论】:

  • 我正在使用 pycurl 来获取和处理网页。那么问题的本质是如何处理从网站获得的纯文本。
  • 为每个单词创建字典并计算这个单词 {"word":count} 然后显示前 10 个单词。 ps:删除html和js标签
猜你喜欢
  • 2010-12-11
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2010-10-04
  • 1970-01-01
  • 2014-04-16
  • 2010-12-18
  • 2010-11-14
相关资源
最近更新 更多