【问题标题】:Easiest tool (Windows Platform) to crawl the web and save words? [closed]最简单的工具(Windows 平台)爬网和保存单词? [关闭]
【发布时间】:2011-02-02 12:51:58
【问题描述】:

我想抓取网页并保存关键字及其频率。例如,我想从 URL:http://www.dmoz.org/Arts/ 抓取艺术类别并保存一个单词列表及其频率。所以我想要以下输出

词频
电影 400
歌曲 100
杂志 120

实现这一目标的最简单方法是什么?任何语言的任何工具或库都会非常有用。

【问题讨论】:

  • 为什么这个请求在主列表中显示为非常轻的文本?这是您作为“有天赋”而打开的属性吗?还是您撤回了问题,或者...? 您是否仍然对这个问题的一些答案感兴趣?
  • 我没有附加任何东西,是的,我仍然对答案感兴趣。
  • 您可以访问 Unix/Linux 命令行吗?嗯..抱歉刚刚注意到您已将其标记为 java。
  • 我曾经为我的问题标记了超过 1 种语言,但它已被删除并得到负分。你可以用 PHP、Perl 或 Unix/Linux 回答我,任何开源工具也可能有帮助。平台无所谓。谢谢!

标签: java open-source web-crawler scraper word-frequency


【解决方案1】:

好的,我们开始吧。

(小幅修改,主要针对语法,20110316)

我只能抽出时间向您展示解决问题的最简单、非生产就绪的解决方案。如果您需要一次性解决方案,那么这应该可以为您节省大量时间。如果您正在寻找生产级工具,那么您将希望完全不同,尤其是如何将 html 简化为纯文本。只需在 SO 上搜索“awk html 解析器”,看看这个解决方案有多么错误 ;-)(下面有更多信息)......无论如何......

1 -- 蜘蛛/捕获文本到文件

wget -nc -S       -r -l4 -k -np -w10 --random-wait  http://www.dmoz.org/Arts/
     #noClobber
         #server Responses
                # -r recursive
                    # -l4 4 levels
                     # -k (convert) make links in downloaded HTML point to local files.
                        # -np no-parent.  don't ascend to the parent directory.
                              #  -w10 wait 10 secs between
                                    # --random-wait randomize that 10 secs above from 0-10

这会将所有 www.dmoz.org 文件放在当前目录的目录结构中,从顶部的 www.dmoz.org 开始。如果您愿意,可以将其 CD 下来以查看原始数据。

2 -- 制作一个简单的 html 剥离器脚本,如

$: cat rmhtml3

#! /bin/awk -f
{
        gsub(/[{<].*[>}]/, "")
        gsub("&nbsp;", "")
        gsub(/[ \t][ \t]*/, " ")
        if ($0 !~ /^[ \t]*$/) {
                print $0
        }
}

这将使“在 awk 中解析 html”的警察对我们失望 ;-),所以也许有人会推荐一个简单的命令行 xslt 处理器(或其他),它会比上面的工作更干净.我最近才弄清楚其中的一些,并正在寻找适合 unix 脚本环境的适当解决方案。或者您可以查看Wikipedia entry for webCrawlers 列出的开源网络爬虫

3 -- 制作一个大的 unix 管道以获得所需的输出。

find . -name '*.html' | xargs ./rmhtml3 \
| awk 'BEGIN {RS=" ";};{ print $0}' \
| sort | uniq -c \
| sort +0n | tail -50

您可以轻松地将其分解并查看每个阶段对流程的影响。

不寻常的位是

awk 'BEGIN{RS=" ";};{print $0}'

这会将 awk RecordSeparator 重置为空格字符,以便每个单词都打印在单独的行上。

然后很容易对它们进行排序,获取 uniq 项的计数,按排序输出的前导数排序,并且只显示最后 50 个条目。 (显然,您可以将其更改为您认为可能有用的任何数字。)

如果您不喜欢查看所有干扰词(the、at、it、....等),请将这些词放入文件中并使用

.... | fgrep -vif skipwords | sort | uniq -c ...

4 -- 在让蜘蛛运行 1/2 小时后,我正在查看输出,并且我看到了一些您想要添加到管道中的其他内容,这留给您作为练习;- )

   sort -i # ignore upper-lower case while sorting
   sed 's/[,]//g  # delete all commas. Add any other chars you find inside the []

希望对你有帮助

【讨论】:

    猜你喜欢
    • 2011-05-01
    • 1970-01-01
    • 1970-01-01
    • 2014-11-28
    • 1970-01-01
    • 2017-10-03
    • 2012-03-11
    • 2023-03-13
    • 2010-10-08
    相关资源
    最近更新 更多