【问题标题】:Nutch retrieve too many duplicate imagesNutch 检索到太多重复的图像
【发布时间】:2023-03-04 04:06:01
【问题描述】:

我正在尝试使用 Nutch 检索图像。该插件只是搜索所需的图像并检索它们的网址。我最后得到的包含太多重复的网址。它检索了 43000 个 url,其中 39000 个是重复的。 这是正常的还是我写的代码可能有问题(我不认为是这种情况),或者 Nutch 本身有问题?

【问题讨论】:

    标签: image duplicates web-crawler webpage nutch


    【解决方案1】:

    可能例如多次引用相同的图像?在这种情况下,您的结果可能完全正常,我想在给定/已知的一组 URL 上运行测试示例可以为您提供更好的答案,仅限制您的抓取,种子文件上的 URL 运行测试并检查正在抓取哪些图像。你的爬行尺寸是多少?您是在获取已经获取的页面还是关注尚未访问的页面?您是否忽略了图标之类的小图像?

    请记住,通常在一个网站上,很多图片资源会被一遍又一遍地重复使用,特别是如果该网站不是这样的

    【讨论】:

    • 是的,问题似乎是图像被反复使用。我忽略了缩略图、图标、PNG 甚至 GIF。这些过滤后的图像包含更多重复项。
    • 在我这边,我认为可能是我的错,但没有费心去测试,我从限制 Nutch 抓取它们的 conf 文件中删除了 jpeg 和 jpg,即我允许 Nutch 抓取图像,而我的代码以另一种方式检测图像,这可能导致系统将大部分图像考虑两次。您认为这可能是问题之一吗?
    • 是的,这可能是,您正在使用自定义插件检测图像,然后 Nutch 无论如何都会找到该链接,并且在某些时候,它会获取/解析该文件。但是,如果您在 Solr 上将 URL 定义为 id,则它不应该导致任何重复,但如果您存储在文件中/某些东西可能会。请记住,在您的情况下,可能不需要允许 Nutch 获取/解析实际图像,因为在那里您将找不到更多链接。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-04-15
    • 1970-01-01
    • 2020-03-30
    • 2018-09-23
    • 2014-03-04
    相关资源
    最近更新 更多