【发布时间】:2023-03-04 04:06:01
【问题描述】:
我正在尝试使用 Nutch 检索图像。该插件只是搜索所需的图像并检索它们的网址。我最后得到的包含太多重复的网址。它检索了 43000 个 url,其中 39000 个是重复的。 这是正常的还是我写的代码可能有问题(我不认为是这种情况),或者 Nutch 本身有问题?
【问题讨论】:
标签: image duplicates web-crawler webpage nutch
我正在尝试使用 Nutch 检索图像。该插件只是搜索所需的图像并检索它们的网址。我最后得到的包含太多重复的网址。它检索了 43000 个 url,其中 39000 个是重复的。 这是正常的还是我写的代码可能有问题(我不认为是这种情况),或者 Nutch 本身有问题?
【问题讨论】:
标签: image duplicates web-crawler webpage nutch
可能例如多次引用相同的图像?在这种情况下,您的结果可能完全正常,我想在给定/已知的一组 URL 上运行测试示例可以为您提供更好的答案,仅限制您的抓取,种子文件上的 URL 运行测试并检查正在抓取哪些图像。你的爬行尺寸是多少?您是在获取已经获取的页面还是关注尚未访问的页面?您是否忽略了图标之类的小图像?
请记住,通常在一个网站上,很多图片资源会被一遍又一遍地重复使用,特别是如果该网站不是这样的
【讨论】: