【发布时间】:2013-10-20 18:54:01
【问题描述】:
我正在编写一个脚本,用于通过用户发送的 url 索引和下载整个网站
例如,当用户提交像http://example.com 这样的域时,我将复制索引页面中的所有链接并下载其内部链接并从第一个开始.....
我使用 curl 和正则表达式来下载和提取链接
然而 一些黄色网站正在制作假网址,例如,如果您访问 http://example.com?page=12,它会提供一些指向 http://example.com?page=12&id=10 或 http://example.com?page=13 的链接等。 这将形成一个循环,脚本无法完成网站下载
有什么方法可以检测到这类页面!?
p.s.:我认为 google 和 yahoo 以及其他一些搜索引擎也面临这种问题,但是他们的数据库很清晰,并且在搜索时不会显示这些数据....
【问题讨论】:
-
“假网址”是什么意思?
-
正如我在第 4 节中所说的,假网址是一个只链接到其他一些页面并像一些warez 网站一样形成循环的页面
-
如果它实际上链接到另一个页面,那么它不是假的。如果您发现内容是多余的,则通过哈希对内容进行索引,或者尝试找出可以接受的百分比差异以计为不同的资源。您还可以在链接元素中查找规范 URL。
-
你对 md5 有什么想法,我的意思是我将数据库中所有页面内容制作成 md5,如果我发现重复的 md5 它将是一个重复的页面!?
标签: php url curl artificial-intelligence