【问题标题】:How to track links within a website如何跟踪网站内的链接
【发布时间】:2010-07-15 17:03:35
【问题描述】:

所以我正在将旧网站转移到新服务器,并尝试在此过程中进行清理。

我正在寻找一些脚本或免费软件,它们可以:

a) 显示通过网站的路径(按照超链接等),这样我就可以看到哪些链接指向哪些内容

和 b) 一些软件可以在文件夹结构中查看哪些 html 文件是孤立的(未链接到)。

我们将不胜感激任何一个或两个方面的帮助:)

【问题讨论】:

标签: html optimization web


【解决方案1】:

http://haveamint.com/ 说明一切,漂亮的 GUI,简单的集成,轻量级,数据库存储,JavaScript 跟踪。

薄荷糖(y)

或者你可以只使用谷歌分析的女巫,这些天几乎每个网站都在使用

【讨论】:

  • 我可能应该“免费”添加警告
  • 然后使用带有自定义链接跟踪的谷歌分析。
【解决方案2】:

a) 显示通过网站的路径(按照超链接等),这样我就可以看到哪些链接指向哪些内容

所以基本上是一个爬虫?您可以将一些东西与 http 库、html 解析器和任何品牌的脚本语言一起搅拌。不过,我不知道任何现成的脚本。

和 b) 一些软件可以在文件夹结构中查看哪些 html 文件是孤立的(未链接到)。

您的网站是由纯 html 文件组成,还是有某种服务器端技术,例如 PHP?如果是这样,则无法自动检测所述孤儿,因为它们是作为服务器端应用程序的函数生成的,而不是实际页面,即使它们可能在浏览器中显示为这样。

【讨论】:

  • 对不起,是的——虽然我最近意识到javascript中也包含一些链接......
【解决方案3】:

a) 根据您网站的复杂性和内容的动态程度,您可以下载任何蜘蛛并将其限制在您的网站上并检查结果(“burp 套件”包含一个非常好的蜘蛛,并且是每个人都可以使用的工具应该知道)。

b) 在蜘蛛完成其工作后,检查您的 wevsites 目录中所有文件的访问时间,任何访问时间早于蜘蛛执行时间的文件都可能是孤立文件。

(在使用用户输入来引用页面的网站上,这两种解决方案都不太有效)

【讨论】:

    【解决方案4】:

    home.snafu.de/tilman/xenulink.html (Xenulink) 提供链接爬取,并通过 FTP 访问提供孤立文件检查。

    【讨论】:

      猜你喜欢
      • 2010-09-26
      • 1970-01-01
      • 2017-12-07
      • 2016-01-16
      • 1970-01-01
      • 2010-09-17
      • 1970-01-01
      • 2021-11-07
      • 1970-01-01
      相关资源
      最近更新 更多