【问题标题】:Is there a way I can find the canonical domain name for a list of websites?有没有办法可以找到网站列表的规范域名?
【发布时间】:2011-12-31 01:25:26
【问题描述】:

我正在开发一个页面跟踪网络应用程序,我想获取网站列表的规范域。据我所知,没有很好的方法来判断站点对子域和顶级域的所有权从哪里开始和结束。我不确定描述它的最佳方式,所以这里是一个例子:

如果我拥有个人 URL mysite.com,我可以设置子域,例如 www.mysite.comcdn.mysite.com 等。

如果我的“小组”在大学有一个网站,例如computerscience.myuni.edu,我可能也可以控制www.computerscience.myuni.edu,但不能控制myuni.edu

如果我是一家大型企业并且需要分散网络流量,我什至可能有www.acme.comww2.acme.comww3.acme.com 等。

所以没有什么是确定的,但如果给我一个 URL,我可能会从前面去掉 www.ww2.cdn.,也许还有 secure.,但是还有其他常见的“子域”吗“我不认为这是相当普遍的,通常不用于提供不同的网站?

我想我只是想找出获得网站真正“规范”域名的最佳方法。

【问题讨论】:

    标签: web subdomain domain-name canonical-link


    【解决方案1】:

    首先,您应该区分域名和网站/URL。 我认为没有任何有效的方法可以轻松识别网站所有者,但关于域名,可以通过其结构推断出来。

    大致而言,完全限定域名由子域名称后缀组成,在您的情况下,您正在寻找规范域名名称 + 后缀)。

    由于域名系统是分层的,因此应从头到尾读取像 www.example.com. 这样的 FQDN:.com.example.www,并且可以这样分解:

    • 后缀com
    • 姓名example
    • 子域www

    为了您的身份,您应该按照相同的顺序进行:

    1. 后缀:查找名称已注册的后缀(.com、.net、.co.uk、.com.es
    2. 姓名:识别点后的名字
    3. 子域:去除字符串的其余部分。

    没有列出所有公共后缀的官方数据库,但是在 Mozilla 基金会的倡议下,已经创建了一个非官方的数据库。项目名为Public Suffix,目的是记录后缀,在后缀下可以注册域名,拥有several implementations to parse the database

    我在我的个人博客上写了一篇介绍域名系统的文章,如果你有兴趣,我在这里更详细地描述了域名结构:What's a domain name and what's behind the scene

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2020-07-20
      • 2010-11-22
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多