【发布时间】:2021-08-10 10:52:59
【问题描述】:
所以我有多个包含网站链接的列表:
['www.google.com', 'www.yahoo.com', 'www.amazon.com']
我想获取如下列表:
['google', 'yahoo', 'amazon']
如何使用 urllib 来检索它?我得到了以下信息:
from urllib.parse import urlparse
domain = urlparse('http://www.google.com').netloc
print(domain)
但我不知道如何为列表做这件事,结果是www.google.com 而不仅仅是谷歌。
【问题讨论】:
-
列表的目的是什么?例如,您通过将其缩减为
amazon来剥离大量信息。amazon.co.uk和amazon.net应该被认为是同一件事吗?google.com和mail.google.com是否应该被视为相同? -
我将合并列表以创建超链接。所以我只需要您可以点击的网站名称即可访问该网站。
-
如果不绑定使用 urllib,那么您也可以使用正则表达式或简单的字符串拆分也可以使用它。(在这种情况下正则表达式会过大)