【发布时间】:2021-02-06 06:59:45
【问题描述】:
我需要解析大量 URL 以使用 urllib/python3 检索 guid。一些 url 包含一个导致返回参数出现问题的片段。
import urllib
url = "https://zzz.com/index.html#viewer?guid=6a755e6d-4eae&Link=true&psession=true")
parse_response = urllib.parse.urlsplit(self.url)
self.logger.info("The parsed url components = {}".format(parse_response))
解析后的url组件 = SplitResult(scheme='https', netloc='abc.com', path='/index.html', query='', fragment='viewer?guid=6a755e6d-4eae&Link=true&psession =true')]
所以 urllib 正确地看到了“#”并将 URL 的其余部分存储为片段,并且不会返回参数。处理带有和不带有片段的 URL 的最佳方法是什么?
【问题讨论】:
标签: python-3.x url urllib