【发布时间】:2019-12-27 03:57:09
【问题描述】:
我有以下网址:https://tenhou.net/3/mjlog2xml.cgi?2009042400gm-00b9-0000-3a2a55dc
它只包含文本,我想下载它并使用 Python 将其作为 xml 文件存储在我的磁盘上。我正在使用请求模块。这是我尝试做的事情:
import requests
url = "https://tenhou.net/3/mjlog2xml.cgi?2009042400gm-00b9-0000-3a2a55dc"
r = requests.get(url, allow_redirects=True)
open('test.xml', 'wb').write(r.content)
当我去检查test.xml 的内容时,它只包含文本“请下载原始文件”。我也尝试过使用urllib.request.urlopen(),但我得到了相同的结果。
但是,当我在浏览器中打开 url 时,我会看到完整的标记文本,我什至可以将页面下载为另存为 xml。
我使用 requests 方法收到的 HTML 是:
<html>
<body>
<p>PLEASE DOWNLOAD RAW FILE</p>
</body>
</html>>
但是网站上的 HTML 是like this
我要下载的文本在左边。 HTML 显示在右侧。如果我能得到右边的 HTML,那么我就知道如何使用 BeautifulSoup 之类的东西来解析它并得到我想要的东西。但我不确定为什么 python-requests 和 urllib 没有给我正确的数据。
【问题讨论】:
标签: html xml python-requests urllib