【发布时间】:2017-03-28 11:55:41
【问题描述】:
我正在使用urllib3 构建一个网络爬虫。示例代码:
from urllib3 import PoolManager
pool = PoolManager()
response = pool.request("GET", url)
mime_type = response.getheader("content-type")
我偶然发现了几个文档文件的链接,例如 docx 和 epub,我从服务器获取的 mime 类型是 text/plain。获得 正确 mime 对我来说很重要输入。
有问题的网址示例:
现在获取文件的 mime 类型的逻辑是从服务器获取它,如果不可用,则尝试获取文件的扩展名。
Firefox 怎么不会被这些 url 弄糊涂,让用户立即下载文件?它怎么知道这个文件不是纯文本?如何获得正确的 mime 类型?
【问题讨论】:
-
您如何访问
response中的mime 类型? -
我已经更新了问题。
-
这可能是解决这个问题的方法。首先将响应保存到临时文件中。然后为保存的文件名获取
content-type。 link -
这对我有帮助 mime.ritey.com
标签: python mime-types urllib3