【发布时间】:2015-11-15 00:36:57
【问题描述】:
我通常使用以下模板脚本从网站下载数据:
import urllib.request as web
from bs4 import BeautifulSoup
...
url_to_visit ='http://www.website-link-to-download-data'
source_code = web.urlopen(url_to_visit).read()
source_code = ''.join(map(chr, source_code)
source_code = source_code.split('\n')
## then further process the lines returned in `source_code` as needed
但有时我会遇到非常困难的网站。
考虑网站:https://www.spice-indices.com/idp2/Main#home。假设从第一个表Intraday Alerts - United States,我想通过Python脚本下载点击SP TMI标签时显示的信息。
我查看了上面splitSource 的输出,但我不知道如何提取我想要的信息。它似乎正在使用 Javascript 后端来显示信息。有人可以给我任何指示或建议吗?
我正在使用 Python 3.x。
【问题讨论】:
标签: python python-3.x web-scraping beautifulsoup