【发布时间】:2015-02-16 11:58:40
【问题描述】:
Python 新手
试图从网页中抓取一些所需的信息。我想得到的第一件事是今天和昨天日期之间的所有 HTML。这是我到目前为止所拥有的
import datetime
import urllib
import re
t = datetime.date.today()
t1 = t.strftime("%B %d, %Y")
y = datetime.date.today() - datetime.timedelta(1)
y1 = y.strftime("%B %d, %Y")
htmlfile = urllib.urlopen("http://www.blu-ray.com/itunes/movies.php?show=newreleases")
htmltext = htmlfile.read()
block1 = re.search(t1 + r'(.*)' + re.escape(y1), htmltext)
print block1
据我所知(我可能错了),我的正则表达式应该抓住我想要的,这样我就可以开始只从今天的日期提取信息。但它返回“无”。
我确信这只是我的有限理解,因为我是新手,但任何帮助将不胜感激。非常感谢!
【问题讨论】:
-
问题是
.*不匹配换行符。但是你真的应该使用 HTML 解析器,就像 alecxe 说的那样。
标签: python html regex web-scraping html-parsing