【发布时间】:2014-10-19 10:12:51
【问题描述】:
我一直在提取 li 标签之间的文本。以下是部分html页面源代码
<div class="item_desc_text">
<ul class="fk-key-features">
<li>1.2 GHz Qualcomm Snapdragon 400 Quad Core Processor and 1 GB RAM</li><li>Android v4.4 (KitKat) OS</li>
<li>Wi-Fi Enabled</li><li>8 GB Internal Memory</li><li>Dual SIM (GSM + GSM)</li><li>HD Recording</li>
<li>5 MP Primary Camera and 1.3 MP Secondary Camera</li><li>4.5-inch HD Display</li>
</ul>
</div>
我使用以下代码提取输出
import bs4
import re
suburl="http://www.flipkart.com/moto-g/p/itmdsmbxcrm9wy8r?pid=MOBDSGU2ZMDYENQA&icmpid=reco_pp_hSame_mobile_1"
subhtml = urllib2.urlopen(suburl)
subhtml = subhtml.read()
subhtml = re.sub(r'\s\s+','',subhtml)
subsoup=bs4.BeautifulSoup(subhtml)
print "Key features of "+Name.get_text()
for res2 in subsoup.findAll('div',attrs={'class':'item_desc_text'}):
print res2
我该怎么办?
【问题讨论】:
标签: python html tags beautifulsoup web-crawler