【发布时间】:2013-04-08 05:17:00
【问题描述】:
这是我目前的代码:
import urllib
from bs4 import BeautifulSoup
lis = []
webpage = urllib.urlopen('http://facts.randomhistory.com/interesting-facts-about- cats.html')
soup = BeautifulSoup(webpage)
for ul in soup:
for li in soup.findAll('li'):
lis.append(li)
for li in lis:
print li.text.encode("utf-8")
我只是想从开始和结束“li”标签之间获取猫的事实,并以一种看起来不会乱七八糟的方式输出它们。目前,此代码的输出将所有事实重复 4 次左右,“can't”一词出现为“can’t”。
如果有任何帮助,我将不胜感激。
【问题讨论】:
-
为什么要遍历
ul元素然后不使用它们?摆脱那条for行。
标签: python html tags web-scraping beautifulsoup