【发布时间】:2016-12-14 08:17:57
【问题描述】:
我正在尝试使用 python 读取网页并将数据保存为 csv 格式,以作为 pandas 数据框导入。
我有以下代码从所有页面中提取链接,而不是尝试读取某些列字段。
for i in range(10):
url='https://pythonexpress.in/workshop/'+str(i).zfill(3)
import urllib2
from bs4 import BeautifulSoup
try:
page = urllib2.urlopen(url).read()
soup = BeautifulSoup(page)
for anchor in soup.find_all('div', {'class':'col-xs-8'})[:9]:
print i, anchor.text
except:
pass
我可以将这 9 列保存为 pandas 数据框吗?
df.columns=['Organiser', 'Instructors', 'Date', 'Venue', 'Level', 'participants', 'Section', 'Status', 'Description']
【问题讨论】:
-
你不能只从结果中选择感兴趣的列吗?例如
df = df[cols_I want]
标签: pandas beautifulsoup bs4