【发布时间】:2014-08-28 09:05:18
【问题描述】:
我是 Python 新手,我正在尝试从 html 页面中提取数据。表格的某一列是文本和 URL 的混合。我想从该列中提取所有信息,保持链接完整地保存到 csv 文件(稍后我将保存为 Excel 文件)。请建议我。这是我仅提取文本的代码。
trs = soup.find_all('tr')
for tr in trs:
tds = tr.find_all("td")
try:
RS_id = str(tds[5].get_text().encode('utf-8'))
该列的一些单元格有多个 URL,我希望它们保持不变。
【问题讨论】:
标签: python html url csv extract