【发布时间】:2023-03-04 01:38:01
【问题描述】:
在网站上抓取一些信息后,我必须将带有原始代码的文件保存为 html 格式,因为我没有找到find_all列表列表中的文本的解决方案。
现在我有了数据,但我无法获取文本,因为bs4 无法识别格式列表。
这是我的开放代码:
with open('/my_file.csv', 'r') as read_obj:
csv_reader = reader(read_obj)
list_of_rows = list(csv_reader)
print(list_of_rows)
这是列表格式:
[['', '0', '1', '2', '3'], ['0','<span class="item">Red <small>col.</small></span>',
'<span class="item">120 <small>cc.</small></span>',
'<span class="item">Available <small>in four days</small></span>',
'<span class="item"><small class="txt-highlight-red">15 min</small></span>'],
['1', '<span class="item">Blue <small>col.</small></span>',
'<span class="item">200 <small>cc.</small></span>',
'<span class="item">Available <small>in a week</small></span>',
'<span class="item">04 mar <small></small></span>'],
['0', '<span class="item">Green <small>col.</small></span>',
'<span class="item">Available <small>immediately</small></span>',
'<span class="item"><small class="txt-highlight-red">2 hours</small></span>']]
有没有办法在 BeautifulSoup 中读取 csv 文件然后解析它?
任务的目的是只保留文本,删除'<>'(包括符号)之间的所有内容。
【问题讨论】:
-
当您抓取数据并写入 CSV 文件时,只提取文本并放入 CSV,而不是所有 Html 标签。
-
:) 我知道,但我必须继续工作,直到您在我的上一个问题中给出解决方案并且时间线很重要。你知道有什么办法解决吗?
-
您可以读取CSV,并拆分一串列表并获取您想要的数据。坚果这不是一个好方法。你的最后一个问题是什么?没有更多信息,没有人可以帮助您。
-
在这个你给出了解决方案:link这就是我的意思
标签: list beautifulsoup scrape