【发布时间】:2021-01-13 01:52:55
【问题描述】:
我有一个网页,其中包含多个指向文本文件的链接,这些文本文件的标签如下:“2013 年 7 月 6 日,星期六”,其中包含指向以 *_130706.txt 结尾的文件的超链接。有人可以指导我使用将标签中包含 2013 的文件的所有内容写入文本文件的脚本吗?文本文件位于标签中。到目前为止,我已经能够以 xml 格式输出 html:
from lxml import html
from bs4 import BeautifulSoup
import urllib
string = '2013'
my_url = 'url'
html = urllib.request.urlopen(my_url).read()
html_page = BeautifulSoup(html, features='lxml')
有什么建议吗?
【问题讨论】:
-
请提供更多细节?喜欢网站的图片和html代码吗?
-
超链接嵌入到标签中。我基本上希望将 2012/2013 文件的所有内容写入单个文本文件。
-
好的,我明白了,我会尽力给你答复