【发布时间】:2020-05-14 10:00:28
【问题描述】:
我正在构建网络爬虫,以便从url 获取当天的每日重要事件, 我的代码是:
import requests
from bs4 import BeautifulSoup
url = "http://www.tarihtebugun.gen.tr/?t=1"
# Get the latest link for the updated news:
try:
r = requests.get(url)
except Exception as err:
logging.error("Connect: {}, {}".format(err, url))
soup = BeautifulSoup(r.content, "html.parser")
soup = soup.find_all('td', class_='Maddeler')
olaylar = "Tarihte Bugün\n"
for tarih, olay in zip(soup[0::2], soup[1::2]):
olaylar = olaylar + "{}-{}\n".format(fx._b(tarih.get_text().strip()), olay.get_text().strip())
对于 html 行:
<td align='left' valign='top' class='Maddeler' Style='padding-right:3px;'><a href=http://www.tarihtebugun.gen.tr/türkiye.html />Türkiye</a> Tas Kömürü Kurumu Zonguldak'ta kuruldu.</td>
我明白了
<td align='left' valign='top' class='Maddeler' Style='padding-right:3px;'><a href=http://www.tarihtebugun.gen.tr/türkiye.html />Türkiye</a></td>
BeautifulSoup 结果中缺少 URL Anchor 之后的文本。如果没有<a> 标签,则可以正常工作。
我不知道是什么问题
非常感谢
【问题讨论】:
标签: python-3.x web-scraping beautifulsoup