【发布时间】:2019-04-19 16:00:51
【问题描述】:
试图提取但最后一个字段出现错误想要将所有字段保存在 excel 中。
我尝试使用beautifulsoup 提取但未能捕获,出现以下错误
Traceback(最近一次调用最后一次):
文件“C:/Users/acer/AppData/Local/Programs/Python/Python37/agri.py”,第 30 行,在
标本=soup2.find('h3',class_='触发器
expanded').find_next_sibling('div',class_='collapsefaq-content').text
AttributeError: 'NoneType' 对象没有属性 'find_next_sibling'
from bs4 import BeautifulSoup
import requests
page1 = requests.get('http://www.agriculture.gov.au/pests-diseases-weeds/plant#identify-pests-diseases')
soup1 = BeautifulSoup(page1.text,'lxml')
for lis in soup1.find_all('li',class_='flex-item'):
diseases = lis.find('img').next_sibling
print("Diseases: " + diseases)
image_link = lis.find('img')['src']
print("Image_Link:http://www.agriculture.gov.au" + image_link)
links = lis.find('a')['href']
if links.startswith("http://"):
link = links
else:
link = "http://www.agriculture.gov.au" + links
page2 = requests.get(link)
soup2 = BeautifulSoup(page2.text,'lxml')
try:
origin = soup2.find('strong',string='Origin: ').next_sibling
print("Origin: " + origin)
except:
pass
try:
imported = soup2.find('strong',string='Pathways: ').next_sibling
print("Imported: " + imported)
except:
pass
specimens = soup2.find('h3',class_='trigger expanded').find_next_sibling('div',class_='collapsefaq-content').text
print("Specimens: " + specimens)
想提取最后一个字段并使用 python 将所有字段保存到 excel 表中,请帮助我。
【问题讨论】:
标签: html python-3.x web-scraping beautifulsoup