【发布时间】:2017-10-10 07:57:24
【问题描述】:
我是一个写网络爬虫的新手。我想使用http://www.creditchina.gov.cn/search_all#keyword=&searchtype=0&templateId=&creditType=&areas=&objectType=2&page=1 的搜索引擎来检查我的输入是否有效。
例如,912101127157655762 是有效输入,912101127157655760 是无效输入。
通过开发者工具查看网页源代码后,我发现如果输入的是无效数字,则标签为:
如果输入有效,则标签为:
所以我想通过检查'ul class=“credit-info-results public-results-left item-template”'标签中是否有任何内容来确定输入是否有效。以下是我编写网络爬虫的方式:
import urllib
from bs4 import BeautifulSoup
url = 'http://www.creditchina.gov.cn/search_all#keyword=912101127157655762&searchtype=0&
templateId=&creditType=&areas=&objectType=2&page=1'
req = urllib.request.Request(url)
data = urllib.request.urlopen(req)
bs = data.read().decode('utf-8')
soup = BeautifulSoup(bs, 'lxml')
check = soup.find_all("ul", {"class": "credit-info-results public-results-left item-template"})
if check == []:
# TODO
if check != []:
# TODO
但是,check 的值始终是 []。我不明白为什么选项卡之间没有任何内容。希望有人可以帮助我解决问题。
【问题讨论】:
标签: html python-3.x beautifulsoup web-crawler urllib