【发布时间】:2021-07-14 02:11:50
【问题描述】:
我对 webscraping 有点陌生,我之前使用以下方法创建了 webscrapers,但是对于这个特定的网站,我遇到了解析器无法找到特定类('mainTitle___mbpq1')的问题,这是类指公告正文。每当我运行代码时,它都会返回 None。大多数其他类也是如此。我想在不使用 selenium 的情况下捕获此信息,因为这会减慢我所理解的过程。我认为问题在于它是一个 json 文件,因此正在使用脚本标签(我可能完全错了,只是一个猜测),但我对这方面了解不多,所以任何帮助将不胜感激。
我尝试使用下面的代码,但没有成功。
from bs4 import BeautifulSoup
import re
import requests
# Method 1
url_4 = "https://www.kucoin.com/news/categories/listing"
res = requests.get(url_4)
html_page = res.content
soup = BeautifulSoup(html_page, 'html.parser')
texts = soup.body
text = soup.body.div.find('div',{'class':'mainTitle___mbpq1'})
print(text)
from bs4 import BeautifulSoup
import urllib3
import re
# Method2
http = urllib3.PoolManager()
comm = re.compile("<!--|-->")
def make_soup(url):
page = http.request('GET', url)
soupdata = BeautifulSoup(page.data,features="lxml")
return soupdata
soup = make_soup(url_4)
Annouce_Info = soup.find('div',{'class':'mainTitle___mbpq1'})
print(Annouce_Info)
【问题讨论】:
标签: python-3.x web-scraping beautifulsoup