【发布时间】:2018-08-07 06:22:20
【问题描述】:
我正在尝试在这个链接上抓取文章的内容:https://onlinelibrary.wiley.com/doi/full/10.1111/jvim.15224
我已使用 Selenium 加载页面(PhantomJS 和 Firefox),但我似乎无法获取文章标签。
这一行是等待页面加载:
element = WebDriverWait(driver, 20).until(EC.presence_of_element_located((By.CLASS_NAME, "article-section__sub-title section1")))
另外,我也尝试等待文章标签加载。
但是,驱动程序会在几秒钟后继续运行,但每当我检查等待后得到的 html 时,唯一出现的是“head”和“body”标签 - 只是标签,没有它们的内容。
知道我在加载页面和抓取文章标签方面做错了什么吗?
【问题讨论】:
-
试试 headless chrome,phantomjs 现在已经过时了,headless chrome 更快
-
article 标签指的是哪个元素?
标签: python selenium selenium-webdriver screen-scraping article