【发布时间】:2020-08-01 02:03:54
【问题描述】:
我正在使用 selenium 抓取一些产品页面,但最近我只获得了登录页面(而不是我想要的产品页面)。因此,我尝试在浏览器中加载该页面,结果发现访问任何产品 URL 都会打开两个选项卡:一个用于登录,一个用于产品本身。 所以我不需要登录,我只需要能够从每次尝试访问 URL 时打开的两个页面之一中抓取。
我有一个包含 URL 和不同字段的数据框,我需要将它们留空,所以我将 URL 作为“myurl”传递给这个函数:
item_id=myurl[20:-5]
browser.get(myurl)
html = browser.page_source
soup = BeautifulSoup(html, 'lxml')
try:
titulo = soup.find('div', {'class':'sku-name'}).get_text(strip=True)
except:
titulo=""
然后从汤中读取每个字段 我在 python 中使用 chromedriver
非常感谢任何帮助!
【问题讨论】:
-
您能分享更多代码或网址吗?以便我们看到并提出建议。通过查看您的描述,很难找出问题所在。
-
当然,这是网址item.jd.com/4487398.html之一
-
这是与项目同时打开的登录URL:passport.jd.com/uc/…
标签: python selenium web-scraping