【发布时间】:2016-03-22 01:26:23
【问题描述】:
我想抓取一个有一些由 js 生成的内容的网站。 该站点每 5 秒运行一次 js 更新内容(请求新的加密 js 文件,无法解析)。
我的代码:
from selenium import webdriver
driver = webdriver.PhantomJS()
driver.set_window_size(1120, 550)
driver.get(url)
trs = driver.find_elements_by_css_selector('.table tbody tr')
print len(trs)
for tr in trs:
try:
items.append(tr.text)
except:
# because the js update content, so this tr is missing
pass
print len(items)
len(items) 与 len(trs) 不匹配。
我运行trs = driver.find_elements_by_css_selector('.table tbody tr')后如何告诉selenium停止执行js或停止工作?
我需要稍后使用trs,所以不能driver.quit()
异常详情:
---------------------------------------------------------------------------
StaleElementReferenceException Traceback (most recent call last)
<ipython-input-84-b80e3579efca> in <module>()
11 items = []
12 for tr in trs:
---> 13 items.append(tr.text)
14 #items.append(map_label(hidemyass_label, tr.find_elements_by_tag_name('td')))
15
C:\Python27\lib\site-packages\selenium\webdriver\remote\webelement.pyc in text(self)
69 def text(self):
70 """The text of the element."""
---> 71 return self._execute(Command.GET_ELEMENT_TEXT)['value']
72
73 def click(self):
C:\Python27\lib\site-packages\selenium\webdriver\remote\webelement.pyc in _execute(self, command, params)
452 params = {}
453 params['id'] = self._id
--> 454 return self._parent.execute(command, params)
455
456 def find_element(self, by=By.ID, value=None):
C:\Python27\lib\site-packages\selenium\webdriver\remote\webdriver.pyc in execute(self, driver_command, params)
199 response = self.command_executor.execute(driver_command, params)
200 if response:
--> 201 self.error_handler.check_response(response)
202 response['value'] = self._unwrap_value(
203 response.get('value', None))
C:\Python27\lib\site-packages\selenium\webdriver\remote\errorhandler.pyc in check_response(self, response)
179 elif exception_class == UnexpectedAlertPresentException and 'alert' in value:
180 raise exception_class(message, screen, stacktrace, value['alert'].get('text'))
--> 181 raise exception_class(message, screen, stacktrace)
182
183 def _value_or_default(self, obj, key, default):
StaleElementReferenceException: Message: {"errorMessage":"Element is no longer attached to the DOM","request":{"headers":{"Accept":"application/json","Accept-Encoding":"identity","Connection":"close","Content-Type":"application/json;charset=UTF-8","Host":"127.0.0.1:63305","User-Agent":"Python-urllib/2.7"},"httpVersion":"1.1","method":"GET","url":"/text","urlParsed":{"anchor":"","query":"","file":"text","directory":"/","path":"/text","relative":"/text","port":"","host":"","password":"","user":"","userInfo":"","authority":"","protocol":"","source":"/text","queryKey":{},"chunks":["text"]},"urlOriginal":"/session/4bb16340-a3b6-11e5-8ce5-9d0be40203a6/element/%3Awdc%3A1450243990539/text"}}
Screenshot: available via screen
显然 tr 丢失了。
PS:我需要使用 selenium 来选择元素。其他库如lxml、pyquery 不知道哪个元素是display:none,.text() 经常在<script> 中得到评论或其他内容,等等错误。可惜python没有完美的jquery克隆。
【问题讨论】:
-
您能否删除
try/except- 如果有的话,您会遇到什么错误? -
@alecxe 我已经粘贴了异常。
-
@Mithril 也许您可以尝试像
.find_elements_by_css_selector('.table tbody tr').text一样一次获取表格的整个文本,然后通过字符串操作存储tex。 -
@Mesut Güneş 例如我只是写代码,我需要在 tr 下操作一些 td,for 循环可能会花费几秒钟,然后 tr 丢失.....
标签: python selenium web-crawler