【发布时间】:2014-12-03 02:20:10
【问题描述】:
我还没有找到一个简单的方法来做到这一点,我一直在关注this 我写了以下内容,
##just comments before this
import lxml,requests
23 page = requests.get('https://finalexams.rutgers.edu.html')
24
25 tree = html.fromstring(page.text)
26
27 tableRow = tree.xpath('//tr/text() ' )
28
29 print 'Rows' , tableRow
该脚本需要解析这些表格行并取出其中的内容,但可能存在无限数量的表格行。我不知道如何访问嵌套标签,而且它们没有唯一的名称或 ID 供我查找。
如何编写一个 for 循环来获取这些表中的每一行并让我获取它们的各个位?
<tr>
<td> 04264</td>
<td>01:198:205</td>
<td>01</td>
<td>INTR DISCRET STRCT I</td>
<td>C</td>
<td>Dec 17, 2014: 8:00 AM - 11:00 AM </td>
</tr>
<tr>
<td> 09907</td>
<td>01:198:214</td>
<td>01</td>
<td>SYSTEMS PROGRAMMING</td>
<td>C</td>
<td>Dec 18, 2014: 8:00 PM - 11:00 PM </td>
</tr>
【问题讨论】:
-
tree = html.fromstring(page.text)不能与import lxml一起使用;你在某处做了from lxml import html吗?
标签: python html web-scraping lxml