【发布时间】:2016-03-21 05:18:57
【问题描述】:
import lxml
from lxml import html
import requests
import re
import csv
with open('job.csv', 'wb') as csvfile:
a=csv.writer(csvfile)
a.writerow(["title","employer","salary","location"])
for i in range(1):
url = "http://www.jobs-salary.com/salaries.php?q=illumina&ml=25&lc=&state=&company=&title=&sb=relevance&ps={}".format(i)
page = requests.get(url)
# print page.text
tree = html.fromstring(page.content)
for item in tree.xpath('//table[@class="resTb"]'):
# print tree.xpath('//table[@class="resTb"]//td/b/a/text()')
info = {}
info['title']=item.xpath('.//td/b/a/text()')
h = info['title']
print h
我得到的输出是
['Scientist I', 'Scientist', 'Scientist', 'Scientist', 'Biochemist', 'Scientist I', 'Biochemist', 'Scientist I', 'Scientist I', 'Biomedical Engineer', 'Biochemist', 'Fluidics Engineer', 'Biochemist And Biophysicists', 'Scientist I', 'Scientist I', 'Scientist', 'Scientist', 'Scientist I', 'Scientist I', 'Scientist II']
但我希望它是垂直的,没有括号和逗号 谁能帮忙?
【问题讨论】:
标签: python csv xpath screen-scraping