【发布时间】:2016-01-19 16:06:33
【问题描述】:
我正在尝试废弃韩国专利局。但是,搜索引擎使用 ajax。我需要什么才能获得第一个结果?然后我将如何废弃后续页面? 假设我正在搜索关键字 TV 的专利。
这是我的起始代码。 任何提示都非常感谢
import urllib
import re
url = 'http://engpat.kipris.or.kr/engpat/searchLogina.do?next=MainSearch'
acct = open("results.txt", "w")
regex= '<title>(.+?)</title>'
pattern = re.compile(regex)
htmlfile = urllib.urlopen(url)
htmltext = htmlfile.read()
title= re.findall(pattern,htmltext)
acct.write(title)
谢谢!
【问题讨论】:
标签: python ajax screen-scraping