【问题标题】:Scraping ajax search engine with multiple pages in Python在 Python 中使用多个页面抓取 ajax 搜索引擎
【发布时间】:2016-01-19 16:06:33
【问题描述】:

我正在尝试废弃韩国专利局。但是,搜索引擎使用 ajax。我需要什么才能获得第一个结果?然后我将如何废弃后续页面? 假设我正在搜索关键字 TV 的专利。

这是我的起始代码。 任何提示都非常感谢

import urllib
import re


url = 'http://engpat.kipris.or.kr/engpat/searchLogina.do?next=MainSearch'
acct = open("results.txt", "w")
regex= '<title>(.+?)</title>'
pattern = re.compile(regex)
htmlfile = urllib.urlopen(url)
htmltext = htmlfile.read()
title= re.findall(pattern,htmltext)
acct.write(title)

谢谢!

【问题讨论】:

    标签: python ajax screen-scraping


    【解决方案1】:

    有很多方法可以做到这一点。我推荐的一种方法是使用Selenium 完成此任务,使用 XPath 抓取每个页面以选择下一个页面元素。查看 Selenium 文档以获取更多示例。正则表达式不是 html 抓取的方式...

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-05-12
      • 2013-04-29
      • 2022-11-12
      • 2018-09-25
      • 1970-01-01
      相关资源
      最近更新 更多