【问题标题】:how can i use scrapy to extract link with some text matching我如何使用scrapy提取带有一些文本匹配的链接
【发布时间】:2012-12-14 03:33:30
【问题描述】:

我想关注那些在文本中有 Next 的链接,比如

<div id="pagination"
<a href="#" > 1 </a>
<a href="#" > 2 </a>
<a href="#" > 3 </a>
<a href="#" > Next </a>
</div>

我怎么能做到这一点?也是最后一个选择

【问题讨论】:

标签: python scrapy


【解决方案1】:

创建一个扩展BaseSgmlLinkExtractor 的类并提供process_value 可调用,如docs 所示

【讨论】:

  • 你能给我举例说明如何将它与我的数据一起使用。我不知道如何使用链接提取器
  • 是的,当然。我有一个小时左右的考试。几个小时后我可以告诉你。在此之前,您能否向我们展示您的尝试。在 SO,我们的用户更喜欢只回答那些提出问题的人已经尝试过解决方案并且面临具体问题的问题。您可以编辑您的问题并将其放入您尝试过的代码中。
  • 只需给我选择器以用于查找下一个链接。我无法弄清楚选择器。我现在已经为此使用了 beautifulSoup,但正在寻找一种简单的方法来找到它
  • 对于process_value,您需要一个与&lt;a href="#" &gt; Next &lt;/a&gt; 行匹配的正则表达式。尝试创建一个包含上述 HTML 的多行字符串,并在 Python 解释器中测试正则表达式。这个链接应该很有用:regular-expressions.info
猜你喜欢
  • 1970-01-01
  • 2015-03-01
  • 1970-01-01
  • 2015-02-28
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多