【发布时间】:2020-06-09 06:42:58
【问题描述】:
我对scrapy 和Python 还是很陌生。我正在制作一个网络抓取工具,试图从他们网站的 HTML 文本中抓取企业主的姓名。我的问题是我不能完全使用 xpath 或 css 响应从网站代码中获取文本,因为我正在抓取数百个具有不同编码、类、页面等的不同网站。这是我到目前为止所拥有的:
html_text = str(response.text)
owner_name=re.findall("owner", html_text)
if owner_name:
print("OWNER FOUND @ " + str(response.url))
显然,所有这一切确实是让我知道程序是否找到了提及所有者的页面。我不太确定如何从 html 代码中抓取他们的名字。我假设他们的名字会立即跟随在 HTML 中提到所有者的任何地方,所以我实际上是在尝试在所有者一词之后刮下一个或两个词。
【问题讨论】:
-
嗨,欢迎来到 SO,请提供最小的可重现示例stackoverflow.com/help/minimal-reproducible-example
标签: python web-scraping scrapy