【问题标题】:Finding location of company from website从网站查找公司位置
【发布时间】:2017-12-15 18:42:13
【问题描述】:

首先,感谢我几天前刚开始学习编码的帮助,非常感谢您的帮助!

所以基本上我有一个公司网址列表,并想找到它们的位置。我一直在考虑使用 urllib2 和 BeautifulSoup 从 url 中获取所有文本,然后搜索该文本以找到加利福尼亚、马萨诸塞州、纽约等,并将其打印出来,无论找到哪个我可以放入excel的文件。到目前为止,我已经编写了下面的代码,它给了我一组文本,但我不知道如何搜索它,如何使用多个 url 进行搜索,或者如何将该信息打印成 Excel 可读格式。

谢谢!

import urllib2
import re
from bs4 import BeautifulSoup


links = urllib2.urlopen('http://www.coolcomposites.com/')
html = links.read()
soup = BeautifulSoup(html, "html.parser")
locations = ["Boston", "MA"]
file_text = soup.get_text()
print (file_text)

【问题讨论】:

  • 我的回答有帮助吗?如果是,请投票并标记为答案,这样您的问题就可以结束了。快乐的编码,干杯伙伴:)

标签: excel python-2.7 beautifulsoup urllib2


【解决方案1】:

您需要遍历locations 列表并检查file_text 中是否存在每个条目。

for loc in locations:
  if loc in file_text:
    print ("Found location")
  else:
    print ("Location not found")

小心

1.大写

坚持使用locations 的一种表示形式。要么一切都是小写,要么大写,要么先大写,然后再小写等等。重点是,不要混淆它,因为上面的实现不区分大小写,所以MA != ma != Ma != mA

假设您为locations 选择小写,同时将file_text 转换为小写。

2。中点检测

locations 中,您包括MA。这也将在包含关于其位置的MA 的任何文本中被检测到。想办法解决这个问题。

【讨论】:

    猜你喜欢
    • 2010-12-22
    • 2017-10-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多