【发布时间】:2017-05-15 03:19:16
【问题描述】:
我正在从 http://www.sfma.org.sg/member/info/a-linkz-marketing-pte-ltd 等网站抓取公司资料信息
我想要从公司名称到网站的内容,然后是类别内容。我写了一些代码,但它返回 None 类型错误。
谁能帮忙看看代码,看看哪里出了问题?非常感谢。
import sys
import csv
import urllib
import requests
from bs4 import BeautifulSoup
import time
import datetime
from random import randint
import numpy as np
import pandas as pd
fi = open('Input_List.csv', 'r')
#readers = list(csv.reader(fi))
readers=csv.reader(fi)
#print(readers)
df = []
for reader in readers:
#print(str(reader)[1:-1]+"\n")
url=str(reader)[2:-2]
request = requests.session()
htmlpage = requests.get(url)
#print("status code: "+ str(htmlpage.status_code))
if htmlpage.status_code != 200 :
break # something went wrong #
soup = BeautifulSoup(htmlpage.text,'lxml')
for result_table in soup.**findall**("div", {"class": "w3-container"}):
#content=result_table.find('p')
#print(result_table)
content=result_table.text
if(content.find("Website") > -1):
index=content.find("Website")
content=content[:content.find("\n",index)]
#print(content)
df=np.append(df,content)
break
#print(content)
df=np.append(df,str(content))
#print(df)
df1 = pd.DataFrame(df)
df1.to_csv("SFMA.csv",index=False,encoding='utf-8')
# #df.savetxt("SFMA.csv", index=False,encoding='utf-8')
# #df.save("SFMA.csv")
fi.close()
【问题讨论】:
标签: html python-3.x beautifulsoup web-crawler