【发布时间】:2020-11-06 00:34:00
【问题描述】:
我是 python 新手,我正在尝试遍历 csv 文件中的 url 列表并使用 BeautifulSoup 抓取网站 title,然后我想将其保存到文件 Headlines.csv .但我无法抓取网页title。如果我使用带有单个 url 的变量,如下所示:
url = 'https://www.space.com/japan-hayabusa2-asteroid-samples-landing-date.html'
resp = req.get(url)
soup = BeautifulSoup(resp.text, 'lxml')
print(soup.title.text)
它工作得很好,我得到了标题Japanese capsule carrying pieces of asteroid Ryugu will land on Earth Dec. 6 | Space
但是当我使用循环时,
import csv
with open('urls_file2.csv', newline='', encoding='utf-8') as f:
reader = csv.reader(f)
for url in reader:
print(url)
resp = req.get(url)
soup = BeautifulSoup(resp.text, 'lxml')
print(soup.title.text)
我得到以下信息
['\ufeffhttps://www.foxnews.com/us/this-day-in-history-july-16']
还有一条错误消息
InvalidSchema: No connection adapters were found for "['\\ufeffhttps://www.foxnews.com/us/this-day-in-history-july-16']"
我不确定我做错了什么。
【问题讨论】:
标签: python loops csv url beautifulsoup