【发布时间】:2011-09-28 15:48:47
【问题描述】:
我正在尝试创建一个包含 URL 列表的 CSV 文件。
我对编程很陌生,所以请原谅任何草率的代码。
我有一个循环遍历一个地方列表以获取 URL 列表。
然后我在该循环中有一个循环,将数据导出到 CSV 文件。
import urllib, csv, re
from BeautifulSoup import BeautifulSoup
list_of_URLs = csv.reader(open("file_location_for_URLs_to_parse"))
for row in list_of_URLs:
row_string = "".join(row)
file = urllib.urlopen(row_string)
page_HTML = file.read()
soup = BeautifulSoup(page_HTML) # parsing HTML
Thumbnail_image = soup.findAll("div", {"class": "remositorythumbnail"})
Thumbnail_image_string = str(Thumbnail_image)
soup_3 = BeautifulSoup(Thumbnail_image_string)
Thumbnail_image_URL = soup_3.findAll('a', attrs={'href': re.compile("^http://")})
这是不适合我的部分:
out = csv.writer(open("file_location", "wb"), delimiter=";")
for tag in soup_3.findAll('a', href=True):
out.writerow(tag['href'])
基本上,作者会不断地重写自己,有没有办法跳到 CSV 上的第一个空行下方并开始写作?
【问题讨论】:
-
由于空格在 Python 中非常很重要,请将您的代码重新格式化为可执行文件。
-
@Constantinius 谢谢,我已经编辑了代码,如果你是这个意思,请告诉我,为什么空格在 Python 中如此重要?
-
@Mark 如果您仍然想知道空格这里是一个链接 - secnetix.de/olli/Python/block_indentation.hawk 基本上缩进表示 Python 中函数和语句的开始和结束