【发布时间】:2010-10-11 02:26:24
【问题描述】:
我正在尝试将 RSS 2.0 提要中的标题标签解析为该提要中每个条目的三个不同变量。使用 ElementTree,我已经解析了 RSS,以便我可以使用以下代码打印每个标题 [减去结尾的 )]:
feed = getfeed("http://www.tourfilter.com/dallas/rss/by_concert_date") for item in feed: print repr(item.title[0:-1])
我包含它是因为,如您所见,item.title 是一种 repr() 数据类型,我对此不太了解。
交互窗口中特定的repr(item.title[0:-1])printed 如下所示:
'randy travis (Billy Bobs 3/21' 'Michael Schenker Group (House of Blues Dallas 3/26'
用户选择了一个乐队,我希望在将每个 item.title 解析为 3 个变量(乐队、场地和日期各一个......或者可能是一个数组或者我不知道......)选择只有那些与所选乐队相关的人。然后将它们发送到 Google 进行地理编码,但这是另一回事。
我看过一些regex 的例子,我正在阅读它们,但它似乎非常复杂。是吗?我想也许这里有人会对如何以一种智能的方式做到这一点有一些见解。我应该使用re 模块吗?输出当前是repr()s 是否重要?有没有更好的办法?我在想我会使用像这样的循环(这是我的伪 Python,只是我正在写的一种笔记):
最后,我需要在 .csv(逗号分隔)文件中选择如下所示的条目:
band,venue,date,lat,long randy travis,Billy Bobs,3/21,1234.5678,1234.5678 Michael Schenker Group,House of Blues Dallas,3/26,4321.8765,4321.8765
我希望这不是太多要求。我会自己研究它,只是想我应该在这里发帖以确保它得到回答。
那么,问题是,我如何最好地将feed 中的每个repr(item.title[0:-1]) 解析为3 个单独的值,然后我可以将它们连接成一个.csv 文件?
【问题讨论】:
标签: python regex parsing text-parsing