【发布时间】:2013-11-18 05:48:41
【问题描述】:
我有一个 html 文件,其中包含不同的团队名称。我只是想抓住球队的名字。团队名称总是出现在某些文本之后并在某些文本之前结束,所以我已经拆分函数来查找团队名称。我是一个初学者,我确信我比现在更难。数据就是文件
teams = data.split('team-away">')[1].split("</sp")[0]
for team in teams:
print team
这将返回它找到的第一个团队的每个单独的字符(例如,如果团队 = San Francisco 49ers,它会打印“S”,然后是“A”等,而不是我需要它做的事情:打印“旧金山 49 人队”然后在下一行下一个球队“卡罗来纳黑豹队”等。
谢谢!
【问题讨论】:
-
解析 HTML。不要将其作为字符串使用。
-
是的,我想知道多久有人链接到“小马托尼”。 OP 确实声明“我有一个 html 文件......团队名称总是出现在某些文本之后并在某些文本之前结束”假设 @sdeep27 正确描述了问题(除了他自己知道),那么纯文本搜索工作 100 %(当然,不是最佳实践)。
标签: python web-scraping