【发布时间】:2017-01-06 04:08:48
【问题描述】:
我的数据如下,
data['url']
http://hostname.com/aaa/uploads/2013/11/a-b-c-d.jpg https://www.aaa.com/
http://hostname.com/bbb/uploads/2013/11/e-f-g-h.gif https://www.aaa.com/
http://hostname.com/ccc/uploads/2013/11/e-f-g-h.png http://hostname.com/ccc/uploads/2013/11/a-a-a-a.html
http://hostname.com/ddd/uploads/2013/11/w-e-r-t.ico
http://hostname.com/ddd/uploads/2013/11/r-t-y-u.aspx https://www.aaa.com/
http://hostname.com/bbb/uploads/2013/11/t-r-w-q.jpeg https://www.aaa.com/
我想找出 .jpg、.gif、.png、.ico、.aspx、.html、.jpeg 等格式并向后解析,直到找到“/”。我还想检查整个字符串中是否出现了几次。我的输出应该是,
data['parsed']
a-b-c-d
e-f-g-h
e-f-g-h a-a-a-a
w-e-r-t
r-t-y-u
t-r-w-q
我在想,不是为每种格式编写单独的命令,而是有一种方法可以在单个命令下编写所有内容。
谁能帮我写这些命令?我是正则表达式的新手,任何帮助将不胜感激。
【问题讨论】:
-
必须用正则表达式完成吗?
urlparse(如可能的重复项中所述)出色地完成了这项工作。 -
@JIm 是的。我有几个这样的条件,并且 URL 的结构不足以通过 urlparse 进行解析
标签: python regex python-2.7 python-3.x regex-negation