【发布时间】:2016-05-15 10:53:38
【问题描述】:
我有一个包含各种 url 的数据集。
https://www.thetrainline.com/buytickets/combinedmatrix.aspx?Command=TimeTable
https://wwf-fb.zyngawithfriends.com/wwf-fb.a84485c126e67ea2787c.html
http://www.thetrainline.com/destinations/trains-to-london
我想做一个url的语义分析(/之后的url中的关键字)。
请帮帮我。
谢谢
【问题讨论】:
-
在这种情况下什么是“语义分析”?哪个斜线?你尝试了什么?
-
就像在第三个 url 中一样,我需要从 url 中提取目的地和到伦敦的火车。我对正则表达式的概念不是很熟悉。
-
/后面的意思是指 URL 的路径吗? -
类似的东西?
gsub('^(?:[^/]*/){3}','/', 'http://www.thetrainline.com/destinations/trains-to-london') -
是的。但它可以推广到所有 url 吗?
标签: r semantics text-analysis