【问题标题】:Which string metric or NLP algorithm is should I use to find substring in different URLs我应该使用哪种字符串度量或 NLP 算法来查找不同 URL 中的子字符串
【发布时间】:2020-04-30 11:59:04
【问题描述】:

我正在尝试查找具有用户提供的关键字的 URL。

Eg. Keyword - 'Avengers' 
#URL1: www.xyzmovies.com/Avengers_2019/243564
#URL2: www.avengers.org/4r43435
#URL3: www.abcmovies.co/23543/avenngers_34435/walt/marvel/comics

难点在于网址没有单一的标准,关键字可以出现在网址中的任何位置。需要捕获也有拼写错误的 url。

哪种算法最适合在 python 中完成这项任务。

【问题讨论】:

  • 该任务似乎适合在 python 中使用带有re 的正则表达式。
  • 拼写错误有多严重?
  • 'avengers' in url是检查'avengers'是否在url中的测试。

标签: python string url


【解决方案1】:

如果我理解正确,您可以使用

"keyword".lower() in url.lower()

如果关键字在 URL 中,则返回 True,否则返回 False。 .lower() 确保结果不区分大小写。为了解决拼写错误,我会查看 stringgrouperfuzzywuzzy 库。 Fuzzywuzzy 的部分比率非常适合这一点,因为它专门查看部分字符串匹配,因此您的关键字“Avengers”将被视为与 URL1 的完美匹配,而“Avnegers”可能仍会获得高分。

【讨论】:

    猜你喜欢
    • 2015-03-12
    • 2016-06-28
    • 1970-01-01
    • 2017-07-12
    • 1970-01-01
    • 2012-10-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多