【发布时间】:2011-03-06 22:06:39
【问题描述】:
这里有点开放式问题,因为我主要是在寻找意见。因为我想搬家,所以我正在从 craigslist 中获取我所在地区的 apt 广告的一些数据。我的目标是能够比较项目以查看某些内容何时重复,这样我就不会整天都在看相同的 3 个广告。问题是他们稍微改变了一些东西以通过 CL 的过滤器。
我已经有一些正则表达式来查找要比较的地址和电话号码,但这不是最可靠的。有没有人熟悉一种简单的方法来比较整个文档并可能显示一些简单的东西,比如“80% 相似”?我暂时想不出任何东西,所以我怀疑我必须从头开始自己的解决方案,但我认为值得问问 stackoverflow 的集体天才:)
首选语言/方法是 python/php/perl,但如果这是一个很好的解决方案,我很开放。
更新:值得注意的一点是,由于我会将我所在地区(洛杉矶)的 apts 的 rss 提要的抓取数据存储在本地数据库中,因此首选方法包括将其与我的所有内容进行比较的方法目前知道。这可能会有点令人费解,因为随着帖子数量的增加,这可能会成为一个非常漫长的过程。
【问题讨论】: