【发布时间】:2011-01-13 16:38:02
【问题描述】:
我正在尝试创建一个脚本来查看字符串文件列表并报告它们之间最常见的子字符串。
例如:
- 你好,我是一号线。我喜欢苹果和橘子。我们在这里都是字符串。
- 你好,我是二号线。我喜欢苹果和橘子。我们在这里都是字符串。
- 你好,我是三号线。我喜欢苹果和橘子。我们在这里都是字符串。
- 你好,我是第四组。我喜欢苹果和橘子。我喜欢表达我的个性。
我希望脚本告诉我字符串之间的共同元素是什么,超过某个阈值(例如,5 个字符)。
理想情况下我会被告知
- “我喜欢苹果和橙子”出现在所有文件中
- “你好,我是字符串”出现在所有文件中
- “We are all strings here”出现在三个文件中。
如果在我熟悉的技术(SQL、Javascript、PHP、Ruby 或 Bash)中存在执行此操作的函数,我会非常高兴...
非常感谢,
杰克
【问题讨论】:
-
这个问题密切相关,有很多相关答案:stackoverflow.com/questions/1410822/…
标签: string grep substring text-comparison