【问题标题】:How to extract words from a text using python?如何使用python从文本中提取单词?
【发布时间】:2013-03-11 07:34:44
【问题描述】:

我需要提取文本中的单词和短语。比如文字是:

Привет, hello, как дела? english word, еще одно русское слово, слово-1224, тест 4456

并且脚本应该返回以下内容:

Привет
как
дела
еще
одно
русское
слово
слово-1224

也就是说,我需要从文本中提取所有以俄文字母([а-яА-Яё-])开头的单词,并且可以包含俄文字母的数字和字母。这是如何实现的?

【问题讨论】:

  • 我想你在谈论这个,stackoverflow.com/questions/5717886/…问候。
  • 这是一个使用正则表达式的简单任务。只需阅读它们的工作原理:)
  • 你的某些词中间有一个“-”,但你没有在问题中提及。

标签: python split words


【解决方案1】:

这比我想象的要复杂一些。从未使用过西里尔字符。我确实认为应该这样做:

text =  # Set you're input unicode string here.
words = re.findall('[\p{IsCyrillic}][0-9\p{IsCyrillic}]+', text)

for word in words:
    print word

【讨论】:

    猜你喜欢
    • 2014-09-20
    • 1970-01-01
    • 2013-06-23
    • 2015-10-28
    • 2017-04-17
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多