【问题标题】:Nltk Word Tokenizer in python notebookpython笔记本中的Nltk Word Tokenizer
【发布时间】:2018-12-18 19:02:12
【问题描述】:

我试图在每行由多行字符串组成的数据框中找到常用词。

from nltk.tokenize import word_tokenize
from nltk.tokenize import sent_tokenize
tokens = [word for sent in nltk.sent_tokenize(df['file_data'].to_string()) for 
         word in nltk.word_tokenize(sent)]

Most common word

在这里,(...) 是最常用的词,但实际上它不会出现在任何行中。 默认情况下,笔记本上的多行打印 (...) 表示延续。 但是,问题是 nltk 将 (...) 视为单词并以此结尾。 它跳过字符串中的剩余单词。 请让我知道我在哪里失踪,提前谢谢。

【问题讨论】:

    标签: python jupyter-notebook nltk google-colaboratory


    【解决方案1】:

    在我看来,这不是to_string() 的预期用途,据我所知,这意味着控制台友好的输出(尽管我可能错了)。 怎么样:

    from nltk.tokenize import word_tokenize
    from nltk.tokenize import sent_tokenize
    tokens = [word for row in df['file_data'].apply(nltk.sent_tokenize).values for sent in row for 
             word in nltk.word_tokenize(sent)]
    

    如果您发布我可以检查的数据的简短示例,我不确定这是否会按预期工作。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-12-01
      • 2020-11-21
      • 2013-05-20
      • 2016-06-18
      • 2020-04-22
      相关资源
      最近更新 更多