【发布时间】:2016-10-03 05:01:28
【问题描述】:
我有一些波斯语文本文件。每个文件包含很多句子,每个句子都换行。每个句子前面都有一个制表符,然后是一个单词,然后是一个制表符,然后是一个英文单词。这些英文单词在一些文件中是 2,在一些是 3,在一些是 5,在其他一些中,或多或少。实际上,它们显示句子类。我必须分别计算每个班级的总单词(只计算句子的单词而不是它们之后的单词)。为此,我必须将文件更改为列表,以便我可以实现句子。现在的问题是,我应该如何编写它分别返回每个类的总单词的代码。下面是例句。
corpus = []
def CountWords (file):
with open (file, encoding = "utf-8") as f1:
for line in f1:
t = line.strip().split("\t")
corpus.append(t)
for row in corpus:
if row[2] != row[2]:
现在我不知道如何继续。如果有人可以提供帮助,我将不胜感激。 (我没有编程背景)。
【问题讨论】:
-
我不太清楚你面临什么问题,但你可以使用很棒的
collections.Counter数据结构来计算文件中的元素。 -
班上的话是什么意思?一个例子?
-
比如“激情”类有多少个词,“咸”类有多少个词。