【发布时间】:2014-09-01 05:08:15
【问题描述】:
我正在尝试阅读一个长文本,并将该文本分成它包含的每个单词。我所做的第一次尝试是使用std::ifstream 和operator>> 从文件中读取它以读入字符串。问题是,因为它只剪切空白字符上的文本,我仍然会在短语的最后一个单词处得到句点(如problem.)和一些没有任何意义的特殊字符串(有时我有-> 或@987654325 @)。
我想逐个字符地读取字符,或者也将读取字符的字符串拆分成字符,并找到删除不在正确范围内的字符(介于 az、AZ 和 0-9 之间的字符),但这个解决方案似乎很乱。另外,由于我使用的是 GCC 4.8.3 并且无法使用 Boost,因此我无法使用正则表达式。
是否有比第二个更好的解决方案,或者这是好方法?好的我的意思是相对容易实现并产生预期的结果(只有字母数字字符)。
【问题讨论】: