【发布时间】:2022-01-02 07:33:21
【问题描述】:
我正在开展一个项目,该项目涉及识别特定组中的文本特征。例如,假设有两组文本:一组包含发送给员工的电子邮件,另一组包含发送给老板的电子邮件。这样做的目的是探索在给您下方和上方的人写电子邮件时存在句法或单词选择的差异。我最初的方法是使用 k-means 聚类来识别语法序列和单词序列,它们 (1) 对每个组都是唯一的,并且 (2) 识别出更多的子组(这是成功的)。
但是,有人建议我使用马尔可夫链来分析个人的电子邮件写作习惯并识别每个组的个人电子邮件特征(他们说我应该达到相同的序列)。我以前从未使用过马尔可夫链,当我试图弄清楚这一点时,我很迷茫。马尔可夫链如何引导我找到句法或单词序列?这种事情有教程吗?非常感谢任何让我从这里开始的帮助和指导。
【问题讨论】:
标签: statistics cluster-analysis markov-chains