【问题标题】:How would you use Markov chains to find characteristics of English text?您将如何使用马尔可夫链来查找英文文本的特征?
【发布时间】:2022-01-02 07:33:21
【问题描述】:

我正在开展一个项目,该项目涉及识别特定组中的文本特征。例如,假设有两组文本:一组包含发送给员工的电子邮件,另一组包含发送给老板的电子邮件。这样做的目的是探索在给您下方和上方的人写电子邮件时存在句法或单词选择的差异。我最初的方法是使用 k-means 聚类来识别语法序列和单词序列,它们 (1) 对每个组都是唯一的,并且 (2) 识别出更多的子组(这是成功的)。

但是,有人建议我使用马尔可夫链来分析个人的电子邮件写作习惯并识别每个组的个人电子邮件特征(他们说我应该达到相同的序列)。我以前从未使用过马尔可夫链,当我试图弄清楚这一点时,我很迷茫。马尔可夫链如何引导我找到句法或单词序列?这种事情有教程吗?非常感谢任何让我从这里开始的帮助和指导。

【问题讨论】:

    标签: statistics cluster-analysis markov-chains


    【解决方案1】:

    我认为你绝对应该看看Latent Dirichlet Allocation

    此方法允许捕获语料库中的主题分布。本文主要参考Thomas L. Griffiths and Mark Steyvers (2004)。如果你想要更多的动手材料,我建议你看看这个网站 (https://github.com/sekhansen),它提供了关于这个主题的很好的教程。

    【讨论】:

    • 谢谢,我看了一下,我的理解是,在聚类是基于潜在主题形成的意义上,它与聚类非常相似?
    猜你喜欢
    • 1970-01-01
    • 2016-03-29
    • 1970-01-01
    • 2018-03-24
    • 1970-01-01
    • 2023-03-31
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多