【问题标题】:Correlating word proximity关联词接近度
【发布时间】:2011-12-13 09:42:09
【问题描述】:

假设我有一段大约一段对话的文字记录。 1小时。我想知道哪些单词彼此非常接近。我将使用什么类型的统计技术来确定哪些词聚集在一起以及它们彼此之间的接近程度?

我怀疑某种聚类分析或 PCA。

【问题讨论】:

    标签: algorithm text statistics cluster-analysis


    【解决方案1】:

    要确定单词的接近度,您必须构建一个图表:

    1. 每个单词都是一个顶点(或“节点”),并且
    2. 左右词是边

    所以“我喜欢狗”会有 2 个边和 3 个顶点。

    现在,下一步将根据此模型确定您对“关闭”的定义是什么。

    这就是统计数据的来源。

    确定相关词的“组”

    1. MCL 聚类 - 这将为您提供一些在算法上很有可能一起被看到的聚类。

    2. K MEANS 聚类 - 这将为您提供“k”组单词。

    3. 阈值 - 这是最可靠和最直观的方法。绘制您理解的一小部分数据的所有关系(例如,您已阅读的新闻剪辑或文章中的一段)并运行您的方法以生成图形,并使用诸如 graphviz 或 cytoscape 之类的工具可视化图形.一旦您可以看到相关性,您就可以计算在明显聚集在一起的不同单词之间通常找到多少条边。例如,您可能会发现,聚集在一起的两个单词每 5 个实例就有一个优势。将其用作截止点并编写您自己的图形分析脚本,该脚本输出顶点图中每 5 个单词实例至少有 1 个边的单词对。

      1. 通过 ROC 曲线评估 3。你可以将你的截止值滴定得越来越高,直到你有很少的“集群”。如果您随后针对具有已知预期结果的段落运行算法(由已经知道应该将哪些单词报告为相关的人创建),您可以使用比较相关单词的接收器操作特征来评估算法的精度输出到预先计算的黄金标准。

    【讨论】:

    • 我鼓励编辑这篇文章...有一些错别字。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2011-06-28
    • 1970-01-01
    • 2017-08-17
    • 2012-11-30
    • 2013-06-09
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多