【发布时间】:2011-12-13 09:42:09
【问题描述】:
假设我有一段大约一段对话的文字记录。 1小时。我想知道哪些单词彼此非常接近。我将使用什么类型的统计技术来确定哪些词聚集在一起以及它们彼此之间的接近程度?
我怀疑某种聚类分析或 PCA。
【问题讨论】:
标签: algorithm text statistics cluster-analysis
假设我有一段大约一段对话的文字记录。 1小时。我想知道哪些单词彼此非常接近。我将使用什么类型的统计技术来确定哪些词聚集在一起以及它们彼此之间的接近程度?
我怀疑某种聚类分析或 PCA。
【问题讨论】:
标签: algorithm text statistics cluster-analysis
要确定单词的接近度,您必须构建一个图表:
所以“我喜欢狗”会有 2 个边和 3 个顶点。
现在,下一步将根据此模型确定您对“关闭”的定义是什么。
这就是统计数据的来源。
确定相关词的“组”
MCL 聚类 - 这将为您提供一些在算法上很有可能一起被看到的聚类。
K MEANS 聚类 - 这将为您提供“k”组单词。
阈值 - 这是最可靠和最直观的方法。绘制您理解的一小部分数据的所有关系(例如,您已阅读的新闻剪辑或文章中的一段)并运行您的方法以生成图形,并使用诸如 graphviz 或 cytoscape 之类的工具可视化图形.一旦您可以看到相关性,您就可以计算在明显聚集在一起的不同单词之间通常找到多少条边。例如,您可能会发现,聚集在一起的两个单词每 5 个实例就有一个优势。将其用作截止点并编写您自己的图形分析脚本,该脚本输出顶点图中每 5 个单词实例至少有 1 个边的单词对。
【讨论】: