此次记录为对现阶段工作的总结和下一阶段工作展开的简单设计 --写于2019.7.15 14:30

主题时间窗口的动态划分

1.现阶段采用方法流程

1.1数据集预处理
原始数据集为关于九寨沟地震的微博文本数据,包括微博ID,链接,发文时间,文本内容等。
自然灾害舆情的动态窗口主题划分1.0
利用textrank4zh和_future_进行分词,去除微博ID,链接等无关因素,取出每个微博文本的关键词,若超过十个则仅保留前十个。同时保留文本发文时间。
自然灾害舆情的动态窗口主题划分1.01.2比较文本相似度及文本词汇向量化
文本相似度
设计有函数compareTexts和compareText分别计算窗口间文本相似度和窗口内文本相似度,采用余弦相似度的方法计算相似度。
词汇向量化
利用TfidfVectorizer对关键词进行向量化操作,以实行后续的聚类

1.3窗口的动态划分
1.3.1预先设定最小窗口长度单位和相似度指标
设定窗口最小长度单位time-div,也是窗口在动态调整过程中最小扩大或缩小的单位长度,单位为秒。设定相似度指标score,score=窗口内相似度-0.7窗口间相似度+1。

1.3.2扩大窗口
令窗口变化量time为time-div,窗口初始大小为0
令窗口扩大,增量为time,计算此时窗口整体相似度TotalScore
若TotalScore>score且窗口内文本数量>100 则退出循环 否则time加倍
直到数据集全部处理完

1.3.2缩小窗口
令变化量time减半
当TotalScore与score误差在0.0005时退出循环
若TotalScore过大,则缩小窗口,变化量为time
若TotalScore过小,则增大窗口,变化量为time
更新窗口相似度和文本数量
保证窗口内文本数量不小于100 否则调用扩大窗口函数
直到变化量time为一个单位

1.4聚类得到主题词
通过K-Means算法对划分出的每个窗口文本进行聚类,设定K值为4,输出离每个聚类中心点最近的10个关键词 。

1.5输出结果
输出保存每个动态窗口的起止时间,窗口大小,窗口内文本数量及主题词
自然灾害舆情的动态窗口主题划分1.0自然灾害舆情的动态窗口主题划分1.0

2.结果分析

2.1.1结果的周期性
对于自然灾害的网络舆情来讲,往往事件一发生即达到高峰,热度随着时间推移逐渐降低,因此整体来看窗口的动态划分初期应该细且密,后期窗口长度逐渐变大。另外从微博用户的作息来看,白天用户比较活跃,半夜绝大多数用户都在休息,因此晚上的时间划分要比白天大。对照结果来看符合其规律。
自然灾害舆情的动态窗口主题划分1.0自然灾害舆情的动态窗口主题划分1.0
2.1.2主题词的变化分析
主题词集中程度很高,文本数量往往集中在一个或两个聚类中。另外,不同窗口间主题词的确存在变化,或多或少,但整体来看各窗口主题仍然符合事件主题。
自然灾害舆情的动态窗口主题划分1.0
2.1.3更改参数的结果对比
令score=1.24不变
当time-div=600时,窗口划分如图
自然灾害舆情的动态窗口主题划分1.0

当time-div=300时,窗口划分如图
自然灾害舆情的动态窗口主题划分1.0
根据两份结果来看,在参数socre不变的情况下,改变时间参数得到的窗口划分区别很小,故设想可以取消时间参数的人为设定,改为固定值。此时将时间参数改为900即15min做猜想验证,发现存在划定的窗口内仅2条文本无法进行聚类的情况(k=4)这显然是不合理的,故增加了划定窗口时文本数量不得小于100的条件
改进后结果如图
自然灾害舆情的动态窗口主题划分1.0窗口划分差别很大,计划破产,认为time-div值仍需自行设定。

3. 存在的问题

3.1缺少评价标准。无法精确验证得出结果的合理程度,不能良好进行对比实验。
3.2运用方法的不确定。目前使用的聚类方法KM方法存在k值难以确定的问题,可能对结果造成明显影响。同时使用的计算相似度的方法余弦相似度的在此处的性能也有待考察。
3.3预设值的主观性。当前设定的预设值score及time-div全部带有很强的主观星,且score=窗口内相似度-0.7窗口间相似度+1的设定缺乏理论依据。
3.4预处理过程的不足。当前仅对原始数据集进行了分词的处理,在很大程度上缺失了预处理部分。
3.5创新性的不足。核心功能,思想及使用技术上与《基于动态主题模型的时间窗口划分研究》一文重合度较高。
3.6电脑性能的限制。电脑性能的不足导致无法做充足的对比实验,比如无法提高score的值,否则电脑将死机。

4.下阶段计划

4.1增大文献的阅读量和面。寻找合理的评价标准,预定值设定标准,加强创新点。
4.2改变使用的方法。寻找其他聚类方法,避免k值确定的问题。尝试其他相似度计算的方法做对比实验。
4.3加强预处理。对原始数据集进行清洗,比如去除文本带有的标签等。
4.4考虑文本聚类与时序的结合,考虑数据集中周期性的发掘和利用。

相关文章:

  • 2022-01-12
  • 2021-07-11
  • 2022-12-23
  • 2021-06-05
  • 2021-12-23
  • 2022-12-23
猜你喜欢
  • 2021-12-25
  • 2022-02-06
  • 2021-11-08
  • 2021-04-11
  • 2021-05-08
  • 2021-11-25
相关资源
相似解决方案