-
基于三支决策的多粒度文本情感分类模型–张越兵、苗夺谦、 张志飞、
中文语料库选用谭松波在携程(http://www.ctrip.com)上采集的酒店评论ChnSentiCorp-Htl-ba-600,其中包括正、负极性的酒店评论各3000篇,总共6000篇。
数据网址:http://www.searchforum.org.cn/tansongbo/corpus -
基于文本挖掘的网络直播评论情感分析-陈彩蓉 窦倩
爬取了20个直播间共30000条数据,采集数据的维度选择了昵称、ID、评论内容和房间号等四个维度。对于无效评论的处理主要利用Excel的自定义排序、筛选等功能进行批量删除,初步整理出用户评论语料库,共包含22000条用户评论数据。 -
面向电子商务的评论文本情感分析研究-刘贤友
选取了四个文本库,分别包含1770,902,1307,1027个文本数量,总共为5006个。 -
中文短文本的情感分析–袁丁
数据集A为只包含正负两个情感极性的微博文本数据,并且微博的话题比较单一,数据集规模比较小,共计2000条微博文本数据,其中1800条作为训练集,200条作为发展集。数据集B也是只包含正负两个情感极性的微博文本数据,但是话题数较多,共计5000条微博文本数据,其中4500条作为训练集,500条作为发展集。
-
中文短文本情感倾向性分析研究–宋静静
实验采用 2011 年 7 月 11 日至 7 月 22 日期间新浪微博热门话题数据集,共包含 968 个热门话题,其中每个话题约有 1000 条左右的微博。虽然有968000条数据,很多,但是有话题分割,相当于一个话题还是1000条左右。 -
基于支持向量机的文本情感分析研究–韩开旭
实验数据也不多,5513条英文和3520条中文。 -
基于文本分类的商品评价情感分析–钟将
最终训练集中有 354 篇好评,357 篇差评, 测试集中好评和差评均为 533 篇,总共1777条数据。 -
面向产品评论的情感文本分类研究–马那那
实验使用的数据集为酒店、电脑、书籍评论语料,其中酒店语料中正负类别各2000篇文本,电脑与书籍评论语料中正负类别各500篇。从单类来看最多4000条数据,最少1000条数据。实验使用的数据集分别为谭松波整理的酒店语料,正负类别各2000篇文本;京东电脑评论语料,正负类别各500篇。