【发布时间】:2020-08-26 15:47:59
【问题描述】:
我的问题很简单。我有一个带有 124957 条不同推文(与中心主题相关)的 pandas 数据框。问题是每个日期都有超过 1 条推文(每天大约 300 条)。
我的目标是对每天的推文进行情绪分析。为了解决这个问题,我试图将同一天的所有推文组合成一个字符串(对应于每个日期)。
为此,我尝试了以下方法:
indx=0
get_tweet=""
for i in range(0,len(cdata)-1):
get_date=cdata.date.iloc[i]
next_date=cdata.date.iloc[i+1]
if(str(get_date)==str(next_date)):
get_tweet=get_tweet+cdata.text.iloc[i]+" "
if(str(get_date)!=str(next_date)):
cdata.loc[indx,'date'] = get_date
cdata.loc[indx,'text'] = get_tweet
indx=indx+1
get_tweet=" "
df.to_csv("/home/development-pc/Documents/BTC_Tweets_1Y.csv")
我的问题是只有一小部分数据实际上被转换为我选择的格式。
我不知道它是否重要,但数据框由三个单独的数据集组成,我使用“pd.concat”将它们组合成一个。之后,我按日期(升序)对新创建的数据帧进行排序,并在索引反转时重置索引(最后一个输入(2020-01-03)= 0,第一个输入(2019-01-01)= 124958)。
提前致谢, 菲利普斯
【问题讨论】:
-
请provide a reproducible copy of the DataFrame with
to_clipboard。 Stack Overflow Discourages Screenshots。这个问题很可能会被否决。您不鼓励提供帮助,因为没有人愿意重新输入您的数据或代码,而且屏幕截图通常难以辨认。
标签: python pandas dataframe dataset