【问题标题】:Reconstruct news texts from Keras' reuters dataset从 Keras 的路透社数据集中重建新闻文本
【发布时间】:2018-04-02 14:56:17
【问题描述】:

我似乎无法理解 Keras 的路透社数据集提供的数据集。

集合是这样加载的:

(x_train, y_train), (x_test, y_test) = reuters.load_data()

据我所知,“x”数组是新闻报道中单词索引的序列(列表)数组,而“y”数组是这些序列主题的数组。

但是当我尝试使用提供的字典将其中一个序列的单词索引翻译成实际单词时:

wordDict = {y:x for x,y in reuters.get_word_index().items()}  
for index in x_train[0]:
    print (wordDict.get(index))

这个顺序似乎没有意义。如何将序列转回原始新闻?

编辑: 找到了一个类似的线程here。似乎字典中的索引与数据集中的单词索引不匹配存在问题。但是重新下载数据并不能解决我的问题。

【问题讨论】:

标签: python-3.x data-structures dataset keras reuters


【解决方案1】:

load_data 参数“index_from”的默认值允许实际单词的索引>3。 可以使用wordDict.get(index - 3)重构文本。

【讨论】:

    猜你喜欢
    • 2017-12-21
    • 2019-04-06
    • 2011-09-03
    • 2021-11-13
    • 2012-01-01
    • 1970-01-01
    • 2020-06-25
    • 1970-01-01
    • 2017-08-06
    相关资源
    最近更新 更多