【发布时间】:2016-08-02 19:15:56
【问题描述】:
我正在做一个临床文本分类项目。在我的语料库中,数据已经用代码标记(例如:768.2、V13.02、V13.09、599.0 ...)。我已经将文本和标签分开,然后使用嵌入文字的文本。我将把它们输入卷积神经网络。但是,标签需要编码,我阅读了情感文本分类和 mnist 的示例,但它们都使用整数来对数据进行分类,我的标签为文本形式,这说明为什么我不能像它们一样使用 one-hot 编码。任何人都可以建议任何方法吗? 谢谢
【问题讨论】:
-
您可以对离散标签使用 one-hot 编码。例如,对于标签“Yes”、“No”和“Maybe”,您可以分配“No=0”、“Yes=1”、“Maybe=2”,然后将其编码为多个二进制/连续标签。
-
感谢 Mephy,我的文本数据按 45 个标签分类。有些文本可能同时有两个标签。
标签: python encoding tensorflow text-classification