【发布时间】:2017-08-25 11:37:38
【问题描述】:
大纲: 我想知道如何将新输入的非数字数据保持为唯一!
描述: 也就是说,当我们完成训练和测试期间,将数值和非数值数据联合输入到我的模型中的大量新数据。
问题(1): 因此,第一个重要的事情是将这些新的混合数据转换为全数字格式的数据框!
尝试过的方法:
我们怎样才能做到这一点?我使用 LabelEncoder 将每个非数字数据转换为浮点类型,但是 SCIKIT-LEARN 的成员反馈我 LabelEncoder 仅适用于 Label[Y],我应该使用 OneHotEncoder 转换特征。 [他在网址回复我:https://github.com/scikit-learn/scikit-learn/issues/8674],同时误解了我的意思
不幸的是,OneHotEncoder 仅适用于 SCIKIT-LEARN 官方文档在 p.1829 中所述的整数功能。
我知道有一个标题是关于“具有异构数据源的特征联合”,虽然它不像 LabelEncoder 那样方便。 问题(2): 这个问题让我感到困惑的第二个原因与我们如何确保输入的新非数值数据可以转换为不同于先前转换的训练数据或先前转换的测试数据的唯一值有关。即,虽然我们可以使用 LabelEncoder 将新的输入数据转换为数值数据,但存在转换后的数据[在新的输入数据中的产量]可能等于转换后的数据[在之前的转换后的数据中]的风险
提前感谢您的帮助
【问题讨论】:
-
两个问题:(1)我们如何将混合数据(字符串和数字)转换为数字数据; (2)我们如何确保新输入的混合数据(字符串和数字)可以转换为唯一的数字数据,这与之前转换的数据(训练数据和测试数据)不同
标签: python machine-learning scikit-learn