【发布时间】:2020-10-30 00:26:24
【问题描述】:
我正在构建一个模型来预测纽约街头的行人伤亡情况,该模型来自 data set 的 170 万条记录。我决定从ON STREET NAME 列中构建虚拟功能,以查看可能提供的预测能力。这样,我就有大约 7500 个特征。
我尝试运行它,但我立即收到 Jupyter 内核死亡的警报。再试一次,同样的事情发生了。考虑到模型拟合需要多长时间以及计算机运行的热度,当我尝试拟合 100 个特征时,我只能假设 LogisticRegression() 不适合处理这样的特征集。
两个问题:
- 是这样吗,逻辑回归是否意味着处理较小的特征集?
- 是否有某种方法可以缓解这种情况,并对此类特征集应用逻辑回归模型?
【问题讨论】:
标签: python memory scikit-learn complexity-theory logistic-regression