【问题标题】:Dataset interpretation Continuous vs Categorical for House Prices数据集解释房价的连续与分类
【发布时间】:2020-07-03 15:30:32
【问题描述】:

我正在使用英国房价数据集,并希望创建一个机器学习模型来根据城市(以及其他一些类别)预测房屋价格。

作为所有这一切的新手,我很难过。我可以创建具有连续变量的模型,甚至可以对具有 4 种不同选项(例如房屋类型)的其他一些类别执行 one-hot 编码(虚拟变量)。

但是,当涉及到城市时,数据集中大约有 1200 个不同的城市,所以我不知道如何设计数据来处理这个问题。

非常感谢任何对此有任何想法的人!

无论我搜索多少,我都找不到这个问题的答案,但这可能是因为不知道要搜索什么。

【问题讨论】:

    标签: pandas dataframe machine-learning linear-regression


    【解决方案1】:

    对我来说,你需要每个城市的城市等级和房子的价格。

    例如:

    Country     | City Grade 
    ------------+------------
    Los Angeles |    1
    New York    |    4
    
    House       | Price
    ------------+------------
    Option1     | $200,000
    Option2     | $300,000
    

    然后根据城市等级乘以房价*城市等级计算房价。

    所以这意味着洛杉矶的 Option1 房子仍然是 200,000 美元,但在纽约将是 1,200,000 美元。

    您不必担心在数据库中易于查询的 1200 个城市。

    【讨论】:

    • 嗨,金,谢谢你的帖子。不知道这是否对我有太大帮助。这是否意味着我需要通过每个城市并对其进行评分才能使用它?这里的目的是能够将所有这些信息放入一个模型中,然后能够使用该模型来预测单个房屋的价格。
    猜你喜欢
    • 1970-01-01
    • 2018-12-26
    • 2017-08-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多