【问题标题】:Clustering or recommender?聚类还是推荐?
【发布时间】:2015-12-19 05:46:07
【问题描述】:

我目前正在研究基于大量数据的匹配算法的概念。这是我的第一次。

是这样的:

  • 我们有 X 个“房屋”类型的对象,具有大小、位置等特征
  • 我们有人在找房子,他们的搜索包括大小、位置等

=> 我们希望根据人们的偏好(大小、位置……)为他们匹配房屋

有什么更好的方法?

1) 对所有房屋进行聚类并检查该人(想要购买的人)属于哪个聚类(匹配具有相同特征值(如大小和位置)的人/房屋) 2) 建立一个推荐器,这也需要许多过去在我们的 HDSF 中买过房子的人

使用哪种技术堆栈来获得更好的方法?

我目前正在考虑:Hadoop/Hive(存储)- Sqoop(将数据放入存储)- Mahout(分析)

非常感谢您的帮助!提前致谢!

【问题讨论】:

    标签: hadoop cluster-analysis mahout mahout-recommender


    【解决方案1】:

    我建议,基于您还没有用户匹配房屋的事实,最好的方法是使用集群,一旦您拥有一致的集群,就为每个集群分配一个类,从而减少分类一的问题。

    关于堆栈,很大程度上取决于个人喜好以及可用的硬件。

    【讨论】:

    • 感谢您的回答。您是否也知道如何使其实时?所以如果用户访问网站,我可以实时计算集群并告诉他哪些房子符合他的需求?
    • 一旦将类标签分配给集群,它就被简化为分类任务,如前所述。然后,您只需在数据集上训练一个分类器模型(同样,聚类也可以)。对于每个到达的用户,通过偏好询问提取用于房屋的相同特征。然后,使用您训练的模型对他进行分类。
    猜你喜欢
    • 1970-01-01
    • 2019-05-16
    • 2017-03-16
    • 2012-07-30
    • 2019-04-14
    • 1970-01-01
    • 2013-05-26
    • 2011-06-02
    • 1970-01-01
    相关资源
    最近更新 更多