【发布时间】:2017-07-27 16:06:19
【问题描述】:
目前我有一个包含大约 600,000 条记录的数据库,代表商品的类别信息如下所示:
{'title': 'Canon camera', 'category': 'Camera'},
{'title': 'Panasonic regrigerator', 'category': 'Refrigerator'},
{'title': 'Logo', 'category': 'Toys'},
....
但是有些商品没有分类信息。
{'title': 'Iphone6', 'category': ''},
所以我在考虑是否可以通过使用scikit-learn 来根据我的商品名称训练一个文本分类器来帮助我预测商品应该属于哪个类别。我将此问题形成为多类文本分类,但每个项目也有一个~许多图片,所以也许deep learning/Keras也可以使用?
我不知道解决此问题的最佳方法是什么,因此欢迎任何建议或建议,感谢您阅读本文。
附:实际文字是日文
【问题讨论】:
-
标题“iphone6”出现了多少次,是否有与之关联的其他类别?如果这是唯一的条目,您将不得不求助于外部培训来源
-
@yosemite_k 感谢您的回复。我认为项目中出现两个相同标题的可能性很小,但多个项目的标题中会出现重新出现的术语。稍后我会提供更多信息。
标签: machine-learning classification deep-learning prediction