【发布时间】:2013-08-25 18:21:12
【问题描述】:
我有一个机器学习问题。我得到了一长串域名,我必须弄清楚哪些是电子商务网站,哪些是个人网站。这是一个难题,因为我没有任何训练数据可供使用。我想出了几个想法:
手动浏览数百个这样的网站,以判断它们是商业网站还是个人网站,并以这种方式开发训练集(漫长而无聊!)。
爬取这些网站并搜索一些关键字,例如。 “立即购买”、“价格”、“信用卡”。等等。
有人有其他方法吗?
谢谢
【问题讨论】:
-
我认为抓取是正确的方式,但我建议寻找带有“位置”、“联系我们”等链接的网站,而不是简单的关键字。
标签: web-crawler supervised-learning