【发布时间】:2012-03-05 03:34:03
【问题描述】:
我对基于配方的各种属性的统计分析以编程方式对配方进行分类感兴趣。换句话说,我想在没有任何用户输入的情况下将食谱分类为Breakfast、Lunch、Dinner 或Dessert。
我可用的属性是:
- 食谱标题(例如鸡肉沙拉)
- 配方描述(描述配方的任意文本)
- 烹饪方法(准备此食谱的步骤)
- 准备和烹饪时间
- 配方中的每种成分及其用量
好消息是我有一个样本集,其中包含大约 10,000 个已经分类的食谱,我可以使用这些数据来教我的算法。我的想法是寻找模式,例如 syrup 一词是否在统计上更频繁地出现在 breakfast 食谱中,或者任何需要超过 1 杯糖的食谱中 有 90% 的可能性是甜点。我想如果我从多个维度分析配方,然后适当调整权重,我可以得到相当准确的东西。
在解决这个问题时,有哪些好的算法可以研究?像 k-NN 这样的东西会有帮助吗,还是有更适合这项任务的?
【问题讨论】:
-
您愿意投入多少编程工作?最简单(最少编程)的解决方案是将所有这些字段连接成一个大文本并运行任何文本分类工具。第二种方法需要更多的参与,需要您从数据中创建自己的特征并运行一种或多种分类算法:SVM、Boosting、KNN、神经网络、决策树等。
-
@ElKamina - 我正在寻找涉及构建我自己的算法的后一种方法。我主要想从这个问题中得到什么是指向最适合这类问题的算法的指针,我不是在寻找任何示例代码或任何东西(这个问题显然太宽泛了!)
-
拥有这些功能后,您可以使用Weka 轻松尝试多种不同的分类算法,并选择最适合您要求的一种。
-
@LarsKotthoff - 这个 Weka 项目看起来非常棒!我肯定会检查一下,至少我可以以这种格式获取我的数据并快速测试一些各种算法。谢谢指点!
标签: algorithm data-mining classification categorization document-classification