【问题标题】:What are some good machine learning programming exercises? [closed]有哪些好的机器学习编程练习? [关闭]
【发布时间】:2011-05-11 17:48:52
【问题描述】:

理想情况下,它们应具有以下特征:

  1. 只需一个晚上的编码即可完成。不需要一周或更长时间即可获得有趣的结果。这样一来,我就可以感觉自己在一次(可能长达数小时)的坐姿中学到并完成了一些事情。

  2. 问题来自现实世界,或者至少是现实世界问题的玩具版本。

  3. 如果问题需要数据来测试解决方案,有现成的真实世界数据集,或者自己生成有趣的测试数据是微不足道的。

  4. 很容易评估我所做的工作有多好。当我测试我的解决方案时,从结果中可以清楚地看出我已经完成了一些不平凡的事情,无论是通过简单的检查,还是通过对结果质量的可量化测量。

【问题讨论】:

    标签: machine-learning artificial-intelligence


    【解决方案1】:

    实现以下算法:

    • 感知器,边缘感知器:您可以尝试使用任何人脸数据库检测人脸图像(对人脸图像和非人脸图像进行分类)。例如尝试MIT CBCL face database。你也可以试试MNIST data,写一个穷人的OCR系统。
    • LVQ、Kohonen 地图:可以尝试压缩图像。您可以从任何壁纸网站下载大图。
    • 朴素贝叶斯分类器:您可以分类垃圾邮件而不是垃圾邮件。还有更多的科学数据集,比如Reuters和Newsgroups等,给定文章你要确定主题。
    • 反向传播、多层感知器:您可以尝试使用面部、垃圾邮件或with the text/histogram data
    • 使用 SGD 进行原始 SVM 线性学习:例如,您可以尝试使用 MNIST 数字。

    有很多项目,有些需要几个小时,有些需要几天,但你肯定会学到很多东西。

    【讨论】:

    • 实际数据集有什么具体问题吗?我可以从教科书中随机挑选一些东西来实施,但如果只是做一个练习,最好有明确的目标和数据来配合它。
    • 我已经编辑了我的答案。
    【解决方案2】:

    查看UCI machine learning repository 以获取真实数据集。

    例如Breast Cancer Wisconsin (Diagnostic) Data Set 。 查看数据集描述以获取更多信息。

    即使是朴素贝叶斯分类器也会在这个数据集上给出很好的结果(超过 95% 的交叉验证准确率)。如果我没记错的话,通过一些变量选择,你甚至可以达到 100%。

    【讨论】:

      【解决方案3】:

      大多数机器学习项目可能需要一些时间。

      Bayesian 文本分类怎么样?

      NLTK Toolkit(Python 的自然语言工具包)中的一个示例是电影评论。该工具包提供了标记为正面或负面的电影评论。

      编写一个可以对电影评论进行分类的贝叶斯分类器,使用此数据进行训练。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2010-09-05
        • 2011-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2010-10-03
        • 2011-02-22
        • 2011-10-30
        相关资源
        最近更新 更多