【发布时间】:2018-01-11 12:31:44
【问题描述】:
我是机器学习的完全初学者,所以请原谅我提出一般性问题。
我正在尝试将随机数据集中的列名映射到已知数据集的列。例如,列名“image_link”需要匹配随机数据集,其中相同的列名可能是“Image Link”,然后另一个可能是“img_url”。
我有每个列名的不同变体的大型数据集
我相信机器学习可以帮助解决这个问题,并且已经开始研究这个问题。我用python做了一些机器学习,主要是线性回归,我觉得不适合这个问题。
我通过谷歌做了很多研究,看看是否能找到任何类似的例子,但我找不到太多。任何人都可以帮助我并建议我是否应该使用机器学习来解决这个问题,如果是的话,是否有任何特定的机器学习技术可能适合这个问题,所以我知道我的研究方向。
任何帮助将不胜感激。
编辑**
经过更多研究,我觉得分类器可能是使用 SVM 或朴素贝叶斯的最佳选择?
我还创建了一个非常基本的数据集,但准备此类数据进行处理的最佳方法是什么?
--------------------------------------------------
| **Category** | **Term** |
--------------------------------------------------
| id | SKU |
--------------------------------------------------
| id | id |
--------------------------------------------------
| id | productID |
--------------------------------------------------
| link | productLink |
--------------------------------------------------
| link | URL |
--------------------------------------------------
| link | link |
--------------------------------------------------
| image_large | Image |
--------------------------------------------------
| image_large | ImageMedium |
--------------------------------------------------
| image_large | image_link |
--------------------------------------------------
| image_thumb | ImageSmall |
--------------------------------------------------
| image_thumb | Image |
--------------------------------------------------
| image_thumb | image link |
--------------------------------------------------
【问题讨论】:
标签: machine-learning