【发布时间】:2014-06-03 21:03:08
【问题描述】:
一般来说,仅使用实值向量实现 Kohonen 映射/SOM 算法是一项相对简单的任务。由于“权重更新”阶段,我想知道如何为文本字符串等非实值(即非标量)属性实现这种算法。
假设有一组数据包含不同长度、不同含义类别以及浪漫程度的单词,例如rose(非常浪漫)、flower(浪漫)、plant(浪漫取决于上下文)、factory (浪漫仅适用于蒸汽朋克)。我在编造,所以请忽略细节。 (编辑:是的,浪漫性可以表示为一个标量值;我的问题真的不在于 部分。)
人们可以打乱单词甚至字母以在地图上创建原型,然后使用 Levenshtein 距离来找到最佳匹配单元,我明白了。但是如何更新 BMU 及其邻域朝向选定的目标向量?
其他示例可能是嵌入一维(标量)数据流中的绘画(例如,按颜色、主题、时代……)或感知形状(例如三角形、锯齿……)。
【问题讨论】:
-
现在开始考虑这个问题,我认为解决方案是获取相关定性预测变量的向量空间嵌入(例如,
word2vec),然后基于这些进行聚类.
标签: algorithm machine-learning artificial-intelligence som