【问题标题】:How to implement Kohonen maps (SOMs) with non-scalar input data/attributes如何使用非标量输入数据/属性实现 Kohonen 映射 (SOM)
【发布时间】:2014-06-03 21:03:08
【问题描述】:

一般来说,仅使用实值向量实现 Kohonen 映射/SOM 算法是一项相对简单的任务。由于“权重更新”阶段,我想知道如何为文本字符串等非实值(即非标量)属性实现这种算法。

假设有一组数据包含不同长度、不同含义类别以及浪漫程度的单词,例如rose(非常浪漫)、flower(浪漫)、plant(浪漫取决于上下文)、factory (浪漫仅适用于蒸汽朋克)。我在编造,所以请忽略细节。 (编辑:是的,浪漫性可以表示为一个标量值;我的问题真的不在于 部分。)

人们可以打乱单词甚至字母以在地图上创建原型,然后使用 Levenshtein 距离来找到最佳匹配单元,我明白了。但是如何更新 BMU 及其邻域朝向选定的目标向量?

其他示例可能是嵌入一维(标量)数据流中的绘画(例如,按颜色、主题、时代……)或感知形状(例如三角形、锯齿……)。

【问题讨论】:

  • 现在开始考虑这个问题,我认为解决方案是获取相关定性预测变量的向量空间嵌入(例如,word2vec),然后基于这些进行聚类.

标签: algorithm machine-learning artificial-intelligence som


【解决方案1】:

这些浪漫程度不只是一个数字吗? “这朵玫瑰是0.9浪漫”。然后在 SOM 中为您的 0.9 找到正确的位置,这就是您的玫瑰应该坐的位置。如果你有多个维度,它基本上是一个向量,但仍然是一个数字向量,而不是字符串,因此更容易更新

【讨论】:

  • 这显然是对的,但我的问题是关于映射那些非标量部分,即映射单词(不仅仅是命名样本。)
  • 所以基本上你正在寻找一种方法将“BLA”的“权重”移动到“BLUB”,更新为 0.05,因此结果将是 0.95*BLA + 0.05*BLUB你在问这样的字符串是什么样子的?
  • 本质上是的。我知道这是一个奇怪的问题,但我找不到太多(如果有的话)关于如何处理此类案件的信息。有没有可以使用的标准转换......你知道,那种解决方案。
  • 是的,我明白了。没有立即想到,但您感兴趣的一般主题称为“结构化数据的机器学习”。特别是,您可能会寻找“字符串内核”,即使它们是一种相似性度量并且不一定允许插值
猜你喜欢
  • 2018-08-13
  • 2010-12-07
  • 1970-01-01
  • 2018-05-06
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多