【发布时间】:2016-10-12 19:22:11
【问题描述】:
我正在努力使用 Logstash 中的过滤器。
我正在尝试采用结构良好的 json 流(我正在使用 twitter 提要来获取测试数据)并扩充数据。我们的需求之一是获取现有字段,例如消息,并存储所有唯一标记(在本例中为简单的空格分隔词)。
从长远来看,我们希望能够使用弹性搜索分析器将消息分解为规范化的块(使用词干、停用词、toLower 等...)
理想的目标是采取以下措施: { "@timestamp":"2016-10-12T19:01:33.000Z", "message":"最快的棕狐", ... }
并得到类似的东西: { "@timestamp":"2016-10-12T19:01:33.000Z", "message":"最快的棕狐", "tokens":["The", "quickest", "Brown", "fox"], ... }
最终像这样: { "@timestamp":"2016-10-12T19:01:33.000Z", "message":"最快的棕狐", “代币”:[“快速”,“棕色”,“狐狸”], ... }
我觉得我的头撞到了墙上。任何为我指明正确方向的帮助将不胜感激。
谢谢
【问题讨论】:
-
令牌数组正是当您要求 ES 分析您的
message字段时生成、索引和存储的。我不太明白为什么你需要用这些标记创建一个新字段?请详细说明。
标签: logstash