【发布时间】:2021-04-12 01:24:06
【问题描述】:
我在定义为的管道中使用附件处理器:
PUT _ingest/pipeline/attachment
{
"description": "Extract attachment information",
"processors": [
{
"foreach": {
"field": "attachments",
"processor": {
"attachment": {
"field": "_ingest._value.data",
"target_field": "_ingest._value.attachment",
"properties": [ "content" ]
}
}
}
},
{
"foreach": {
"field": "attachments",
"processor" : {
"remove" : { "field" : "_ingest._value.data" }
}
}
}
]
}
预期:
给定一组具有不同文件类型的附件,例如 doc、Docx 或 pdf,这些文件将被处理(由 Tika)以获取原始文本,其中表格布局、字体类型、字体颜色和图像将被删除。
但看起来图像在摄取后仍然存在。我可以在内容字段中看到一些很长的 base64 字符串,例如
lWQk9SdzBLR2dvQUFBQU5TVWhFVWdBQUFQb0FBQUQ2Q0FZQUFBQ0k3Rm85QUFBZ0FFbEVRVlI0WGx5OUI1TWNXWEtsNjVGYWxBWlFBQnBvTVQz...
我相信,与文件中的图像有关。
对摆脱图像有什么建议吗?
【问题讨论】:
标签: elasticsearch