【问题标题】:Is it possible to transform the data before retrieving from mongoDB?是否可以在从 mongoDB 检索之前转换数据?
【发布时间】:2018-02-08 00:35:52
【问题描述】:

假设我有一个只有一个字段BlogText 的集合。当用户搜索一个词并且该词出现在BlogText 中时,我想:

  1. 仅检索匹配词之前的 10 个词和匹配查询之后的 10 个词,以省略号开头并后跟。
  2. 另外,我想用<b>Matched word</b> 替换Matched word

例如,如果搜索到的查询是1500,我想检索以下内容:

... has been the industry's standard dummy text ever since the <b>1500<b>s, when an unknown printer took a galley of type and ...

鉴于BlogText 中的原文为:

Lorem Ipsum 只是印刷和排版行业的虚拟文本。自 1500 年代以来,Lorem Ipsum 一直是行业的标准虚拟文本,当时一位不知名的印刷商采用了一种类型的厨房并将其加扰以制作类型样本书。它不仅经历了五个世纪,而且经历了电子排版的飞跃,基本保持不变。它在 1960 年代随着包含 Lorem Ipsum 段落的 Letraset 表的发布而流行起来,最近还随着 Aldus PageMaker 等桌面出版软件(包括 Lorem Ipsum 的版本)而普及。

我知道这也可以在服务器上完成,但我想避免检索我不需要的数据(参考第 1 点)。

【问题讨论】:

  • 你唯一的希望是聚合框架,但我不确定它是否足够先进。
  • “但我想避免检索我不需要的数据。” -- 那么你为什么建议数据库在结果中添加额外的标记,这会增加它需要返回给您的应用程序客户端的字节数???这就是我们所说的矛盾。做这种事情不是数据库的工作(部分原因是 Oracle 等上可用的功能墙在 MongoDB 中不存在)。在从数据库服务器返回结果之后标记您的匹配项。您应该记住您要求的术语,因此只需匹配它们并添加标记。
  • @SergioTulentsev "No can do" on regex matching and replacement。而通过 mapReduce 强制执行此操作将是彻头彻尾的愚蠢。
  • @NeilLunn 我同意。说我指的是我的第一点。一个 BlogText 可能包含 1000 个单词,而即使添加了 b 标签,我也只需要 11 或 13 个单词。我会编辑。

标签: mongodb highlighting teaser


【解决方案1】:

您可以使用aggregation 返回长文本的子字符串。

假设您需要一个子字符串围绕第一次匹配项出现,并且使用空格作为单词分隔符,管道可以是这样的:

db.collection.aggregate([
    { $match: { BlogText:/1500/ } },
    { $project: {
        match: {
            $let: {
                vars: { pos: { $indexOfCP: [ "$BlogText", "1500" ] }},
                in: { $concat: [
                    { $reduce: {
                        input: { $slice: [ 
                            { $split: [ 
                                { $substrCP: [ "$BlogText", 0, "$$pos" ] }, 
                                " " 
                            ]}, 
                            -10 
                        ]},
                        initialValue: "",
                        in: { $concat : [ "$$value", " ", "$$this" ] }
                    }},
                    { $reduce: {
                        input: { $slice: [ 
                            { $split: [ 
                                { $substrCP: [  "$BlogText", "$$pos", { $strLenCP: "$BlogText" } ] }, 
                                " " 
                            ]}, 
                            10 
                        ]},
                        initialValue: "",
                        in: { $concat : [ "$$value", " ", "$$this" ] }
                    }}            
                ]}
            }
        } 
    }}
]);

【讨论】:

  • 谢谢。我会尽力让你知道
猜你喜欢
  • 2019-12-10
  • 2016-08-19
  • 2018-05-11
  • 2018-12-17
  • 1970-01-01
  • 1970-01-01
  • 2020-04-26
  • 1970-01-01
  • 2011-04-01
相关资源
最近更新 更多