【问题标题】:Extract Keywords from Office Documents with Sharepoint Flow使用 Sharepoint Flow 从 Office 文档中提取关键字
【发布时间】:2019-06-18 01:43:09
【问题描述】:

我正在尝试使用 Sharepoint 实施文档管理系统。一个主要问题是同事在当前设置(本地文件服务器)中找不到文档。他们要求我们有一个系统,可以扫描上传的文档并自动在其中查找关键字,然后填充“元”列。

我在图像文件上使用 OCR 取得了一定程度的成功,但是从办公室文档(doc、xls 等)中获取关键字我直到现在都没有成功。

有没有办法设置一个流程来为我完成这项任务?

任何帮助都非常感谢。

我尝试了“获取文件元数据”和 Azure“文本分析”,但它似乎获取了文件的原始数据(我假设为 XML)并返回该文档太大而无法分析。

【问题讨论】:

    标签: sharepoint flow


    【解决方案1】:

    这个要求有些模糊——文档中的关键字是如何定义的?

    因此,第一个明显的解决方案是在上传每个文件时为其分配关键字。您可以为此创建一个流程,包括任务、提醒等。

    首先使用 OCR 自动执行此操作意味着您需要使用与 MS 流一起使用的 OCR,您只有一个选择 - ElasticOCR。然后,在你的流程中 - 将文档内容提供给 ElasticOCR 操作 - 请记住,OCR 并非 100% 准确 - 根据您的关键字定义分析生成的文本内容 - 最后将元数据写回相应列中的库。

    在处理过类似要求后,我们要求上传者发布带有简短摘要(内容类型的列)的文档。假设摘要包含关键字并存储在多行列中 - 使其可在站点范围内搜索。

    【讨论】:

    • 嗨,感谢您的回答。对于 OCR,我发现使用 Azure / 计算机视觉 OCR 仅适用于图像,不适用于办公文档。也许我用错了,但从日志来看,它似乎在 .doc 或 xls 上失败了。和注册。用户生成的元数据:我们有数千个(旧)文件需要打包,因此手动输入不是一种选择。我们确实想创建一个关键字数据库,工作流应该与之匹配以限制/聚焦元信息。
    • 嗨 Nicolas,好的,让我们假设您有一个非常简单的文档,其中包含 简单的通用文本信息。 您的关键字 DB 设置为具有 通用 b> 作为关键字。因此,该文档的关键字结果应该是“通用的”。对于 20 000 个单词和 100 个单词的大关键字 DB 的文档,其迭代次数多达 2 000 000 次。我不确定你有什么资源。另一方面,您可能希望采用基于集合的方法。 set1 是文档,set2 是关键字 DB。交叉点是“通用的”。如果相交分数为 100/20000 > 0.005,则关键字至少包含一次。
    • 嗨,我知道你在哪里,但不确定这对最终用户是否实用。但我认为这意味着至少据您所知,Sharepoint 中没有直接的 / ootb 实现?
    • 我发现了这个:anupams.net/azure-text-analytics-tag-sharepoint-documents,似乎是我正在寻找的东西,但我并不是真正的编码员。我已经不知道应该把他建议的代码放在哪里了 :) :) :)
    • 这是一个非常有价值的资源,但您需要开发人员的帮助 :)
    猜你喜欢
    • 2014-07-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-02-12
    • 2018-02-02
    • 1970-01-01
    • 2013-07-17
    相关资源
    最近更新 更多