【问题标题】:Finding numbers of one document in another document [closed]在另一份文件中查找一份文件的编号[关闭]
【发布时间】:2018-05-14 06:23:47
【问题描述】:

我有两个文档 A 和 B。为了便于说明,让我们简单说明一下:每个文档都只有一页。页面包含文本和数字形式的信息。

我的目标是标记文档 A 中所有出现在文档 B 中完全的数字。但是考虑数字的上下文也非常重要! 示例:

  • “A”包含以下句子:“我 2017 年的薪水是 50 000 欧元”
  • “B”包含以下句子:“我 2016 年的工资是 50 000 欧元”和“我 2017 年的工资是 50 000 欧元”

由于B中的第二句,此处计算机应在A中标记“50 000”。如果只有B的第一句,则不应标记数字。

我的问题是:这是卷积神经网络 (CNN) 或支持向量机 (SVM) 等机器学习技术的用途吗?也许我可以通过解析或字符串识别(或类似的东西)来解决这个问题,但我相信机器学习方法会提供更准确的结果!

也许还有一些其他技术更适合我的目标。

感谢您的帮助!

【问题讨论】:

    标签: machine-learning neural-network artificial-intelligence svm pattern-recognition


    【解决方案1】:

    如果句子的大小是固定的,您可以将文档 B 拆分为 size(sentence)-块并测量从原始句子到所有块的距离。最小的距离意味着最相似的句子。

    否则,您可以开发一些循环算法,其中块可能是灵活的。

    对于这两种情况,您可以将一些聚类或最近邻域算法放在顶部。无论如何,如果你的句子差异真的是一个词 - 这不是问题,距离方法应该足够了。

    不幸的是,我看不到如何通过 CNN 或 SVM 解决此任务。可能你的意思是RNN?也许是一种有趣的方法,但不适用于您描述的项目 :) 但恐怕有些细节我根本不知道。

    PS 我最近正在寻找一些用于聚类的自定义 RNN 方法。好用,你可以试试。

    【讨论】:

    • 感谢您的帮助!也许我可以实现阈值而不是使用最小距离,因为有时 B 中没有表示数字!最小的距离比会导致错误。但这是一个很好的提示!我有点熟悉的唯一方法是 NN,尤其是 CNN 和 SVM,所以对我来说这会更容易使用它们。但是我注意到这些方法在这种情况下是没有用的。也许 RNN 会解决我的问题。我会收集一些信息!谢谢:)
    • 在这种情况下,您需要自定义距离度量,例如:字差对您来说是可以的,但数量差异很关键。
    • 我会考虑的!谢谢
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-02-10
    • 2017-04-24
    • 1970-01-01
    • 2021-02-21
    • 1970-01-01
    • 2012-06-09
    相关资源
    最近更新 更多