【问题标题】:bert + text and structur databert + 文本和结构化数据
【发布时间】:2020-04-21 15:44:18
【问题描述】:

对于每个实例,我都有文本和表格数据。我想知道是否有任何方法可以使用 Bert_classification 并结合结果对整个数据集进行分类而不会过度拟合。有没有办法对文本和表格数据进行两种不同的分类并将它们组合在一起?

【问题讨论】:

    标签: text tabular bert-language-model


    【解决方案1】:

    BERT 可以返回一个向量,即所谓的[CLS] 向量,可用作任何进一步模型的输入。所以,答案是肯定的:您可以使用 BERT 处理您的文本并获得单向量表示,获得您对表格数据所做的任何表示/特征,将它们连接起来并在它们之上训练分类器。

    【讨论】:

    • 感谢您的回复。我想知道我是否可以使用 BertForSequenceClassification。 [cls] 是否使用类标签制作?如果是这种情况,可能会导致过度拟合。我应该改用 BertModel 吗?
    • BertForSequenceClassification 只是 CLS 向量之上的线性分类器。如果你想将BERT与其他特征结合起来,你需要使用BertModel来获取向量,然后用你自己的代码来做分类器的其余部分。
    • 感谢您的回答。我想知道是否应该使用 pooler_output,或者我可以在 hidden_​​states 的最后 4 层 Bert 中的 CLS 中取平均值。根据文档,pooler_output 通常不能很好地总结输入的语义内容,通常最好对整个输入序列的隐藏状态序列进行平均或合并。
    猜你喜欢
    • 2011-03-10
    • 2011-08-18
    • 2015-07-26
    • 2013-01-14
    • 1970-01-01
    • 2015-10-09
    • 2016-02-19
    • 1970-01-01
    • 2019-07-29
    相关资源
    最近更新 更多