解决问题:
新的slot作为数据库搜索参数;领域迁移难、学习更快
背景:

  • 置信状态
    对话系统论文集(2)-MDAP网络
    bg是置信对话状态中与语义槽无关的部分,bi是置信状态中与第 i 个语义槽相关的部分。

  • 可能的动作集合为A
    对话系统论文集(2)-MDAP网络
    Ag是可能的对话动作中与语义槽无关的动作的集合,Ai是可能的动作中与第 i 个语义槽相关的对话动作的结合。

  • DSTC数据集:
    每个分为label和log;
    label:直接是json形式:
    对话系统论文集(2)-MDAP网络
    槽已经处理好了。

创新点:

  • 多智能体对话策略
    本文根据是否和语义槽相关的置信状态和动作状态,提出了类似原理的多agent训练。
    有一个agent是和状态无关的,其他的都相关。然后 agent之间共享参数,我觉得像是增加了参数。
    对话系统论文集(2)-MDAP网络
    对话系统论文集(2)-MDAP网络
    对话系统论文集(2)-MDAP网络对话系统论文集(2)-MDAP网络对话系统论文集(2)-MDAP网络
    这里面Hs,Cs,Gs对于所有的Agent都是一样的。

  • 作者又提出了一种,共享-私有加权网络
    也就是多出一个参数,
    对话系统论文集(2)-MDAP网络
    右边的s网络是原来的共享参数的网络,左边的j网络是加上的私有参数的网络。两者用权重连接。

  • 训练过程
    步骤一:在原有领域中训练 MADQN;
    步骤二:当领域扩展时,为每个新增的语义槽添加一个对应的 S-Agent;
    步骤三:如果 MADQN 是 MADQN_S,即 S-Agent 没有私有参数,则新增加的 S-Agent 直接使用共享参数;
    如果 MADQN 是 MADQN_SP,即 S-Agent 除了共享参数还有私有参数,则新增加的 S-Agent 的共享参数直接使用之前其它 S-Agent 的共享参数,而私有参数用共享参数加上很小的噪音进行初始化;
    步骤四:在扩展后的领域继续训练 MADQN。

所以说新来的S-Agent是和语音槽挂钩的,一个语音槽一个Agent
实验结果
在单个domain的时候也训练的更快(因为agent分为了slot-dependent和slot-independent)

相关文章:

  • 2022-01-16
  • 2021-06-29
  • 2021-06-15
  • 2021-07-01
  • 2021-06-06
  • 2021-06-22
  • 2022-12-23
猜你喜欢
  • 2021-05-28
  • 2021-05-19
  • 2021-12-14
  • 2021-09-24
  • 2021-12-10
  • 2021-09-22
  • 2021-12-19
相关资源
相似解决方案