中国宝贝在线
您当前的位置:中国宝贝在线资讯正文

AAAI2020开源论文语义感知BERT(SemBERT)

放大字体  缩小字体 2019-12-23 16:01:33  阅读:8148+ 来源:自媒体 作者:PaperWeekly

原标题:AAAI 2020 开源论文 | 语义感知BERT(SemBERT)

作者丨张倬胜

校园丨上海交通大学硕士生

研讨方向丨自然言语了解

本文从核算言语学视点,提出运用显性语义人物信息来改善深度言语模型的建模功能,将语义人物标示用于机器阅览了解和推理使命中,供给愈加丰厚和精准的语义信息。本论文来自上海交通大学与云从科技联合立异试验室,录用于 AAAI 2020。

论文地址:https://arxiv.org/abs/1909.02209

开源代码:https://github.com/cooelf/SemBERT

导言

机器阅览了解的方针是教会机器学习并了解人类言语、像人相同考虑与沟通,是深度学习促进自然言语处理的研讨和工程使用后鼓起的实用性使命。机器阅览了解交融了文本上的常识表达、语义了解和某些特定的程度上根据常识的推理等一系列应战。

上下文标明是文本了解的中心模块,最新根据大规模预练习的深度言语模型有用集成了语境化特征,在很多的自然言语处理使命上取得巨大的成功,尤其是在各种机器阅览了解和自然言语推理使命。

但是,许多研讨者发现当时许多机器阅览了解模型未能“真实”地了解语义信息,在一些人类易懂的标题上机器简略犯错。现有的言语标明模型(包括 ELMO、GPT、BERT、XLNet 等),只利用了简略的上下文特征,如字符或子词嵌入,缺少对结构化言语学信息的考虑,而这些信息可认为言语表达供给丰厚的语义和结构化常识,构建愈加准确的文本表征。

为了增强自然言语了解,本文提出经过预练习的语义人物标示模型引进显式的上下文语义标签信息,并 引进一种改善的言语标明模型——语义感知 BERT (SemBERT),它能够在 BERT 为根底的骨架网络上,显性地交融上下文语义信息。SemBERT 坚持了 BERT 的易用性,只需进行习惯性的微调,而无需对特定使命进行大幅度的模型修正。

与 BERT 比较,SemBERT 在概念上相同简略,但功能却更为强壮。SemBERT 在 10 项自然言语了解使命上显著地提高了基准模型,乃至达到了最佳的水平。

SemBERT模型架构

SemBERT 模型包括三个部分:

1)语义人物标示器,用于对文本进行标示,给输入的语句标示谓词-论元结构(词等级);

2)序列编码模块,其间运用预练习的言语模型构建输入原始文本的向量标明,经过 CNN 将子词级标明重构为词等级完成与标签对齐;一起,将语义人物标签向量化,构建语义标签向量标明;

3)语义集成模块,用于将文本标明与语义标签向量标明集成交融,以取得可用于下流使命的联合标明。

SemBERT输入数据结构

1. 语义人物标示

语义人物标示(SRL)旨在发现语句的谓词-论元结构。它以语句的谓词为中心,剖析语句中各成分与谓词之间的联系,即语句的谓词(Predicate)- 论元(Argument)结构。

谓词是对主语的陈说或阐明,指出“做什么”、“是什么”或“怎么样,代表了一个事情的中心,跟谓词调配的名词称为论元。语义人物是指论元在动词所指事情中担任的人物。首要有:施事者(Agent)、受事者(Patient)、客体(Theme)、经历者(Experiencer)、受益者(Beneficiary)、东西(Instrument)、场所(Location)、方针(Goal)和来历(Source)等。

例如:关于文本 {reconstructing dormitories will not be approved by cavanaugh},因为包括 2 个谓词,因而对应 2 个谓词-论元结构序列。

[ARG1: reconstructing dormitories] [ARGM-MOD: will] [ARGM-NEG: not] be [V: approved] [ARG0: by cavanaugh]

[V: reconstructing] [ARG1: dormitories] will not be approved by cavanaugh}

2. 编码模块

首要别离将自然言语文本和语义人物标签序列向量化:

1)文本序列:原始文本序列 X 首要被 BERT 的子词切分器切分为子词。然后输入到 Transformer,得到具有上下文的文本向量标明。

2)标签序列:关于与谓词数量相对应的 m 个标签序列 ,每个序列 长度等于原始语句 X 的长度 n。将标签向量输入到 BiGRU 层以取得以上 m 个标签序列在向量空间的标明,然后咱们将 m 个标签序列拼接起来,并将它们输入到全衔接层,取得多个标签序列的交融标明。

3. 语义集成模块

该集成模块交融了文本序列标明和标签标明。因为原始的预练习 BERT 根据子词序列(Subword-level),而咱们引进的语义标签根据词等级(word-level),因而咱们在交融前需要将词语标签对齐。咱们将每个词语的子词分组,并运用卷积神经网络(CNN)提取每个词语所对应的的子词特征,然后取得大局词等级的标明。

咱们以一个词为例:假定词语 由一系列子词 组成,其间 l 是词语 的子词数量。经过 BERT 编码后,将子词 的向量标明为 ,将其输入到卷积神经网络 Conv1D 后经过 ReLU 激活和最大池化得到词等级的标明。

然后将词等级对齐的文本序列向量和提取的标签序列向量交融得到语义增强的言语标明。

试验成果

咱们的模型在 10 个基准数据会集进行了评价,这些数据集触及自然言语推理,机器阅览了解,语义相似性和文本分类等多种使命。

GLUE试验成果

SQuAD试验成果

SNLI试验成果

成果剖析

GLUE 上的试验显现了 SemBERT 在一切使命上均有用增强 BERT,而且取得了抢先的成果。SemBERT 模型简略且有用,经过很少的参数增加,取得了与更杂乱的模型相挨近,乃至逾越了多使命学习模型的功能。关于 SQuAD,SemBERT 在 EM 和 F1 指标上均优于 BERT 基准模型,逾越了一切已宣布的作业,并取得了与排行榜中的一些未宣布的、更杂乱模型可比的功能。而在 SNLI 数据集上的试验显现 SemBERT 达到了该数据集上的最佳功能,乃至超越一切 Ensemble 模型(SNLI 排行榜:https://nlp.stanford.edu/projects/snli/)。

本作业提醒了显性语义信息在自然言语了解上的有用性,这标明显式上下文语义能够与最新的预练习言语标明有用地集成交融,然后进一步提高功能。除了这项作业中验证的各种使命之外,SemBERT 还能够轻松地习惯其他言语。

SRL 是 NLP 的一项基本使命,ConLL 2009 供给了 7 个 SRL 树库,因而能够方便地练习首要言语的标签。关于那些没有可用的树库的场景,能够轻松又有用地使用无监督的 SRL 办法。关于跨范畴问题,咱们所研讨的数据集(GLUE 和 SQuAD)涵盖了十分不同的范畴,而且试验标明咱们的办法依然有用。

点击以下标题检查更多期内容:

#

• 稿件确系个人 原创著作,来稿需注明作者自己信息(名字+校园/作业单位+学历/职位+研讨方向)

• PaperWeekly 默许每篇文章都是首发,均会增加“原创”标志

责任编辑:

“如果发现本网站发布的资讯影响到您的版权,可以联系本站!同时欢迎来本站投稿!