提升零样本事件检测中的事件定义遵循能力

← 全部研究

语言理解

ACL 2024 (主会) · 长文 · PDF · 论文页面 · 代码 · DivED

让事件检测模型遵循训练中未见过的事件定义。 ZeroED 研究零样本事件检测应如何构造训练数据。多样化事件定义数据集 DivED 包含超过 3,000 种事件类型,利用事件本体信息生成多样的定义与样例。

DivED 数据生成流程:事件检索、感知本体的定义与样例生成,以及定义扩展。
图 2:DivED 利用事件本体生成可区分的定义和样例,扩展定义,并剪除触发词高度重叠的事件类型。点击查看大图。

论文分别改变事件类型数、定义数量和样例数量。在报告的扩展实验中,丰富事件类型与定义有助于泛化,而只增加每种类型的样例最终不再带来收益。感知本体的定义和困难负例帮助模型区分相邻事件类型及其触发词。

在 DivED 与 Geneva 上训练的 LLaMA-2-7B,使用 ACE、M2E2、MEE 中未见过的事件类型评测,平均触发词分类 F1 为 25.7,相比之下,仅用 Geneva 训练的模型为 22.6,论文采用的 GPT-3.5 基线为 9.0。这些结果对应论文的零样本基准与提示设置;扩展实验也显示,过量生成数据可能损害域外迁移。