👩🏼🏫 负采样
负采样
MixKG: Mixing for harder negative samples in knowledge graph
2.方法
首先,从采样的负三元组中选择高质量的负三元组;其次,混合配对的高质量负三元组,然后生成新的更难的负三元组。
硬负样本是所提出模型的核心,但如何定义硬负样本仍然是一个问题。
张等人之前的几部作品。 (2019);卡兰蒂斯等人。 (2020)使用评分函数 𝑓 ,将得分高的负三元组作为硬负样本,我们将这种方法称为基于评分函数的硬负样本(HNS-SF)。
然而,这个定义只考虑了负集中的负样本,而忽略了真三元组的帮助。因此,我们对硬负样本引入了不同的定义,它将与正确的头或尾实体更相似的候选实体视为硬负样本。我们将这种硬负样本的定义命名为基于正确实体相似性的硬负样本(HNS-CES)。
3Mix for Harder negative triplets
3.1.1硬负样本-评分函数
对于 { (ℎ,𝑟,𝑡1′),(ℎ,𝑟,𝑡2′),…(ℎ,𝑟,𝑡𝑀′) } 中的每个三元组,我们使用评分函数 𝑓 计算分数 𝑠(𝑡𝑚′)=𝑓(ℎ,𝑟,𝑡𝑚′) 。然后我们对分数{ 𝑠(𝑡1′),𝑠(𝑡2′),…𝑠(𝑡𝑀′) }进行降序排序,分数最大的负三元组是硬负样本。
3.1.2硬负样本-修正实体相似度
我们计算尾部实体与 (𝑡1′,𝑡2′,…𝑡𝑀′) 中每个候选实体之间的点积,然后得到相似度 𝑠(𝑡𝑚′)=𝑡∗𝑡𝑚′ 。具有top-K最大 𝑠(𝑡𝑚′) 的候选实体和头实体, (ℎ,𝑟,𝑡) 中的关系形成硬负三元组。
3.2这些硬三元组之间的混合
在获得用于混合的硬负三元组后,我们随机选择配对的硬负三元组,然后混合尾部实体以生成新的硬负样本。准确地说,假设有两个负三元组{ (ℎ,𝑟,𝑡𝑖′),(ℎ,𝑟,𝑡𝑗′) },那么新生成的更难负三元组的尾部实体是
| 𝑡^𝑖,𝑗=𝛼∗𝑡𝑖′+(1−𝛼)∗𝑡𝑗′ |
|---|
| 𝑡^𝑖,𝑗=𝛼∗𝑡𝑖′+(1−𝛼)∗𝑡𝑗′ |
其中 𝛼 是从 (0,1) 中随机抽取的,那么生成的更难的负三元组是 (ℎ,𝑟,𝑡^𝑖,𝑗) 。
3.3损失函数
第一类是平移距离模型:

第二个是语义匹配模型:

Negative Sampling with Adaptive Denoising Mixup for Knowledge Graph Embedding
3.Methodology
PNE 模块利用 KGE 模型的当前预测结果将未标记的损坏三元组划分为伪负三元组和真负三元组。然后,AdaMix 模块为每个损坏的三元组选择合适的混合伙伴,并将它们混合在实体嵌入空间中,以生成部分正确的三元组或更难的负三元组,以帮助训练 KGE 模型。
3.1 边际伪负三重估计器(MPNE)
3.2自适应混合(AdaMix)
Toward Degree Bias in Embedding-Based Knowledge Graph Completion
让 𝑒1= (欧洲、国家/地区、德国)作为我们要扩充的三元组。我们将其与尾部实体德国的另一个三元组混合。我们考虑三元组 𝑒2= (比利时、博德斯、德国)。混合三元组表示为 𝑒~=(Europe+Belgium,Has Country+Borders,Germany) 。由于 𝑒1 包含德国所属的大陆,而 𝑒2 包含其接壤的国家,因此我们可以将合成三元组 𝑒~ 理解为传达德国在内部的地理位置欧洲的。这在预测原始三元组 𝑒1 中的德国时很有帮助,因为合成样本为德国的表示注入了更具体的地理信息。