Skip to content

Latest commit

 

History

History
176 lines (131 loc) · 6.04 KB

File metadata and controls

176 lines (131 loc) · 6.04 KB

BERT 系列模型 (Encoder-only 架构) ✒️1📋7

create date last modify

Keywords: Transformer_BERT


背景


表示学习

TODO

SentenceBERT, SimCSE, 句向量 等


改进模型

RoBERTa

移除 NSP, 动态 Mask, 更多训练数据

DeBERTa

解耦注意力机制 (Disentangled Attention) 🔸 相对位置编码 🔸 增强的 Mask 解码器 (Enhanced Mask Decoder, EMD)

解耦注意力 (Disentangled Attention)

增强 Mask 解码器 (EMD)


Q&A


1. 🏷️ BERT 改进模型比较

1.1. ✅ 说明 RoBERTa 相比 BERT 的改进

RoBERTa 在架构上与 BERT 基本一致, 但在 预训练方法 上做了系统优化, 显著提升了模型性能与泛化能力
主要改进: 移除 NSP 任务 🔸 动态 Mask 🔸 更多训练数据;

1.2. ✅ 比较 DeBERTa 和 BERT 在架构与预训练目标上的差异

• BERT 使用静态 Mask + NSP
• DeBERTa 引入 解耦注意力 (Disentangled Attention)增强的 Mask 解码器 (EMD)

  • 展开详情 ⬇️

1.3. ✅ 解释一下 DeBERTa 的优点及原因

优点: 语义理解更精细, 长程依赖更好, 预训练效率更高 (相比 BERT/RoBERTa)
原因: 更精细的语义–位置建模, 更高效的预训练目标

  • 展开详情 ⬇️

2. 🏷️ 表示学习

2.1. ✅ 说明 SentenceBERT (SBERT) 与 SimCSE 的核心思想?

• 引入 对比学习, 在 语义相似任务 上微调, 使语义相近的句子在向量空间中靠近, 语义不相关的句子远离;
SimCSE 额外利用 batch 内其他句子作为负样本来提升学习效率, 同时利用 dropout 构造正样本带来 无监督版本.

2.2. ✅ 为什么对比学习能提升句向量的判别力?

• 通过 正负样本约束 显式地塑造了句向量空间: 语义相似的句子被拉近, 不相似的句子被推远

  • 展开详情 ⬇️
    • 显式几何约束: 对比学习直接优化 "相似句子近, 不相似句子远", 使得向量空间更符合语义结构.
    • 避免塌缩 (collapse): 负样本的存在防止所有句子映射到同一向量.
    • 增强鲁棒性: 通过 dropout 或数据增强生成的正样本对, 迫使模型学习到语义不变性.
    • 缓解各向异性: 对比学习能让句向量分布更均匀, 提升余弦相似度的判别性.

2.3. ✅ 说明 SBERT 的双塔结构

• SBERT 的双塔结构本质是 参数共享 的 Siamese/Triplet 网络;
• 两个完全相同且参数共享的 BERT 编码器分别处理两个句子, 得到各自的句向量后, 再通过相似度函数 (如余弦、曼哈顿、欧氏距离) 或拼接后接分类器来完成语义相似度/匹配等任务;

2.4. ✅ 为什么拼接形式的双塔结构中, 通常还会加入 |u-v|?

$|u-v|$ 提供了对称、直观的差异特征, 增强了模型对相似度的判别力

  • 展开详情 ⬇️
    • 余弦相似度、欧氏距离等常用度量, 本质上都依赖向量差异;
    • 加入 $|u-v|$ 等价于在输入层显式提供这些度量的近似特征;