Word Embedding :从分布式假设到神经网络语言模型

发布时间:2026/8/17 17:22:35
Word Embedding :从分布式假设到神经网络语言模型 Word Embedding 从分布式假设到神经网络语言模型一、Word Embedding 的本质从符号到语义空间的映射1.1 什么是 Word EmbeddingWord Embedding词嵌入是一种将离散的词汇符号映射到连续的低维稠密向量空间的技术。在这个向量空间中语义相似的词在几何距离上彼此接近从而实现了从 “符号匹配” 到 “语义计算” 的跨越。核心定义词嵌入是将单词或多词短语表示为固定维度的实值向量这些向量之间的距离例如余弦相似度反映了单词之间的相关性这种相关性基于单词通常出现的上下文。1.2 为什么需要 Word Embedding表格表示方法维度语义信息计算效率主要缺陷One‑Hot 编码等于词汇表大小(104‑105)完全无关极低维度灾难、语义鸿沟TF‑IDF等于词汇表大小统计重要性低忽略词序、无法捕捉语义关系Word Embedding50‑300 维丰富的语义关系高一词多义静态嵌入关键突破Word Embedding 将高维稀疏的 One‑Hot 向量压缩为低维稠密向量同时保留了词汇的语义和语法关系。二、理论基础分布式假设Distributional Hypothesis2.1 语言学根源Word Embedding 的理论基石是分布式假设Distributional Hypothesis由语言学家 Zellig Harris 于 1954 年提出“You shall know a word by the company it keeps”通过单词的上下文可以推断其含义核心思想一个词汇的语义由其上下文词汇的分布决定。语义相似的词会在相似的语境中频繁出现因此它们的向量表示应该在空间中聚集。经典示例“医生” 和 “护士” 的上下文都是 “医院、病人、开药、治疗”“苹果” 和 “香蕉” 的上下文都是 “水果、吃、甜、榨汁”因此这些词对的词向量会在向量空间中距离相近。2.2 从统计到神经网络技术演进表格阶段时间代表方法核心思想统计语言模型1990sN‑gram、共现矩阵基于词频统计矩阵分解2000sLSA、SVD降维提取潜在语义神经网络语言模型2003‑2013NNLM、Word2Vec预测任务学习嵌入上下文感知嵌入2018ELMo、BERT、GPT动态生成语境相关嵌入三、神经网络语言模型Word2Vec 的数学原理3.1 模型架构浅层神经网络Word2Vec 由 Mikolov 等人于 2013 年提出是 Word Embedding 发展的里程碑。它通过简单的浅层神经网络将词汇预测任务转化为向量学习问题。网络结构输入层One‑Hot 编码词汇表大小 V隐藏层线性变换 无激活函数维度 N通常 50‑300输出层Softmax 分类词汇表大小 V权重矩阵即词嵌入输入→隐藏权重矩阵 (\mathbf{W} \in \mathbb{R}^{V \times N})行向量即为词嵌入隐藏→输出权重矩阵 (\mathbf{W}’ \in \mathbb{R}^{N \times V})可作为上下文嵌入3.2 两种训练模式3.2.1 CBOWContinuous Bag‑of‑Words目标用上下文预测中心词(P(w_t | w_{t-c}, \cdots, w_{t-1}, w_{t1}, \cdots, w_{tc}) \frac{\exp(\mathbf{v}{w_t}^\top \cdot \mathbf{h})}{\sum{w1}^{V} \exp(\mathbf{v}_w’^\top \cdot \mathbf{h})})其中(\mathbf{h} \frac{1}{2c} \sum_{-c \leq j \leq c, j \neq 0} \mathbf{v}{w{tj}})(\mathbf{h}) 是上下文词向量的平均。输入输出示例[The] [cat] [sat] [on] [the] → [mat] 上下文词袋忽略顺序 → 中心词3.2.2 Skip‑gram目标用中心词预测上下文(P(w_{tj} | w_t) \frac{\exp(\mathbf{v}{w{tj}}^\top \cdot \mathbf{v}{w_t})}{\sum{w1}^{V} \exp(\mathbf{v}w’^\top \cdot \mathbf{v}{w_t})})输入输出示例[sat] → [The] [cat] [on] [the] 中心词 → 分别预测周围每个词3.3 目标函数与优化对数似然目标Skip‑gram(J(\theta) \frac{1}{T} \sum_{t1}^{T} \sum_{-c \leq j \leq c, j \neq 0} \log P(w_{tj} | w_t))负采样Negative Sampling优化为加速训练Mikolov 等人提出负采样将多分类问题转化为二分类问题(\log \sigma(\mathbf{v}{w_O}^\top \cdot \mathbf{v}{w_I}) \sum_{i1}^{k} \mathbb{E}{w_i \sim P_n(w)} \big[\log \sigma(-\mathbf{v}{w_i}^\top \cdot \mathbf{v}_{w_I})\big])其中 (w_O) 是真实上下文词(w_I) 是输入词k 是负样本数(P_n(w)) 是噪声分布通常与词频相关。四、GloVe 全局统计与局部预测的融合4.1 共现矩阵的利用GloVeGlobal Vectors for Word Representation由 Stanford 于 2014 年提出结合了全局统计信息和局部上下文预测的优势。共现矩阵 (\mathbf{X} \in \mathbb{R}^{V \times V})其中 (X_{ij}) 表示词 j 出现在词 i 上下文中的次数。4.2 核心思想比率比GloVe 的关键洞察词对共现概率的比率比绝对概率更能表达语义关系。(\frac{P_{ik}}{P_{jk}} \frac{X_{ik}/X_i}{X_{jk}/X_j} \approx \frac{\exp(\mathbf{w}_i^\top \tilde{\mathbf{w}}_k)}{\exp(\mathbf{w}_j^\top \tilde{\mathbf{w}}_k)} \exp((\mathbf{w}_i - \mathbf{w}_j)^\top \tilde{\mathbf{w}}_k))### 4.3 目标函数(J \sum_{i,j1}^{V} f(X_{ij}) \left( \mathbf{w}_i^\top \tilde{\mathbf{w}}j b_i \tilde{b}j - \log X{ij} \right)^2)其中 (f(X{ij})) 是加权函数对罕见共现降权避免过度拟合稀有词对。五、Word Embedding 的数学性质5.1 线性语义关系Word2Vec 发现词向量空间存在惊人的线性结构(\mathbf{v}{\text{king}} - \mathbf{v}{\text{man}} \mathbf{v}{\text{woman}} \approx \mathbf{v}{\text{queen}})其他经典类比首都‑国家(\text{Paris} - \text{France} \text{Italy} \approx \text{Rome})动词时态(\text{walking} - \text{walk} \text{swim} \approx \text{swimming})复数形式(\text{cars} - \text{car} \text{apple} \approx \text{apples})5.2 几何解释表格数学操作语义含义应用向量加法语义组合“中国” “首都” ≈ “北京”向量减法语义差异“医生” ‑ “医院” ≈ “护士” ‑ “医院”余弦相似度语义相似度最近邻搜索、类比推理向量投影语义去偏去除性别 / 种族偏见六、从静态到动态上下文感知嵌入6.1 静态嵌入的局限Word2Vec 和 GloVe 生成的是静态词嵌入 —— 每个词只有一个固定向量无法处理一词多义表格句子“银行” 的含义静态嵌入问题“我去银行取钱”金融机构同一个向量“河岸边有一家银行”河岸 / 堤岸无法区分语境6.2 ELMo深度上下文表示ELMoEmbeddings from Language Models使用双向 LSTM为每个词生成语境相关的嵌入(\mathbf{h}{k,j}^{\text{ELMo}} \gamma \sum{j0}^{L} s_j \mathbf{h}{k,j}^{\text{LM}})其中 (\mathbf{h}{k,j}^{\text{LM}}) 是第 j 层 LSTM 的词 k 的隐藏状态(s_j) 是可学习的层权重(\gamma) 是缩放因子。6.3 BERTTransformer 时代的动态嵌入BERTBidirectional Encoder Representations from Transformers通过掩码语言模型和双向注意力实现了更深层的语境理解。训练目标MLMMasked Language Model随机掩码 15% 的 token预测原词NSPNext Sentence Prediction判断句子 B 是否是 A 的下一句动态嵌入生成(\mathbf{h}{\text{BERT}} \text{Transformer}{\text{encoder}}(\text{input_embeddings}))同一词在不同句子中获得不同向量“我用苹果手机支付” → 公司 / 品牌语义“我吃苹果” → 水果语义七、Word Embedding 的评估与应用7.1 内在评估Intrinsic Evaluation表格任务描述示例词类比完成类比关系man : woman :: king : ?词相似度与人类评分对比WordSim‑353、SimLex‑999最近邻检查语义相关性“python的邻居是否包含programming”7.2 外在评估Extrinsic Evaluation将 Embedding 作为特征输入下游任务情感分析、命名实体识别、机器翻译性能提升即证明 Embedding 质量。7.3 核心应用场景表格应用技术实现效果信息检索查询‑文档向量相似度语义搜索超越关键词匹配推荐系统用户 / 物品嵌入 相似度计算协同过滤、内容推荐机器翻译跨语言嵌入空间对齐零样本翻译、多语言模型问答系统问题‑答案嵌入匹配RAG检索增强生成八、总结Word Embedding 的理论体系分布式假设1954↓统计共现分析LSA/SVD↓神经网络语言模型2003→ Word2Vec2013CBOW/Skip‑gram 负采样↓全局统计融合GloVe, 2014共现矩阵 对数线性模型↓深度上下文模型2018ELMo → BERT/GPT → 大语言模型核心数学思想分布式表示语义分散在向量各维度而非局部符号预测即学习通过预测任务强制模型学习语义关系几何即语义向量空间的线性结构编码语言规律上下文即意义动态嵌入解决一词多义实现真正的 “理解”一句话总结Word Embedding 的本质是将语言的离散符号系统转化为连续的几何空间使得语义计算成为可能为现代自然语言处理奠定了数学基础。