论文深解:Word2Vec 的表示学习原理
Berkeley AI Research 论文从表示学习角度严格分析 word2vec 的工作机制。这是理解现代 LLM 基础的关键论文。
Berkeley AI Research 论文从表示学习角度严格分析 word2vec 的工作机制。这是理解现代 LLM 基础的关键论文。
word2vec 究竟学习什么,以及如何学习?回答这个问题等同于在最小化但有趣的语言建模任务中理解表示学习。尽管 word2vec 是现代语言模型的知名前驱,但多年来研究人员缺乏对其学习过程的定量和预测理论。在我们的新论文中,我们终于提供了这样一个理论。我们证明存在现实的、实用的训练机制,其中学习问题可以简化为无权最小二乘矩阵分解。我们用闭式形式求解了梯度流动力学;最终学到的表示只不过是 PCA 的结果。
当从小的初始化开始训练时,word2vec 分阶段地进行学习。左图:权重矩阵中的秩递增学习步骤,每一步都降低损失。右图:潜在嵌入空间的三个时间切片,展示了嵌入向量如何在每个学习步骤中扩展到越来越高维的子空间,直到模型容量饱和。
在详细说明这个结果之前,让我们先明确问题的动机。word2vec 是一个著名的算法,用于学习单词的稠密向量表示。这些嵌入向量通过对比学习算法训练;在训练结束后,任意两个单词之间的语义关系被编码为对应嵌入向量之间的角度。实际上,学到的嵌入在几何上表现出引人注目的线性结构:潜在空间中的线性子空间通常编码可解释的概念,如性别、动词时态或方言。这种所谓的线性表示假设最近引起了大量关注,因为 LLM 也表现出这种行为,使得内部表示的语义检查和新型模型引导技术成为可能。在 word2vec 中,正是这些线性方向使学到的嵌入能够通过嵌入向量加法完成类比任务(例如,"man : woman :: king : queen")。
也许这不应该令人惊讶:毕竟,word2vec 算法只是遍历文本语料库,训练一个两层线性网络,使用自监督梯度下降来建模自然语言中的统计规律。在这种框架下,word2vec 显然是一个最小化的神经语言模型。因此,理解 word2vec 是理解更复杂语言建模任务中特征学习的先决条件。
基于这一动机,让我们描述主要结果。具体来说,假设我们将所有嵌入向量随机初始化为非常接近原点的值,使它们实际上是零维的。那么(在某些温和的近似下),嵌入向量集体地在一系列离散学习步骤中一次学习一个"概念"(即正交线性子空间)。
这就像头突猛进地开始学习数学的新分支一样。起初,所有术语都混在一起——函数和泛函之间有什么区别?线性算子与矩阵呢?慢慢地,通过接触感兴趣的新设定,这些词在脑海中分离开来,它们的真实含义变得清晰。
因此,每个新学到的线性概念有效地增加了嵌入矩阵的秩,给每个词嵌入更多空间来更好地表达自己及其含义。由于这些线性子空间一旦学到就不再旋转,它们实际上是模型学到的特征。我们的理论使我们能够用闭式形式先验地计算这些特征——它们只是某个特定目标矩阵的特征向量,该矩阵仅由可测量的语料库统计和算法超参数定义。
答案简单得出人意料:潜在特征只是以下矩阵的顶部特征向量:
其中 $i$ 和 $j$ 索引词汇表中的单词,$P(i,j)$ 是单词 $i$ 和 $j$ 的共现概率,$P(i)$ 是单词 $i$ 的一元概率(即 $P(i,j)$ 的边际概率)。
从维基百科统计数据构建并对角化这个矩阵,我们发现顶部特征向量选中与名人传记相关的单词,第二个特征向量选中与政府和市政管理相关的单词,第三个与地理和制图描述符相关,等等。
关键要点是:在训练过程中,word2vec 找到了 $M^{\star}$ 的一系列最优低秩近似。它本质上等价于在 $M^{\star}$ 上运行 PCA。
以下图表说明了这种行为。
在左边,关键的经验观察是 word2vec(加上我们的温和近似)在本质上离散的步骤序列中学习。每一步都增加嵌入的有效秩,导致损失逐步下降。在右边,我们展示了潜在嵌入空间的三个时间切片,演示了嵌入在每个学习步骤中如何沿着新的正交方向扩展。此外,通过检查最强烈地与这些奇异方向对齐的单词,我们观察到每个离散的"知识块"对应一个可解释的话题级别概念。这些学习动态在闭形式中是可解的,我们在理论和数值实验之间看到了极好的匹配。
它们是:1) 在原点周围目标函数的四次近似;2) 对算法超参数的特定约束;3) 足够小的初始嵌入权重;4) 无穷小的梯度下降步长。幸运的是,这些条件不是很强,实际上它们与原始 word2vec 论文中描述的设定非常相似。
重要的是,没有任何近似涉及数据分布!实际上,该理论的一个巨大优势是它不做任何分布假设。因此,该理论根据语料库统计和算法超参数准确预测学到的特征。这特别有用,因为在分布不可知的设定中,对学习动态的细粒度描述是罕见的和难以获得的;据我们所知,这是实用自然语言任务的第一个。
至于我们做出的近似,我们经验上表明我们的理论结果仍然对原始 word2vec 提供忠实的描述。作为我们近似设定与真实 word2vec 之间一致性的粗略指示,我们可以比较标准类比完成基准上的经验分数:word2vec 达到 68% 的准确率,我们研究的近似模型达到 66%,标准经典替代方案(称为 PPMI)只得到 51%。查看我们的论文以查看有详细比较的图表。
为了演示该结果的有用性,我们应用我们的理论来研究抽象线性表示的出现(对应于二元概念,如男性/女性或过去/未来)。我们发现,在学习过程中,word2vec 在一系列有噪声的学习步骤中构建这些线性表示,它们的几何被尖峰随机矩阵模型很好地描述。在训练初期,语义信号占主导;然而,在训练后期,噪声可能开始占主导,导致模型分辨线性表示能力的降低。有关更多详细信息,请查看我们的论文。
总的来说,这一结果给出了对特征学习的第一个完整闭形式理论,在一个最小化且相关的自然语言任务中。从这个意义上讲,我们认为我们的工作是在获得描述实用机器学习算法性能的现实分析解决方案这一更大项目中的一个重要进步。
了解更多关于我们工作的信息:完整论文链接
此文原发表于 Dhruva Karkada 的博客。