Alex_McAvoy

想要成为渔夫的猎手

【概述】

Word2Vec 模型,是由谷歌提出的一套新的词嵌入(Word Embedding)方法,其实质上是一个简单的神经网络

该模型能够学习一个从高维稀疏离散向量到低维稠密连续向量的映射,该映射具有近义词向量的欧氏距离小,词向量之间的加减法有实际物理意义等特点

阅读全文 »

【概述】

N-Gram 模型是一种基于统计语言模型的算法,常用于预测一个文本中下一个单词出现的概率

其基本思想是将文本内容按词进行大小为 $N$ 的滑动窗口操作,形成长度是 $N$ 的词片段序列,每一个词片段被称为 gram,通过这种序列信息,来预测下一个项的出现概率

阅读全文 »

【概述】

潜在狄利克雷分配 LDA 模型的学习是一个复杂的最优化问题,难以精确求解,只能近似求解,常用的求解方法有吉布斯抽样和变分推理,本文仅介绍使用吉布斯抽样进行 LDA 模型的学习

对于给定文本的集合 $D=\{\mathbf{w}_1,\mathbf{w}_2,\cdots,\mathbf{w}_M\}$,其中 $\mathbf{w}_m=(w_{m1},w_{m2},\cdots,w_{mN_m})$ 是第 $m$ 个文本,以 $\mathbf{w}$ 表示文本集合的单词序列,即:

阅读全文 »

【概述】

潜在狄利克雷分配(Latent Dirichlet Allocation,LDA)是文本集合的生成概率模型,其假设话题由单词的多项分布表示,文本由话题的多项分布表示,单词分布和话题分布的先验分布都是狄利克雷分布,文本内容不同是由于它们的话题分布不同

LDA 模型表示了文本集合自动生成过程:首先,基于单词分布的先验分布(狄利克雷分布)生成多个单词分布,即决定多个话题内容;之后,基于话题分布的先验分布(狄利克雷分布)生成多个话题分布,即决定多个文本内容;最后,基于每一个话题分布生成话题序列,针对每一个话题,基于话题的单词分布生成单词,整体构成一个单词序列,即生成文本,重复这个过程生成所有文本

阅读全文 »

【概述】

狄利克雷分布(Dirichlet Distribution)是一种多元连续随机变量的概率分布,属于贝塔分布的扩展,在贝叶斯统计中,狄利克雷分布常作为多项分布的先验分布使用

在常见概率分布中,曾简单介绍过贝塔分布和多项分布,为便于符号统一,本文将先对多项分布进行重新叙述,再叙述狄利克雷分布

阅读全文 »

【概述】

概率潜在语义分析(Probabilistic Latent Semantic Analysis,PLSA)也称概率潜在语义索引(Probabilistic Latent Semantic Indexing,PLSI),是一种利用概率生成模型对文本集合进行话题分析的无监督学习方法

PLSA 受 LSA 启发,由 Hofmann 于 1999 年提出,与 LSA 不同的是,LSA 基于非概率模型,PLSA 基于概率模型,其假设每个文本由一个话题分布决定,每个话题由一个单词分布决定,利用隐变量表示话题,整个模型表示为一个由文本生成话题、话题生成单词,进而得到单词-文本共现数据的过程

阅读全文 »

【概述】

非负矩阵分解(Non-negative Matrix Factorization,NMF)是由 Lee 和 Seung 于 1999 年在《Nature》上提出的一种矩阵分解方法,其使分解后的所有分量均为非负值,并且同时实现非线性的维数约减,NMF 目前已逐渐成为机器学习中常用的多维数据处理工具之一

【基本思想】

阅读全文 »

【概述】

除了使用单词向量空间的度量来表示两个文本的语义相似度外,还可以使用话题相似度来进行表示

话题(Topic),并没有严格的定义,其是指文本所讨论的内容或者主题,一个文本一般含有若干话题,若两个文本的话题相似,那么两者的语义应该也相似

阅读全文 »

【概述】

词频-逆文档频率(Term Frequency-Inverse Document Frequency,TF-IDF)是一种用于信息检索与数据挖掘的常用加权技术,常用于衡量单词在文档中重要性,其结合了单词在文档中的频率和在整个文集中的普遍程度

TF-IDF 的主要思想是:如果某个单词在一个文档中出现的频率高,并且在其他文档中很少出现,则认为此词或者短语具有很好的类别区分能力

阅读全文 »