1、FFM理论

在CTR预估中，经常会遇到one-hot类型的变量，one-hot类型变量会导致严重的数据特征稀疏的情况，为了解决这一问题，在上一讲中，我们介绍了FM算法。这一讲我们介绍一种在FM基础上发展出来的算法-FFM（Field-aware Factorization Machine）。
FFM模型中引入了类别的概念，即field。还是拿上一讲中的数据来讲，先看下图：
推荐系统遇上深度学习(二)--FFM模型理论和实践
在上面的广告点击案例中，“Day=26/11/15”、“Day=1/7/14”、“Day=19/2/15”这三个特征都是代表日期的，可以放到同一个field中。同理，Country也可以放到一个field中。简单来说，同一个categorical特征经过One-Hot编码生成的数值特征都可以放到同一个field，包括用户国籍，广告类型，日期等等。
在FFM中，每一维特征 xi，针对其它特征的每一种field fj，都会学习一个隐向量 v_i,fj。因此，隐向量不仅与特征相关，也与field相关。也就是说，“Day=26/11/15”这个特征与“Country”特征和“Ad_type"特征进行关联的时候使用不同的隐向量，这与“Country”和“Ad_type”的内在差异相符，也是FFM中“field-aware”的由来。
假设样本的 n个特征属于 f个field，那么FFM的二次项有 nf个隐向量。而在FM模型中，每一维特征的隐向量只有一个。FM可以看作FFM的特例，是把所有特征都归属到一个field时的FFM模型。根据FFM的field敏感特性，可以导出其模型方程。
推荐系统遇上深度学习(二)--FFM模型理论和实践
可以看到，如果隐向量的长度为 k，那么FFM的二次参数有 nfk 个，远多于FM模型的 nk个。此外，由于隐向量与field相关，FFM二次项并不能够化简，其预测复杂度是 O(kn^2)。

注：FFM的主要思想是，不是每维度特征学习一个隐变量，而是每维特征有多个隐变量，每维特征对应的隐变量的数目等于filed的数目，和不同的filed的特征交叉使用不用的隐变量。

下面以一个例子简单说明FFM的特征组合方式。输入记录如下：
推荐系统遇上深度学习(二)--FFM模型理论和实践
这条记录可以编码成5个特征，其中“Genre=Comedy”和“Genre=Drama”属于同一个field，“Price”是数值型，不用One-Hot编码转换。为了方便说明FFM的样本格式，我们将所有的特征和对应的field映射成整数编号。
推荐系统遇上深度学习(二)--FFM模型理论和实践
那么，FFM的组合特征有10项，如下图所示。

推荐系统遇上深度学习(二)--FFM模型理论和实践
其中，红色是field编号，蓝色是特征编号。

2、FFM实现细节

这里讲得只是一种FFM的实现方式，并不是唯一的。
损失函数
FFM将问题定义为分类问题，使用的是logistic loss，同时加入了正则项
推荐系统遇上深度学习(二)--FFM模型理论和实践
什么，这是logisitc loss？第一眼看到我是懵逼的，逻辑回归的损失函数我很熟悉啊，不是长这样的啊？其实是我目光太短浅了。逻辑回归其实是有两种表述方式的损失函数的，取决于你将类别定义为0和1还是1和-1。大家可以参考下下面的文章：https://www.cnblogs.com/ljygoodgoodstudydaydayup/p/6340129.html。当我们将类别设定为1和-1的时候，逻辑回归的损失函数就是上面的样子。
随机梯度下降
训练FFM使用的是随机梯度下降方法，即每次只选一条数据进行训练，这里还有必要补一补梯度下降的知识，梯度下降是有三种方式的，截图取自参考文献3：
推荐系统遇上深度学习(二)--FFM模型理论和实践
总给人一种怪怪的感觉。batch为什么是全量的数据呢，哈哈。

3、tensorflow实现代码

本文代码的github地址：
https://github.com/princewen/tensorflow_practice

原文链接：https://www.jianshu.com/p/781cde3d5f3d

推荐系统遇上深度学习(二)--FFM模型理论和实践

1、FFM理论

2、FFM实现细节

3、tensorflow实现代码

相关推荐