BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / bupt-auta / #88同步于 2014/4/22
该镜像源已超过 30 天没有更新,可能在源站已被删除。
buptAUTA机器人发帖

『码小农第三期』标签推荐算法实践

cslei54
2014/4/22镜像同步0 回复
标签推荐算法实践 --- *** 『码小农第三期』技术文章导览 *** 标签推荐算法实践 *** 当CPU飙升时,找出PHP中可能有问题的代码行 *** 几个生物学理论在计算机科学中的运用案例 --- 背景 为什么要做标签推荐? 通用的用户个性化推荐算法往往是基于用户的行为去计算1)用户与后台类目、2)用户商品之间(U2I)的偏好关系,在某些情况下,这套算法会遇到各种业务问题,首先,后台类目在淘宝的业务环境里是用来做商家后台商品管理,而不是用来做营销的,所以“用户与后台类目”的偏好关系很多情况下不能直接应用到个性化导购场景,“用户商品之间(U2I)的偏好关系”可以解决这个问题,但“用户商品之间的偏好关系”的缺陷在与数据粒度太细,针对不同的个性化需求,可能需要做不同的算法,也就是N个推荐场景可能需要N份U2I数据,这样开发代价大、周期长。 所以,目前想到的一个解决思路是,用“前台类目”的方式去构建用户偏好的粒度:基于标签的偏好,所谓的“标签”,其实是介于“类目”与“商品”之前的粒度,且它是扁平化的,直接面对业务需求的。 系统架构 标签推荐的系统架构基于推荐平台实现推荐服务接口提供。用户个性化特征(偏好类目、偏好价格段、偏好标签、偏好标签关键词)用于构建搜索Query,离线导入HBase;用户个性化推荐结果通过终搜服务建立商品索引并定制自定义打分排序计算功能来进行搜索和个性化排序。 算法架构 整个个性化标签推荐体系,建立在商品的标签挖掘,用户个性化标签意图识别(离线+实时),以及商品信息的索引体系上。大体的算法处理流程如下: 整个流程中,从用户的标签意图识别,query构造,以及搜索引擎通过用户的query召回商品,个性化的元素无处不在。 详细技术方案 一、标签库定义 标签人工定义和自动生成的权衡 标签本质上是一种商品信息的元数据,是对商品的标题、属性等非结果化信息的抽象。一般标签的自动抽取会用到聚类的方法,但无监督的学习往往生成的结果不可预知,按之前项目积累的经验,自动聚类的标签无法直接应用到业务场景,所以在我们目前的标签推荐方案中,我们采用了人工标注的方式。 二、Tag/User意图识别 一般训练U-I的模型的时候,常见的有ctr预估或者cvr预估,由于用户对曝光点击的行为有随意性,所以在训练U-I时主要考虑用户从点击到购买的概率。 三、个性化模型 用户-tag个性化的偏好算法:离线/实时,都是用来刻画用户的个性化需求,以及作为搜索商品搜索的个性化query,不同的是,两个算法的特征抽取和模型训练的时间窗口不同。用户的离线算法,体现的是用户长期的偏好,更倾向于挖掘用户长期的点击购买日志,通常以天为时间窗口进行特征收集和模型训练,而用户的实时算法,反映用户当前时间点的偏好,通常以session为时间窗口训练数据。 离线算法(用户长期偏好) 用户从打开一个商品到选择关掉,还是查看其他商品,还是最终点击购买,反映的是用户从浏览、选品、购买的决策过程,在这个决策过程中,用户会有各种的行为,如,从搜索、lish打开商品,查看图片,查看评价,联系客服,进入店铺页面,店铺内搜索,加入收藏夹,等等,每个行为都能从一定程度反应用户对该商品的“接受”程度,所以这些行为变量很自然的成为了购买决策模型训练的特征变量。另外,行业本身的特征也是模型需要考虑的关键点,如购买女装天然需要比购买家电比较更多的商品,因为女装的款式很多样,价格更便宜,用户的需求量越大,所以每一次点击对购买概率的权重也相应的不同。 实时算法(用户实时偏好) 用户在淘宝的行为常常不是单一的,可能10分钟前在看衣服,10分钟后就在看零食,所以用户的行为反应到他的偏好也是具有时效性的,过了这个点再去推荐,可能用户的偏好,情境上下文都发生了变化,推荐的有效性 就会大大降低。所以说越近的数据越能准确地预测用户的行为。 如上图所示:当前点击查看“连衣裙”的用户,未来购买“连衣裙”的概率,在点击查看连衣群的一分钟内,购买概率是8.6%,10分钟后,购买概率下降到2.4%,半个小时后概率下降到0.8%,一个小时后概率为0.2%。可以明显看出这个趋势,当用户行为发生后,根据行为计算用户偏好的时间越久,偏好的准确度越低。 四、商品排序策略 商品排序策略主要是按用户的个性化分数和商品本身的质量分加权排序。 商品的排序分为初排和精排两个步骤,根据用户个性化标签及类目偏好“海选”商品,按商品质量分控制海选池商品量后,按照用户的个性化query词、购买力精排,最终输出推荐结果。 五、个性化与打散策略 用户的个性化是为了让贴近用户的真实意图,更精准的为用户推荐商品,但卖家端的角度,也是为了流量打散,缓解平台的马太效应,让小众风格的内容有机会浮现。但当用户的行为特征特别稀疏的时候,或者某个TAG的商品特别庞大,而且有不同卖家发布很多同质商品的时候,就需要人为地增加打散策略。我们目前主要考虑的是通过,卖家ID,类目ID,商品的品牌ID做打散。 标签推荐的价值 解决了在个性化场景中,一套后台类目同时存在过粗或者过细,且本身不导购场景的问题。 沉淀了基于垂直市场的个性化解决方案。在任何垂直市场,只要实现通过人工或者机器学习的方法,事先预定义好标签库,则用户的个性化偏好,商品的个性化排序都能自动完成,不需要作额外的开发,支持垂直市场个性化的快速迭代、快速上线。 标签推荐在U站活动中的表现: 对比其他非基于标签推荐算法的活动(极客玩物、我是御宅族、吃心绝对、恋恋怀旧风),标签推荐算法支持的活动(私人定制),人均IPV高了11%,浏览转化高了80%,客单价均值基本持平。
订阅后,新回复会通过你的通知中心匿名送达。
0 条回复
暂无回复 · 你可以订阅本帖等待新回复。