阿里重排论文PRM 《Personalized Re-ranking for Recommendation》

和DLCM做法类似,都是使用序列模型对rank后的结构做rerank,不同点是PRM使用了transform encoder来建模,并且使用了用户预训练向量和位置向量

最后一层使用了softmax来计算每个item被点击的概率(论文提到使用click作为label,也就是所存在多个label为1的情况,不知道有没有做什么特殊处理),并采用了交叉熵损失

 

参考资料

https://zhuanlan.zhihu.com/p/382349636

https://zhuanlan.zhihu.com/p/79182904?from_voters_page=true

posted @ 2024-05-27 16:52  xd_xumaomao  阅读(21)  评论(0编辑  收藏  举报