[์ฐธ์กฐ ๋
ผ๋ฌธ ๋ฐ ์ฌ์ดํธ]
โDeep Learning based Recommender System: A Survey and New Perspectives
โReinforcement Learning to Rank in E-Commerce Search Engine:Formalization, Analysis, and Application
โPersonalizing Session-based Recommendations with Hierarchical Recurrent Neural Networks
โWide & Deep Learning for Recommender Systems
โConvolutional Matrix Factorization for Document Context-Aware Recommendation
โDeep Neural Networks for YouTube Recommendations
โITEM2VEC: NEURAL ITEM EMBEDDING FOR COLLABORATIVE FILTERING
โDocument Context-Aware Recommendation
โA Multi-View Deep Learning Approach for Cross Domain User Modeling in Recommendation

1.์ฐ๊ด๊ท์น๋ถ์(A Priori Algorithm)/ ์ฅ๋ฐ๊ตฌ๋ ๋ถ์(Market Basket Analysis)
๊ต๊ณผ์์์ ๋ง์ด ๋ณด์์ ์๊ณ ๋ฆฌ์ฆ์ผ๋ก ํ์ ์์๋ ์๋ฌด๋ ์ฌ์ฉํ์ง ์๋ ์๊ณ ๋ฆฌ์ฆ์ด์ง๋ง, ์ถ์ฒ ์๊ณ ๋ฆฌ์ฆ์ ์์ด๊ฒฉ์ผ๋ก ๊ฐ๋จํ๊ฒ ์ค๋ช ์ํ๊ณ ๋์ด๊ฐ๋๋ก ํ๊ฒ ๋ค. ์ฅ๋ฐ๊ตฌ๋ ๋ถ์์ ๊ธฐ๋ณธ์ ์ผ๋ก ๊ณ ๊ฐ์ ๊ตฌ๋งค ์ด๋ ฅ์ ๋ฐํ์ผ๋ก A๋ผ๋ ์ ํ์ ๋ง์ด ์ฌ๋ ์ฌ๋์ด B๋ผ๋ ์ ํ์ ๋ง์ด ์ฌ๋๋ผ์ ๊ฐ์ ํํ๋ก ์ถ๋ก ํ๋ ๊ฒ์ผ๋ก ์ดํดํ ์ ์๋ค.
| ์กฐ๊ฑด์ | ๊ฒฐ๊ณผ์ | ์ง์ง๋ | ์ ๋ขฐ๋ | ํฅ์๋ |
|---|---|---|---|---|
| ์ฐธ์น์บ | ๋ฌ๊ฑ, ๋ผ๋ฉด | 1 | 2.5 | 2.5 |
| ์ฐธ์น์บ | ๋ฌ๊ฑ | 1 | 1.5 | 1.5 |
| ๋ผ๋ฉด,์ฐธ์น์บ | ๋ฌ๊ฑ | 1 | 1 | 1 |
์ฃผ์ด์ง ๋ฐ์ดํฐ์์ ์์ ๊ฐ์ ๊ฒฐ๊ณผ๋ฅผ ์ถ์ถํ์ฌ ์ฐธ์น์บ์ ์ฐ ์ฌ๋์๊ฒ ๋ฌ๊ฑ์ ์ถ์ฒํ๋ ์์ผ๋ก ํ์ฉํ๋ค๊ณ ์ดํดํ ์ ์๊ฒ ๋ค. ์ฌ๊ธฐ์ ๋์ค๋ ์ง์ง๋(support)์ ์ ๋ขฐ๋(confidence), ํฅ์๋(lift) ๋ ์๋์ ๊ฐ์ด ์ ์ํ ์ ์๋ค.
- ์ง์ง๋(support) s(XโY) = X์ Y๋ฅผ ๋ชจ๋ ํฌํจํ๋ ๊ฑฐ๋ ์ / ์ ์ฒด ๊ฑฐ๋ ์ = n(XโชY) / N
- ์ ๋ขฐ๋(Confidence) c(XโY) = X์ Y๋ฅผ ๋ชจ๋ ํฌํจํ๋ ๊ฑฐ๋ ์ / X๊ฐ ํฌํจ๋ ๊ฑฐ๋ ์ = n(XโชY) / n(X)
- ํฅ์๋(Lift) = ์ฐ๊ด๊ท์น์ ์ ๋ขฐ๋/์ง์ง๋ = c(XโY) / s(Y)
์ฐธ์กฐ : https://ratsgo.github.io/machine%20learning/2017/04/08/apriori/
2.ํ์ ํํฐ(Collaborative Filtering)

ํ์
ํํฐ๋ ๊ณ ๊ฐ์ ๊ตฌ๋งค ์ด๋ ฅ ํน์ ๋ณ์ ๋ฑ์ ์ด๋ ฅ์ ๊ธฐ๋ฐ์ผ๋ก ์ ์ฌํ ๊ณ ๊ฐ๊ทธ๋ฃน ํน์ ์ ํ ๊ทธ๋ฃน์ ์ฐพ์ ์ถ์ฒํ๋ ๋ฐฉ์์ ๋งํ๋ค. ๋๋ฌธ์ ์ ๊ท ๊ณ ๊ฐ์ ๋ํด์๋ ์ ์ฌ๋๋ฅผ ๊ตฌํ ์ ์๋, Cold Start ๋ฌธ์ ๋ฑ์ด ์กด์ฌํ์ง๋ง, ํ์ฌ ๋ฅ๋ฌ๋ ๊ธฐ๋ฐ์ ์ถ์ฒ ๋ชจ๋ธ์์๋ ๊ธฐ๋ณธ ๊ฐ๋
์ผ๋ก์ ์ฌ์ฉ๋๊ณ ์๋ค. ์กฐ๊ธ ๋ ์์ธํ ์ค๋ช
ํด๋ณด๋ฉด ์ฐ๋ฆฌ๊ฐ ๊ฐ์ง๊ณ ์๋ ๊ตฌ๋งค/์ถ์ฒ ๋ฑ ๋ฐ์ดํฐ๋ ์์ ๊ฐ์ ํํ์ Sparse Matrix ํํ๋ก ํํ์ด ๊ฐ๋ฅํ๊ณ , ํ๋์ ๊ณ ๊ฐ์ ๋ณต์์ ์ ํ์ ๋ํ ์ ํธ๋๋ก ๊ทธ ํน์ฑ์ด Featureํํ๋ก ํํ์ด ๊ฐ๋ฅํ๋ค. ์ด๋ฌํ Feature ๊ฐ์ ์ ์ฌ๋๋ฅผ ํตํด ํด๋น User ๋ Buy ํ์ง ์์์ง๋ง, ์ ์ฌ ๊ทธ๋ฃน์ ๋ง์ด Buy ํ ๋ฌผ๊ฑด์ ์ถ์ฒํ๋ ํํ๋ก ์ด๋ฃจ์ด ์ง๋ ๊ฒ์ด ํ์
ํํฐ๋ง์ ๊ธฐ๋ณธ ๊ฐ๋
์ด ๋๊ฒ ๋ค.
์์ Matrix ๊ฐ ๋งค์ฐ ๋ง์ User ์ ์ ํ์ ๋ํด์ ํํ๋๋ค๊ณ ์๊ฐํด๋ณด๋ฉด, ์์ฒญ๋๊ฒ ๊ทธ ๋ฐ์ดํฐ ์ฌ์ด์ฆ์ ๊ณ์ฐ๋์ ์ปค์ง๊ฒ ๋ ๊ฒ์ด๋ค. ๋๋ฌธ์ 2000๋
๋ Hadoop/Spark ๋ถ์ฐ์ฒ๋ฆฌ์ ๊ฒฐํฉ์ ํตํ CF ๊ธฐ๋ฒ์ด ๋ง์ด ์ฌ์ฉ๋๊ณ ๋ ํ์๋ค.
์ฌ๊ธฐ์ ์ค์ ๊ตฌํ ๋ฐฉ๋ฒ์ ํฌ๊ฒ Memory Based์ Model Based ๋ก ๋๋์ด ์ง ์ ์๋ค. ์ด ๋ ๋ฐฉ๋ฒ์ ์ฐจ์ด๋ ML ์ ์ฌ์ฉํ์ฌ ํ๋ผ๋ฉํฐ๋ฅผ ํ๋ จํ๋์ง ์๋๋ฉด ๊ทธ๋ฐ ๊ณผ์ ์์ด ๋ฐ์ดํฐ๋ฅผ ํด์ํ๋์ง๋ก ์ดํดํ๋ฉด ๋๊ฒ ๋ค.
- Memory Based : Euclidean, Cosine, Pearson ๋ฑ ์ ์ฌ๋ ๋ฑ ๊ฑฐ๋ฆฌ ์ธก์ ๋ฐฉ๋ฒ
- Model Based : Clustering(KNN ๋ฑ), ์ฐจ์์ถ์(SVD,PMF,NMF,PCA ๋ฑ) , Deep Learning ๋ฑ

CF ๊ฐ๋ ์ ๋ฐ์ดํฐ๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ๋ค์ํ ์ฐ๊ตฌ๊ฐ ์ด๋ฃจ์ด ์ง๋๋ฐ, ๋จ์ํ๊ฒ Memory Based ๋ฐฉ๋ฒ์ผ๋ก ๊ฑฐ๋ฆฌ๋ฅผ ์ธก์ ํ๋ ๋ฐฉ๋ฒ๋ถํฐ, Matrix Decomposition ํ ์ ์ฌ๋๋ฅผ ๊ตฌํ๋ ๋ฐฉ๋ฒ, Matrix Decomposition ํ Deep Learning ์ Input ์ผ๋ก ์ฌ์ฉํ๋ ๋ฐฉ๋ฒ ๋ฑ ๋ค์ํ ๋ฐฉ๋ฒ์ด ์ ์ฉ ๋ ์ ์๊ฒ ๋ค.
3.Item2Vec
์ฅ๋ฐ๊ตฌ๋ ๋ถ์์ ์ด๋ค ์ํ์ ๊ตฌ์
ํ ๋ ๊ฐ์ด ๊ตฌ๋งคํ๋ ์ํ์ด๋ผ๋ ๊ด์ ์์ ์ง์ง๋(support)์ ์ ๋ขฐ๋(confidence), ํฅ์๋(lift) ๋ฅผ Measure ๋ก ์ฌ์ฉํ์๋ค. CF(ํ์
ํํฐ์์๋) ์ฌ์ฉ์์ ๊ตฌ๋งค/์ถ์ฒ ๋ฑ์ ๋ฐ์ดํฐ๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ๊ทธ ์ ์ฌ๋๋ฅผ Measure ๋ก ์ถ์ฒ ์ํ์ ๊ฒฐ์ ํ์๋ค. (๋ฌผ๋ก MF ๊ธฐ๋ฐ์ผ๋ก Matrix ๋ฅผ ๋ถ๋ฆฌํ๊ณ ์ํ ๊ธฐ์ค์ Feature ๋ ์ฌ์ฉํ ์๊ฐ ์์ง๋ง) Item2Vec๋ผ๋ ๊ฐ๋
์์๋ ์ปจํ ์ธ ๊ฐ ๊ฐ์ง๊ณ ์๋ “์ ๋ชฉ”,”์์ฑ”,”์์”,”์ค๋ช
”๋ฑ ๋น์ ํ ์ ๋ณด๋ฅผ ์ง์ Vector ํ ํ๊ณ ๊ทธ ์ ์ฌ๋๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ์ถ์ฒํ๊ธฐ ์ํ ๊ฐ๋
์ผ๋ก ์ดํดํ๋ฉด ์ข์ ๋ฏ ํ๋ค.
Contents ์์ฒด์ Feature ๋ฅผ ๋์ถํ๊ธฐ ์ํ ๋ฐฉ๋ฒ์ Word2Vec, Doc2Vec, LDA2Vec, DEC(Autoencoder), Deep Learning Based Language Model ์ฌ์ฉ ๋ฑ ๋ค์ํ ๋ฐฉ๋ฒ์ด ์์ ์ ์์ผ๋, 2000๋
๋ Item2Vec ์ ์๊ฐ์ ์ค ์ฐ๊ตฌ๋ ๋จ์ฐ Word2Vec ์ด์์ ๊ฒ์ด๋ค.
์ฐธ์กฐ : ITEM2VEC: NEURAL ITEM EMBEDDING FOR COLLABORATIVE FILTERING
4. Document Context-Aware Recommendation(CF + CNN, AutoEncoder .. Etc)

CF ์ CNN, AutoEncoder ๋ฑ Deep Learning ๋ชจ๋ธ์ ๊ฒฐํฉํ๋ ํํ์ ์ฐ๊ตฌ๋ค์ด ์งํ๋์๋ค. Item2Vec ์์ ๋น์ ํ ๋ฐ์ดํฐ๋ฅผ ์ถ์ฒ์ ํ์ฉํ๊ณ ์ ํ๋ ์ฐ๊ตฌ๋ก๋ถํฐ ๊ธฐ์กด์ ์ฐ๊ตฌ์์ ๊ฒฐํฉํํ๋ก ๋ง์ด ์งํ์ด ๋์๋ค๊ณ ์๊ฐ๋๋ค. ์ด ์๊ธฐ๊น์ง๋ ์ฌ์ ํ ๊ธฐ์กด์ ๋ฐฉ๋ฒ๋ก ์ Deep Learning ์ Feature ๋ง ์ ๋ฝ์ ์ฃผ๋ฉด ๋๋ค๋ ์๊ฐ์ด ๋ง์ด ๋๊ปด์ง๋ค.
์ ๊ตฌ์กฐ๋ฅผ ๊ฐ๋จํ๊ฒ ์ค๋ช ํ๋ฉด ์๋์ ๊ฐ์
- Document Information ์ CNN ์ ํตํด์ Feature ๋ฅผ ์ ์ถ์ถ ํ ์ ์๋๋ก ํจ
- CF ์ Spare ํ Matrix ์ Matrix Factorization์ ํตํด User ์ Item Vector ๋ก ๋ถ๋ฆฌ ๊ฐ๋ฅ
- ์์ Document ์์ ์ถ์ถํ Feature ๋ฅผ Item Vector ๋ก ์ฌ์ฉํจ
- ํน์ User Vector ๋ฅผ ์๊ณ ํด๋น User ์ CF Matrix ์ ์๊ณ ์์ผ๋ Loss Function ๊ตฌ์ฑ์ด ๊ฐ๋ฅํด ์ง
5. A Multi-View Deep Learning Approach for Cross Domain User Modeling in Recommendation

DSSM( A deep structured semantic model ) ๊ณ์ด์ ์ฐ๊ตฌ๋ค์ ์ฌ์ฉ์์ ๊ฒ์/ํ๋๋ฑ์ Encoding ํ๊ณ ๊ฐ Item์ ๋ํ ํน์ฑ์ Encoding ํ ํ์ ์๋์ ๊ฐ์ด Cosine ์ ์ฌ๋๋ฅผ ํตํด ๊ณ ๊ฐ์ ํ๋๊ณผ ๊ฐ์ฅ ์ ์ฌํ ์ํ์ ์ถ์ฒํ๋ ํํ๋ก ๊ตฌ์ฑ๋์ด ์๋ค. ํ๋ จ์ ๋น์ฐํ ์ค์ ๊ตฌ๋งค/ํด๋ฆญํ ์ํ์ ๊ฒฝ์ฐ 1 ์๋๋ฉด 0์ผ๋ก ์ ์ฌ๋์ CE ๋ฅผ ํตํด ํ๋ จํ๋ ํํ๊ฐ ๋ ๊ฒ์ด๋ค.
์ ๋
ผ๋ฌธ์ ๊ฒฝ์ฐ ๊ธฐ์กด DSSM ์์ ํน์ ๋ถ์ผ์์์ ๊ณ ๊ฐ์ ์๋น ํจํด์ ๋ค๋ฅธ ๋ถ์ผ์์๋ ์ ์ฉ๋ ์ ์์ ๊ฒ์ด๋ผ๋ Cross-Domain ๊ฐ๋
์ด ์ถ๊ฐ๋ ํํ๋ก ์ดํดํ๋ฉด ์ข์ ๋ฏ ํ๋ค.
6. Deep Neural Networks for YouTube Recommendations
์ด ์๊ธฐ๋ถํฐ ๊ธ์๋๋ก ๋ฅ๋ฌ๋ ๊ธฐ๋ฐ์ ์ฐ๊ตฌ๋ก Phase ๊ฐ ๋์ด๊ฐ๋ ๊ฒ์ผ๋ก ์๊ฐ๋๋ค. ํ๋ฆ ์์ฒด๊ฐ ๊ธฐ์กด์ CF, CB ๋ฑ์ ๊ฐ๋ ์ ์ข ์๋๊ธฐ ๋ณด๋ค๋ ๋ชจ๋ ๋ฐ์ดํฐ๋ฅผ ๋ค ์ ๊ฒฝ๋ง์ ๋ฃ๊ณ ์์ธก์ ํ๋ ํํ๋ก ์งํ๋๋ฉฐ, ์ถ์ฒ ๊ด๋ จ ์ฐ๊ตฌ๋ผ๊ธฐ ๋ณด๋ค๋ ๋ฅ๋ฌ๋ ๊ด๋ จ ์ฐ๊ตฌ์ ๋ฐ์ ์ ๋ฐ๋ผ ํด๋น ์ฐ๊ตฌ๋ฅผ ์ถ์ฒ์ ์ฐจ์ฉํ๊ณ ๋ณตํฉ์ ์ผ๋ก ์ ์ฉํ๋ ํํ๋ก ์ฐ๊ตฌ๊ฐ ์ง์์ ์ผ๋ก ๋ฐ์ ๋๋ค๊ณ ์ดํด๋๋ค.

YouTube ์ถ์ฒ์ ์ฌ์ฉ๋ ์๊ณ ๋ฆฌ์ฆ์ ๋ํ ์ฐ๊ตฌ๋ก, ํฌ๊ฒ ๋ ๋ถ๋ถ์ผ๋ก ๋๋์ด ์ง๋ค. ํ๋ณด ์ถ์ถ ๋ชจ๋๊ณผ ๋ญํน ๋ชจ๋์ด๋ค.

์๋ N ๊ฐ์ ํ๋ณด ๋์์ผ๋ก ์์ถํ๊ธฐ ์ํ ๋ชจ๋์ ์ํคํ์ณ์ด๋ค. Input ์ ์์ ์ด ๋ณด์๋ ์ํ๋ค์ Avg Feature ์ ๊ฒ์ํ์๋ ์์๋ค์ Avg Feature ๋ฐ ๊ธฐํ ์ฑ๋ณ, ์ง์ญ ๋ฑ ์ ํ ๋ฐ์ดํฐ๋ฅผ ์ฌ์ฉํ๋ค. Y ๋ ์ด๋ธ์ ์ข์์ ๋ฑ์ Flag ๊ฐ ์๋ ๋๊ฐ์ง ์์ฒญํ์๋์ง ์ฌ๋ถ๋ฅผ ์ฌ์ฉํ๋ค. Output Layer ๋ Extreme multiclass classification ์ด๋ผ๊ณ ํํํ๊ณ ์๋๋ฐ, ๋ชจ๋ ์ํ์ ์ข ๋ฅ๋ณ๋ก ๋ณผ ํ๋ฅ (0~1)์ ๊ตฌํ๋ค. Train ์์๋ ์ฐ๋ฆฌ๊ฐ ๊ฐ์ง๊ณ ์๋ Y Label ๊ณผ์ CE ๋ฅผ Loss ๋ก ์ ๊ฒฝ๋ง์ ํ๋ จํ๋ฉฐ, Inference ์์๋ ๋ง์ง๋ง Feature ๋ฅผ ๊ฐ ์ํ๋ณ Feature Index(ํ๋ จ์์ Update)์ ์ ์ฌ๋ ๋น๊ต๋ฅผ ํตํด ์ถ์ฒ์ ์คํํ๋ค. (Top K ๊ฐ๋ฅผ ๊ณ ๋ฅด๋ ํ์๋ฅผ ํ๊ฒ ๋๋ค)

์ด์ ๋ 1์ฐจ๋ก ์ถ์ฒ๋ ๋ชฉ๋ก์ Ranking ์ ๊ตฌํ๋ ์์ ์ ์งํํ๋ค. ์ด ๋์๋ ๋ ๋ง์ ์๋ฐฑ๊ฐ ์ด์์ ์์๋ค์ X ์ธ์๋ก ์ฌ์ฉํ์ฌ, ๋ ธ์ถ๋๋น ์ผ๋ง๋ ๋ง์ด ์์ฒญํ์๋์ง๋ฅผ Loss ๋ก ํ์ฌ Real Time ์ผ๋ก ๋ชจ๋ธ์ ๊ณ์ํด์ ํ๋ จํ์ฌ ์ฌ์ฉํ๋ค. (๊ณ ๊ฐ์ด ์ค์๊ฐ์ผ๋ก ์ถ์ฒ ํ์ ๋, ์ด๋ป๊ฒ ๋ฐ์ํ์๋์ง๋ฅผ ๋ค์ Serving ์ ๋ฐ์ํ๋ ๊ฒ์ด ์ค์ํจ, ๊ทธ๋ ์ง ์์ผ๋ฉด, ๊ทธ ๊ณ ๊ฐ์ด ๋ง์์ ๋ค์ง ์๋ ์ถ์ฒ ์์์ด ๊ณ์ ์ถ์ฒ ๋ ๊ฒ์) ๋, ์ด์ ์ ๋ดค๋ ์์๋ค์ Avg ์ ์ง์ ์ ๋ณธ ์์์ ๋ํ Feature๋ ๋ถ๋ฆฌํ์ฌ Input ์ ๋ฃ์ด์ฃผ์ด ํ์ฌ ์์์ ๋ณด๊ณ ์๋ ์์์ ๋ฐ๋ผ ๋ค๋ฅธ ์์์ ๊ณ์ ์ถ์ฒํ๊ธฐ ์ํ ์ฅ์น๋ฅผ ๋ง๋ จํ๋ค.
์ง๊ธ์์ ๋ณด๋ฉด ์ ์ฒด์ ์ผ๋ก ํน๋ณํ ๊ฒ๋ ์๊ณ ํ์ดํ ๋ด์ฉ๋ค์ด ์ง๋ถํ ๋์ด๋ก ๋ณด์ด๊ธฐ๋ ํ์ง๋ง, ๊ทธ ๋น์์๋ ๋ญ๊ฐ ๊ธฐ์กด์ ํ์ ๊นจ๊ณ ๋ฅ๋ฌ๋์ผ๋ก End2End ์ถ์ฒ ๋ฌธ์ ๋ฅผ ํด๊ฒฐํ๊ณ , ํ๋ จ๊ณผ์ ๊ณผ ์ฌ์ฉ๊ณผ์ ์ Interactive ํ๊ฒ ์ค๊ณํ์๋ค๋ ์ ์์ ์๋ฏธ๊ฐ ์์๋ค.
7. Wide & Deep Learning for Recommender Systems

๋ก์ง์คํฑ ํ๊ท ๋ชจ๋ธ์ ์ด์ฉํ์ฌ ์ถ์ฒ ์๊ณ ๋ฆฌ์ฆ์ ์์ฑํ์ฌ ํ์ต์ ์ํจ ๊ฒฝ์ฐ, ํ์ต ๋ฐ์ดํ๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ์์ธํ๋ ์์ธก ๊ฒฐ๊ณผ๋ฅผ ๋ฆฌํดํด์ค๋ค. ์๋ฅผ ๋ค์ด ๊ฒ์ ํค์๋ (ํ๋ผ์ด๋ ์นํจ)์ผ๋ก ๊ฒ์ํ ์ฌ์ฉ์๊ฐ (์นํจ๊ณผ ์ํ)์ ์ฃผ๋ฌธํ ๊ธฐ๋ก์ด ๋ง์๋ค๋ฉด, ์ด ๋ชจ๋ธ์ (ํ๋ผ์ด๋ ์นํจ)์ผ๋ก ๊ฒ์ํ ์ฌ์ฉ์๋ ํญ์ (์นํจ๊ณผ ์ํ)์ ์ถ์ฒํด์ฃผ๊ฒ ๋๋ค. ์ฆ ์์ ์ ๊ธฐ์ต๋ ๊ฐ (Memorization๋ ๊ฐ)์ ํตํด์ ์์ธก์ ํ๋๋ฐ, ์ด๋ฌํ ๋ชจ๋ธ์ ์์ด๋ ๋ชจ๋ธ์ด๋ผ๊ณ ํ๋ค.
๊ทธ๋ฌ๋ (ํ๋ผ์ด๋ ์นํจ)์ผ๋ก ๊ฒ์ํ ์ฌ์ฉ์์๊ฒ ๊ฐ์ ํจ์คํธ ํธ๋ ์ข ๋ฅ์ธ ํ๋ฒ๊ฑฐ๋ ํ๋ ์นํ๋ผ์ด๋ฑ์ ์ถ์ฒํด๋ ์ ๊ตฌ๋งค๊ฐ ๋์ง๋ง ์์ด๋ ๋ชจ๋ธ์ ๊ธฐ์กด์ ๊ธฐ์ต๋ ๊ฒฐ๊ณผ๋ก๋ง ์ถ์ฒ์ ํ๊ธฐ ๋๋ฌธ์ ์ด๋ฌํ ๊ฒฐ๊ณผ๋ฅผ ์ป๊ธฐ๊ฐ ์ด๋ ต๋ค.
๋ด๋ด๋คํธ์ํฌ ๋ชจ๋ธ์ ๊ฒฝ์ฐ ํ๋ผ์ด๋ ์นํจ์ ํ๋ฒ๊ฑฐ, ํ๋์น ํ๋ผ์ด๋ฑ์ ์ผ๋ฐํ ์์ผ์ ํจ์คํธ ํธ๋๋ก ๋ถ๋ฅํ์ฌ ํ๋ผ์ด๋ ์นํจ์ผ๋ก ๊ฒ์์ ํด๋ ์ด์ ๊ฐ์ ์ข ๋ฅ์ ํ๋ฒ๊ฑฐ๋ฅผ ์ถ์ฒํด๋ ์ฌ์ฉ์๊ฐ ํํ ๊ฐ๋ฅ์ฑ์ด ๋๋ค.
์ด๋ฌํ ๋ชจ๋ธ์ ๋ฅ๋ชจ๋ธ์ด๋ผ๊ณ ํ๋๋ฐ, ๋ฅ ๋ชจ๋ธ์ ๊ฒฝ์ฐ ๋ฌธ์ ์ ์ด, ๋๋ฌด ์ผ๋ฐํ๊ฐ(under fitting) ๋์ ์๋ฑํ ๊ฒฐ๊ณผ๊ฐ ๋์ฌ ์ ์๋ค๋ ๊ฒ์ธ๋ฐ, ์๋ฅผ ๋ค์ด์ ๋ฐ๋ปํ ์๋ฉ๋ฆฌ์นด๋ ธ๋ฅผ ๊ฒ์ํ๋๋ฐ, ์ปคํผ๋ผ๋ ์ผ๋ฐํ ๋ฒ์ฃผ์์ ์์ด์ค ๋ผ๋ผ๋ฅผ ์ถ์ฒํด์ค ์ ์๋ค๋ ๊ฒ์ด๋ค. ์ฆ ์ปคํผ๋ผ๋ ์ผ๋ฐํ ๋ฒ์ฃผ์์ ๋ผ๋ผ๋ ๋ง๋ ์ถ์ฒ์ผ ์ ์์ง๋ง, ๋ฐ๋ปํ ์๋ฃ๋ฅผ ์ํ๋ ์ฌ๋์๊ฒ ์ฐจ๊ฐ์ด ์๋ฃ๋ฅผ ์ถ์ฒํ๋ ์ง๋์น ์ผ๋ฐํ๊ฐ ๋ฐ์ํ ์ ์๋ค.

๊ทธ๋์ ๊ฒฐ๊ตญ Logistic ๊ธฐ๋ฐ์ Wide ์ Deep Learning ๊ธฐ๋ฐ์ Deep ์ ๋์์ Ensemble ํ์ฌ ํ๋จํ๋ฉด์, End2End Network ๋ก ํ๋ฒ์ ํ๋ จํ ์ ์๋๋ก Joint Training ๊ฐ๋ ์ ์ ์ฉํ์๋ค๋ ๊ฒ์ด ์ด ๋ ผ๋ฌธ์ ํต์ฌ์ด ๋๊ฒ ๋ค.
8. Personalizing Session-based Recommendations with Hierarchical Recurrent Neural Networks

์ด ๋ ผ๋ฌธ์์์ ํต์ฌ์ Session ์ด๋ผ๋ ๊ฐ๋ ์ด๋ค. ์ ํต์ ์ธ CF(ํ์ ํํฐ) ๋ฐฉ์๋ฑ์ ๊ณ ๊ฐ์ Log Term Favor ๋ฅผ ์ ํํํ ์๋ ์์ผ๋, ์ต๊ทผ์ ์๋น์ ๊ฐํ ์ํฅ์ ์ค ์ ์๋ ํ๋์ ์ ๋ฐ์ํ์ง ๋ชปํ๋ ๋ฌธ์ ๊ฐ ์์ ์ ์๋ค. ์ฌ๊ธฐ์ Session ์ด๋ผ๋ ๊ฐ๋ ์ ๊ณ ๊ฐ์ด ํ๋์ ์๋น๋ฅผ ํ๊ธฐ ์ ์ ์์ ๋ฐ์ํ๋ ์ผ๋ จ์ ์์์๋ ๊ฐ์ ๊ฒ์ด๋ค. ์๋ฅผ ๋ค์ด ์ง์ ์ฐ๋ค๊ณ ํ๋ฉด, ์์ ์ ์ง์ด ์ผ๋ง์ธ์ง ์์๋ณด๊ณ , ๋์ถ์ด ์ผ๋ง ๊ฐ๋ฅํ์ง ์์๋ณด๊ณ , ๋งค๋ฌผ์ ์ฐพ์ ๋ณด๊ณ ํ๋ ์ผ๋ จ์ ํ์๋ฅผ ํ๋์ ๊ทธ๋ฃน์ผ๋ก ํฉ์ณ์ Session ์ด๋ผ๊ณ ์ด์ผ๊ธฐ ํ๊ณ ์๋ค. ํ์ง๋ง, ์ด๋ ๊ฒ Session ๋ง ๋ฐ์์ ํ๊ฒ ๋๋ฉด, ๊ณ ๊ฐ์ Long Term Favor ๋ฅผ ๋ ์์ด ๋ฒ๋ฆด ์๊ฐ ์๋ค.

๊ทธ๋์ ์ด ์ฐ๊ตฌ์์ ์ ์ํ๋ ๋ฐฉ์์ด Session ๋จ์ Encoding ์ ์ํ RNN ๊ณผ Long Term Favor ๋ฅผ Encoding ํ๊ธฐ ์ํ RNN ์ ๊ณ์ธต์ ์ผ๋ก ์ฌ์ฉํ๋ Hierarchical Recurrent Neural Networks ๋ผ๊ณ ์ดํดํ๋ฉด ์ข๊ฒ ๋ค.
9. TF-Ranking: Scalable TensorFlow Library for Learning-to-Rank

LTR(Learn to Rank) ๋ฅผ Deep Learning ์ ์ ์ฉํ๊ธฐ ์ํด์ ์ต๊ทผ Tensorflow ์์๋ ๊ด๋ จ๋ Loss Function ์ ์ ๊ณตํ๊ณ ์๋๋ฐ, ์๋์ ๊ฐ์ด 3๊ฐ์ง์ Metric(MRR, ARP, NDCG) ์ Pointwise, Pairwise, Listwise 3๊ฐ์ง Loss Function์ ๊ต์ฐจ๋ก ์ฑ๋ฅ์ ํ๊ฐํ ๊ฒฐ๊ณผ๋ฅผ ์ ๊ณตํ๊ณ ์๋ค.


- ์ฐธ์กฐ : https://www.yumpu.com/en/document/read/33943335/1spz42p/90
- ์ฐธ์กฐ : https://towardsdatascience.com/introducing-tf-ranking-f94433c33ff
- ์ฐธ์กฐ : https://arxiv.org/pdf/1812.00073.pdf
๋ฅ๋ฌ๋์ LTR(Learn to Rank)๋ฅผ ์ ์ฉ์ ์ฌ์ฉ ๊ฐ๋ฅํ ์กฐํฉ์ ํฌ๊ฒ ๋๊ฐ ์ถ์ผ๋ก ์ค๋ช ๋ ์ ์๋ค. ์ด๋ค ํ๊ฐ Metric ์ ์ฌ์ฉํ ๊ฒ์ธ๊ฐ์ ์ด๋ค Loss Function ์ ์ฌ์ฉํ ๊ฒ์ธ๊ฐ ์ด๋ค. ์ฐ์ Loss Function ์ ๋ํ ๋ถ๋ถ์ ์ดํด ๋ณด์. ์๋์ Loss Function ์ด ๊ฐ๊ฐ PointWise, PairWise, ListWise ์ ๋ํญํ๋ Loss Function ์ผ๋ก ์ดํดํ๋ฉด ๋๋ค.

PointWise ์ ํด๋นํ๋ Loss ๋ก๋ ์ฐ๋ฆฌ๊ฐ ์นดํ ๊ณ ๋ฆฌ ๋ถ๋ฅ์ ๋ง์ด ์ฌ์ฉํ๋ Cross Entropy ์ด๋ฉฐ, ์ฌ๊ธฐ์ p ๋ Softmax ๊ฐ ์๋ Sigmoid ํ์ฑํจ์๋ฅผ ์ ์ฉํ ๊ฒฐ๊ณผ์ด๊ณ Sigmoid ์ Input ์ ์์์ ์ด์ผ๊ธฐํ ํน์ Score Metric ์ ๊ฒฐ๊ณผ๋ก ์ดํดํ๋ฉด๋๋ค. ์คํ ๊ฒฐ๊ณผ๋ฅผ ๋ณด๋ฉด, Ranking ๋ฌธ์ ๋ฅผ ํด๊ฒฐํจ์ ์์ด์๋ ๊ทธ๋ฆฌ ํจ๊ณผ์ ์ด์ง ์๋ค.

PairWise ๋ ์๋ฅผ๋ค์ด ์ค์ Label ์ Rank ๊ฐ A ์ํ>B์ํ ์ด๋ผ๊ณ ํ์๋, ์์ธกํ ๊ฒฐ๊ณผ๊ฐ B์ํ>A์ํ์ด๋ผ๊ณ ํ๋ฉด, ์ค์ ๊ฒฐ๊ณผ์ ๋ค๋ฅด๊ธฐ ๋๋ฌธ์ Loss ๋ฅผ ์ฆ๊ฐ ์์ผ ์ฃผ์ด์ผ ํ๋ ๊ฒ์ด๊ณ , B์ A ์ํ์ ์ฐจ์ด ๋งํผ Loss ์ Sum ์ด ์ฆ๊ฐ๋๋ ํํ๋ก ์ด์ ํ๋ฉด ๋๋ค. ์ค์ ์ ๋์ผํ๊ฒ ์์ธกํ ๊ฒฝ์ฐ I ํจ์๊ฐ (Indicator Function)์ด 0์ด ๋๊ธฐ ๋๋ฌธ์ Loss ๋ ์ฆ๊ฐํ์ง ์๋๋ค.

ListWise ๋ ์ ์ฒด List ์ ์์๊ฐ ์ผ๋ง๋ ์ ์ฌํ๋๋๋ฅผ Loss ๋ก ์ฌํํ๋ฉด ๋๋ ๋ฌธ์ ๋ก ์๊ฐ๋๋ค. Log(Softmax) Term ์ ๋ณด๋ฉด, Score ๊ฐ ๋์ผ๋ฉด 0์ ๊ฐ๊น์ ์ง๊ณ Score ๊ฐ ์ ์ผ๋ฉด -๋ฌดํ๋๋ก ๊ฐ๊น์ ์ง๊ฒ ๋์ด ์๋ค. ๊ฑฐ๊ธฐ์ Labled ๋ Score ๋ฅผ ๊ณฑํ๋ ๊ฐ๋ ์ผ๋ก ์ค๊ณ๊ฐ ๋์ด ์๋๋ฐ, ํด์ํด๋ณด๋ฉด ์ค์ฝ์ด๊ฐ ๋์๊ฑธ ๋๊ฒ ์์ธกํ๋ฉด Loss ๊ฐ 0์ ๊ฐ๊น์ ์ง๊ณ ๋์๊ฑธ ๋ฎ๊ฒ ์์ธกํ๋ฉด Loss ๊ฐ -๋ฌดํ๋ * (-) ๋ก Loss ๊ฐ ์ปค์ง๊ฒ ๋๋ค.

NDCG ๋ ๊ฒ์์์ง์์ ๋ ธ์ถ ์์๊ฐ ์ผ๋ง๋ ์ ๋ง๋์ง๋ฅผ ํ๊ฐํ๊ธฐ ์ํ ๋ฐฉ๋ฒ์ผ๋ก, ํฌ๊ฒ Gain(์ผ๋ง๋ ์ ๋ง์ถ ๊ฒ์ธ์ง), Position Discount(ํ์์๋ ๋ณ๋ก ์ค์ํ์ง ์์), Normalize(0~1์ฌ์ด์ ๊ฐ์ผ๋ก ํํ) , Cumulating(์์๋๋ก ๋์ ํฉ) ํฌ๊ฒ 4๊ฐ์ง ๋ถ๋ถ์ผ๋ก ์ด๋ฃจ์ด์ ธ ์๋ค.

์ผ๋ง๋ ์ ์์๋ฅผ ์ถ์ฒํ๋์ง์ ๋ฐ๋ผ์ ์์ ๊ฐ์ ํํ๋ก ์ ์๋ฅผ ๋ถ์ฌํ๋ค.

Max DCG ๋ ์ฃผ์ด์ง Label ๋ก Ordering ํ์๋ ์ป์ ์ ์๋ ์ต๋ ์ ์๋ก ์๊ฐํ๋ฉด ๋๋ฉฐ, Normalize ๋ฅผ ํตํด 0~1์ฌ์ด์ ๊ฐ์ผ๋ก ๊ฐ๊ฐ์ ๋ํ ์ ์๊ฐ ๊ณ์ฐ๋๋ค. ์ด ์ ์๋ฅผ ์์์ ์ค๋ช ํ Loss Function ์ ์ ์ฉํ๋ฉด ๋๋ค. ์ด๋ฌํ ๋ฐฉ๋ฒ๋ก ์ ํตํด Ranking ๋ฌธ์ ์ ์์ด์ ๊ธฐ์กด์ Cross Entropy ๋ฅผ ์ ์ฉํ๋ ๊ฒ๋ณด๋ค ๋ ์ข์ ์ฑ๊ณผ๋ฅผ ๋ณด์ฌ์ฃผ์๋ค.
10. Reinforcement Learning to Rank in E-Commerce Search Engine: Formalization, Analysis, and Application

์ด ๋ ผ๋ฌธ์ ํต์ฌ์ ๊ธฐ์กด์ ์ถ์ฒ ์๊ณ ๋ฆฌ์ฆ๋ค์ด ์ฌ์ฉ์์ ์๋น ํจํด์ ์์ ๊ทธ๋ฆผ์ฒ๋ผ ๊ฐ๊ฐ์ Session์ ๋ค๋ฅธ Session ๋ค๊ณผ ๋์ ์ฐ๊ด์ฑ์ ๊ฐ์ง๊ณ ์์ผ๋, ๊ทธ๋ฌํ ์ฐ๊ด์ฑ์ ์ ๋ฐ์ํ์ง ๋ชปํ๊ณ ์๋ ๋ฌธ์ ๊ฐ ์์ด RL(๊ฐํํ์ต)์ ์ ์ฉํ์ฌ ๊ทธ ์ฐ๊ด์ฑ์ ์ ๋ฐ์ํ๊ณ ์ ํ๋ ๊ฒ์ด๋ค.

์ด ๋ ผ๋ฌธ์์๋ MDP(Markov Decision Process)๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ๋ช ๊ฐ์ง ํน์ฑ์ ์ถ๊ฐํ Search Session MDP ๋ผ๋ ๋ฐฉ๋ฒ์ ์ ์ํ๊ณ ์๋ค. (์๋ MDP ์ ์ผ๋ฐ์ ์ธ ๊ตฌ์กฐ) , SSMDP ์์ ๊ฐ ์์๋ ์๋์ ๊ฐ์ด ์ ์ ๋๋ค.
- Agent ๋ Search Engine ์ผ๋ก Ranking Engine ์ด๋ผ๊ณ ์๊ฐํ๋ฉด ๋๋ค.
- Environment ๋ ์ผํ๋ชฐ์ด ๊ฐ์ง๊ณ ์๋ ๋ชจ๋ ๊ณ ๊ฐ์ ์ผํ ํจํด ์ ๋ณด์ด๋ค.
- State ๋ ํฌ๊ฒ 3๊ฐ๋ก ์ ์(๊ณ์ ์ผํ, ์ผํ ์ค๋จ, ๋ฌผ๊ฑด ๊ตฌ๋งค), ์ด์ State ์ Action ์ผ๋ก ํ๋ฅ ํ๋จ
- Action์ ์ฌ์ฉ์์๊ฒ ์ถ์ฒํ๋ ์ํ ๋ชฉ๋ก์ด๋ค.
- Reward ๋ ์ค์ ์ฌ์ฉ์๊ฐ ๋ฌผ๊ฑด์ ๊ตฌ๋งค ํ์ ๋ ์ถ์ฒํ ๋ฌผ๊ฑด์ ๊ฐ๊ฒฉ์ด ๋๋ค.
์์ ์ ์๋ฅผ ๊ธฐ๋ณธ์ผ๋ก ์ค์ ํ๋์ Session ์ ๊ตฌ์ฑํด ๋ณด๋ฉด ์๋์ ๊ฐ์ด ์๊ฐํํ์ฌ ์ค๋ช ํ ์ ์๋ค

- C ๋ Continue ์ํ๋ก ๊ณ์ ๋ค๋ฅธ ๊ฒ์์ ์งํํ๋ non-terminal state ์ด๋ค
- B ๋ Buy ์ํ๋ก ๋ฌผ๊ฑด์ ๊ตฌ๋งคํ๋ terminal state ์ด๋ค
- L ์ Leave ์ํ๋ก ๊ฒ์์ ์ข ๋ฃํ๊ณ ๋ ๋๋ terminal state ์ด๋ค
- Red h ๋ ๊ณผ๊ฑฐ ์ถ๋ ฅ๋ Item ๋ชฉ๋ก ์ด๋ ฅ ์ ๋ณด ์ด๋ค
- Blue ๋ ๊ฐ State ๋ก ์ ์ดํ ํ๋ฅ ์ด๋ค.
์ด ๋ค์์ B, C , L ์ค์ ์ด๋ค State ๋ก ์ ์ดํ ๊ฒ์ด์ง์ ๋ํ ํ๋ฅ ์ ์๋์ ๊ฐ์ด. ์ด์ State ์ Action ์ ๋ฐ๋ฅธ๋ค๊ณ ๋ณธ ๋ ผ๋ฌธ์์ ์ฆ๋ช ํ๊ณ ์๋ค. (์ฆ๋ช ์ ๋ ผ๋ฌธ์์ ์ฐธ์กฐ)

Reward ๋ ์๋์ ๊ฐ์ด Buy State ๋ก ๊ฐ์ ๋, h ๋ ์ถ์ฒ ๊ฒฐ๊ณผ, m(h) ๋ ์ถ์ฒ ๊ฐ๊ฒฉ์ ๋ฐ์ํ ๊ฒฐ๊ณผ์ด๋ค.

๊ทธ๋ฆฌ๊ณ ๋ง์ง๋ง์ผ๋ก Reinforcement Learning ์ ํตํด ํ๋ จ์ ์งํํ๋๋ฐ, ์์ธกํด์ผ ํ๋ Action ์ด ๋ง๊ธฐ ๋๋ฌธ์ ์๋์ ํ์์ ๋ณด๋ ๊ฒ์ฒ๋ผ Value๋ฐฉ์๊ณผ Policy ๋ฐฉ์์ ๋ชจ๋ ์ทจํ๋ Actor-Critic ๋ฐฉ๋ฒ์ ์ฌ์ฉํ๋ค.

๊ทธ๋ ๊ฒ ํ๋ ค๊ณ ํ๋ฉด Q Function ๊ณผ J Function ์ด ๋ชจ๋ ์ ์๋์ด์ผ ํ๋๋ฐ, ์๋๊ณผ ๊ฐ์ด ์ ์๋๋ค. J Function ์ ์ผ๋ฐ์ ์ผ๋ก ๊ฐํํ์ต์์ ์ฌ์ฉํ๋ Policy Gradient ์ต์ข ๊ณต์๊ณผ ํฐ ์ฐจ์ด๊ฐ ์๋ ๊ฒ์ผ๋ก ๋ณด์ด๋ฉฐ, Q Function ์ ์์์ ์ ์ํ ๋ณํ๋ State ์ ๋ฐ๋ฅธ Reward ๋ฅผ ๋ฐ์ํ ํํ๋ก ๊ตฌ์ฑ์ด ๋๋ ๊ฒ์ ๋ณผ์ ์๋ค. (Advantage ๊ฐ๋ ์ ์๋ณด์ด๋๊ฑฐ ๊ฐ๊ธฐ๋ ํ๋ฐ..) ์์ Term ์ Buy ํ๋ ๊ฒฝ์ฐ, ์์ ํ๋งค๊ฐ์ด๊ณ ๋ค์ Term ์ ๊ณ์ ์ผํ์ ํ๋ ๊ฒฝ์ฐ ๋ฏธ๋์ ๊ธฐ๋๋๋ Reward ์ด๋ค.


์ด์ ์๋ ์๋์ฝ๋์ ๊ฐ์ด ํ๋ จ์ ์งํํ๋๋ฐ, ์ฌ๊ธฐ์ ์ธํ๋ ํ์ด(ํด๋ฆฌ์)์ ๋ํ ํ๋ฆฌ๋ฉํฐ์ด๊ณ , W ๋ Q(Value) ์ ๋ํ ํ๋ผ๋ฉํฐ ์ด๋ฉฐ, ์ธํ๋ ์ผ๋ฐฉ์ ์ธ ๊ฐํํ์ต์ Policy ํ๋ จ๊ณผ ๋ง์ฐฌ๊ฐ์ง๋ก ์ธํ + ๋ฌ๋๋ ์ดํธ*Gradient(J)*Q ๋ก ํ๋ จํ๊ณ , Q Function ์ TD ๋ฐฉ์์ผ๋ก ์ด์ ๊ณผ ์ดํ์ Value ์ ์ฐจ์ด๋ฅผ(MSE) ์ด์ฉํ์ฌ ํ๋ จํ๋ ๊ฒ์ผ๋ก ๋ณด์ธ๋ค.
ํ๋์ Session(T Time) ๊น์ง ๊ฐ Step ์ ๋ฐ๋ผ Gradient w์ ์ธํ๋ฅผ ์ถ์ ํ๋ค๊ฐ(Sum) ํ Session ์ด ๋๋๋ฉด, T ๋ก ๋๋์ด Update ํ๋ ํํ๋ก ํ๋ จ์ด ์งํ๋๋ค.

11. Personalized Re-ranking for Recommendation

์ด ๋ ผ๋ฌธ์ ๊ธฐ๋ณธ์ ์ผ๋ก Item ์ถ์ฒ ์์์ Re-Ordering ์ ํํ๋ฅผ ๊ฐ์ง๊ณ ์๋ค. ์ด ๋ ผ๋ฌธ์์์ ํต์ฌ ์์ด๋์ด๋ ๋ ๊ฐ์ง๋ก ์๊ฐ๋๋ค. ํ๋๋ Item ๊ฐ์ ๊ด๊ณ๋ฅผ ํด์ํ ์ ์๋ ๋ชจ๋ธ ๊ตฌ์กฐ๋ฅผ ์ฌ์ฉํ๊ฒ ๋ค. (๊ทธ๋์ ์๋ฐฉํฅ์ ๊ด๊ณ๋ฅผ ์ ํ์ตํ ์ ์๋ Attention ๊ธฐ๋ฐ์ Transformer ์ํคํ์ณ๊ฐ ์ ํฉํ๋ค๊ณ ์ด์ผ๊ธฐ ํจ). ํ๋์ Item์ ์ถ์ฒํ๋ ๊ฒ์ด ์๋ ์ฐ๊ด๋ Item ๋ค๋ ์ถ์ฒ์ ํ ์ ์๋ ํํ๋ฅผ ์๊ฐํ ๊ฒ ๊ฐ์(ex: ์ , ์ค์ง์ด, ๋ด๋ฐฐ ์ ๊ฐ์ด)

์์ ๋ด์ฉ์ ๊ฐ์ง๊ณ Re-Ranking ์ ๋ํ Loss ๋ฅผ ์ ์ํ๋ฉด ์์ ๊ฐ์ด ๋ ๊ฒ์ด๋ค.(์ด๊ฑธ LTR: Learn to Rank ๋ผ๊ณ ๋ถ๋ฅธ๋ค๊ณ ํจ) ํ์ง๋ง ์ฌ๊ธฐ์์ ๋น ์ง ๊ฒ์ด ์๋๋ฐ, ์ด์ ์ ์ฐ๊ตฌ๋ค์์ ์ฌ์ฉ๋๋, ๊ฐ์ธ์ ์ ํธ ๋ฐ Session ์ด๋ผ๊ณ ์ด์ผ๊ธฐํ ์ต๊ทผ ์กฐ์ ์ ๋ณด ๋ฑ ์ ๋ณด๊ฐ Re-Ranking ํ๋จ์ ์ ์ฉ๋์ง ์๊ฒ ๋๋ค.

๊ทธ๋์ PV ๋ผ๋ ITEM ๋ณ๋ก ๊ฐ์ธ์ ์ฑํฅ ๋ฐ ์กฐ์ ์ ๋ณด๋ฅผ Input ์ผ๋ก Pretrained ๋ชจ๋ธ์ ๊ฑฐ์ณ ๋์จ Feature ๋ฅผ ์ฌ์ฉํ๋ ๋ฐฉ๋ฒ์ ์ ์ํ๊ณ ์๋ค. ํด๋น ๋ชจ๋ธ์ ์ ๊ทธ๋ฆผ์ C ์ ํด๋นํ๋ ๋ถ๋ถ์ธ๋ฐ, Input ์ผ๋ก ๊ฐ์ธ์ ๋ํ ์ ๋ณด + ๊ฐ์ธ์ Action History + Item Vector ๋ฅผ ๋ฃ๊ณ Output ์ผ๋ก ํด๋น Item ์ ํด๋ฆญ ํ๋์ง ์ฌ๋ถ๋ก ์๋์ ๊ฐ์ Loss Function ์ผ๋ก ๋ชจ๋ธ์ Pretrain ํ๊ณ (b) ๋ชจ๋ธ์ ํ๋ จ์ item,user ๋ณ๋ก ๋ง์ง๋ง Layer ์ ๊ฐ์ PV ๋ก ์ถ์ถํ์ฌ ์ฌ์ฉํ๋ค.
์กฐ๊ธ์ ์๋ฌธ์ค๋ฌ์ด ๋ถ๋ถ์ Session ์ด๋ผ๋ ๊ฐ๋ ์ ์ ๋ณด๋ ๋ถ๋ช ํ ์๊ณ์ด ์ฑ๊ฒฉ์ ๊ฐ์ง๊ณ ์๊ณ , ๊ฐ์ฅ ์ต๊ทผ์ ์ฌ์ฉ์์ Action ์ ๊ณผ๊ฑฐ์ Action ๋ณด๋ค ๋ถ๋ช ๋ ํฐ ์ํฅ๋ ฅ์ ๊ฐ์ง๊ณ ์์ด, ๊ทธ๋ฌํ ๋ถ๋ถ์ ์ ๋ฐ์ํ ํ์๊ฐ ์๋ค๊ณผ ์๊ฐ๋๋๋ฐ ๊ทธ๋ฐํ ๊ฐ๋ ์ด ์ ์ค๋ช ๋์ง๋ ์๋ ๊ฒ ๊ฐ๋ค๋ ์๊ฐ์ด ๋ ๋ค..