åå®ä»®æ³æ©æ¢°åŠç¿ã«ã€ããŠè¯ããªãŒããŒãã¥ãŒãæäŸããŠãããŠããããŒã¯ "Counterfactual Learning and Evaluation for Recommender Systems (RecSys2021)"ãèŠãŸããã3.5æéã«åã³ãå
容ãçãã ãããããã£ãããªã®ã§åå¿é²ãå
ŒããŠãŸãšããæžããŸãããèŠãæéãç¡ãæ¹ã«ãšã£ãŠãããšãã»ã³ã¹ãäŒããã°ãããªãšæã£ãŠããŸãã
https://www.youtube.com/watch?v=HMo9fQMVB4w
äºäŸ
ãŸãåå®ä»®æ³æ©æ¢°åŠç¿ãšããåéã§åãæ±ãåé¡ã®äŸãèŠãŠã¿ãŸãããããã®ããŒã¯ã§ã¯ãå
·äœäŸãšããŠãå¿äžå
šã®æ£è
ã«å¯Ÿããæ²»çæ³éžæããæããŠããŸãããéå»ã§éžã°ããªãã£ãéžæè¢ãããæ¡ã£ãŠãããã»ã»ã»ããšããåå®ä»®æ³ã®æ¬è³ªãããåããè¯ãäŸããªã®ããªãšæããŸãã
å
·äœçã«ã¯ã以äžã®ãããªåé¡èšå®ã§ãã
å¿äžå šã®æ£è ããããã«ãããã€ãã¹ããã¹ãã³ãããæè¬ãã®3ã€ã®æ²»çãè¡ããŸããããã®æ²»çæ³ã®éžæã¯ãå»åž«ãæ£è ã®ç¶æ ãèŠãªããäžå®ã®ã«ãŒã«ã«åã£ãŠéžãã ãã®ã§ãããã®çµæå¥å¹ããŠå埩ãã人ãããã°ãæ®å¿µãªããããã§ãªãã£ã人ãããŸããã
ãã®ãããªéå»ã®ããŒã¿ãæå ã«ããåæã§ãæ²»çæ³ã®éžæã«ãŒã«ãèŠçŽãããšæããŸããéå»ã«æ»ã£ãŠæ²»çãããçŽãããšã¯ãã¡ããã§ããŸããããããŸã§æå ã«ããããŒã¿ã ãã䜿ã£ãŠãããããæ²»çæ³ã®ã«ãŒã«ãèŠã€ãåºããŠãã ããã
äŸãã°ãéå»ã®æ²»çã®çµæã¯ä»¥äžã®å³ã®ãããªåœ¢ã§èšé²ãããŠããŸããæ£è ã11åè¡æ¹åã«äžŠã¹ãããŠããŠãæ²»çæ³ãšããŠã©ããéžæãããåæ¹åã«3ã€ããããŠãã®çµæã0(å埩ããªãã£ã) or 1(å埩ãã)ã§èšé²ãããŠããŸãããã®ããŒã¿ã ããæå ã«ãããšãã«ãã§ã¯é«éœ¢ã®æ£è ããã«æè¬æ²»çãåªå ãããã©ããªãã ããããªã©ãæ€èšããã®ãåå®ä»®æ³ã®åé¡èšå®ã§ãã
åæ§ã®åé¡èšå®ã¯ãæã ã®èº«ã®åãã§ãå€ãçºçããŸããäŸãã°ã
ããåç»é ä¿¡ãµãŒãã¹ã§ãŽãŒã«ãã³ãŠã£ãŒã¯æçµæ¥ã®å€æ¹ã«ãµã©ãªãŒãã³ã®Aããã«å š12話ã®ãã©ãããªã³ã¡ã³ããããšãããã¯ãªãã¯ãããªãã£ãã
ããããã®æ¥äžã«èŠããã2æéæ ç»ãããããããŠãããæãããŠã¯ãªãã¯ãããŠããã®ã ãããïŒ
ãªã©ããçŸå®çã«èãããåé¡ã§ãã
ã¡ãªã¿ã«ãããªã³ã¡ã³ãããšåŒã°ããè¡çºã¯æããè¡ãããŠãããã®ã§ãããæ§èœæ¹åã«åããå€ãã®è©Šè¡é¯èª€ããããŸããããã®äžã§ã¯ãããã"A/Bãã¹ã"ãè¡ããããã©ãŒãã³ã¹ãæ€èšŒããŠããŸããããã æè¿ã§ã¯ã以äžã®ãããªçç±ã§A/Bãã¹ããè¡ãããšãé£ãããªã£ãŠããŠããŸãã
- A/Bãã¹ããè¡ãã«ã¯ãŠãŒã¶ãŒã®åå¿ãéããããããçšåºŠã®æéãå¿ èŠããªã³ã¡ã³ãã¢ã«ãŽãªãºã ãã©ãã©ãæ¹è¯ããããšãã幎éã«å®æœã§ããè©äŸ¡åæ°ã®å¶çŽãåããŠããŸãæ¹åãµã€ã¯ã«ãåãã¥ãã
- A/Bãã¹ãã¯ãŠãŒã¶ãŒãå·»ã蟌ãã§è¡ããã®ãªã®ã§Productionç°å¢ã§è¡ãããšã«ãªãããããããšå®éã®äºæ¥ã«ã圱é¿ãåºãŠããŸãã売äžãæ¯æããŠããŸããããããªã
- ãããããŠãŒã¶ãŒã»ã°ã¡ã³ããåºåã£ãŠãã®äžã§å¥ã®éžæè¢ãæç€ºãããããªA/Bãã¹ãã¯ããªã³ã¡ã³ãã®ããŒãœãã©ã€ãºåã«ãã£ãŠããã¥ãããªã£ãŠããŠãããã€ãŸããã20ä»£ç·æ§ãã§ã¯ãªãããç¹å®ã®Aããã®GWæçµæ¥ã®å€æ¹ãã¯ã»ãŒå¯äžã®æ©äŒã§ãããããéžæè¢ãåºãåããããšãã§ããªã
ç¹ã«æåŸã®é ç®ã®ããã§äžã®å¿äžå šã®äŸãšåæ§ãåãã©ã€ãã§ããªãç¶æ³ãçãŸããŠãããåå®ä»®æ³ã®åé¡ãšããŠåãæ±ãå¿ èŠãã§ãŠããŸãã
åé¡ã®èšå®
äžã®äŸã§ã¯ããéå»ã«æ»ã£ãŠå¥ã®éžæè¢ãæç€ºããŠãããã©ãããåå¿ã ã£ããïŒããšãããã¥ã¢ã³ã¹ã®ããšãå£èµ°ããŸããããã ãå®éã®åå®ä»®æ³æ©æ¢°åŠç¿ã®æ çµã¿ã§ã¯ãããŸã§åå¥ã®æšå®åé¡ã«åãçµãã®ã§ã¯ãªããããå°ãå¹ åºãåé¡èšå®ã«åãçµã¿ãŸããã€ãŸãã
éå»ã«ãã§ã«äžå®ã®ã«ãŒã«ã«åã£ãŠèšé²ããããã°ããŒã¿ãæå ã«ããããã®ããŒã¿ãçšããŠãæ°ããæ±ºããã«ãŒã«ãããåªããŠãããã©ããããA/Bãã¹ããæ°ãã«è¡ãããšãªãã«ãªãã©ã€ã³ã§å€æããã
ããã§ããã«ãŒã«ã¯ãå¿äžå
šã®äŸã§ããã°æ£è
ã®ç¶æ
ã«å¿ããæ²»çæ³éžæã®ã«ãŒã«ã«ãªããŸããããªã³ã¡ã³ãã§ããã°ãŠãŒã¶ãŒã®ç¶æ
ã«å¿ããŠäœããªã³ã¡ã³ãããã®ããšããã¢ã«ãŽãªãºã ã«ãªããŸãã
芪ãã¿ããããã«ãŒã«ããšãã衚çŸã䜿ããŸããããæ°åŠçãªè¡šçŸã§ã¯ãããªã·ãŒããšããçšèªã䜿ãããŸãããŠãŒã¶ãŒã倩åãªã©ã®å
¥åæ
å ±ãã¯ãã« $x$ ããã£ãŠãæ²»çæ³éžæããªã³ã¡ã³ã察象ã®éžå®ãªã©åãããã¢ã¯ã·ã§ã³ $a$ ã®éžæè¢ããã£ããšãã«ãã©ã®$a$ãéžæãããã®ç¢ºçãããªã·ãŒ $\pi (a|x)$ ãšããŠå®çŸ©ããŸãã
以äžã§è°è«ããæ çµã¿ã§ã¯ãããªã·ãŒã¯å€§ãã2ã€çŸããŸãããã°ããŒã¿ååŸæéã§çšããããŠããããªã·ãŒ$\pi_0$ãšãæ°ããè©äŸ¡ããããããªã·ãŒ$\pi_e$ã§ãã
ãã°ããŒã¿ã¯ã以äžã®ãããªåœ¢ã§èšé²ãããŠãããŸãã
| No. | $x$: å ¥åæ å ±ãã¯ãã« | $a$: ã¢ã¯ã·ã§ã³ | $p$: ã¢ã¯ã·ã§ã³éžæç¢ºç | $r$: çµæ |
|---|---|---|---|---|
| 1 | 20ä»£ç·æ§, 5/8 15:00 | åç»1ãæšèŠ | 0.8 | 1.0 (ã¯ãªãã¯ããã) |
| 2 | 30代女æ§, 5/9 5:00 | åç»6ãæšèŠ | 0.9 | 0.0 (ã¯ãªãã¯ãããªãã£ã) |
| 3 | 50ä»£ç·æ§, 5/10 14:00 | åç»3ãæšèŠ | 0.7 | 0.0 (ã¯ãªãã¯ãããªãã£ã) |
| 4 | 60ä»£ç·æ§, 5/11 22:00 | åç»9ãæšèŠ | 0.6 | 1.0 (ã¯ãªãã¯ããã) |
çµæã«å¯Ÿå¿ãã$r$ã¯"ãªã¯ãŒã"ãšåŒã°ããŸãã
ãŸãããã°ããŒã¿ååŸæéã§ã¯ãäœããã®ãªã³ã¡ã³ãã¢ã«ãŽãªãºã ã«åŸã£ãŠã¢ã¯ã·ã§ã³éžæç¢ºçãæ±ºãããã®ç¢ºçã«åŸã£ãŠã¢ã¯ã·ã§ã³$a$ãã©ã³ãã ã«éžæããŸããéžã°ããã¢ã¯ã·ã§ã³$a$ã«å¯Ÿå¿ããéžæç¢ºç $p$ã"Propensity (ãããã³ã·ãã£)"ãšåŒã³ãŸããã€ãŸãã$p_i=\pi_0 (a_i|x_i)$ãšè¡šèšããŸãã
ãã®Propensityã®èšç®ã«ã¯ããã°ããŒã¿ãååŸããéã®ããªã·ãŒ$\pi_0$ãå¿
èŠã§ããããªã·ãŒ$\pi_0$ã®ã¢ãã«ãã«ãŒã«ããã¡ããšèŠããŠããã°ãã€ã§ãèšç®ã§ããŸãããããããåŸããèšç®ããªããšããã®æç¹ã§èšç®ããŠèšé²ããŠãããã»ããæ¥œãªã®ã§ããã°ããŒã¿ã®äžã«ä¿åãããŠãããŸãã
倧äºãªãã€ã³ããªã®ã§æ¹ããŠæžãäžããŸããããã°ããŒã¿ååŸæéã«ã¯ä»¥äžã®2ç¹ãè¡ãããšãéèŠã§ã:
- ããããªã·ãŒ$\pi_0 (a_i|x_i)$ã®ç¢ºçã«åŸã£ãŠã¢ã¯ã·ã§ã³$a_i$ãéžå®ããããš
- ãã®ãšãã®Propensity $p_i=\pi_0 (a_i|x_i)$ãèšé²ããŠããããš
åå®ä»®æ³æ©æ¢°åŠç¿ã«ããã2ã€ã®åé¡
ããŠãåå®ä»®æ³æ©æ¢°åŠç¿ã®åéã§ã¯ã以äžã®2ã€ã®åé¡ãåºå¥ããŠåãæ±ããŸã:
- éå»ã«èšé²ããããã°ããŒã¿ã®äžã§ãæ°ããããªã·ãŒ $\pi_e$ ãã©ã®ãããåªããŠããããè©äŸ¡ããã (Off-Policy Evaluation; OPE)
- éå»ã«èšé²ããããã°ããŒã¿ã®äžã§ãããåªããããªã·ãŒ $\pi_e$ ãåŠç¿ãããã (Off-Policy Learning; OPL)
ãã®2ã€ãæ··åããªããããŒã¯ãèããšéã«è¿·ããŸãã®ã§ããã¡ããšåºå¥ããããæ³šæãå¿ èŠã§ãã
è£è¶³ã§ããã"Off-Policy"ãšããã®ã¯ããã°ååŸæã®ããªã·ãŒ $\pi_0$ãšãããããè©äŸ¡ããããããªã·ãŒ $\pi_e$ãç°ãªã£ãŠããããšãæå³ãã衚çŸã§ãã
ãã°ããŒã¿ãçšããããªã·ãŒã®è©äŸ¡ (OPE)
æ°ããããªã·ãŒã®è¯ãæªããè©äŸ¡ããæ¹æ³ã«ã¯å€§ãã2ã€ã®ã¢ãããŒããããããããã玹ä»ãããŠãããŸãã2ã€ãçµã¿åãããDoubly Robustæšå®éã玹ä»ãããŠããŸããã説æã¯ä»ã®èšäºã«è²ããŸãã
Model-based estimator (Direct Method) ã«ããè©äŸ¡
äžã®å³ã®ããã«ãéå»ã®ãã°ããŒã¿ã®ç©ºæ¬ãäœããã®æ©æ¢°åŠç¿ã¢ãã«$\hat{r} (x,a)$ã§ãã¹ãŠåããç䌌ããŒã¿ãäœããŸãããã®ç䌌ããŒã¿ã®äžã§ãæ°ããããªã·ãŒ $\pi_e$ ãè©äŸ¡ããèãæ¹ã§ãã
ç䌌ããŒã¿ãäœãããã®æ©æ¢°åŠç¿ã¢ãã«$\hat{r}$ã¯ãããªã·ãŒ$\pi$ãšã¯å¥ã«æºåããå¿
èŠããããšããç¹ã«æ³šæãå¿
èŠã§ãããã®æ©æ¢°åŠç¿ã¢ãã«$\hat{r}$ã¯éåžžã·ã³ãã«ãªååž°ã¢ãã«ãªã©ãçšãããã°ã«èšé²ãããå
¥åæ
å ±ãã¯ãã«ãšã¢ã¯ã·ã§ã³ $(x,a)$ ã«å¯ŸããŠãªã¯ãŒã$r$ãæšå®ããããåŠç¿ãè¡ããŸãã
åœç¶ã§ããããã®æ©æ¢°åŠç¿ã¢ãã«$\hat{r}$ãéå»ã®æªèŠ³æž¬ãªã¯ãŒããæ£ããäºæž¬ããé©åãªç䌌ããŒã¿ãè£å®ããä¿èšŒã¯ã©ãã«ããããŸãããæ£ãããªãç䌌ããŒã¿ã®äžã§è©äŸ¡ãããã®ã§ããã°ãæ°ããããªã·ãŒ$\pi_e$ã®æ§èœè©äŸ¡ã¯ç䌌ããŒã¿ã®ééãã«ãã£ãŠãã€ã¢ã¹ãåããŸãããã®ãããModel-based estimator (Direct Method) ã§æé©ãšå€æãããããªã·ãŒãå®éçšã§ãæé©ã§ããä¿èšŒã¯ãªãããããäžè¬çã«ã¯æ£ãããªãããšãå€ãã®ã課é¡ã§ãã
ãã®åŒ±ç¹ã¯èªãã€ã€ãModel-based estimator (Direct Method) ã«ããããªã·ãŒã®è©äŸ¡ã¯ãäžå³ã®äžæ®µã®åŒãšããŠäžããããŸããã€ãŸããå³åŽã®è¡šã®ãã¹ãŠã®ã»ã«ã«å¯ŸããŠãæ°ããããªã·ãŒãææ¡ããéžæç¢ºç $\pi_e (a|x)$ãšãæ©æ¢°åŠç¿ã¢ãã«$\hat{r}$ã«ãã£ãŠè£å®ããããªã¯ãŒã$\hat{r} (x,a)$ãæããŠå¹³åããšã£ããã®ã«ãªããŸãã$\pi_e$ã¯1ã«èŠæ ŒåãããŠãããããçµå±$\hat{V}_\text{DM}$ã¯ãªã¯ãŒãã®æåŸ å€ãšããŠè§£éã§ããŸãã
Model-free Estimator (Inverse Propensity Score; IPS) ã«ããè©äŸ¡
ãã®è©äŸ¡ææ³ã«ãããŠã¯ãç䌌ããŒã¿ã¯çšãããéå»ã«èŠ³æž¬ããããã°ããŒã¿ã ããçšããŠè©äŸ¡ããŸãããã®ãããç䌌ããŒã¿ã®èª€ãã«ãããã€ã¢ã¹ã®åœ±é¿ãåããã«è©äŸ¡ãè¡ãããšãã§ããŸãã
Model-based estimator (Direct Method) ãšåæ§ã«ãªã¯ãŒãã®æåŸ
å€ãèšç®ããŸããããããŸã§éå»ã®ãã°ããŒã¿ããæœåºãã$(x_i,a_i,r_i)$ã®ã¿ã䜿ã£ãŠèšç®ãè¡ããŸãã
ãã ãããã°ããŒã¿ååŸæéã«ãããPropensityãã€ãŸãéžæç¢ºç$\pi_0 (a|x)$ã倧ããããŒã¿ã®çµã«ã€ããŠã¯ããã°ããŒã¿ååŸæéäžãé »ç¹ã«ãŠãŒã¶ãŒã«ææ¡ãããŠããããã°ããŒã¿ã«ãæ°å€ãèšé²ãããŠããŸãããã°ããŒã¿ã®åºçŸé »åºŠãåã£ãŠãããšãäžèšç»åã®äžçªäžã®åŒã§å®çŸ©ããããªã¯ãŒãæåŸ
å€ãèšç®ããéã«ããã«éã¿ä»ããããŠèšç®ãããŠããŸããŸãããã°ååŸæã®ããªã·ãŒ$\pi_0$ããæ°ããããªã·ãŒ$\pi_e$ã®è©äŸ¡ã«åœ±é¿ãäžããã®ã¯ããããã§ãã®ã§ã$\pi_0$ã®Propensity $p_i=\pi_0 (a|x)$ã§å²ãè£æ£ãè¡ãããšã§åºçŸé »åºŠã®åãã®åœ±é¿ã軜æžããŸãã
ããã«ãã£ãŠãæ°ããããªã·ãŒ $\pi_e$ãã®æ§èœè©äŸ¡ãè¡ã£ãŠãããã®ããInverse Propensity Scoreã«ããè©äŸ¡ã®èãæ¹ã§ãã
ãã®ææ³ã¯Model-based estimator (Direct Method) ãšã¯ç°ãªãããã°ããŒã¿éãååãªãšãã«ãã€ã¢ã¹ç¡ãè©äŸ¡ãè¡ãããšãã§ããŸãããã ãããã°ããŒã¿ã®æ°ãäžååãªå Žåã«ã¯è©äŸ¡çµæã®åæ£ã倧ããè©äŸ¡çµæãã°ãã€ãããšã匱ç¹ã§ãã
ãŸãããã®æã®ç¢ºçã®å²ãç®ãå«ãã èšç®ã«ãããã話ãšããŠã$\pi_0$ã®Propensityãæ¥µç«¯ã«å°ããã£ãå Žåãéã¿$\pi_e(a|x)/\pi_0(a|x)$ã倧ãããªã£ãŠå®çšäžäœ¿ãã¥ãããšãã£ãåé¡ãçºçããŸãããããé²ãããã®ææ³ãšããŠãæ£ååããä¿®æ£ãå ããCLIPS EstimatorãSNIPS Estimatorãªã©ãããŒã¯ã®äžã§ç޹ä»ãããŠããŸãã
ãã°ããŒã¿ãçšããããªã·ãŒã®åŠç¿ (OPL)
åºæ¬çãªèãæ¹
åã®é
ã§ã¯ããã°ããŒã¿ãçšããããªã·ãŒã®è©äŸ¡ææ³ã«ã€ããŠèŠãŠããŸãããè¯ãããªã·ãŒãå®éçã«éžã¹ãããã«ãªãã°ããããç®ç颿°ãšããŠããªã·ãŒã®ãã©ã¡ãŒã¿ã調æŽããããšã§åŠç¿ãè¡ãããšãå¯èœã§ãã
ããŒã¯ã®äžã§ã¯ãInverse Propensity ScoreãåŠç¿ã®ãšãã®ç®ç颿°ã«ããŠããŸããç䌌ããŒã¿ãäœãããã®æ©æ¢°åŠç¿ã¢ãã«$\hat{r}$ãæ°èŠã«å°å
¥ããå¿
èŠãç¡ããäœåãªä»®å®ãå°å
¥ããå¿
èŠãç¡ãããã§ããããšã¯ãæ°ããããªã·ãŒ$\pi_e(a_i|x_i)$ã®ãã©ã¡ãŒã¿ãåãããªãããç®ç颿°ãæå€§å/æå°åããã ãã§ãã
äžå³ããã®èããæ°åŒã§è¡šçŸãããã®ã§ããIPSã®è©äŸ¡é¢æ°ã«$argmax$ãã€ããã ãã§ã (泚: ããŒã¯ã®äžã§ã¯ããããããªã¯ãŒãã®æ£è² ãéã«ããŠããã®ã§åããã¥ãããªã£ãŠããŸãããã®èšäºã®äžã§ã¯ã$argmin$ã$argmax$ãšèªã¿æ¿ããŠããããŸã§ã®èšè¿°ãšæŽåãåããŸã)ã
äžç¹ã忝ã$\pi_0 (a_i|x_i)$ããPropensity $p_i$ã«å€ãã£ãŠããŸããããã¯ãã°ããŒã¿ååŸæã®$\pi_0 (a_i|x_i)$ãããããããã§ã«ãã°ããŒã¿ã®ã«ã©ã ãšããŠèšé²ãããŠããã®ã§ãããã«çœ®ãæãããã®ã§ãã
æ°ããããªã·ãŒ$\pi_e$ããæ·±å±€åŠç¿ã¢ãã«ã§æ§ç¯ããã®ãBanditNetã§ãäžã®å³ã§è¡šçŸããã圢ã§å®çŸ©ãããŠããŸããä»çµã¿ã¯åçŽãå ¥åæ å ±ãã¯ãã«$x$ãå ¥åãšããŠåããã¢ã¯ã·ã§ã³$a$ãåããã確çãåºåããæ·±å±€åŠç¿ã¢ãã«ãšããŠæ§æãããŠããŸãã$\exp(...)/Z(x)$ãšæžãããŠããŸãããããã¯Softmax颿°ãæå³ããŠããŸãã$w$ã¯æ·±å±€åŠç¿ã¢ãã«ã®ãŠã§ã€ãã§ãããã®æ·±å±€åŠç¿ã¢ãã«ã®ã¢ã¯ã·ã§ã³$a$ã«å¯Ÿããåºå確çã$f_a(x)$ãšæžããŠäžèšåŒã«å ¥ãããšãå šäœåã¯ä»¥äžã®ãããªåœ¢ã«ãªããŸãã
$\underset{f}{argmax} \left( \Sigma_i \Sigma_{a'} [ ÎŽ(a', a_i) \cdot r_i \cdot f_{a'}(x) \cdot 1 / p_i ] \right)$
ããã§ã$i$ã¯ãã°ããŒã¿ã®ã€ã³ããã¯ã¹ã$a'$ã¯åãããã¢ã¯ã·ã§ã³ã§ããã$ÎŽ(a', a_i)$ã¯$a'=a_i$ã®ãšãã«1ããã以å€ã§0ã«ãªã颿°ã§ãã
æ¯èŒã®ããã«ãsoftmax-cross-entropyããã¹é¢æ°ãšããåé¡åšã«ã€ããŠãæé©ååé¡ãå®åŒåãããšä»¥äžã®ããã«ãªããŸãã
$\underset{f}{argmin} \left( - \Sigma_i \Sigma_{a'} [ ÎŽ(a', a_i) \cdot \log{ f_{a'}(x) } ] \right)$
åŸè ã«å¯ŸããŠãåè ã¯ã
- æå°ååé¡ã§ã¯ãªããæå€§ååé¡ã«ãªã£ãŠãã (ãªã¯ãŒãã®æåŸ å€å€ãæå€§åããç®çã®ãã)
- Softmaxåºåã«å¯ŸããŠã$\log$ãæããŠããã確çã®ãŸãŸèšç®ããŠããããªã¯ãŒã$r_i$ãæããŠããã®ã§ãçµæãšããŠãªã¯ãŒãã®æåŸ å€ãšãªã
- $\pi_0$ã«ãããã€ã¢ã¹ãé€ãããPropensity $p_i$ã§å²ã圢ã«ãªã£ãŠãã
å·®åã¯ãã®ãããã§ãã®ã§ãäžè¬çãªæ·±å±€åŠç¿ã®åé¡åšã«å°ãæãå ¥ããããšã§åŠç¿ã®ä»çµã¿ãå®è£ ã§ããããšãåãããŸãã
å¿ èŠãªæ£åå
ãã®ããã«ã·ã³ãã«ãªåŠç¿åã®å°åºã§ããŸããããå®å®ããåŠç¿ãè¡ãããã«ã¯ããäžæ¯å·¥å€«ãããªããŠã¯ãªããŸããã2ã€ã»ã©æ£ååãå ¥ããå¿ èŠããããŸãã
1ã€ç®ã¯ããæ°ããããªã·ãŒ$\pi_e$ããæ¥µç«¯ã«ãã°ããŒã¿ååŸæã®ããªã·ãŒ$\pi_0$ããä¹é¢ããŠããªãããšãèŠæ±ãããæ£ååããã®è§£éã¯åç»ã®äžã§ã¯èšåãããŠããããçŽæçãªçè§£ã«å°ã£ãŠãããšãããAdith.S, Thorsten.J, "The Self-Normalized Estimator for Counterfactual Learning" ã«ãŠä»¥äžã®ããã«èª¬æãããŠããã®ãåŒçšããŠããŸã:

以äžã®å³ã®$\lambda_1$ã®é
ã§ãã$\pi_e(a_i|x_i)/p_i = \pi_e(a_i|x_i)/\pi_0(a_i|x_i)$ãæŽãããšãã®é
ã倧ãããªããŸãããããã¯2ã€ã®ããªã·ãŒãåãå€ã倧ããç°ãªãå Žåã«çºçããŸãã
çµå±ããã°ããŒã¿ååŸæã®ç¶æ³ãšå€§ããç°ãªããšãè©äŸ¡ã®äžå®æ§ã¯ã©ãããŠã倧ãããªãããããã®ãããªç¶æ³ã§å¶ç¶è¯ãå€ãå©ãåºããããªã·ãŒãæ¡çšãããªãããã«ããããã®æ£ååã§ãã
2ã€ç®ã¯ãããã°ããŒã¿ã®äžã§ããŸããŸPropensity $p_i$ãå°ããã£ãã¢ã¯ã·ã§ã³ãéžã°ãããšããæ°ããããªã·ãŒ$\pi_e$ãããã«ãªãŒããŒãã£ããããŠããŸãããš(Propensity overfitting)ãé²ããæ£ååãäžå³ã®$\hat{S}(\pi)$ã®åœ¢ãèŠããšãPropensity $p_i$ãå°ããããŒã¿ã«å¯ŸããŠãæ°ããããªã·ãŒ$\pi(a_i|x_i)$ã倧ããªå€ãåãã«è¡ããšããããããã®åæ°ã¯å€§ããªå€ãåããããšãåãããŸãããã®æ§è³ªãåŠç¿ã®ãšãã«å€ã«å©çšãããŠããŸããšãPropensity $p_i$ãå°ããããŒã¿ã«å¯ŸããŠå€§ããªç¢ºçãåºåãããããªåçŽãªããªã·ãŒ$\pi(a_i|x_i)$ãåŠç¿ãããŠããŸããŸããããã¯ããŒã¿ã«å¯ŸãããªãŒããŒãã£ããã§ãããæ¬æ¥è¡ããããªã¯ãŒãæåŸ å€ãæå€§åããããªã·ãŒã®æ¢çŽ¢ããã¯å€ããŸãããããé²ãããã«ãäžçªäžã®è¡ã®ããã«$\hat{V}(\pi)/\hat{S}(\pi)$ãšããåœ¢ã®æ£ååãå°å ¥ããŸããModel-free estimatorã®ç« ã§èª¬æã端æã£ãŠããŸã£ãSNIPS Estimatorã§ããããŸãã«Propensity overfittingãè§£æ¶ããããã®ã¢ãããŒãã§ãããåãåŒã«ãªããŸãã®ã§ã以äžã®å³ã§ã$\hat{V}^{SNIPS}$ãšæžãããŠããŸãã
ãŸãšã
ããŒã¯ãèŠçµãã£ãŠã®ææ³ã§ãããåå®ä»®æ³æ©æ¢°åŠç¿ãšããåŠåã¯ãæ°åŒãæ¯èŒçã·ã³ãã«ã«ãŸãšããããŠãããããã¹ãããšãæç¢ºã«å®çŸ©ãããŠããŠãšã³ãžãã¢ã䜿ããããå®è·µçãªåŠåã ãšæ¹ããŠæããŸããã課é¡èšå®ãçŸå®ã«çºçãããã·ãã¥ãšãŒã·ã§ã³ãè¯ãæããŠããŸãããäœãããããããŒã¹ã«ããŠäœããããªã³ã¡ã³ãã·ã¹ãã ã¯ããŠãŒã¶ãŒãžã®ãããã£ããã®æäŸã¯ãã¡ããã®ããšãäŒæ¥ã«ãšã£ãŠã(A/Bãã¹ãã§çºçãããããª)å£²äžæ¯æãªã¹ã¯ã軜æžããããšãã§ããå®è£ ã®ããããããšæ¥œããã®èгç¹ã§éçºè ã幞ããšããäžæ¹è¯ããå®çŸããããã®ã ãšæããŸããããã°ãããã
æåŸã«ãäŒç€Ÿã®ç޹ä»ããããŠãã ããããã¥ãŒã©ã«ãã±ããã§ã¯ã人ã
ã䟿å©ã§å¹žããªç掻ãéããã¹ããŒãã·ãã£ã®å®çŸã«åããæ·±å±€åŠç¿ã¢ãã«ãæé©åã¢ã«ãŽãªãºã ã®éçºãé²ããŠããŸããç¥ç奜å¥å¿ã«æº¢ããã¡ã³ããŒãããã¯ã€ãããŒãã«è²ã
æžããªããè°è«ãæ·±ããŠããæåã§ããå°ãã§ãèå³ãæã£ãŠããã ããæ¹ã¯ããã²ä»¥äžã®ããŒãžãããé£çµ¡ãããã ããŸããšå¹žãã§ãã
https://hrmos.co/pages/neuralpocket/jobs/1725841606893461509






