æ¬èšäºã§ã¯ãæ©æ¢°åŠç¿ã®ã¿ã¹ã¯ãè§£ãäžã§éåžžã«ããç»å Žãã**æé©ååé¡(optimization problem)**ã®åºç€ã解説ããŠãããŸãã
æ©æ¢°åŠç¿ã§çšããæé©åãšããã°ãSGDãMomentumãAdamãªã©ãæåã§ãããã¯ããããããã«é¢ããŠã®è§£èª¬ãæžããããšãèããŸããããæ¢ã«åªããèšäºãå€ã ããã®ã§ãããã§ã¯ã»ãšãã©è§ŠããŸããã
äžæ¹ãæé©ååé¡ãšã¯äœããã¢ã«ãŽãªãºã ã"åªããŠãã"ãšã¯ã©ãè©äŸ¡ãããããªã©ã®æé©åã®åºç€ã«é¢ããéšåã®æ å ±ãå°ãªãã£ãã®ã§ãæ¬èšäºã§ã¯ãããã«ã€ããŠè§£èª¬ãè¡ãªã£ãŠãããããšæããŸãã
æé©ååé¡
ãŸããã¯ããã«æé©ååé¡ã®å®çŸ©ãäžããŸããæé©ååé¡ãšã¯ãäžããããæ¡ä»¶ã®ããšã§äœããã®é¢æ°ãæå°å(ãããã¯æå€§å)ããåé¡ã®ããšãæããŸãã
颿°$f:R^n \rightarrow R$, $g_i:R^n \rightarrow R(i=1,...,m)$, $h_j:R^n \rightarrow R(j=1,...,l)$ãšãããšããæé©ååé¡ã¯æ¬¡ã®ããã«ããããããŸãã
$$
\begin{array}{lrll}
& \min & \displaystyle f(x) & \\
& \rm{s.t.} & \displaystyle g_i(x) = 0 \ \ (i=1,...,m) \\
& &\displaystyle h_j(x) \leq 0 \ \ (j=1,...,l)
\end{array}
$$
ããã§ã$f(x)$ãç®ç颿°(objective function)ã(æ©æ¢°åŠç¿ã®æèã§ã¯ãã¹é¢æ°(loss function)ãšã)ã$g_i(x)$, $h_j(x)$ãå¶çŽé¢æ°(constraint function)ãšåŒã³ãŸããããã§ã$g_i(x)$, $h_j(x)$ã¯ããããçåŒå¶çŽãäžçåŒå¶çŽãšåŒã°ããŸãã
ãã®ããã«å¶çŽæ¡ä»¶ã®ååšããåé¡ãã**å¶çŽä»ãæé©ååé¡(constrained optimization problem)ãšåŒã³ãäžæ¹å¶çŽæ¡ä»¶ãååšããªãåé¡ãããªãã¡
$$
\begin{array}{rl}
\min & \displaystyle f(x)
\end{array}
$$
ãç¡å¶çŽæé©ååé¡(unconstrained optimization problem)**ãšåŒã³ãŸãã
æå€§ååé¡ã¯èããªããŠè¯ãã®ïŒãšæã£ãæ¹ããããããããŸãããæå€§ååé¡ã¯ãæå°ååé¡ã®ç®ç颿°ã«ãã€ãã¹ãæããminãmaxãžãšããããšã§ç䟡ãªåé¡ãšããŠæ±ãããšãã§ããã®ã§ãæé©åã®æèã§ã¯ããã°ãã°æå°ååé¡ãäžå¿ãšããŠæ±ãããŸãã
倧åçæé©è§£ãšå±æçæé©è§£
ããŠãæé©ååé¡ãè§£ãããã«ã¯ãããããè§£ãšã¯äœãªã®ãããšããå®çŸ©ãäžããªããã°ãªããŸããã
æå°ååé¡ãèãããšãäžçªå°ããç¹ãè§£ã«ãªãããšçŽæçã«èããããŸãããããåŒã§ãããããšæ¬¡ã®ããã«ãªããŸãã
ä»»æã®ç¹$x \in R^n$ã«å¯ŸããŠã
$$
f(x^*) \leq f(x)
$$
ãæºããæã$x^*$ãã**倧åçæé©è§£(global optimizer)**ãšåŒã³ãŸãã
ããããçŽæçãªæå³ã§ã®é¢æ°å€ã"äžçªå°ãã"ç¹ã§ãããããããæé©åã§ã¯ããäžã€éèŠãªè§£ã®å®çŸ©ãååšããŸããããããæ¬¡ã®å®çŸ©ã§ãã
$x^*$ã®$\epsilon$è¿åã®ä»»æã®ç¹$x \in R^n$ã«å¯ŸããŠã
$$
f(x^*) \leq f(x)
$$
ãæºããæã$x^*$ãã**屿çæé©è§£(local optimizer)**ãšåŒã³ãŸãã
éåžžã«ãã䌌ãå®çŸ©ã§ããã"è¿å"ã®ç¹ãšæ¯èŒããŠãäžçªå°ãããšããç¹ãéèŠãšãªããŸããå³ã§ã¿ããšããããããã§ããã
æé©ååé¡ãè§£ãæããã¡ãã倧åçæé©è§£ãæ±ããããã°è¯ãã®ã§ãããåæç¹ã®äœçœ®ãç®ç颿°ã®æ§è³ªã«ãã£ãŠãåžžã«å€§åçæé©è§£ãæ±ãããããšã¯éããŸãããããã§ã代ããã«å±æçãªæé©è§£ãçšããããšããã°ãã°ãããŸãã
åžèšç»åé¡
æé©ååé¡ã«ã¯ããã®åé¡ã®æ§è³ªã«å¿ããŠæ§ã ãªåé¡ãååšããŸããæåãªãšããã§èšãã°ãç®ç颿°ãšå¶çŽé¢æ°ãç·åœ¢é¢æ°ã§ãã**ç·åœ¢èšç»åé¡(linear problem)**ãèããããšããããããããŸããã
ããã§ã¯ãéåžžã«éèŠãªæŠå¿µã§ãã**åžèšç»åé¡(convex problem)**ã«ã€ããŠç޹ä»ããŸãããã®æºåã®ããããŸãåžé¢æ°ãšåžéåã®å®çŸ©ãäžããŸãã
颿°$f:R^n \rightarrow (-\infty, +\infty)$ãä»»æã®$x, y\in R^n$ãš$\alpha \in [0,1]$ã«å¯ŸããŠã
$$
f((1-\alpha)x+\alpha y ) \leq (1-\alpha) f(x) +\alpha f(y)
$$
ãæºãããšãã$f$ã**åžé¢æ°(convex function)**ãšåŒã³ãŸãã
ããã¯ã颿°$f$ã®ä»»æã®äºç¹ãçµãã ç·åãåžžã«é¢æ°ã®äžã«ååšããããšããããããŸãã
éå$S \subseteq R^n$ã«ãããŠã
$$
x\in S, y\in S, \alpha \in [0,1] \Rightarrow (1-\alpha) x + \alpha y \in S
$$
ãæãç«ã€ãšãã$S$ã**åžéå(convex set)**ãšåŒã³ãŸãã
ããã¯ãéå$S$å
ã®ä»»æã®2ç¹ãçµã¶ç·åã$S$ã«å«ãŸããããšãæããŸãã
ç®ç颿°ãåžé¢æ°ã§ãããå¶çŽæ¡ä»¶ãåžéåã§ãããããããšãããã®åé¡ã**åžèšç»åé¡(convex problem)**ãšåŒã³ãŸãã
åžèšç»åé¡ã¯ã屿çæé©è§£ãšå€§åçæé©è§£ãäžèŽãããšããè¯ãæ§è³ªãæã£ãŠããŸãããŸããããã«å³ããå¶çŽã®ããšããã®è§£ã®äžææ§ãä¿èšŒãããå ŽåããããŸãããã®ãããªè§£æã®å®¹æããããåžèšç»åé¡ã«å¯Ÿããå€ãã®ç ç©¶ãè¡ãããŠããŸããã
ããã«å¯Ÿããéåžãªåé¡ã¯ãäžè¬ã«å±æçæé©è§£ãšå€§åçæé©è§£ãäžèŽãããè§£æã¯å°é£ãªãã®ãšãªããŸãã
åžé¢æ°ã®äŸ
åžé¢æ°ã®ç°¡åãªäŸãšããŠã$f(x)=x^2$ãæããããŸãã
å®éã
$$
(1-\alpha) x^2 +\alpha y^2 - ((1-\alpha)x+\alpha y )^2 = \alpha (1- \alpha) (x-y)^2 \geq 0
$$
ãããåžé¢æ°ã§ããããšãããããŸãã
ããã§ã¯ãå®çŸ©ã«ããŠã¯ããŠèšç®ããŸãããã颿°ãåžã§ãããã¯ããã®äºå埮åã®ããã»è¡åã忣å®å€ã§ãããã©ããã調ã¹ãããšã§æ±ããããšãã§ããŸãã
$$
f^{''}(x) = \frac{d^2}{dx^2} x^2 = 2 \geq 0
$$
ããã§ã¯ãç°¡åãªé¢æ°ãçšããã®ã§è¡ãªã£ãŠããŸããããå®éã«ã¯ãè¡åã®åºæå€ãªã©ãã忣å®å€æ§ã調ã¹ãå¿
èŠããããŸãã
å埩æ³ã®ã¢ã«ãŽãªãºã
ããããã¯ãå®éã«æé©è§£ãæ±ããããã®å埩æ³ã®èª¬æãè¡ããŸãã
å埩æ³ã¯ãé©åœãªåæç¹$x^0 \in R^n$ããã¹ã¿ãŒãããŠç¹ã次ã®ããã«æŽæ°ãããããªã¢ã«ãŽãªãºã ãæããŸãã
$$
x^{k+1} = x^{k} + \alpha^k d^k
$$
ããã§$d^k \in R^n$ã¯ã**æ¢çŽ¢æ¹å(search direction)**ãšåŒã°ãããã®æ¹åã«é²ãããšã§$k$åç®ã®å埩ç¹ããã$k+1$åç®ã®å埩ç¹ã®æ¹ãè§£ã«è¿ã¥ãããšãæåŸ
ãããŸãã$\alpha^k$ã¯ã¹ã«ã©ãŒã§æ¢çŽ¢æ¹åã«ã©ããããé²ãããå¶åŸ¡ããã®ã§ã**ã¹ãããå¹
(step size)**ãšåŒã°ããŸãã(æ©æ¢°åŠç¿ã®æèã§ã¯ã**åŠç¿ç(learning rate)**ãšã)
ãã®æŽæ°ãç¹°ãè¿ãããšã§ã$x^k$ãæé©è§£$x^*$ã«ååè¿ã¥ãããšããã¢ã«ãŽãªãºã ãçµäºããŸãã(çè«çã«ã¯ãååå°ãã$\epsilon$ã«å¯ŸããŠ$| x^k - x^* | \leq \epsilon$ãæºããããšããçµäºããŸããçã®è§£ãããããªãããå埩æ³ã䜿ã£ãŠããã®ã«ã©ããã£ãŠå€å®ããã®ïŒãšæãããæ¹ã¯ãããè¯ãåããããŠããŸããå®éã®å®è£ ã§ã¯ãæŽæ°ã®å¹ ãååå°ãããªã£ãæãçµäºããå Žåãå€ãã§ãã)
ç¹åã®æŽæ°åŒããèŠãŠãããéããéèŠãšãªãã®ã¯ã¹ãããå¹ ãšæ¢çŽ¢æ¹åãã©ã決å®ãããããšããç¹ãæããããŸãã
ã¹ãããå¹
ã¹ãããå¹
ã®æ±ºãæ¹ã¯å€ã
ååšããŸããããããããªãé©åãªã¹ãããå¹
ããšããªããã°ãªããªãã®ã§ããããã
ããã¯ã以äžã®å³ã®ãããªåé¡ãçããããã§ãã
ããã§ã¯ãæãåºæ¬çãªæ±ºãæ¹ã§ãã**çŽç·æ¢çŽ¢(line search)**ãæããŸãã
çŽç·æ¢çŽ¢ã¯ã$d^k$ã«é²ãã ãšãã«ãç®ç颿°å€ãæå°ã«ãã$\alpha > 0$ãã¹ãããå¹
ãšããŸããããªãã¡ã
$$
f(x^k + \alpha^k d^k) = \min_{\alpha} {f(x_k + \alpha d^k)}
$$
ãæºãããã®ã§ãã
ãã ããçŽç·æ¢çŽ¢ã¯ãè€éãªé¢æ°ãšãªãã°ãªãã»ã©æ£ç¢ºãªã¹ãããå¹
ãæ±ããããšããèšç®éã®ç¹ããé£ãããªããå®éã«ã¯ãåºå®ã®ã¹ãããå¹
($=0.1, 0.01$ãªã©)ãçšããããããšãå€ãã§ãã
çè«çã«è¯ããšãããŠããã¹ãããå¹ ã®æ±ãæ¹ãšããŠãArmijoæ¡ä»¶ãWolfæ¡ä»¶(åŸè¿°)ãªã©ãæåã§ãã
äžè¬ã«ã¯ãåºç€ã®æŽæ°ã§å€§ããè§£ã«è¿ã¥ããŠãè§£ã®è¿åã§ã¯ç²ŸåºŠãè¯ãããããã«å°ããæŽæ°ãããããªã¹ãããå¹
ãè¯ããšãããŸãã
äŸãã°ãã¹ãããæ°(ã¢ã«ãŽãªãºã ã®ååŸ©åæ°)ã$k$ãšããŠã
$$
\alpha^k = \frac{1}{\sqrt{k}}
$$
ãªã©ãšãããšãå埩ãé²ãã«ã€ããŠå°ãããªããããªã¹ãããå¹
ãåŸãããŸãã
æ¹ååŸ®ä¿æ°
æ¢çŽ¢æ¹å$d^k$ã®æ±ºå®æ¹æ³ã§ãããããã¯é¢æ°ãæžå°ããæ¹åãšãªãããšãæåŸ
ãããŸããããªãã¡ã
$$
f(x^{k+1}) - f(x^{k}) =f(x^{k} +\alpha ^k d^k) - f(x^{k})
$$
ãè² ãšãªããããª$d^k$ãæ±ãããããšããããšã«ä»ãªããŸããã
ããã§é¢æ°$f$ã埮åå¯èœãªãšãã
$$
\lim_{t\rightarrow +0} \displaystyle \frac{f(x^{k} +t d^k) - f(x^{k})}{t} = \nabla f(x^k)^T d^k
$$
ããããã®å³èŸºãè² ãšãªãã°è¯ãããšãããããŸãã(ã€ã¡ãŒãžãã¥ããæ¹ã¯ã$f(x^{k} +\alpha ^k d^k)$ããã€ã©ãŒå±éããŠãäžæ¬¡ã®é
ãŸã§ã§æã¡åã£ãŠã¿ãŠãã ããã)
ãã®å³èŸºããæ¹ååŸ®ä¿æ°ãšåŒã³ãå埩æ³ã§ã¯ãããè² ãšãªããããª$d^k$ã**éäžæ¹å(descent direction)**ãšåŒã³ãŸãã
é£ç¶æé©åã«ãããæ§ã ãªã¢ã«ãŽãªãºã ã¯ããã®éäžæ¹å$d^k$ã®æ±ãæ¹ãç°ãªããŸãã
ææ¥éäžæ³
æãåºæ¬çãªéäžæ³ã®äžã€ã§ãã**ææ¥éäžæ³(steepest descent)**ã玹ä»ããŸãã
ãŸããåå°ç¯ããæ¹ååŸ®ä¿æ°ã¯æ¬¡ã®ããã«ããããããŸãã
$$
\nabla f(x^k)^T d^k = |\nabla f(x^k) |\ | d^k | \ {\rm cos} \gamma
$$
ãã ãã $\gamma$ã¯$\nabla f(x^k)$ãš$d^k$ã®ãªãè§ã§ãããã®åŒãããæ¹ååŸ®ä¿æ°ãæå°ã«ããã®ã¯ã${\rm cos} \gamma = -1$ãããªãã¡$\gamma = \pi$ã®ãšãã§ãããæ¢çŽ¢æ¹åã¯
$$
d^k = -\nabla f(x^k)
$$
ãšããŠãæ±ããããŸãã
ãã®ããã«ãæ¹ååŸ®ä¿æ°ãæå°ãšããæ¹åãçšããŠãè§£ãæ¢çŽ¢ããããã«ææ¥éäžæ³ãšåŒã°ããŸãã
ã¢ã«ãŽãªãºã ã¯ã次ã®éãã§ãã
- åæç¹$x^0$ãé©åœã«å®ããã
- çŸåšã®å埩ç¹$x^k$ãçµäºæ¡ä»¶ãæºãããŠããã°çµäºãããã§ãªããã°3.ãžã
- $d^k = -\nabla f(x^k)$ãèšç®ããã
- ã¹ãããå¹ $\alpha^k$ãèšç®ããã
- ç¹ã$x^{k+1} = x^k + \alpha^k (-\nabla f(x^k)) =x^k - \alpha^k \nabla f(x^k)$ãšããŠæŽæ°ããã
- 2.ãžã
ææ¥éäžæ³ã®åææ§
ã¢ã«ãŽãªãºã ãè©äŸ¡ããäžã§ãéåžžã«éèŠãªææšãšãªãã®ãåææ§ãããªãã¡ç¹åãæŽæ°ããŠå¿
ãè§£ã«èŸ¿ãçããã©ããããšããç¹ã§ãã
ããŸãåææ§ã«è§Šããããšã®ãªãã£ãæ¹ã¯ãã¢ã«ãŽãªãºã ãªãã ããåæããŠåœç¶ã§ã¯ïŒãšæãæ¹ããããããããŸããããå®éã¯ã¢ã«ãŽãªãºã ã«ã¯åæããæ¡ä»¶ããããŸãã
äŸãã°ãä»»æã®åæç¹ããã¯ãããŠåæããã¢ã«ãŽãªãºã ãªã®ãã©ããããããã¯è§£ã®è¿åãåæç¹ãšãããšãã®ã¿åæããã¢ã«ãŽãªãºã ãªã®ãã倧åçæé©è§£ã«åæããã®ãã屿çæé©è§£ã«åæããã®ãããªã©ãç°ãªããŸãã
ããã§ã¯ãææ¥éäžæ³ã®åææ§ã«ã€ããŠèŠãŠãããŸãã
åæç¹ã$x_0$ãšããŸãããã®ãšãã$f(x)$ãäžã«æçããã€éå{${ x\in R^n \ | \ f(x) \leq f(x_0) }$}ã§$f(x)$ãé£ç¶ç埮åå¯èœã§ã$\nabla f(x)$ããªãã·ããé£ç¶ã§ãããšããŸãããã®ãšããArmijoæ¡ä»¶ãæºããã¹ãããå¹ ãçšããææ¥éäžæ³ã¯å€§åçåæããŸãã
ç°¡åãªèšŒæãèŠãŠãããŸãã
ç¹åã®æŽæ°åŒ
$$
x^{k+1} = x^k - \alpha^k \nabla f(x^k)
$$
ãããç¹å{$x^k$}ãåæããããã®ãå¿
èŠå忡件ã¯$|| \nabla f(x^k) || \rightarrow 0(k\rightarrow \infty)$ã§ããããšãããããŸãã
Zoutendijkæ¡ä»¶ãããä»®å®ãããããšã$x^{k+1}=x^k+\alpha^k d^k$ã§çæãããç¹å{$x^k$}ã¯ã次ã®åŒãæºãããŸãã
$$
\sum_{k=0}^{\infty}\left( \frac{\nabla f(x^k)^T d^k}{||d^k||} \right)ã< \infty
$$
ãã®åŒã¯ã次ã®ããã«ããããããŸãã
$$
\sum_{k=0}^{\infty} ||\nabla f(x^k)|| {\rm cos} \theta_kã< \infty
$$
ãã ãã${\rm cos} \theta_k$ã¯
$$
{\rm cos} \theta_k = \left( \frac{- \nabla f(x^k)^T d^k}{||\nabla f(x^k)|| \ ||d^k||} \right)
$$
ã§ããããããŸãã
ããã§ãææ¥éäžæ³ã§ã¯ã$d^k = -\nabla f(x^k)$ãªã®ã§ã
$$
{\rm cos} \theta_k = \left( \frac{- \nabla f(x^k)^T (-\nabla f(x^k))}{||\nabla f(x^k)|| \ ||-\nabla f(x^k)||} \right) = 1
$$
ãæãç«ã¡ãŸãããã£ãŠãZoutendijkæ¡ä»¶ãã
$$
\sum_{k=0}^{\infty} ||\nabla f(x^k)|| ã< \infty
$$
ãæç«ããŸããããã§ãç¡éçŽæ°ãåæããããã«ã
$$
\lim_{k \rightarrow \infty} ||\nabla f(x^k)|| ã= 0
$$
ãæç«ããŸãããã£ãŠãã¢ã«ãŽãªãºã ãé²ãã«ã€ããŠãåŸé
ã®ãã«ã ã0ã«åæããŠããããšãããã£ãã®ã§ã倧åçåæããããšãããããŸããã(åå倧ãã$k$ã«å¯ŸããŠã$||x^{k+1} -x^k|| \rightarrow 0$ãæç«)
ææ¥éäžæ³ã®åæç
ã¢ã«ãŽãªãºã ãè©äŸ¡ããäžã§ãåææ§ãšäžŠãã§éèŠãªæŠå¿µãåæçã§ããããã¯ãã©ã®ãããã®éãã§ã¢ã«ãŽãªãºã ãåæãããããããããŸãã
ããçšããããææšãšããŠã**q-1次åæ(q-linear convergence)**ãæããããŸãã
ããã¯ãç¹å{$x^k$}ã$x^{*}$ã«åæãããšãããã宿°$c\in (0,1)$ãæŽæ°$k'$ã«å¯ŸããŠã
$$
||x^{k+1} -x^{*}|| \leq c||x^k - x^{*}|| \ \ (\forall k \geq k')
$$
ãæãç«ã€ããšãèšããŸããããªãã¡ãçŸåšã®å埩ç¹$x^k$ãšæ¬¡ã®å埩ç¹$x^{k+1}$ãšè§£ãšã®å·®ãç·åœ¢ã«è¿ããªãããšã瀺ããŸãã
ããã«ã
$$
||x^{k+1} -x^{*}|| \leq c||x^k - x^{*}||^2 \ \ (\forall k \geq k')
$$
ãæãç«ã€æã**q-2次åæ(q-quadratic convergence)**ãšåŒã³ãŸãã
äœæçã«ã¯ãq-2次åæã¯éåžžã«éãã10ã¹ãããçšåºŠã§åæãããããªã±ãŒã¹ãå€ããq-1次åæã¯æ°100ã¹ãããããããããªã€ã¡ãŒãžã§ãã
ææ¥éäžæ³ã®åæçãèŠãŠãããŸãã
ä»ãè¡å$A\in R^{n\times n}$ãæ£å®å€å¯Ÿç§°ã§$b\in R^n$ã宿°ãã¯ãã«ã§ãããšããåé¡
$$
\begin{array}{rl}
\min & \displaystyle f(x) = \frac{1}{2} x^TAx + b^Tx
\end{array}
$$
ãèããŸãã
ãã®ãšããçŽç·æ¢çŽ¢ãçšããŠçæãããç¹å{$x^k$}ã¯ã以äžã®åŒãæºãããŸãã
$$
||x^{k+1} - x^{*}|| \leq \left| \frac{\lambda - \mu}{\lambda +\mu} \right| ||x^k-x^{*}||
$$
ãã ãã$0<\lambda \leq \mu$ã¯ããããè¡å$A$ã®æå°åºæå€ãæå€§åºæå€ããããããŸãã
ãŸããã«ã ã¯$||v||=\sqrt{v^TAv}$ã§ããããããŸãã
ãããããææ¥éäžæ³ã¯1次åæããããšãããããŸããã(蚌æã¯ç¥)
SGD
ææ¥éäžæ³ã§ã¯ãäžåã®æŽæ°ã§å šãŠã®ããŒã¿ãèŠãŠç¹åãæŽæ°ããŠããŸãããããããããŒã¿æ°ãèšå€§(100äž~)ãšãªã£ããšãããã®å šãŠã®ããŒã¿ã®æ å ±ãçšããŠãç¹åãæŽæ°ããã®ã¯éåžžã«èšç®éãããããŸãã
ããã§ã**確ççåŸé éäžæ³(stochastic gradient descent; SGD)**ã§ã¯ã泚ç®ããããŒã¿ã«å¯ŸããŠã®ã¿ã®æŽæ°ãè¡ãããããç¹°ãè¿ãããšã§è¿äŒŒè§£ãåŸãŸããããã«ãããããŒã¿æ°ãèšå€§ãªæã§ããããçšåºŠã®ç²ŸåºŠã®è§£ã(éåžžã®åŸé éäžæ³ãšæ¯èŒããŠ)é«éã«åŸãããšãã§ããŸãã
ããã«ãäžã€ãã€ã§ã¯ãªãäžå®ã®ãããŸã(äŸãã°100ã³ãã€)ã®ããŒã¿ãçšããŠæŽæ°ããæ¹æ³ã**ãããããåŸé éäžæ³(minibatch gradient descent)**ãšåŒã³ãŸãã
ãŸãšãããšä»¥äžã®ããã«ãªããŸãã
ææ¥éäžæ³ãçè§£ã§ããŠããæ¹ã¯ã SGDãããã«çè§£ã§ãããšæããŸããSGDã¯ãåæããããšã蚌æãããŠãããæ©æ¢°åŠç¿ã®æèã§ããã䜿çšãããŸãããã ããåæçã«é¢ããŠã¯ãããŒã¿ãã©ã®ãããªé çªã§åŠç¿ããããªã©ã«äŸåããéšåãããå°ãè€éã«ãªããŸãã
ãã®ä»ã®ã¢ã«ãŽãªãºã
ææ¥éäžæ³ã¯æ¢çŽ¢æ¹åã$d^k = -\nabla f(x^k)$ãšããŠããŸããããåžžã«ããã§è¯ãã®ã§ãããããå®éã«ã¯ãããã§ã¯äžæããããªãå Žå(æ¯åãªã©)ããããŸããããã§ãããæ©ãåæãããããª**å ±åœ¹åŸé æ³(conjugate gradient method)**ãªã©ãèããããŠããŸãã
ãŸããææ¥éäžæ³ã§ã¯é¢æ°ã®äžé埮åãŸã§ã®æ
å ±ããçšããŠããŸããã§ããããããé«ç²ŸåºŠãªè§£ãæ±ããããäºå埮åãçšããŠæ¢çŽ¢æ¹åãæ±ºå®ãã**ãã¥ãŒãã³æ³(Newton method)ãªã©ããããŸããããã«ãåææ§ãä¿èšŒããããæŽŸçãããæºãã¥ãŒãã³æ³(quasi-Newton method)ãèšç®éãåæžããèšæ¶å¶éæºãã¥ãŒãã³æ³(limited memory quasi-Newton method)**ãç¥ãããŠããŸãã
ãã ããäºå埮åãçšããææ³ã¯éåžžã«éãåæçãæã€äžæ¹ãéè¡åã®èšç®ãªã©ã§èšç®éã®ãªãŒããŒãéåžžã«å€§ãããªããããããã°ããŒã¿ã«å¯ŸããŠã¯ããŸãåããŠããŸããã
æ©æ¢°åŠç¿ã§ã¯ãåé ã«æããéããæ £æ§é ãæŽæ°åŒã«åãå ¥ããMomentumãéå»ã®åŸé ã®æžå°æ å ±ãä¿æããAdamãªã©ãæåã§ãã
ãã ããã©ã®ã¢ã«ãŽãªãºã ãäžé·äžçãããåé¡ãšã®çžæ§ãããã®ã§ãäžæŠã«ã©ããåªããŠãããšããã®ã¯èšãã¥ããã®ãå®éã®ãšããã§ãã
ãããã«
æ¬èšäºã§ã¯ãæé©ååé¡ã®åºç€ãåãäžããŠããŸããã
çŸåšã¯ãåªããã©ã€ãã©ãªãæ°å€ãæã£ãŠããã®ã§ãåé¡ã®æé©åãè¡ãéšåã¯æ°è¡æžããŠçµããããšããæ¹ãå€ããšæããŸãã
ããããäžæãåæããªãæãã¹ãããå¹
ãã©ã®ããã«å€åãããã°è¯ããããªã©ãèããéã«ã¯ãæé©åãžã®çè§£ãå¿
èŠäžå¯æ¬ ã§ãã
æ¬èšäºã§ãäžäººã§ãå€ãã®æ¹ãæé©åã«èå³ãæã£ãŠé ãããšå¹žãã§ãã
èšäºäžã®åŒãæ°å€ã¯å®éèšç®ãè¡ããŸãããã倧ããééã£ãŠãããªã©ããæ°ä»ãã®ç¹ããŸããææ³ããããŸããããé æ ®ãªãã³ã¡ã³ãã@hiyoko9tã®æ¹ãžã声ãããã ããã


