Skip to content

문제 4 · 최대가능도추정

문제 4 — 최대가능도추정

우리가 관찰한 데이터가 가우시안 분포Gaussian distribution로부터 독립적이고 동일하게 분포independently and identically distributed되었다고 가정하자.

p(xn)N(xnμ,σ2)

이 때 가능도likelihood 함수를 정의하고, 데이터가 추출된 가우시안 분포의 평균과 분산값을 최대가능도추정maximum likelihood estimation 방법을 이용하여 구하라. 또한, 구한 결과가 과적합overfitting 현상에 미치는 영향에 대해 서술하여라.


가우시안 분포의 정의를 사용하고, 가능도 함수에 로그를 취한 결과를 사용하여야 한다.

N(xnμ,σ2)=12πσ2exp((xnμ)22σ2)
풀이 및 해설

가능도 함수 — 데이터 x={x1,,xN}가 i.i.d.이므로 결합 확률은 곱으로 쓰인다.

p(xμ,σ2)=n=1NN(xnμ,σ2)

로그 가능도 — 곱을 합으로 바꾸기 위해 로그를 취한다.

lnp(xμ,σ2)=12σ2n=1N(xnμ)2N2lnσ2N2ln(2π)

평균μ에 대해 미분하여 0으로 둔다.

μlnp=1σ2n=1N(xnμ)=0 μML=1Nn=1Nxn 

분산σ2에 대해 미분하여 0으로 둔다.

σ2lnp=12σ4n=1N(xnμ)2N2σ2=0 σML2=1Nn=1N(xnμML)2 

과적합과의 관계 — 두 추정량의 기댓값을 구하면 평균은 불편(unbiased)이지만 분산은 편향(biased)되어 있다.

E[μML]=μ,E[σML2]=N1Nσ2<σ2

즉 최대가능도 분산은 참 분산을 과소추정한다. 이는 같은 데이터로 평균 μML을 먼저 추정한 뒤 그 평균을 다시 분산 계산에 사용하기 때문으로, 모델이 학습 데이터에 지나치게 맞춰지는 과적합의 한 단면이다. 불편 추정을 원하면 σ~2=NN1σML2=1N1n(xnμML)2로 보정한다. 데이터 수 N이 커질수록 편향 N1N1이 되어 사라진다.

PDF