Skip to content

문제 4 · EM 알고리즘의 적용 (결측치)

문제 4 — EM 알고리즘의 적용

아래는 5개의 관측값을 행row으로 나열한 행렬이며, 기호는 결측치missing observation를 의미한다.

[12234554]

모든 데이터가 단위행렬을 공분산으로 갖는 정규분포 N(μ,I)로부터 생성되었다고 가정하고, 초기 추정치를 μ=(2,2)로 설정하였다. 두 번의 EM 알고리즘을 적용하여 μ를 업데이트하시오.


첫 번째 E 단계에서 공분산은 단위행렬이므로 각 결측치는 단순히 μ로 채운다. M 단계에서는 채워진 행렬로 μ를 다시 계산한다. 두 번째 반복도 같은 방식으로 진행한다.

풀이 및 해설

공분산이 I(두 차원 독립)이므로, E 단계에서 각 결측치의 조건부 기댓값은 해당 차원의 현재 평균 μj가 된다.

1차 E 단계μ=(2,2)로 결측치를 채운다. [2,][2,2], [,3][2,3].

[1222234554]

1차 M 단계 — 열 평균:

μ=(1+2+2+4+55, 2+2+3+5+45)=(145,165)=(2.8, 3.2)

2차 E 단계 — 갱신된 μ=(2.8,3.2)로 다시 채운다. [2,][2,3.2], [,3][2.8,3].

[1223.22.834554]

2차 M 단계 — 열 평균:

μ=(1+2+2.8+4+55, 2+3.2+3+5+45)=(14.85,17.25)=(2.96, 3.44)

두 번의 EM 반복 후 최종 추정치는 μ=(2.96,3.44)이다.

👉 실습(Python)에서 두 번의 EM 재현

PDF