2 · 확률 분포
확률 분포는 복잡한 모델을 만드는 데 중요한 역할을 한다. 핵심 문제 중 하나는, 관찰된 데이터가 주어졌을 때 그를 가장 잘 표현하는 확률 분포를 모델링하는 것이다.

2.1 이산 확률 변수
- 이진 확률 변수random variable
에서 일 확률을 로 두면 , 이다. 이 분포를 베르누이 분포Bernoulli distribution라 한다.
- 관측
이 i.i.d.라면 로그 가능도는 이고, 을 통해서만 데이터에 의존한다(이는 충분 통계량sufficient statistic). 로 미분하여 으로 두면
으로 표본 평균sample mean이 된다.
개 중 인 관측 수 의 분포가 이항 분포binomial distribution이다.
2.1.1 베타 분포
- 베르누이에 베이지안적으로 접근하려면
의 사전 분포 가 필요하다. 가능도가 꼴이므로, 와 의 거듭제곱에 비례하는 사전 분포를 쓰면 사후 분포도 같은 함수 형태를 갖는다. 이 성질을 켤레성conjugacy이라 한다. - 사전 분포로 베타 분포beta distribution를 쓴다.
- 이항 가능도(2.8)에 베타 사전(2.11)을 곱하고 정규화하면(
)
으로 다시 베타 분포가 된다. 사후에서



그림 2.3 · 사전
- 관측 수가 늘수록 사후 분포는 더 뾰족해지고(
또는 면 분산 ) 불확실성이 꾸준히 감소한다. 이는 베이지안 학습의 일반적 성질로, 데이터를 하나씩 반영하는 순차적sequential 학습이 자연스럽다.




그림 2.2 · 다양한 초매개변수
실습 · 베타–이항 켤레와 순차적 사후 갱신
사전
a, b = 2.0, 2.0 # 사전 Beta(2, 2)
def mv(a, b):
m = a/(a+b); v = a*b/((a+b)**2*(a+b+1)); return m, v
obs = [1, 1, 0, 1, 1, 1, 0, 1] # 순차 관측 (x=1 → a 증가)
m, v = mv(a, b)
print(f"사전 Beta(a=2, b=2): 평균={m:.3f}, 분산={v:.4f}")
for i, x in enumerate(obs, 1):
a += x; b += 1-x # 켤레 갱신
m, v = mv(a, b)
print(f"관측 {i}개 후 Beta(a={a:.0f}, b={b:.0f}): 평균={m:.3f}, 분산={v:.4f}")
print("\n관측이 늘수록 분산이 줄어(사후가 뾰족해짐) 불확실성이 감소한다.")2.2 다항 변수
개 값 중 하나를 취하는 이산 변수는 원 핫 인코딩one hot encoding으로 차원 벡터 ( 중 하나만 )로 표현한다. 일 확률을 라 하면 이고 , 이다. 개 관측의 가능도는 ( , 충분 통계량)이다. 제약 하에 라그랑주 승수Lagrange multiplier 로 을 최대화하면 , 제약 대입 시 이므로
(
의 결합 분포가 다항 분포multinomial distribution이다.
2.2.1 디리클레 분포
- 다항 분포의 켤레 사전 분포가 디리클레 분포Dirichlet distribution이다(
, ).
- 가능도(2.23)를 곱하면 사후 분포
로 다시 디리클레 분포가 되어 순차적 성질을 가진다.

그림 2.4 · 세 변수
2.3 가우시안 분포
- 단일·다변량 가우시안 분포는 각각 다음과 같다(
: 평균, : 공분산).
- 중심 극한 정리central limit theorem에 따라 여러 확률 변수의 합은 변수 수가 늘수록 가우시안에 가까워진다.



그림 2.6 · 균등분포
실습 · 중심 극한 정리
import numpy as np
rng = np.random.default_rng(0)
trials = 200000
print("N개 균등분포 U(0,1)의 평균 분포:")
for N in [1, 2, 10]:
m = rng.uniform(0, 1, (trials, N)).mean(1)
print(f" N={N:2d}: 표본평균={m.mean():.3f}(이론 0.5), 표본분산={m.var():.4f}(이론 {1/12/N:.4f})")
print("N이 커질수록 평균의 분포가 가우시안에 가까워진다(중심극한정리).")- 가우시안의 기하는 지수부의 이차식
로 드러난다. 는 마할라노비스 거리Mahalanobis distance이며, 이면 유클리드 거리Euclidean distance가 된다. 의 고유분해 ( 는 정규직교orthonormal)를 쓰면 , 이고, 로 좌표를 바꾸면 이다.

그림 2.7 · 상수 밀도 타원의 축은 공분산의 고유벡터
- 새 좌표
에서 야코비안 , 이므로 로 개의 독립 단변량 가우시안의 곱이 된다. 즉 고유벡터 축을 따라 인수분해된다. - 큰
에서 완전 공분산은 계산이 비싸므로 대각 행렬diagonal matrix 공분산을 쓰기도 한다. 또 가우시안은 단봉unimodal 분포라 다봉multimodal 분포를 근사하지 못하는데, 잠재 변수latent variable 등으로 이를 해소한다.
2.3.1 조건부 가우시안 분포
- 결합 분포가 가우시안이면 조건부 분포와 주변 분포도 가우시안이다.
를 (앞 개)와 로 나누고, 정밀도 행렬precision matrix 을 같은 방식으로 분할하면
- 지수부의 이차식에 제곱식의 완성completing the square을 적용하면 조건부 분포
의 평균·공분산을 얻는다.
평균은
실습 · 조건부 가우시안 공식 검증
import numpy as np
rng = np.random.default_rng(1)
mu = np.array([1.0, 2.0])
Sig = np.array([[2.0, 0.8], [0.8, 1.0]])
xb = 3.0
mu_ab = mu[0] + Sig[0,1]/Sig[1,1]*(xb - mu[1]) # μ_a + Σ_ab Σ_bb^-1 (x_b-μ_b)
var_ab = Sig[0,0] - Sig[0,1]**2/Sig[1,1] # Σ_aa - Σ_ab Σ_bb^-1 Σ_ba
print(f"이론 조건부 평균 μ_a|b (x_b={xb}) = {mu_ab:.4f}")
print(f"이론 조건부 분산 Σ_a|b = {var_ab:.4f}")
X = rng.multivariate_normal(mu, Sig, 2_000_000)
mask = np.abs(X[:,1]-xb) < 0.05
print(f"[MC] x_b≈{xb} 표본에서 x_a 평균={X[mask,0].mean():.4f}, 분산={X[mask,0].var():.4f}")2.3.2 주변 가우시안 분포
분할 가우시안
결합 가우시안


그림 2.9 · (좌) 결합 분포
2.3.3 가우시안 변수에 대한 베이지안 정리
- 선형 가우시안 모델
, 에서 결합 의 로그를 이차식으로 정리하면 주변·조건부 분포를 얻는다.
2.3.4 가우시안 분포의 최대 가능도
- i.i.d. 데이터
의 로그 가능도는 과 (충분 통계량)에만 의존하며, 최대 가능도 해는
2.3.5 가우시안 분포에서의 베이지안 추론
- 분산
을 아는 상태에서 평균 를 추정할 때, 가능도가 의 이차식 지수 형태이므로 사전 분포 가 켤레다. 사후 분포는
사후 평균은 사전 평균

그림 2.12 · 데이터 수가 늘수록 평균
2.3.6 가우시안 분포의 혼합


그림 2.21 · '오래된 믿음' 데이터. (좌) 단일 가우시안은 두 무리를 잡지 못한다. (우) 두 가우시안의 결합은 잘 표현한다.
- 충분히 많은 가우시안을 선형 중첩하면 거의 모든 연속 밀도를 근사할 수 있다. 가우시안 혼합 분포mixture of Gaussians는
각



그림 2.23 · 세 가우시안 혼합. (a) 성분별 밀도, (b) 주변 밀도
2.4 지수족
- 가우시안 등 많은 분포는 지수족exponential family의 특수 경우다.
2.4.1 최대 가능도와 충분 통계량
- 정규화 조건 (2.195)의 양변을
로 미분하면 로, 단순 미분으로 모멘트를 얻는다. i.i.d. 데이터에서 최대 가능도 해는
으로,
2.4.2 켤레 사전 분포
- 모든 지수족 분포에는 켤레 사전 분포
가 존재하며, 사후 분포는 이다. - 사전 정보가 불분명할 때는 무정보적 사전 분포uninformative prior로 사전의 영향을 최소화한다.
"Letting the data speak for themselves." — Peter Gould
연습문제
문제 2.1 · 베르누이가 지수족인지 확인
식 (2.194)와 비교하면
문제 2.2 · 우드베리 역행렬 공식
풀이. 우변을
문제 2.3 · 다항 분포가 지수족인지 확인
문제 2.4 · 베타 분포의 평균·분산·최빈값
평균.
분산. 같은 방식으로
최빈값.
문제 2.5 · 두 가우시안 합의 미분 엔트로피
즉 평균은 합, 분산은