← Playground← 놀이터

PRISM · Machine Learning PlaygroundPRISM · 머신러닝 놀이터

Cross-Entropy & KL Divergence교차 엔트로피 & KL 발산
Entropy, cross-entropy, and KL — the information behind classification loss엔트로피, 교차 엔트로피, KL — 분류 손실의 정보이론적 근거

q — model (softmax)q — 모델 (softmax) p — true distributionp — 참 분포

loss on the true class = −log₂ q(true)참 클래스의 손실 = −log₂ q(true)

H(p)
Entropy엔트로피
−Σ pₖ log₂ pₖ

Uncertainty already inside the true labels참 레이블 안에 이미 존재하는 불확실성

H(p,q)
Cross-entropy교차 엔트로피
−Σ pₖ log₂ qₖ

Average bits to encode p using q — this is the lossq로 p를 부호화하는 데 드는 평균 비트 수 — 이것이 손실입니다

D(p‖q)
KL divergenceKL 발산
Σ pₖ log₂(pₖ/qₖ)

Extra bits from using q instead of p — always ≥ 0p 대신 q를 사용해 늘어난 비트 수 — 항상 ≥ 0

H(p,q) = H(p) + D(p‖q)  →  = + bits

Formulas수식
$$H(p)=-\sum_{k} p_k \log_2 p_k$$ $$H(p,q)=-\sum_{k} p_k \log_2 q_k$$ $$D(p\Vert q)=\sum_{k} p_k \log_2 \frac{p_k}{q_k}=H(p,q)-H(p)\;\ge\;0$$ $$q=\operatorname{softmax}(z/T),\qquad q_k=\frac{e^{z_k/T}}{\sum_j e^{z_j/T}}$$
What to watch관찰 포인트
  1. D(p‖q) ≥ 0, and equals 0 exactly when q = p — press “Set q ← p” to see the gap collapse.D(p‖q) ≥ 0이며, q = p일 때 정확히 0이 됩니다 — “q ← p 설정”을 눌러 간극이 사라지는 것을 확인하세요.
  2. H(p,q) ≥ H(p) always; the cross-entropy sits above the entropy floor, and the gap between them is the KL divergence.항상 H(p,q) ≥ H(p)이며, 교차 엔트로피는 엔트로피 하한 위에 위치하고, 둘 사이의 간극이 바로 KL 발산입니다.
  3. A one-hot p makes H(p)=0, so cross-entropy = KL = −log₂ q(true) — that single number is the classification loss.원-핫 p는 H(p)=0으로 만들어 교차 엔트로피 = KL = −log₂ q(true)가 됩니다 — 이 하나의 숫자가 바로 분류 손실입니다.
  4. Raising temperature T flattens q toward uniform and raises the loss; lowering T sharpens q and (when it is right) lowers it.온도 T를 높이면 q가 균등 분포에 가까워지며 손실이 커지고, T를 낮추면 q가 뾰족해져 (예측이 맞을 때) 손실이 줄어듭니다.