q — model (softmax)q — 모델 (softmax)
p — true distributionp — 참 분포
loss on the true class = −log₂ q(true)참 클래스의 손실 = −log₂ q(true)
H(p)
Entropy엔트로피
−Σ pₖ log₂ pₖ—
Uncertainty already inside the true labels참 레이블 안에 이미 존재하는 불확실성
H(p,q)
Cross-entropy교차 엔트로피
−Σ pₖ log₂ qₖ—
Average bits to encode p using q — this is the lossq로 p를 부호화하는 데 드는 평균 비트 수 — 이것이 손실입니다
D(p‖q)
KL divergenceKL 발산
Σ pₖ log₂(pₖ/qₖ)—
Extra bits from using q instead of p — always ≥ 0p 대신 q를 사용해 늘어난 비트 수 — 항상 ≥ 0
H(p,q) = H(p) + D(p‖q) → — = — + — bits
Formulas수식
$$H(p)=-\sum_{k} p_k \log_2 p_k$$
$$H(p,q)=-\sum_{k} p_k \log_2 q_k$$
$$D(p\Vert q)=\sum_{k} p_k \log_2 \frac{p_k}{q_k}=H(p,q)-H(p)\;\ge\;0$$
$$q=\operatorname{softmax}(z/T),\qquad q_k=\frac{e^{z_k/T}}{\sum_j e^{z_j/T}}$$
What to watch관찰 포인트
- D(p‖q) ≥ 0, and equals 0 exactly when q = p — press “Set q ← p” to see the gap collapse.D(p‖q) ≥ 0이며, q = p일 때 정확히 0이 됩니다 — “q ← p 설정”을 눌러 간극이 사라지는 것을 확인하세요.
- H(p,q) ≥ H(p) always; the cross-entropy sits above the entropy floor, and the gap between them is the KL divergence.항상 H(p,q) ≥ H(p)이며, 교차 엔트로피는 엔트로피 하한 위에 위치하고, 둘 사이의 간극이 바로 KL 발산입니다.
- A one-hot p makes H(p)=0, so cross-entropy = KL = −log₂ q(true) — that single number is the classification loss.원-핫 p는 H(p)=0으로 만들어 교차 엔트로피 = KL = −log₂ q(true)가 됩니다 — 이 하나의 숫자가 바로 분류 손실입니다.
- Raising temperature T flattens q toward uniform and raises the loss; lowering T sharpens q and (when it is right) lowers it.온도 T를 높이면 q가 균등 분포에 가까워지며 손실이 커지고, T를 낮추면 q가 뾰족해져 (예측이 맞을 때) 손실이 줄어듭니다.