지수족과 정규화 상수
SNA 이론 · 단계별 학습 차례

단원 5-2The Exponential Family and the Normalizing Constant

지수족과 정규화 상수

SNA 이론 · 단계별 학습STAGED+ 스터디
오늘 배우는 것 한 줄 요약
5-1에서 κ(θ)=(1+eθ)561\kappa(\theta)=(1+e^{\theta})^{561}이라는 닫힌 식이 나왔다. 그래프가 7.5×101687.5\times10^{168}개인데 그 합을 한 줄로 적을 수 있었다.
오늘은 그게 운이었다는 것을 보인다. 통계량이 간선 수 하나뿐이라 쌍들이 서로 독립이었고, 그래서 2N2^N항의 합이 NN개의 짧은 합의 으로 접혔던 것이다.
항을 하나만 더 넣으면 — 삼각형 수 — 그 접힘이 깨진다. n=3n=3의 그래프 8개를 손으로 다시 더해서 어디가 어떻게 깨지는지 눈으로 확인하고, n=5n=5의 1024개는 R로 전부 더해 정확한 답을 구한 뒤 ergm이 내놓는 답과 비교한다.
결론은 하나다. κ(θ)\kappa(\theta)는 거의 언제나 계산할 수 없다. 그 사실이 5단계 나머지 전체(5-3의 의사가능도, 5-7의 MCMC)의 존재 이유다.

1. 오늘의 질문: 5-1의 닫힌 식은 왜 나왔는가 (Why Did 5-1 Have a Closed Form?)

5-1에서 우리는 이렇게 썼다.

P(Y=yθ)=exp{θm(y)}κ(θ),κ(θ)=(1+eθ)N,N=n(n1)2 P(Y=y\mid\theta)=\frac{\exp\{\theta\,m(y)\}}{\kappa(\theta)}, \qquad \kappa(\theta)=(1+e^{\theta})^{N},\qquad N=\frac{n(n-1)}{2}

가라테는 N=561N=561이므로 표본 공간에 그래프가 25617.548×101682^{561}\approx7.548\times10^{168}개 있다. 그 7.5×101687.5\times10^{168}개를 전부 더한 결과(1+eθ)561(1+e^{\theta})^{561}이다. 한 줄이다. 그래서 로그가능도를 미분할 수 있었고, θ^=log78483\hat\theta=\log\frac{78}{483}이라는 닫힌 해가 나왔다.

여기서 멈추고 물어야 할 것
7.5×101687.5\times10^{168}개를 더했는데 어떻게 한 줄이 되는가? 그리고 — 항을 하나 더 넣어도 계속 그런가?
오늘 답한다. 첫 물음의 답은 "쌍들이 독립이라서", 둘째 물음의 답은 "아니다"이다.

비유를 하나 두자. 동전 NN개를 던져서 나올 수 있는 결과가 2N2^N가지다. "앞면이 나온 개수"만 따지는 모형이라면 2N2^N가지를 일일이 볼 필요가 없다 — 동전 하나씩 따로 보고 곱하면 된다. 그런데 "연속으로 앞면이 세 번 나온 횟수"를 따지기 시작하면 동전 하나씩 떼어 볼 수 없다. 세 개를 한꺼번에 봐야 한다. 네트워크에서 간선 수가 앞의 경우이고, 삼각형 수가 뒤의 경우다.

2. 정의 — 정규화 상수 κ(θ)\kappa(\theta) (Defining the Normalizing Constant)

ERGM의 일반형은 이렇다. g(y)=(g1(y),,gq(y))\mathbf g(y)=(g_1(y),\dots,g_q(y))^\top를 통계량 벡터, θ=(θ1,,θq)\boldsymbol\theta=(\theta_1,\dots,\theta_q)^\top를 계수 벡터라 하면

P(Y=yθ)=exp{θg(y)}κ(θ),  κ(θ)=yYexp{θg(y)}   P(Y=y\mid\boldsymbol\theta) =\frac{\exp\{\boldsymbol\theta^\top\mathbf g(y)\}}{\kappa(\boldsymbol\theta)}, \qquad \boxed{\;\kappa(\boldsymbol\theta)=\sum_{y'\in\mathcal Y}\exp\{\boldsymbol\theta^\top\mathbf g(y')\}\;}

세 가지를 확실히 해 두자.

헷갈리는 점사실
κ\kappa는 모수인가?아니다. θ\boldsymbol\theta를 정하면 자동으로 정해지는 값이다. 추정할 대상이 아니라 계산할 대상이다.
합은 무엇에 대해 도는가?관측한 망 yy가 아니라 표본 공간 Y\mathcal Y 전체, 즉 있을 수 있는 모든 망 yy'에 대해 돈다. 그래서 κ\kappa에는 데이터가 전혀 들어가지 않는다 — θ\boldsymbol\thetann만의 함수다.
왜 필요한가?확률의 총합이 1이어야 하기 때문이다. yP(Y=y)=1κyexp{θg(y)}=κκ=1\sum_{y}P(Y=y)=\frac{1}{\kappa}\sum_{y}\exp\{\boldsymbol\theta^\top\mathbf g(y)\} =\frac{\kappa}{\kappa}=1. 정의상 반드시 성립한다.
"정규화(normalizing)"라는 말의 뜻
exp{θg(y)}\exp\{\boldsymbol\theta^\top\mathbf g(y)\}는 그냥 "이 망의 점수"다. 점수는 0보다 크지만 합이 1이라는 보장이 없다. 모든 망의 점수를 더한 값 κ\kappa로 나누면 비로소 확률이 된다. 반 학생 30명의 시험 원점수를 총점으로 나눠서 "각자의 비중"을 만드는 것과 정확히 같은 조작이다. 총점을 모르면 비중을 모른다 — 오늘의 문제가 바로 이것이다.

3. 손 계산 ① n=3n=3, 항이 하나일 때 — 8개를 다 더한다 (Summing All Eight Graphs)

정점 3개짜리 무방향 망을 쓰자. 쌍은 N=(32)=3N=\binom{3}{2}=3개다: {1,2},{1,3},{2,3}\{1,2\},\{1,3\},\{2,3\}. 각 쌍이 0 또는 1이므로 그래프는 23=82^3=8개. 전부 적는다. 통계량은 간선 수 m(y)=A[1,2]+A[1,3]+A[2,3]m(y)=A[1,2]+A[1,3]+A[2,3] 하나뿐이다.

#A[1,2]A[1,2]A[1,3]A[1,3]A[2,3]A[2,3]m(y)m(y)exp{θm(y)}\exp\{\theta m(y)\}모양
10000e0=1e^{0}=1빈 그래프
21001eθe^{\theta}간선 1개
30101eθe^{\theta}간선 1개
40011eθe^{\theta}간선 1개
51102e2θe^{2\theta}경로 (2–1–3)
61012e2θe^{2\theta}경로 (1–2–3)
70112e2θe^{2\theta}경로 (1–3–2)
81113e3θe^{3\theta}삼각형

여덟 줄을 전부 더한다. 하나도 빠뜨리지 않고 적으면

κ(θ)=1#1+eθ#2+eθ#3+eθ#4+e2θ#5+e2θ#6+e2θ#7+e3θ#8=1+3eθ+3e2θ+e3θ \begin{aligned} \kappa(\theta) &= \underbrace{1}_{\#1} + \underbrace{e^{\theta}}_{\#2} + \underbrace{e^{\theta}}_{\#3} + \underbrace{e^{\theta}}_{\#4} + \underbrace{e^{2\theta}}_{\#5} + \underbrace{e^{2\theta}}_{\#6} + \underbrace{e^{2\theta}}_{\#7} + \underbrace{e^{3\theta}}_{\#8}\\[4pt] &= 1 + 3e^{\theta} + 3e^{2\theta} + e^{3\theta} \end{aligned}

계수 1,3,3,11,3,3,1이 보이는가. 이항계수 (30),(31),(32),(33)\binom{3}{0},\binom{3}{1},\binom{3}{2},\binom{3}{3}이다. 간선 mm개짜리 그래프가 (3m)\binom{3}{m}개 있으니 당연하다. 그러므로

κ(θ)=m=03(3m)(eθ)m13m=(1+eθ)3 \kappa(\theta)=\sum_{m=0}^{3}\binom{3}{m}\left(e^{\theta}\right)^{m}\cdot 1^{\,3-m} =\left(1+e^{\theta}\right)^{3}

이항정리다. 일반적인 NN에 대해서도 똑같이 κ(θ)=(1+eθ)N\kappa(\theta)=(1+e^\theta)^N.

3-1. 곱으로 접히는 과정을 한 번 더, 이번엔 반대 방향으로 (Factorization Once More, in Reverse)

이항정리를 몰라도 같은 결과를 얻는 길이 있고, 그 길이 오늘의 핵심이다. (1+eθ)3(1+e^{\theta})^3전개해 보자. 괄호 세 개에서 각각 11 또는 eθe^\theta를 하나씩 고른다:

첫째 괄호
(쌍 {1,2}\{1,2\})
둘째 괄호
(쌍 {1,3}\{1,3\})
셋째 괄호
(쌍 {2,3}\{2,3\})
대응하는 그래프
11111111#1 빈 그래프
eθe^\theta1111eθe^{\theta}#2
11eθe^\theta11eθe^{\theta}#3
1111eθe^\thetaeθe^{\theta}#4
eθe^\thetaeθe^\theta11e2θe^{2\theta}#5
eθe^\theta11eθe^\thetae2θe^{2\theta}#6
11eθe^\thetaeθe^\thetae2θe^{2\theta}#7
eθe^\thetaeθe^\thetaeθe^\thetae3θe^{3\theta}#8 삼각형
전개항 ↔ 그래프의 일대일 대응
괄호 하나가 쌍 하나에 대응하고, 그 괄호에서 11을 고르면 "간선 없음", eθe^\theta를 고르면 "간선 있음"이다. 그러니 (1+eθ)3(1+e^\theta)^3을 전개하는 일과 그래프 8개를 열거하는 일은 글자 그대로 같은 작업이다.
기호로 쓰면 — 이게 오늘 기억해야 할 한 줄이다 — yY i<jeθA[i,j]  =  i<j (a{0,1}eθa)  =  i<j(1+eθ)=(1+eθ)N \sum_{y\in\mathcal Y}\ \prod_{i<j}e^{\theta A[i,j]} \;=\;\prod_{i<j}\ \Big(\sum_{a\in\{0,1\}}e^{\theta a}\Big) \;=\;\prod_{i<j}\big(1+e^{\theta}\big)=(1+e^{\theta})^{N} 왼쪽은 2N2^N개를 더한 것, 오른쪽은 2개짜리 합을 NN번 곱한 것이다. 25612^{561}561561로 줄었다. 이 맞바꿈이 5-1의 전부였다.

4. 손 계산 ② 항을 하나 더 넣는다 — 삼각형 (Adding a Triangle Term)

이제 통계량을 두 개로 늘린다.

g(y)=(m(y), t(y)),m(y)=i<jA[i,j],t(y)=i<j<kA[i,j]A[i,k]A[j,k] \mathbf g(y)=\big(m(y),\ t(y)\big),\qquad m(y)=\sum_{i<j}A[i,j],\qquad t(y)=\sum_{i<j<k}A[i,j]\,A[i,k]\,A[j,k]

t(y)t(y)는 삼각형의 개수다. n=3n=3에서는 삼각형이 될 수 있는 정점 조합이 (33)=1\binom{3}{3}=1가지({1,2,3}\{1,2,3\})뿐이므로 t(y)t(y)는 0 아니면 1이다. 세 간선이 모두 있을 때만 1이 된다.

같은 그래프 8개에 tt 열을 하나 더 붙인다.

#A[1,2]A[1,2]A[1,3]A[1,3]A[2,3]A[2,3]mmttθg=θ1m+θ2t\boldsymbol\theta^\top\mathbf g=\theta_1 m+\theta_2 texp{θg}\exp\{\boldsymbol\theta^\top\mathbf g\}
1000000011
210010θ1\theta_1eθ1e^{\theta_1}
301010θ1\theta_1eθ1e^{\theta_1}
400110θ1\theta_1eθ1e^{\theta_1}
5110202θ12\theta_1e2θ1e^{2\theta_1}
6101202θ12\theta_1e2θ1e^{2\theta_1}
7011202θ12\theta_1e2θ1e^{2\theta_1}
8111313θ1+θ23\theta_1+\theta_2e3θ1+θ2e^{3\theta_1+\theta_2}

여덟 항을 전부 더한다.

κ(θ1,θ2)=1+eθ1+eθ1+eθ1+e2θ1+e2θ1+e2θ1+e3θ1+θ2=1+3eθ1+3e2θ1+e3θ1+θ2 \begin{aligned} \kappa(\theta_1,\theta_2) &= 1 + e^{\theta_1} + e^{\theta_1} + e^{\theta_1} + e^{2\theta_1} + e^{2\theta_1} + e^{2\theta_1} + e^{3\theta_1+\theta_2}\\[4pt] &= 1 + 3e^{\theta_1} + 3e^{2\theta_1} + e^{3\theta_1+\theta_2} \end{aligned}

4-1. 이 식은 인수분해되는가? (Does This Expression Factor)

5-1의 식과 나란히 놓는다.

(1+eθ1)3=1+3eθ1+3e2θ1+e3θ1κ(θ1,θ2)=1+3eθ1+3e2θ1+e3θ1eθ2 \begin{aligned} (1+e^{\theta_1})^{3} &= 1 + 3e^{\theta_1} + 3e^{2\theta_1} + e^{3\theta_1}\\ \kappa(\theta_1,\theta_2) &= 1 + 3e^{\theta_1} + 3e^{2\theta_1} + e^{3\theta_1}\cdot e^{\theta_2} \end{aligned}

앞의 세 항은 똑같고, 마지막 항만 eθ2e^{\theta_2}배가 되었다. 차를 구하면

κ(θ1,θ2)(1+eθ1)3=e3θ1eθ2e3θ1=e3θ1(eθ21) \kappa(\theta_1,\theta_2)-(1+e^{\theta_1})^{3} = e^{3\theta_1}e^{\theta_2}-e^{3\theta_1} = e^{3\theta_1}\left(e^{\theta_2}-1\right)   κ(θ1,θ2)=(1+eθ1)3+e3θ1(eθ21)   \boxed{\;\kappa(\theta_1,\theta_2)=(1+e^{\theta_1})^{3}+e^{3\theta_1}\left(e^{\theta_2}-1\right)\;}
검산 — θ2=0\theta_2=0이면 5-1로 돌아가야 한다
θ2=0\theta_2=0이면 eθ21=11=0e^{\theta_2}-1=1-1=0이므로 보정항이 사라지고 κ=(1+eθ1)3\kappa=(1+e^{\theta_1})^3. ✔
"삼각형 계수가 0"이라는 말은 "삼각형을 신경 쓰지 않는다"는 뜻이고, 그러면 정확히 간선만 있는 5-1 모형이 된다. 모형이 서로 포개진다(nested)는 것을 식이 보여 준다.
속지 말 것 — n=3n=3이라서 짧게 끝난 것이다
위의 "보정항 하나"는 n=3n=3에서 삼각형이 될 수 있는 자리가 단 한 군데라서 생긴 특수 사정이다. n=4n=4만 되어도 삼각형 자리가 (43)=4\binom{4}{3}=4군데이고, t(y)t(y)가 0·1·2·4의 값을 갖는 그래프가 뒤섞여 이런 깔끔한 보정항으로 정리되지 않는다. 직접 확인하는 것이 §14 연습문제 2다.

5. 손 계산 ③ 확률 8개를 전부 계산한다 (All Eight Probabilities)

숫자를 넣자. θ1=0.5\theta_1=-0.5, θ2=1\theta_2=1로 둔다. "간선은 드물게, 그런데 삼각형은 좋아하는" 모형이다. 필요한 지수함수 값 세 개를 먼저 구한다.

필요한 값계산
eθ1e^{\theta_1}e0.5e^{-0.5}0.6065307
e2θ1e^{2\theta_1}e1.0e^{-1.0}0.3678794
e3θ1+θ2e^{3\theta_1+\theta_2}e1.5+1.0=e0.5e^{-1.5+1.0}=e^{-0.5}0.6065307

κ\kappa를 항별로 쌓는다.

κ(0.5,1)=1  +  3(0.6065307)  +  3(0.3678794)  +  0.6065307=1  +  1.8195920  +  1.1036383  +  0.6065307=4.5297610 \begin{aligned} \kappa(-0.5,\,1) &= 1 \;+\; 3(0.6065307) \;+\; 3(0.3678794) \;+\; 0.6065307\\[3pt] &= 1 \;+\; 1.8195920 \;+\; 1.1036383 \;+\; 0.6065307\\[3pt] &= 4.5297610 \end{aligned}

이제 여덟 그래프의 확률을 하나씩 낸다. 각각 점수를 κ\kappa로 나누면 된다.

#mmtt점수 exp{θg}\exp\{\boldsymbol\theta^\top\mathbf g\}P=P=점수/κ/\kappaθ2=0\theta_2=0일 때 PP
(5-1 모형)
100111/4.5297610=1/4.5297610=0.22076220.2411754
2100.60653070.60653070.6065307/4.5297610=0.6065307/4.5297610=0.13389900.1462803
3100.60653070.60653070.13389900.1462803
4100.60653070.60653070.13389900.1462803
5200.36787940.36787940.3678794/4.5297610=0.3678794/4.5297610=0.08121390.0887235
6200.36787940.36787940.08121390.0887235
7200.36787940.36787940.08121390.0887235
8310.60653070.60653070.13389900.0538135

합이 1인지 확인한다. 무리별로 묶어서

yP(Y=y)=0.2207622+3(0.1338990)+3(0.0812139)+0.1338990=0.2207622+0.4016971+0.2436416+0.1338990=1.0000000  \begin{aligned} \sum_{y}P(Y=y) &= 0.2207622 + 3(0.1338990) + 3(0.0812139) + 0.1338990\\[3pt] &= 0.2207622 + 0.4016971 + 0.2436416 + 0.1338990\\[3pt] &= 1.0000000\ \checkmark \end{aligned}
정점 3개 위의 그래프 8개와 두 모형에서의 확률
그림 1. 정점 3개 위의 그래프 8개 전부. 각 그림 아래 두 숫자는 순서대로 θ2=0\theta_2=0(간선만)과 θ2=1\theta_2=1(간선+삼각형)에서의 확률. 삼각형만 확률이 올라가고 나머지 일곱은 전부 조금씩 내려간다.

5-1. 삼각형 확률은 몇 배가 되었나 — 그리고 왜 e1e^{1}배가 아닌가 (How Much the Triangle Probability Grew, and Why Not by e)

표의 마지막 두 열을 비교하면 삼각형의 확률이 0.05381350.13389900.0538135\to0.1338990으로 올랐다. 배율은

0.13389900.0538135=2.4882055 \frac{0.1338990}{0.0538135}=2.4882055

그런데 우리가 곱한 것은 eθ2=e1=2.7182818e^{\theta_2}=e^{1}=2.7182818이었다. 왜 2.718배가 아니라 2.488배인가? 분모도 같이 커졌기 때문이다.

Pθ2=1()Pθ2=0()=e3θ1eθ2/κ1e3θ1/κ0=eθ2κ0κ1=2.7182818×4.14636054.5297610=2.7182818×0.9153589=2.4882055  \frac{P_{\theta_2=1}(\triangle)}{P_{\theta_2=0}(\triangle)} =\frac{e^{3\theta_1}e^{\theta_2}/\kappa_{1}}{e^{3\theta_1}/\kappa_{0}} =e^{\theta_2}\cdot\frac{\kappa_{0}}{\kappa_{1}} =2.7182818\times\frac{4.1463605}{4.5297610} =2.7182818\times0.9153589=2.4882055\ \checkmark
ERGM 계수를 읽을 때 가장 흔한 오독
"삼각형 계수가 11이니 삼각형이 하나 늘면 확률이 e1=2.72e^1=2.72배" — 틀렸다. κ\kappa가 같이 움직이므로 실제 배율은 그보다 작다.
확률이 아니라 확률의 비로 말해야 정확해진다(§7). 5-1에서 "θ\theta는 확률이 아니라 로그오즈"라고 했던 경고의 다항 모형판이다.

5-2. 우연이 아닌 우연 — 삼각형과 간선 1개의 확률이 정확히 같다 (A Coincidence That Isn't One)

표를 다시 보면 θ2=1\theta_2=1일 때 #8(삼각형)과 #2~#4(간선 1개)의 확률이 모두 0.1338990으로 똑같다. 간선이 세 배나 많은 그래프인데도. 왜 그런가? 점수를 비교하면 된다.

e3θ1+θ2=eθ1    3θ1+θ2=θ1    2θ1+θ2=0 e^{3\theta_1+\theta_2}=e^{\theta_1} \iff 3\theta_1+\theta_2=\theta_1 \iff \boxed{\,2\theta_1+\theta_2=0\,}

여기서 2(0.5)+1=1+1=02(-0.5)+1=-1+1=0이다. 조건에 정확히 걸렸다. 우연이 아니라 고른 숫자가 그 선 위에 있었을 뿐이다.

교실로 옮기면
2θ1+θ2=02\theta_1+\theta_2=0은 "간선 하나를 더 그을 비용 2θ12|\theta_1|과 그 결과로 삼각형이 완성될 때 받는 보상 θ2\theta_2가 정확히 맞아떨어지는 지점"이다. 교실로 옮기면 — 새 친구를 사귀는 부담이, 그렇게 해서 "친구의 친구와도 친구가 되는" 이득과 정확히 상쇄되는 상태. 이보다 θ2\theta_2가 크면 학급은 뭉치고, 작으면 흩어진다.

6. 인수분해가 깨지는 이유 (Why the Factorization Breaks)

§3-1의 맞바꿈이 왜 성립했는지 한 단계씩 되짚고, 어디서 무너지는지 짚는다.

6-1. 성립할 때 (간선 항만) (When It Holds: Edges Only)

exp{θm(y)}=exp{θi<jA[i,j]}=i<jeθA[i,j] \exp\{\theta\,m(y)\} =\exp\Big\{\theta\sum_{i<j}A[i,j]\Big\} =\prod_{i<j}e^{\theta A[i,j]}

지수의 이 되었다. 여기서 결정적인 것은 eθA[i,j]e^{\theta A[i,j]}라는 각 인수가 단 하나의 칸 A[i,j]A[i,j]에만 의존한다는 점이다. 그래서 Y\mathcal Y 전체에 대한 합을 칸별로 분배할 수 있다.

yYi<jeθA[i,j]=i<ja=01eθa=i<j(1+eθ)=(1+eθ)N \sum_{y\in\mathcal Y}\prod_{i<j}e^{\theta A[i,j]} =\prod_{i<j}\sum_{a=0}^{1}e^{\theta a} =\prod_{i<j}(1+e^{\theta}) =(1+e^{\theta})^{N}

6-2. 무너질 때 (삼각형 항) (When It Breaks: Adding Triangles)

exp{θ2t(y)}=exp{θ2i<j<kA[i,j]A[i,k]A[j,k]}=i<j<keθ2A[i,j]A[i,k]A[j,k] \exp\{\theta_2\,t(y)\} =\exp\Big\{\theta_2\sum_{i<j<k}A[i,j]A[i,k]A[j,k]\Big\} =\prod_{i<j<k}e^{\theta_2 A[i,j]A[i,k]A[j,k]}

여기까지는 똑같이 곱이 된다. 그러나 이번 인수 eθ2A[i,j]A[i,k]A[j,k]e^{\theta_2 A[i,j]A[i,k]A[j,k]}칸 세 개를 동시에 본다. 칸 A[1,2]A[1,2]{1,2,3}\{1,2,3\}뿐 아니라 {1,2,4},{1,2,5},\{1,2,4\},\{1,2,5\},\dots 인수에도 들어간다. 그래서 "쌍마다 따로 합을 매긴다"는 분배가 불가능하다. \sum\prod을 맞바꿀 수 없다.

n=3n=3의 여덟 항에서 직접 확인
§4의 여덟 항 중 eθ2e^{\theta_2}를 가진 항은 #8 하나뿐이다. 곱 ()()()(\square)(\square)(\square) 형태로 쓰려면 세 괄호에서 하나씩 골라 만든 8가지 조합이 전부 항이 되어야 하는데, θ2\theta_2는 여덟 개 중 딱 한 조합에만 붙어 있다. 어떤 세 괄호로도 이런 비대칭을 만들 수 없다 — 그래서 인수분해가 없다.
같은 사실의 다른 표현: 쌍 독립성(dyadic independence)이 깨진다
5-1의 모형에서는 "1–2가 친구인가"와 "1–3이 친구인가"가 서로 무관했다. 그래서 5-1 §9에서 glm(y ~ 1, family=binomial)ergm과 같은 답을 냈던 것이다 — 561개 쌍을 독립 관측치로 취급해도 됐으니까.
삼각형 항이 들어오는 순간 그게 깨진다. 1–2와 1–3이 이미 있으면 2–3이 생길 확률이 달라진다. 더 이상 로지스틱 회귀가 아니다. 5-3에서 이 붕괴를 정면으로 다룬다.

7. κ\kappa가 약분되는 단 하나의 자리 — 확률의 비 (Where κ\kappa Cancels)

κ\kappa를 모르면 아무것도 못 하는가? 그렇지 않다. 두 망의 확률을 나누면 κ\kappa가 사라진다.

P(Y=y1)P(Y=y2)=exp{θg(y1)}/κ(θ)exp{θg(y2)}/κ(θ)=exp{θ(g(y1)g(y2))} \frac{P(Y=y_1)}{P(Y=y_2)} =\frac{\exp\{\boldsymbol\theta^\top\mathbf g(y_1)\}\big/\kappa(\boldsymbol\theta)} {\exp\{\boldsymbol\theta^\top\mathbf g(y_2)\}\big/\kappa(\boldsymbol\theta)} =\exp\big\{\boldsymbol\theta^\top\left(\mathbf g(y_1)-\mathbf g(y_2)\right)\big\}

분자와 분모에 같은 κ\kappa가 있으니 약분된다. 남는 것은 통계량의 차이뿐이다. 손으로 확인하자. y1=y_1=#8(삼각형), y2=y_2=#5(경로 2–1–3)로 두면

mmtt
g(y1)\mathbf g(y_1) — 삼각형31
g(y2)\mathbf g(y_2) — 경로20
g(y1)g(y2)\mathbf g(y_1)-\mathbf g(y_2)11
P()P(경로)=exp{θ11+θ21}=e0.5+1=e0.5=1.6487213 \frac{P(\triangle)}{P(\text{경로})} =\exp\{\theta_1\cdot 1+\theta_2\cdot 1\} =e^{-0.5+1}=e^{0.5}=1.6487213

표의 값으로 검산하면 0.1338990/0.0812139=1.64872130.1338990/0.0812139=1.6487213. 완전히 일치한다.

왜 이 계산이 5-3의 씨앗인가
방금 고른 두 그래프는 칸 하나만 다르다 — 경로 #5에 A[2,3]=1A[2,3]=1을 더하면 삼각형 #8이 된다. 그러니 위의 비는 그냥 두 그래프의 비가 아니라 "나머지를 다 고정했을 때 2–3 칸에 간선이 있을 오즈"다.
θ1\theta_1은 "간선 하나가 늘어서" 붙고, θ2\theta_2는 "그 간선 때문에 삼각형이 하나 생겨서" 붙는다. 통계량의 이 차이 벡터 (1,1)(1,1)가 5-3에서 배울 변화 통계량(change statistic)이다. κ\kappa를 몰라도 계산되는 유일한 양이고, 그래서 ERGM 계수 해석은 전부 여기에 기댄다.

8. 항의 수는 얼마나 빨리 커지는가 (How Fast the Sum Explodes)

κ\kappa를 정직하게 계산한다는 것은 그래프를 전부 열거한다는 뜻이다. 몇 개인가.

nn쌍 개수 N=(n2)N=\binom n2그래프 수 2N2^N초당 1억 개를 처리한다면
338손으로 (오늘 했다)
4664손으로 (연습문제 2)
5101,024R로 즉시 — 오늘의 §10
61532,768즉시
7212,097,1520.02초
828268,435,4562.7초 — 현실적 한계
104535,184,372,088,83297.7 시간
201901.57×10571.57\times10^{57}1.6×10491.6\times10^{49}초 = 우주 나이의 3.6×10313.6\times10^{31}
34 (가라테)5617.55×101687.55\times10^{168}
1461 (FMH)1,066,530321,058자리 수
가라테 정도의 크기를 감각으로 잡아 보자
관측 가능한 우주의 원자 수가 대략 108010^{80}개다. 가라테 클럽 34명의 표본 공간은 7.55×101687.55\times10^{168}개 — 원자 하나마다 우주를 하나씩 통째로 배정해도 아직 7.5×1087.5\times10^{8}배 모자란다.
학생 34명짜리 한 학급에서 이렇다. 30명 학급이면 N=435N=435, 24358.9×101302^{435}\approx8.9\times10^{130}.
그러니 "정확히 계산하되 조금 오래 걸린다"가 아니다. 영원히 불가능하다.

9. R 검증 ① n=3n=3 전수 합 (Exhaustive Sum for n=3n=3)

손 계산이 맞는지 8개를 실제로 열거해 확인한다.

## 정점 3개 위의 그래프 8개를 전부 만들고 (간선 수, 삼각형 수) 계산
prs <- rbind(c(1,2), c(1,3), c(2,3))
mm  <- sapply(0:7, function(cd) sum(as.integer(intToBits(cd))[1:3]))
tt  <- ifelse(mm == 3, 1, 0)          # n=3 에서 삼각형 자리는 한 군데뿐
t1 <- -0.5; t2 <- 1

sum(exp(t1*mm + t2*tt))                            # kappa 전수 합
[1] 4.529760962
1 + 3*exp(t1) + 3*exp(2*t1) + exp(3*t1 + t2)       # 손 계산 식
[1] 4.529760962
(1 + exp(t1))^3 + exp(3*t1)*(exp(t2) - 1)          # 보정항 형태
[1] 4.529760962

pr <- exp(t1*mm + t2*tt) / sum(exp(t1*mm + t2*tt))
sum(pr)
[1] 1
pr[mm == 3]                                        # 삼각형
[1] 0.1338990434
pr[mm == 1][1]                                     # 간선 1개 — 같은 값!
[1] 0.1338990434

세 가지 형태가 소수점 아래 아홉 자리까지 일치하고, 확률의 합이 정확히 1이며, 2θ1+θ2=02\theta_1+\theta_2=0이라 삼각형과 간선 1개의 확률이 같다는 것까지 확인된다.

10. R 검증 ② n=5n=5 정확 MLE — 1024개를 다 더해서 최적화 (Exact MLE by Enumeration)

이제 진짜 추정을 해 보자. n=5n=5면 그래프가 1024개뿐이니 κ\kappa를 근사 없이 정확히 계산할 수 있다. 이런 크기는 흔치 않다 — "정답을 아는 상태"에서 ergm을 채점할 수 있는 거의 유일한 기회다.

관측 망은 5-1 연습문제 1의 5명 모둠을 그대로 쓴다: 간선 S1–S2 S1–S3 S2–S3 S3–S4, S5는 외톨이. 통계량은 m(yobs)=4m(y_{\text{obs}})=4, t(yobs)=1t(y_{\text{obs}})=1 (삼각형 S1–S2–S3 하나).

## 1024개 전수 열거 -> 정확한 로그가능도 -> optim
e5 <- enumerate(5)          # 1024 x 2 행렬, 열은 (m, t)
mo <- 4; to <- 1            # 관측 통계량

negll <- function(th) {
  lin <- th[1]*e5[,"m"] + th[2]*e5[,"t"]
  M   <- max(lin)                                  # 넘침 방지
  -(th[1]*mo + th[2]*to - (M + log(sum(exp(lin - M)))))
}
op <- optim(c(0,0), negll, method = "BFGS", control = list(reltol = 1e-14))
op$par
[1] -0.7757745245  0.6579263060
-op$value                                          # 최대 로그가능도
[1] -6.60005759

## 적률 일치 확인 — 근사가 아니라 정확한 기댓값
lin <- op$par[1]*e5[,"m"] + op$par[2]*e5[,"t"]
w   <- exp(lin - max(lin)); w <- w/sum(w)
c(sum(w*e5[,"m"]), sum(w*e5[,"t"]))
[1] 3.999999977 0.999998867     # 관측 (4, 1) 과 일치

## 간선만 넣으면 5-1 의 손 계산으로 돌아가는가?
edges-only 정확 MLE = -0.40546513   ,   log(4/6) = -0.4054651081
두 가지가 확인되었다
적률 일치가 다항 모형에서도 성립한다. 5-1에서 m=Np(θ)m=Np(\theta) 하나였던 조건이 Eθ^[m(Y)]=4E_{\hat\theta}[m(Y)]=4, Eθ^[t(Y)]=1E_{\hat\theta}[t(Y)]=1 두 개로 늘었다. 통계량이 qq개면 조건도 qq개다. 이건 모든 ERGM에서 참이다.
간선 항만 남기면 5-1의 닫힌 해로 정확히 돌아온다. log46=0.4054651\log\frac{4}{6}=-0.4054651. 전수 열거로 얻은 값과 소수점 일곱 자리까지 같다. 5-1의 손 계산이 옳았다는 독립적인 증거다.
n=5 정확 로그가능도 등고선
그림 2. n=5n=5 그래프 1024개를 전부 더해 그린 로그가능도 등고선. 가운데 빨간 점이 정확한 MLE. 초록 네모는 삼각형 항을 뺀 5-1 모형의 답이고, 보라 삼각형은 ergm이 MCMC로 내놓은 답이다(§11).

10-1. 삼각형 항을 넣으니 간선 계수가 더 음수가 되었다 (Adding Triangles Pushes the Edge Coefficient Down)

모형θ^1\hat\theta_1 (간선)θ^2\hat\theta_2 (삼각형)
y ~ edges (5-1)0.4055-0.4055
y ~ edges + triangle0.7758-0.7758+0.6579+0.6579

간선 계수가 0.40550.7758-0.4055\to-0.7758더 내려갔다. 왜 그런가?

이 변화를 읽는 법 — 회귀의 통제와 같다
간선만 있던 모형에서 θ1\theta_1은 "이 망에 간선이 4개나 있다"는 사실을 혼자 설명해야 했다. 삼각형 항이 들어오자, 4개 중 삼각형을 이루는 3개는 θ2\theta_2가 설명해 준다. 그러면 θ1\theta_1이 남겨 받는 몫은 "삼각형과 무관하게 그냥 생긴 간선"뿐이고, 그건 훨씬 드무므로 계수가 더 음수가 된다.
교실 언어로: "우리 반은 아무하고나 친구가 되는 경향은 오히려 약하다. 다만 친구의 친구와는 친구가 되는 경향이 뚜렷하다." 앞의 단순 모형은 이 두 힘을 하나로 뭉뚱그려 평균 낸 것이었다.
회귀에서 변수를 추가하면 기존 계수가 움직이는 것과 정확히 같은 현상이며, 그래서 ERGM 계수는 그 모형에 무엇이 같이 들어 있는지를 밝히지 않으면 뜻이 없다.

11. R 검증 ③ ergm은 다른 답을 준다 (What ergm Actually Reports)

같은 자료에 ergm을 그대로 돌려 보자.

nw5 <- network(A5, directed = FALSE)
ergm(nw5 ~ edges + triangle)
Starting maximum pseudolikelihood estimation (MPLE): ...
Starting Monte Carlo maximum likelihood estimation (MCMLE):
Iteration 1 of at most 60: ... Convergence test p-value: 0.0014. Converged with 99% confidence.
Evaluating log-likelihood at the estimate. Fitting the dyad-independent submodel...
Bridging between the dyad-independent submodel and the full model...
Using 16 bridges: 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 .

              Estimate  Std. Error  z value  Pr(>|z|)
edges        -0.9074695   0.9011879  -1.0070    0.3139
triangle      0.8410930   0.9598360   0.8763    0.3809

정확한 답은 (0.7758, 0.6579)(-0.7758,\ 0.6579)였다. ergm(0.9075, 0.8411)(-0.9075,\ 0.8411)을 준다. 차이가 각각 0.130.13, 0.180.18이다. 난수 씨앗을 바꾸면 답도 바뀐다.

방법θ^1\hat\theta_1θ^2\hat\theta_2비고
전수 열거 (정답)0.775775-0.7757750.6579260.6579261024개를 다 더함. 난수 없음
ergm, seed=70.907469-0.9074690.8410930.841093MCMC
ergm, seed=1010.826759-0.8267590.7780330.778033MCMC
ergm, seed=20260.818927-0.8189270.6890580.689058MCMC
이것은 ergm의 버그가 아니다 — 오늘 배운 사실의 직접적 귀결이다
κ(θ1,θ2)\kappa(\theta_1,\theta_2)를 계산할 수 없으므로 ergm모의실험으로 근사한다(MCMLE). 근사이므로 실행마다 값이 흔들린다.
흔들림 폭(약 0.09~0.13)을 표준오차(0.90, 0.96)와 견주면 작지만 0은 아니다. 소수점 셋째 자리를 논문에 적을 때는 이 사실을 기억해야 한다.
4단계 §4-8에서 cluster_louvain()QQ가 실행마다 달랐던 것과 같은 종류의 문제다. "난수를 쓰는 알고리즘의 출력은 값 하나가 아니라 분포"라는 점에서.
결정적으로 — n=34n=34에서는 위 표의 첫 줄이 없다. 대조할 정답이 존재하지 않는다. 그래서 5-7에서 수렴 진단(mcmc.diagnostics())을 반드시 배워야 한다.

출력 로그의 Using 16 bridges도 이제 읽힌다. 로그가능도 값 (모형 비교와 AIC에 필요하다)을 내려면 κ\kappa를 알아야 하는데 알 수 없으므로, ergm은 계산 가능한 쌍 독립 모형에서 출발해 목표 모형까지 중간 모형 16개를 놓고 다리를 놓듯 차이를 누적한다(bridge sampling). κ\kappa를 우회하는 또 하나의 장치다.

12. 세 가지 결과 — 5단계의 나머지가 왜 필요한가 (Three Consequences)

κ\kappa를 모르면 못 하는 것그래서 어떻게 하는가어디서
가능도 P(Y=yobs)P(Y=y_{\text{obs}})를 직접 계산하고 최대화하기의사가능도(MPLE) — 쌍마다의 조건부 확률만 곱한다. 조건부에서는 κ\kappa가 약분된다(§7)
MCMC 최대가능도(MCMLE) — 모형에서 망을 잔뜩 뽑아 κ\kappa의 비를 추정
5-3 / 5-7
로그가능도·AIC·우도비 검정으로 모형 비교하기다리 표본(bridge sampling)으로 두 모형의 logκ\log\kappa 차이를 근사. 절댓값은 끝내 모르지만 차이면 비교에 충분하다5-6
"우리 반 관계망이 나올 확률은 0.003입니다" 같은 절대 확률 말하기포기한다. 대신 확률의 비(조건부 오즈)로 말한다. 실무에서 필요한 것도 대개 이쪽이다5-3
한 줄로 줄이면
5-1은 "ERGM은 이렇게 생겼다"였고, 5-2는 "그런데 그대로는 계산이 안 된다"이다. 5-3부터 5-8까지는 전부 κ\kappa를 피해 가는 방법피해 간 대가로 생기는 문제(퇴화, 수렴 실패)에 관한 이야기다.

13. 교실 적용 (Classroom Application)

13-1. 우리 반에서 실제로 무엇이 계산되고 무엇이 안 되는가 (What Can and Cannot Be Computed for Your Class)

단위nnNN2N2^Nκ\kappa 계산
모둠 하나4664연필로 가능 — 오늘 연습문제 2
모둠 하나 (5명)5101,024R로 즉시 — 오늘 §10
분단8282.7억몇 초. 여기가 끝
한 학급304358.9×101308.9\times10^{130}불가능 — MCMC로 근사
한 학년 6학급18016,11010484910^{4849}불가능

주목할 점은 모둠 하나는 정확히 계산된다는 것이다. "교사가 직접 손으로 확인해 볼 수 있는 규모"가 실재한다는 뜻이고, 4명 모둠에서 κ\kappa를 직접 조립해 보는 경험은 30명 학급에서 ergm이 무엇을 근사하고 있는지를 이해하는 가장 빠른 길이다.

13-2. 동료 교사에게 말할 수 있는 것과 없는 것 (What to Say to a Colleague, and What Not To)

가능?이유
"우리 반 교우관계도가 이렇게 나올 확률은 0.0003입니다"κ\kappa를 모르므로 절대 확률은 계산 불가. 게다가 8.9×101308.9\times10^{130}가지 중 하나이므로 어떤 망이든 확률은 사실상 0이다
"이미 공통 친구가 있는 두 학생이 서로 친구일 오즈는, 공통 친구가 없을 때보다 eθ^2e^{\hat\theta_2}배 높습니다"이므로 κ\kappa가 약분된다(§7). 다만 "다른 조건이 모두 같을 때"를 반드시 붙여야 한다
"삼각형 계수가 0.66이니 뭉침 경향이 e0.66=1.93e^{0.66}=1.93배 강합니다"방향은 맞지만 무엇의 1.93배인지를 말해야 한다. 확률이 아니라 오즈이고, 그것도 간선 하나를 추가할 때의 조건부 오즈다 (§5-1의 2.488배 vs 2.718배 차이)
"작년 반은 θ^2=0.4\hat\theta_2=0.4, 올해는 0.80.8이니 올해가 두 배 잘 뭉칩니다"두 가지 이유로 안 된다. ① e0.8/e0.4=e0.4=1.49e^{0.8}/e^{0.4}=e^{0.4}=1.49배지 두 배가 아니다. ② 학급 크기가 다르면 계수를 직접 비교할 수 없다(5-1 §13, 단원 1-5의 학급 규모 함정)
"ergm을 두 번 돌렸는데 계수가 달라요. 뭔가 잘못됐나요?"✓ 정상MCMC 근사이므로 당연하다(§11). 단, 흔들림이 표준오차에 육박하면 수렴을 의심해야 한다(5-7)
수업에서 그대로 쓸 수 있는 활동 — "4명 모둠, 64가지"
학생 4명(A·B·C·D)을 세우고 "친하다/아니다"를 정할 짝이 6쌍임을 세게 한다. 가능한 경우가 26=642^6=64가지임을 확인한 뒤, 64장을 조별로 나눠 그려 보게 한다.
그리고 묻는다 — "이 중 삼각형이 하나라도 있는 그림은 몇 장일까?" (답: 삼각형 수가 1 이상인 것 4+12+6+1=234+12+6+1=23장. §15 연습문제 2 참조)
학생들이 실제로 세어 보면 "가능한 관계 지도가 이렇게 많다"와 "그중 뭉친 모양은 일부다"를 동시에 체감한다. 30명 학급이면 이 64가 8.9×101308.9\times10^{130}이 된다는 말을 덧붙이면 충분하다.

14. 연습문제 (Exercises)

연습문제 1 — n=3n=3에서 계수를 바꿔 본다
같은 정점 3개 모형에서 이번에는 θ1=1\theta_1=-1, θ2=2\theta_2=2로 둔다. "간선은 더 드물게, 삼각형은 더 좋아하는" 모형이다.

(가) κ(1,2)\kappa(-1,2)네 항을 모두 적어 계산하라. (e1=0.3678794e^{-1}=0.3678794, e2=0.1353353e^{-2}=0.1353353, e3=0.0497871e^{-3}=0.0497871)
(나) 그래프 8개의 확률을 전부 구하고 합이 1인지 확인하라.
(다) θ2=0\theta_2=0일 때(=5-1 모형)의 삼각형 확률과 비교해 배율을 구하라. 그 배율이 e2=7.3891e^{2}=7.3891아닌 이유를 식으로 설명하라.
(라) 이번에도 삼각형과 간선 1개짜리 그래프의 확률이 정확히 같다. 우연인가? §5-2의 조건식으로 답하라.
먼저 풀고 나서 §15 해설과 맞춰 볼 것.
연습문제 2 — n=4n=4에서 κ\kappa를 직접 조립한다 (오늘의 본 문제)
정점 4개짜리 무방향 망. 쌍은 N=(42)=6N=\binom42=6개, 그래프는 26=642^6=64개다.

(가) 간선 mm개짜리 그래프가 몇 개인지 m=0,1,,6m=0,1,\dots,6에 대해 적고, 합이 64인지 확인하라.
(나) 삼각형 수 tt를 센다. 다음 표의 빈칸(?)을 채워라. 힌트를 붙여 둔다.
mm그래프 수tt별 개수힌트
0, 1, 21, 6, 15전부 t=0t=0삼각형에는 간선 3개가 필요하다
320?개가 t=1t=1, ?개가 t=0t=0간선 3개로 만들 수 있는 모양은 삼각형·별·경로 셋뿐이다. 삼각형은 정점 3개를 고르는 (43)\binom43가지
415?개가 t=1t=1, ?개가 t=0t=0뺀 간선 2개로 세는 게 쉽다. 뺀 두 간선이 정점을 공유하는가 아닌가로 갈린다
56전부 t=t=?K4K_4에는 삼각형이 4개. 간선 하나를 빼면 그 간선이 든 삼각형이 몇 개 죽는가?
61t=t=?K4K_4. (43)\binom43
(다) (가)·(나)를 합쳐 κ(θ1,θ2)\kappa(\theta_1,\theta_2)아홉 항으로 적어라. 그리고 θ2=0\theta_2=0을 넣으면 (1+eθ1)6(1+e^{\theta_1})^{6}이 되는지 검산하라.
(라) θ1=0.5, θ2=0.8\theta_1=-0.5,\ \theta_2=0.8에서 κ\kappa의 값을 구하고, P(K4)P(K_4)P(4-사이클 하나)P(\text{4-사이클 하나})를 계산하라. 또 paw(삼각형에 꼬리가 하나 붙은 모양, m=4,t=1m=4,t=1) 하나와 4-사이클 하나의 확률 비가 e0.8e^{0.8}임을 §7의 공식으로 계산 없이 설명하라.
먼저 풀고 나서 §15 해설과 맞춰 볼 것.

15. 해설과 답 (Solutions)

15-1. 연습문제 1 해설 (Solution to Exercise 1)

(가) κ(1,2)\kappa(-1,2) — 항이 네 개다. κ=1+3eθ1+3e2θ1+e3θ1+θ2\kappa=1+3e^{\theta_1}+3e^{2\theta_1}+e^{3\theta_1+\theta_2}θ1=1,θ2=2\theta_1=-1,\theta_2=2를 넣는다. 마지막 지수를 먼저 정리하면 3(1)+2=13(-1)+2=-1이므로 e3θ1+θ2=e1e^{3\theta_1+\theta_2}=e^{-1}이다.

무엇의 합인가지수지수함수 값개수기여
1빈 그래프001111.0000000
2간선 1개θ1=1\theta_1=-10.367879431.1036383
3간선 2개 (경로)2θ1=22\theta_1=-20.135335330.4060058
4삼각형3θ1+θ2=13\theta_1+\theta_2=-10.367879410.3678794
κ(1,2)=1.0000000+1.1036383+0.4060058+0.3678794=2.8775236 \kappa(-1,2)=1.0000000+1.1036383+0.4060058+0.3678794=2.8775236
답 (가) κ(1,2)=1+3e1+3e2+e1=2.8775236\kappa(-1,2)=1+3e^{-1}+3e^{-2}+e^{-1}=2.8775236

(나) 확률 8개 — 각 점수를 κ=2.8775236\kappa=2.8775236으로 나눈다.

#mmtt점수P=P=점수/κ/\kappa개수소계
10011/2.8775236=1/2.8775236=0.347521010.3475210
2–4100.36787940.3678794/2.8775236=0.3678794/2.8775236=0.127845830.3835375
5–7200.13533530.1353353/2.8775236=0.1353353/2.8775236=0.047031930.1410956
8310.36787940.127845810.1278458
0.3475210+0.3835375+0.1410956+0.1278458=1.0000000  0.3475210+0.3835375+0.1410956+0.1278458=1.0000000\ \checkmark
답 (나) 빈 그래프 0.3475210, 간선 1개짜리 각각 0.1278458(셋), 간선 2개짜리 각각 0.0470319(셋), 삼각형 0.1278458. 합은 정확히 1.

(다) 배율θ2=0\theta_2=0이면 κ0=(1+e1)3=(1.3678794)3=2.5594312\kappa_0=(1+e^{-1})^3=(1.3678794)^3=2.5594312이고 삼각형 점수는 e3θ1=e3=0.0497871e^{3\theta_1}=e^{-3}=0.0497871이다.

Pθ2=0()=0.04978712.5594312=0.0194524,배율=0.12784580.0194524=6.5722418 P_{\theta_2=0}(\triangle)=\frac{0.0497871}{2.5594312}=0.0194524, \qquad \text{배율}=\frac{0.1278458}{0.0194524}=6.5722418

e2=7.3890561e^{2}=7.3890561이 아닌가. 분자는 eθ2e^{\theta_2}배가 되었지만 분모 κ\kappa도 커졌다.

Pθ2=2()Pθ2=0()=e3θ1eθ2/κ2e3θ1/κ0=eθ2κ0κ2=7.3890561×2.55943122.8775236=7.3890561×0.8894577=6.5722418  \frac{P_{\theta_2=2}(\triangle)}{P_{\theta_2=0}(\triangle)} =\frac{e^{3\theta_1}e^{\theta_2}/\kappa_{2}}{e^{3\theta_1}/\kappa_{0}} =e^{\theta_2}\cdot\frac{\kappa_{0}}{\kappa_{2}} =7.3890561\times\frac{2.5594312}{2.8775236} =7.3890561\times0.8894577=6.5722418\ \checkmark
답 (다) 배율은 6.5722배. e2=7.3891e^2=7.3891이 아닌 이유는 κ\kappa2.55942.87752.5594\to2.8775로 함께 커졌기 때문이며, 정확한 배율은 eθ2κ0/κ2e^{\theta_2}\cdot\kappa_0/\kappa_2이다.
확률의 총합이 1로 묶여 있으므로, 한 그래프의 확률을 올리면 나머지의 확률은 반드시 내려간다. 실제로 빈 그래프는 1/2.5594312=0.39070.34751/2.5594312=0.3907\to0.3475로 내려갔다.

(라) 삼각형과 간선 1개의 확률이 같은 이유 — §5-2의 조건은 2θ1+θ2=02\theta_1+\theta_2=0이었다. 여기서

2θ1+θ2=2(1)+2=2+2=0 2\theta_1+\theta_2=2(-1)+2=-2+2=0
답 (라) 우연이 아니다. 2θ1+θ2=02\theta_1+\theta_2=0이라는 조건에 정확히 걸렸기 때문이다. 이때 삼각형의 지수 3θ1+θ23\theta_1+\theta_2가 간선 1개의 지수 θ1\theta_1과 같아지므로 (3θ1+θ2=θ1+(2θ1+θ2)=θ1+0=θ13\theta_1+\theta_2=\theta_1+(2\theta_1+\theta_2)=\theta_1+0=\theta_1) 점수가 같고, 같은 κ\kappa로 나누니 확률도 같다.
해석: 간선 하나를 더 긋는 대가 2θ1=22|\theta_1|=2와 삼각형이 완성될 때의 이득 θ2=2\theta_2=2가 정확히 상쇄되는 지점이다. 이 선 위에서는 "혼자 뻗은 관계 하나"와 "완전히 뭉친 삼인조"가 똑같이 그럴듯하다.

15-2. 연습문제 2 해설 (Solution to Exercise 2)

(가) mm별 그래프 수 — 쌍 6개 중 mm개를 고르는 것이므로 (6m)\binom6m이다.

mm0123456
(6m)\binom6m161520156164
답 (가) 1,6,15,20,15,6,11,6,15,20,15,6,1. 합 =64=26=64=2^6

(나) 삼각형 수 세기 — 한 줄씩 간다.

m=0,1,2m=0,1,2: 삼각형에는 간선이 3개 필요하다. 간선이 2개 이하면 불가능하므로 전부 t=0t=0. 그래프 1+6+15=221+6+15=22개.

m=3m=3: 간선 3개로 만들 수 있는 모양은 세 가지뿐이다.

모양개수세는 법tt
삼각형4삼각형을 이룰 정점 3개를 고르는 (43)=4\binom43=4가지. 남은 정점 1개는 외톨이1
K1,3K_{1,3}4중심이 될 정점을 고르는 4가지. 나머지 셋이 전부 중심에 붙는다0
경로 P4P_412나머지. 2044=1220-4-4=12. (직접 세면: 정점 4개의 배열 4!=244!=24가지, 뒤집으면 같으니 24/2=1224/2=12)0

따라서 t=1t=14개, t=0t=016개. 검산 4+4+12=204+4+12=20

m=4m=4: 힌트대로 뺀 간선으로 센다. K4K_4(간선 6개)에서 2개를 빼는 (62)=15\binom62=15가지. 뺀 두 간선의 관계가 두 경우로 갈린다.

뺀 두 간선개수세는 법남는 모양tt
정점을 공유하지 않음
(완전 매칭)
3K4K_4의 완전 매칭은 {12,34},{13,24},{14,23}\{12,34\},\{13,24\},\{14,23\}의 3가지4-사이클 C4C_40
정점을 공유함12153=1215-3=12paw (삼각형 + 꼬리)1

왜 그런가. 4-사이클에는 삼각형이 없다(사이클 길이가 4). paw는 삼각형 하나와 거기 붙은 간선 하나이므로 t=1t=1. 따라서 t=1t=112개, t=0t=03개.

m=5m=5: K4K_4에서 간선 하나를 뺀 것. 6가지. K4K_4에는 삼각형이 (43)=4\binom43=4개 있고, 임의의 한 간선은 그중 2개에 들어 있다(그 간선의 두 끝점 + 나머지 두 정점 각각). 그 2개가 죽으므로 t=42=2t=4-2=2. 6개 모두 t=2t=2.

m=6m=6: K4K_4 하나. t=(43)=4t=\binom43=4.

답 (나)
mm0123456
tt000010124
개수161516431261
검산: 1+6+15+16+4+3+12+6+1=641+6+15+16+4+3+12+6+1=64
삼각형이 하나라도 있는 그래프는 4+12+6+1=4+12+6+1=23개 (§13-2 활동의 답).

(다) κ\kappa 아홉 항 — 위 표의 각 칸이 항 하나가 된다.

κ(θ1,θ2)=1+6eθ1+15e2θ1+16e3θ1+4e3θ1+θ2+3e4θ1+12e4θ1+θ2+6e5θ1+2θ2+e6θ1+4θ2 \begin{aligned} \kappa(\theta_1,\theta_2) ={}& 1 + 6e^{\theta_1} + 15e^{2\theta_1} + 16e^{3\theta_1} + 4e^{3\theta_1+\theta_2}\\ &+ 3e^{4\theta_1} + 12e^{4\theta_1+\theta_2} + 6e^{5\theta_1+2\theta_2} + e^{6\theta_1+4\theta_2} \end{aligned}

θ2=0\theta_2=0을 넣으면 eθ2e^{\theta_2} 꼴이 전부 1이 되므로 같은 mm끼리 합쳐진다.

κ(θ1,0)=1+6eθ1+15e2θ1+(16+4)20e3θ1+(3+12)15e4θ1+6e5θ1+e6θ1=m=06(6m)(eθ1)m=(1+eθ1)6  \begin{aligned} \kappa(\theta_1,0) &= 1 + 6e^{\theta_1} + 15e^{2\theta_1} + \underbrace{(16+4)}_{20}e^{3\theta_1} + \underbrace{(3+12)}_{15}e^{4\theta_1} + 6e^{5\theta_1} + e^{6\theta_1}\\[3pt] &= \sum_{m=0}^{6}\binom6m\left(e^{\theta_1}\right)^m = \left(1+e^{\theta_1}\right)^{6}\ \checkmark \end{aligned}
답 (다) 위의 아홉 항 식. θ2=0\theta_2=0에서 계수가 1,6,15,20,15,6,11,6,15,20,15,6,1로 합쳐져 정확히 (1+eθ1)6(1+e^{\theta_1})^6이 된다. 이 검산은 반드시 해 볼 것 — (나)에서 개수를 하나라도 잘못 셌으면 여기서 이항계수가 어긋난다.

(라) 수치θ1=0.5, θ2=0.8\theta_1=-0.5,\ \theta_2=0.8. 항별로 쌓는다.

mmtt개수지수 mθ1+tθ2m\theta_1+t\theta_2지수함수 값기여 (개수×값)
001001.00000001.0000000
1060.5-0.50.60653073.6391840
20151.0-1.00.36787945.5181916
30161.5-1.50.22313023.5700826
3141.5+0.8=0.7-1.5+0.8=-0.70.49658531.9863412
4032.0-2.00.13533530.4060058
41122.0+0.8=1.2-2.0+0.8=-1.20.30119423.6143305
5262.5+1.6=0.9-2.5+1.6=-0.90.40656972.4394180
6413.0+3.2=+0.2-3.0+3.2=+0.21.22140281.2214028
κ(0.5, 0.8)\kappa(-0.5,\ 0.8)23.3949565
P(K4)=e0.2κ=1.221402823.3949565=0.0522080,P(C4 하나)=e2κ=0.135335323.3949565=0.0057848 P(K_4)=\frac{e^{0.2}}{\kappa}=\frac{1.2214028}{23.3949565}=0.0522080, \qquad P(C_4\ \text{하나})=\frac{e^{-2}}{\kappa}=\frac{0.1353353}{23.3949565}=0.0057848

paw 하나는 P=e1.2/κ=0.3011942/23.3949565=0.0128743P=e^{-1.2}/\kappa=0.3011942/23.3949565=0.0128743. 그 비를 §7\S7의 공식으로 계산 없이 보면 — paw와 4-사이클은 둘 다 m=4m=4이고 tt만 1과 0으로 다르므로

g(paw)g(C4)=(4,1)(4,0)=(0,1)P(paw)P(C4)=exp{θ10+θ21}=e0.8=2.2255409 \mathbf g(\text{paw})-\mathbf g(C_4)=(4,1)-(4,0)=(0,1) \quad\Longrightarrow\quad \frac{P(\text{paw})}{P(C_4)}=\exp\{\theta_1\cdot0+\theta_2\cdot1\}=e^{0.8}=2.2255409

검산: 0.0128743/0.0057848=2.22554090.0128743/0.0057848=2.2255409

답 (라) κ(0.5,0.8)=23.3949565\kappa(-0.5,0.8)=\mathbf{23.3949565}, P(K4)=0.0522080P(K_4)=\mathbf{0.0522080}, P(C4 하나)=0.0057848P(C_4\ \text{하나})=\mathbf{0.0057848}, P(paw 하나)=0.0128743P(\text{paw 하나})=\mathbf{0.0128743}. paw와 4-사이클의 비는 e0.8=2.2255e^{0.8}=\mathbf{2.2255}.
왜 계산 없이 알 수 있었나: 두 그래프는 간선 수가 같다. 그래서 θ1\theta_1이 약분되고, κ\kappa도 약분된다. 남는 것은 삼각형 수의 차 10=11-0=1뿐이므로 비는 정확히 eθ2e^{\theta_2}다.
의미: "간선 4개를 같은 개수로 쓰되 뭉쳐 놓느냐 둥글게 펴 놓느냐"의 선호가 정확히 eθ2e^{\theta_2}배다. 삼각형 계수는 바로 이것을 재는 값이다.
교실 해석 — 모둠 4명, 간선 4개를 어떻게 놓을 것인가
4명 모둠에서 "친한 짝이 4쌍"이라는 사실은 같은데 모양이 다를 수 있다.
4-사이클: A–B–C–D–A. 모두가 두 명씩과 친하지만 삼인조가 하나도 없다. 고리형이라 관계가 얇게 퍼져 있다.
paw: A–B–C가 뭉치고 D가 그중 한 명에게만 붙어 있다. 단단한 삼인조 + 주변부 한 명이다.
간선 수만 세는 지표(밀도·평균차수)로는 이 둘이 완전히 같다. θ2=0.8\theta_2=0.8짜리 모형은 후자를 2.23배 더 그럴듯하게 본다.
현장에서 중요한 것도 대개 후자다 — D가 소외될 위험은 paw에서 훨씬 크다. 모둠 편성을 볼 때 "몇 쌍이 친한가"가 아니라 "어떤 모양으로 친한가"를 봐야 하는 이유이고, ERGM에 삼각형 항을 넣는다는 것은 정확히 그 모양을 모형에 넣는다는 뜻이다.