동질성과 E-I 지수
SNA 이론 · 단계별 학습 차례

단원 3-7Homophily and the E-I Index

동질성과 E-I 지수

SNA 이론 · 단계별 학습STAGED+ 스터디
오늘 배우는 것 한 줄 요약
“끼리끼리 논다”를 숫자 하나로 만드는 법 — 그리고 그 숫자 하나가 집단 크기 때문에 얼마나 쉽게 사람을 속이는지, 그 속임수를 기준선(baseline)으로 어떻게 걷어내는지.

1. 지난 시간 연습문제 확인 (Review of Last Session's Exercises)

연습문제 1 — 전원 참여 활동이 만드는 “밀도 1.0” 착시 (Exercise 1: The Density-1.0 Illusion)

5명(T1~T5), 3활동. E1은 학급 전체 봉사활동이라 다섯 명 모두 참여했다.

E1 (전체봉사)E2E3행합 == 참여 활동 수
T11102
T21102
T31012
T41012
T51001
열합 == 활동 크기522합계 9

이분 밀도 =95×3=915=0.6=\dfrac{9}{5\times 3}=\dfrac{9}{15}=0.6.

학생 투영 RT=TTTR_T = T\,T^\mathsf{T} (대각선 0)의 10쌍을 전부 펼치면:

공유 활동RTR_T공유 활동RTR_T
(T1,T2)E1, E22(T2,T4)E11
(T1,T3)E11(T2,T5)E11
(T1,T4)E11(T3,T4)E1, E32
(T1,T5)E11(T3,T5)E11
(T2,T3)E11(T4,T5)E11
답 (가) 10쌍이 전부 0보다 크다 → 투영은 완전그래프 K5K_5, 밀도 1.0. E1 하나가 (52)=10\binom{5}{2}=10쌍을 통째로 채웠기 때문이다.
답 (나) 뉴먼 가중은 활동 크기 ckc_k에 대해 쌍당 1ck1\frac{1}{c_k-1}씩만 준다.
E1: 151=0.25\frac1{5-1}=0.25 · E2: 121=1\frac1{2-1}=1 · E3: 121=1\frac1{2-1}=1
→ (T1,T2) =0.25+1=1.25=0.25+1=\mathbf{1.25}, 나머지 8쌍 =0.25=\mathbf{0.25}. 대비가 5배로 살아난다.

연습문제 2 — 같은 투영을 낳는 두 소속행렬 (역문제) (Exercise 2: Two Affiliation Matrices, One Projection)

(가) 4인 활동 1개(나) 2인 활동 6개
소속행렬 크기4×14\times 14×64\times 6
이분 간선 수 A\sum A412
학생 차수1 1 1 13 3 3 3
투영 AATAA^\mathsf{T}둘 다 가중치 전부 1인 K4K_4 — 완전히 동일
뉴먼 가중141=0.3333\frac1{4-1}=0.3333121=1\frac1{2-1}=1
복원 불가능. 투영 AATAA^\mathsf{T}만 보면 두 상황이 구별되지 않는다. 이분 간선 수는 4 대 12로 3배 차이인데도 투영은 같다. 뉴먼 가중을 쓰면 0.3333 대 1로 구별된다 — “한 큰 모임” 대 “여섯 개의 단짝”은 다른 사회다.
교실 — “우리 반은 모두가 서로 안다(밀도 1.0)”는 학급 전체 활동 하나가 만든 착시일 수 있다. 원자료(누가 어느 활동에)로 돌아가 확인해야 한다.

2. 오늘의 질문: 구조에서 속성으로 (From Structure to Attributes)

지금까지(단원 3-1 ~ 3-6) 우리는 선만 보았다. 누가 누구와 이어졌는지, 그 선들이 어떤 덩어리를 이루는지. 커뮤니티 탐지는 “데이터가 스스로 집단을 말하게” 하는 방법이었다.

그런데 학생에게는 이미 붙어 있는 라벨이 있다. 성별, 학년, 반, 출신 초등학교, 학원 여부, 성취수준, 다문화 배경, 특수교육 대상 여부. 오늘의 질문은 이것이다.

선(연결)과 라벨(속성)은 얼마나 겹치는가?

겹치면 동질성(homophily) — “비슷한 사람끼리 이어진다”
어긋나면 이질성(heterophily) — “다른 사람끼리 이어진다”

동질성은 사회학에서 가장 반복적으로 확인된 경험 법칙이다 (McPherson, Smith-Lovin & Cook 2001, Birds of a Feather). 오늘은 이것을 숫자로 재는 세 가지 도구를 배운다.

도구기호범위부호 방향강점
E-I 지수EIEI[1,+1][-1,+1]음수 = 동질성손으로 셀 수 있다. 집단별·개인별로 쪼갤 수 있다
동류성 계수rr[rmin,+1][r_{\min},+1]양수 = 동질성기준선이 이미 보정돼 있다
순열 검정pp[0,1][0,1]“우연일 수 있나?”에 답한다
부호가 반대라는 것부터 외우자. E-I는 음수일 때, rr양수일 때 같은 뜻(동질성)이다. E-I는 “Extra(외부)−Internal(내부)”이라 내부가 많으면 음수가 되고, rr은 상관계수라서 “같은 것끼리 붙음”이 양수가 된다. §12에서 두 값이 사실 같은 하나의 양임을 보일 것이다.

3. 오늘의 예시 네트워크 (The Working Example)

10명 학급. 남학생 6명 S1~S6, 여학생 4명 S7~S10. 친구 관계 15개(무방향).

학생성별이웃차수학생성별이웃차수
S1S2, S32S6S4, S5, S103
S2S1, S32S7S3, S8, S103
S3S1, S2, S4, S7, S8, S96S8S3, S7, S93
S4S3, S5, S63S9S3, S8, S103
S5S4, S62S10S6, S7, S93

차수 합 =2+2+6+3+2+3+3+3+3+3=30=2×15=2+2+6+3+2+3+3+3+3+3=30=2\times 15 ✔ (악수 정리)

성별로 칠한 10인 네트워크와 개인별 E-I
왼쪽: 굵은 빨간 선 4개가 성별을 넘는 간선. 오른쪽: 개인별 E-I

그림에서 눈으로 먼저 확인하자. 성별을 넘는 선은 S3에서 나가는 3개S6–S10 1개, 모두 4개뿐이다. 나머지 11개는 전부 같은 성 안에 있다.

4. E-I 지수의 정의 (Definition of the E-I Index)

학생 ii의 집단 라벨을 gig_i라 하고, 크로네커 델타를 쓴다.

δ(gi,gj)={1gi=gj (같은 집단)0gigj (다른 집단) \delta(g_i,g_j)=\begin{cases}1 & g_i=g_j\ \text{(같은 집단)}\\[2pt] 0 & g_i\neq g_j\ \text{(다른 집단)}\end{cases}

무방향 인접행렬 AA에 대해 내부 간선 수 ILIL(Internal Links)과 외부 간선 수 ELEL(External Links)은

IL=12ijA[i,j]δ(gi,gj),EL=12ijA[i,j](1δ(gi,gj)) IL=\frac12\sum_{i}\sum_{j} A[i,j]\,\delta(g_i,g_j), \qquad EL=\frac12\sum_{i}\sum_{j} A[i,j]\,\bigl(1-\delta(g_i,g_j)\bigr)

12\frac12은 무방향이라 A[i,j]A[i,j]A[j,i]A[j,i]가 같은 간선을 두 번 세기 때문이다. 당연히 IL+EL=mIL+EL=m (전체 간선 수). 그리고

 EI=ELILEL+IL=ELILm  \boxed{\ EI=\frac{EL-IL}{EL+IL}=\frac{EL-IL}{m}\ }
상황ELELILILEIEI해석
완전한 동질성0mm1-1집단 간에 선이 하나도 없다 (완전 분리)
절반씩m/2m/2m/2m/200내부와 외부가 같은 수
완전한 이질성mm0+1+1같은 집단끼리는 선이 하나도 없다
ELILEL-ILmm으로 나누는가?
간선 수가 다른 두 학급을 비교하기 위해서다. 30명 학급의 “외부 10, 내부 40”과 20명 학급의 “외부 5, 내부 20”은 원자료로는 다르지만 둘 다 EI=0.6EI=-0.6으로 같은 성향이다.

5. 손 계산 — 15개 간선 전부 분류 (Classifying All 15 Edges)

정의를 그대로 따라 15개를 하나도 빼지 않고 센다. δ=1\delta=1이면 내부, δ=0\delta=0이면 외부.

#간선gig_igjg_jδ(gi,gj)\delta(g_i,g_j)분류한 줄 설명
1S1–S21내부남–남
2S1–S31내부남–남
3S2–S31내부남–남
4S3–S41내부남–남
5S4–S51내부남–남
6S4–S61내부남–남
7S5–S61내부남–남
8S7–S81내부여–여
9S8–S91내부여–여
10S9–S101내부여–여
11S7–S101내부여–여
12S3–S70외부S3가 놓은 다리
13S3–S80외부S3가 놓은 다리
14S3–S90외부S3가 놓은 다리
15S6–S100외부S6–S10, 유일한 또 하나의 다리

세어 보면

IL=7남–남+4여–여=11,EL=4,IL+EL=15=m ✔ IL=\underbrace{7}_{\text{남–남}}+\underbrace{4}_{\text{여–여}}=11, \qquad EL=4, \qquad IL+EL=15=m\ ✔ EI=ELILm=41115=715=0.466667 EI=\frac{EL-IL}{m}=\frac{4-11}{15}=\frac{-7}{15}=-0.466667
값 하나하나의 뜻
0.4667-0.4667[1,0][-1,0] 구간의 거의 절반 지점 — 상당히 강한 동질성.
• 다르게 읽으면: 내부 비율 IL/m=11/15=73.3%IL/m = 11/15 = 73.3\%, 외부 비율 4/15=26.7%4/15=26.7\%. 차이가 73.326.7=46.773.3-26.7=46.7%p, 그것이 곧 EI|EI|다.
• 즉 EIEI는 “내부 비율과 외부 비율의 차이”다.

이 관계를 식으로 정리해 두자. EL=mILEL = m-IL이므로

EI=(mIL)ILm=m2ILm=12ILm EI=\frac{(m-IL)-IL}{m}=\frac{m-2IL}{m}=1-2\cdot\frac{IL}{m}

검산: 121115=12215=7151-2\cdot\frac{11}{15}=1-\frac{22}{15}=-\frac{7}{15} ✔ 이 형태 EI=12(IL/m)EI = 1-2\,(IL/m)는 §12에서 결정적으로 쓰인다.

6. 집단별 E-I (Group-level E-I)

전체 0.4667-0.4667 하나로는 어느 쪽이 닫혀 있는지를 알 수 없다. 집단 kk에 대해 “한쪽 끝이라도 kk에 걸린 간선”만 보고 다시 센다.

집단인원내부 간선 ILkIL_k어떤 간선인가외부 간선 ELkEL_k어떤 간선인가EIkEI_k
남 (6명)67S1–S2, S1–S3, S2–S3, S3–S4, S4–S5, S4–S6, S5–S64S3–S7, S3–S8, S3–S9, S6–S104711=311=0.2727\frac{4-7}{11}=-\frac{3}{11}=-0.2727
여 (4명)44S7–S8, S8–S9, S9–S10, S7–S104S3–S7, S3–S8, S3–S9, S6–S10448=0.0000\frac{4-4}{8}=0.0000
왜 두 집단의 수를 더해도 전체가 안 나오는가?
내부는 잘 더해진다: 7+4=11=IL7+4=11=IL ✔ (내부 간선은 한 집단에만 속한다)
외부는 안 된다: 4+4=84=EL4+4=8\neq 4=EL ✘ — 교차 간선은 양쪽 집단에서 각각 한 번씩, 총 두 번 세어지기 때문이다. 집단별 E-I는 “그 집단에서 본 세계”이지 전체의 부분이 아니다.
교실 — 여학생 집단의 EI=0.0000EI_{\text{여}}=0.0000만 보면 “여학생들은 성별에 개의치 않는다”고 읽고 싶어진다. §8에서 이 해석이 완전히 뒤집힌다. 4명짜리 집단이 우연히 섞였을 때 기대되는 값은 00이 아니라 +0.6+0.6이기 때문이다.

7. 개인별 E-I (Node-level E-I)

학생 ii 한 명의 이웃만 보고 같은 식을 쓴다.

EIi=ELiILiELi+ILi=ELiILideg(i),ILi=jA[i,j]δ(gi,gj) EI_i=\frac{EL_i-IL_i}{EL_i+IL_i}=\frac{EL_i-IL_i}{\deg(i)}, \qquad IL_i=\sum_j A[i,j]\,\delta(g_i,g_j)

10명 전부 전개한다. (이웃 중 굵은 글씨가 다른 성별)

학생성별이웃 (다른 성별은 굵게)deg\degILiIL_iELiEL_iEIiEI_i 계산EIiEI_i
S1S2, S3220(02)/2(0-2)/21.0000-1.0000
S2S1, S3220(02)/2(0-2)/21.0000-1.0000
S3S1, S2, S4, S7, S8, S9633(33)/6(3-3)/60.00000.0000
S4S3, S5, S6330(03)/3(0-3)/31.0000-1.0000
S5S4, S6220(02)/2(0-2)/21.0000-1.0000
S6S4, S5, S10321(12)/3(1-2)/30.3333-0.3333
S7S3, S8, S10321(12)/3(1-2)/30.3333-0.3333
S8S3, S7, S9321(12)/3(1-2)/30.3333-0.3333
S9S3, S8, S10321(12)/3(1-2)/30.3333-0.3333
S10S6, S7, S9321(12)/3(1-2)/30.3333-0.3333

검산: iILi=2+2+3+3+2+2+2+2+2+2=22=2×11\sum_i IL_i = 2+2+3+3+2+2+2+2+2+2=22=2\times 11 ✔ (내부 간선은 양 끝에서 두 번 세어진다)
iELi=0+0+3+0+0+1+1+1+1+1=8=2×4\sum_i EL_i = 0+0+3+0+0+1+1+1+1+1=8=2\times 4

개인 E-I의 평균은 전체 E-I가 아니다 (Averaging Individual E-I Is Not the Overall E-I)

단순평균=11+011131313131310=17/310=0.566667 \text{단순평균}=\frac{-1-1+0-1-1-\tfrac13-\tfrac13-\tfrac13-\tfrac13-\tfrac13}{10} =\frac{-17/3}{10}=-0.566667

전체 EI=0.466667EI=-0.466667과 다르다. 그런데 차수로 가중하면 정확히 일치한다.

ideg(i)EIiideg(i)=2(1)+2(1)+6(0)+3(1)+2(1)S1S5 = 9+5×[3(13)]S6S10 = 530=1430=0.466667 ✔ \frac{\sum_i \deg(i)\,EI_i}{\sum_i \deg(i)} =\frac{\overbrace{2(-1)+2(-1)+6(0)+3(-1)+2(-1)}^{\text{S1}\sim\text{S5}\ =\ -9} +\overbrace{5\times\bigl[3\cdot(-\tfrac13)\bigr]}^{\text{S6}\sim\text{S10}\ =\ -5}}{30} =\frac{-14}{30}=-0.466667\ ✔
왜 그런가 — deg(i)EIi=ELiILi\deg(i)\cdot EI_i = EL_i-IL_i이므로 분자는 i(ELiILi)=2EL2IL\sum_i(EL_i-IL_i)=2EL-2IL, 분모는 2m2m. 나누면 (ELIL)/m=EI(EL-IL)/m = EI. 즉 전체 E-I는 개인 E-I의 차수가중평균이다. 단순평균은 차수 2인 학생과 차수 6인 학생을 똑같이 취급해서 어긋난다.
교실 — 이 표에서 실제로 봐야 할 것
S3만 EI3=0EI_3=0이다. 차수도 6으로 가장 크다. 남녀 양쪽에 똑같이 3명씩 친구가 있는 유일한 균형 다리. 남녀 협동 모둠을 짤 때 이 학생이 핵심이다.
• S6도 다리지만 0.3333-0.3333으로 약하다(여학생 친구 1명). S3가 결석하면 남녀 사이 연결은 S6–S10 단 하나로 줄어든다. 매우 취약한 구조.
EIi=1EI_i=-1인 네 명(S1, S2, S4, S5)은 이성 친구가 0명이다. 소외가 아니라 (차수는 2~3으로 정상) 성별 안에 완전히 갇힌 상태다.

8. 함정 ①: 집단 크기가 E-I를 좌우한다 (Trap 1: Group Size Drives E-I)

여기서부터가 이 단원의 핵심이다. nn명 중 크기 kk인 집단을 생각하자. 간선이 완전히 무작위로 아무 쌍에나 놓인다고 하면, 이 집단에 걸리는 간선 중 내부가 될 쌍과 외부가 될 쌍의 개수는 이미 정해져 있다.

내부 쌍=(k2)=k(k1)2,외부 쌍=k(nk) \text{내부 쌍}=\binom{k}{2}=\frac{k(k-1)}{2}, \qquad \text{외부 쌍}=k(n-k) EIkexp=k(nk)(k2)k(nk)+(k2) EI^{\text{exp}}_k=\frac{k(n-k)-\binom{k}{2}}{k(n-k)+\binom{k}{2}}

우리 예시에 적용 (n=10n=10) (Applying It to Our Example)

집단kk내부 쌍 (k2)\binom{k}{2}외부 쌍 k(nk)k(n-k)기대 EIkexpEI^{\text{exp}}_k관측 EIkEI_k차이
6(62)=15\binom62=156×4=246\times4=24241539=+0.2308\frac{24-15}{39}=+0.23080.2727-0.27270.5035-0.5035
4(42)=6\binom42=64×6=244\times6=2424630=+0.6000\frac{24-6}{30}=+0.60000.00000.00000.6000-0.6000
§6의 해석이 뒤집힌다.
여학생 집단의 EI=0.0000EI=0.0000은 “중립”이 아니다. 우연히 섞였다면 +0.6+0.6이 나왔어야 한다. 관측이 기대보다 0.6이나 아래 — 두 집단 중 여학생 쪽이 오히려 더 강하게 닫혀 있다 (남학생은 기대 대비 0.50-0.50).
소수 집단은 가만히 있어도 E-I가 +1+1에 가깝게 나온다. 상대할 “바깥”이 훨씬 넓기 때문이다.

기대 E-I가 0이 되는 지점 (Where the Expected E-I Is Zero)

EIkexp=0EI^{\text{exp}}_k=0이려면 분자가 0, 즉 외부 쌍 = 내부 쌍:

k(nk)=k(k1)2  nk=k12  2n2k=k1  k=2n+13 k(n-k)=\frac{k(k-1)}{2} \ \Longrightarrow\ n-k=\frac{k-1}{2} \ \Longrightarrow\ 2n-2k=k-1 \ \Longrightarrow\ \boxed{\,k=\frac{2n+1}{3}\,}

25명 학급이라면 k=513=17k=\frac{51}{3}=17. 17명(68%)이 되어야 비로소 기대 E-I가 0이다.

kk (25명 중)12358101315172024
기대 EIkexpEI^{\text{exp}}_k+1.000+0.957+0.913+0.818+0.659+0.538+0.333+0.1760.000−0.310−0.840
집단 크기와 기대 E-I
왼쪽: 25명 학급에서 집단 크기별 기대 E-I. 오른쪽: 실제 고교 데이터에서 같은 함정
교실 — 절대 하면 안 되는 해석
“다문화 배경 학생 3명의 E-I가 +0.87+0.87이니 잘 융화되어 있다.”
25명 학급에서 k=3k=3의 기대값은 +0.913+0.913이다. +0.87+0.87은 기대보다 낮다. 즉 이 3명은 오히려 자기들끼리 뭉쳐 있다. 소수 집단의 E-I를 절대 0을 기준으로 읽지 말 것.

9. 기준선: 무엇과 비교할 것인가 (Baselines: What Do We Compare Against?)

함정 ①의 해법은 하나다. 관측값을 “우연이라면 얼마였을까”와 비교한다. 그 “우연”을 정의하는 방식이 두 가지 있다.

기준선 ① 노드쌍 기준 (node-pair baseline)

“간선이 (n2)\binom{n}{2}개 쌍 중 아무 데나 똑같은 확률로 놓인다.”

쌍의 종류계산개수
남–남 쌍(62)\binom6215
여–여 쌍(42)\binom426
내부 쌍 합계15+615+621
남–여 쌍 (외부)6×46\times424
전체(102)=21+24\binom{10}{2}=21+2445
EIexp=242145=345=115=+0.066667 EI^{\text{exp}}_{\text{쌍}}=\frac{24-21}{45}=\frac{3}{45}=\frac{1}{15}=+0.066667

기준선 ② 배열 모형 (configuration model, degree-preserving)

노드쌍 기준은 차수를 무시한다. 그런데 S3 한 명이 차수 6이라 남학생 쪽 “간선 끝(edge stub)”이 훨씬 많다. 간선 끝을 무작위로 이어 붙인다면 남–남 간선이 저절로 많아진다.

집단 kk간선 끝 비율aka_k라 하자.

ak=ikdeg(i)2m a_k=\frac{\sum_{i\in k}\deg(i)}{2m}
집단차수 합aka_kak2a_k^2
2+2+6+3+2+3=182+2+6+3+2+3=1818/30=0.618/30=0.60.360.36
3+3+3+3=123+3+3+3=1212/30=0.412/30=0.40.160.16
30 =2m=2m1.0 ✔ak2=0.52\sum a_k^2=0.52

무작위로 이었을 때 한 간선이 내부일 확률은 kak2=0.52\sum_k a_k^2 = 0.52, 외부일 확률은 0.480.48. 따라서

EI배열exp=0.480.52=0.04EIexp=12kak2 EI^{\text{exp}}_{\text{배열}}=0.48-0.52=-0.04 \quad\text{즉}\quad \boxed{\,EI^{\text{exp}}=1-2\sum_k a_k^2\,}

검산: 12(0.52)=11.04=0.041-2(0.52)=1-1.04=-0.04

기준선관측관측 − 기준선읽는 법
① 노드쌍+0.0667−0.4667−0.5333차수를 무시한 비교
② 배열 모형−0.0400−0.4667−0.4267차수를 인정한 뒤의 순수 동질성
기준선 ②가 이미 음수(0.04-0.04)라는 게 중요하다. S3의 인기 하나만으로도 E-I는 우연히 0.04-0.04까지 내려간다. 관측 0.4667-0.4667 중 그만큼은 “성별 선호”가 아니라 “차수 분포”의 결과다. 남은 0.4267-0.4267이 진짜 설명해야 할 몫이다.

10. 혼합행렬 (The Mixing Matrix)

지금까지 센 것을 표 하나로 정리한 것이 혼합행렬이다. 먼저 간선 개수로:

행합
7411
448

대각선은 내부 간선 수 그대로, 비대각선은 교차 간선 4개가 양쪽에 한 번씩 적힌다. 이대로 다 더하면 7+4+4+4=19157+4+4+4=19\neq 15이므로, 뉴먼은 합이 1이 되도록 다음처럼 정규화한다.

ekk=mkkm,ek=mk2m (k)kek=1 e_{kk}=\frac{m_{kk}}{m}, \qquad e_{k\ell}=\frac{m_{k\ell}}{2m}\ (k\neq\ell) \qquad\Longrightarrow\qquad \sum_k\sum_\ell e_{k\ell}=1
행합 aka_k
715=0.466667\frac{7}{15}=0.466667430=0.133333\frac{4}{30}=0.1333330.6000000.600000
430=0.133333\frac{4}{30}=0.133333415=0.266667\frac{4}{15}=0.2666670.4000000.400000
열합0.6000000.4000001.0000001.000000

전개해서 합이 1인지 확인:

0.466667+0.133333+0.133333+0.266667=1.000000 ✔ 0.466667+0.133333+0.133333+0.266667=1.000000\ ✔

행합이 §9에서 차수로 구한 aka_k정확히 같다: a=0.6, a=0.4a_{\text{남}}=0.6,\ a_{\text{여}}=0.4 ✔ (당연하다 — 행합은 “남학생에 붙은 간선 끝의 비율”이므로)

그리고 대각합은

kekk=0.466667+0.266667=0.733333=1115=ILm \sum_k e_{kk}=0.466667+0.266667=0.733333=\frac{11}{15}=\frac{IL}{m}
세 가지가 같은 것을 말한다
kekk=ILm=0.7333\sum_k e_{kk}=\dfrac{IL}{m}=0.7333 : 실제로 같은 집단 안에 있는 간선의 비율
kak2=0.52\sum_k a_k^2=0.52 : 우연이라면 그랬을 비율
차이 0.73330.52=0.21330.7333-0.52=0.2133 : 초과분 — 이것이 곧 동질성의 크기다

11. 뉴먼의 동류성 계수 rr (Newman's Assortativity Coefficient)

§10의 “초과분 0.2133”을 그대로 쓰면 최대값이 상황마다 달라 비교가 안 된다. 가능한 최대 초과분은 ekk=1\sum e_{kk}=1일 때의 1ak21-\sum a_k^2이므로, 그것으로 나눈다.

 r=kekkkak21kak2  \boxed{\ r=\frac{\sum_k e_{kk}-\sum_k a_k^2}{1-\sum_k a_k^2}\ }

우리 예시에 대입하면

r=0.7333330.5210.52=0.2133330.48=0.444444=49 r=\frac{0.733333-0.52}{1-0.52}=\frac{0.213333}{0.48}=0.444444=\frac49
rr대응하는 ekk\sum e_{kk}
+1+1완전한 동질성 (집단 간 간선 0)ekk=1\sum e_{kk}=1
00우연과 구별되지 않음ekk=ak2\sum e_{kk}=\sum a_k^2
음수이질성 (기대보다 섞여 있음)ekk<ak2\sum e_{kk}\lt\sum a_k^2
rr의 하한은 1-1이 아니다.
ekk=0\sum e_{kk}=0을 대입하면 r=0.520.48=1.083r=-\frac{0.52}{0.48}=-1.083 — 상관계수가 1-1보다 작을 수는 없다. 모순 같지만, 실은 ekk=0\sum e_{kk}=0이 애초에 불가능하다. 남학생 쪽 간선 끝이 18개, 여학생 쪽이 12개이므로 교차 간선은 최대 12개, 따라서 남–남 간선이 최소 3개는 남는다. 그때 ekk=315=0.2\sum e_{kk}=\frac3{15}=0.2이고
rmin=0.20.520.48=0.320.48=0.6667r_{\min}=\dfrac{0.2-0.52}{0.48}=-\dfrac{0.32}{0.48}=-0.6667.
차수 분포가 rr의 바닥을 정한다. 음수 rr을 “1-1에서 얼마나 멀리”로 읽으면 안 된다.

12. rr은 기준선 보정된 E-I다 (r as a Baseline-corrected E-I)

E-I와 rr은 부호도 반대고 식도 달라 보인다. 그런데 §5와 §9에서 이미 두 개의 다리를 놓았다.

EI=12ILm=12kekkEIexp=12kak2 EI=1-2\cdot\frac{IL}{m}=1-2\sum_k e_{kk} \qquad\qquad EI^{\text{exp}}=1-2\sum_k a_k^2

이 둘을 뒤집어 rr의 정의식에 넣는다.

kekk=1EI2,kak2=1EIexp2 \sum_k e_{kk}=\frac{1-EI}{2}, \qquad \sum_k a_k^2=\frac{1-EI^{\text{exp}}}{2}

분자를 전개하면

kekkkak2=1EI21EIexp2=(1EI)(1EIexp)2=EIexpEI2 \sum_k e_{kk}-\sum_k a_k^2 =\frac{1-EI}{2}-\frac{1-EI^{\text{exp}}}{2} =\frac{(1-EI)-(1-EI^{\text{exp}})}{2} =\frac{EI^{\text{exp}}-EI}{2}

분모를 전개하면

1kak2=11EIexp2=2(1EIexp)2=1+EIexp2 1-\sum_k a_k^2 =1-\frac{1-EI^{\text{exp}}}{2} =\frac{2-(1-EI^{\text{exp}})}{2} =\frac{1+EI^{\text{exp}}}{2}

나누면 12\frac12이 약분되어

 r=EIexpEI1+EIexp  \boxed{\ r=\frac{EI^{\text{exp}}-EI}{1+EI^{\text{exp}}}\ }

수치로 검산 (Numerical Check)

r=(0.04)(0.466667)1+(0.04)=0.4266670.96=0.444444 ✔ r=\frac{(-0.04)-(-0.466667)}{1+(-0.04)} =\frac{0.426667}{0.96} =0.444444\ ✔

§11에서 정의식으로 구한 0.4444440.444444, R의 assortativity_nominal()이 준 0.4444440.444444와 완전히 일치한다.

이 항등식이 말하는 것
분자 EIexpEIEI^{\text{exp}}-EI = 관측이 기준선보다 얼마나 아래인가 (동질성의 크기)
분모 1+EIexp1+EI^{\text{exp}} = 기준선에서 완전 동질성(EI=1EI=-1)까지 남은 거리

rr“기준선에서 출발해 완전 동질성까지 가는 길의 몇 %를 갔는가”이다. E-I를 버리고 rr을 배우는 게 아니라, rr은 E-I를 기준선으로 보정하고 0~1로 다시 눈금을 매긴 것이다.
확인유도결과
EI=1EI=-1이면?r=EIexp+11+EIexpr=\frac{EI^{\text{exp}}+1}{1+EI^{\text{exp}}}r=1r=1
EI=EIexpEI=EI^{\text{exp}}이면?분자 =0=0r=0r=0
EI>EIexpEI\gt EI^{\text{exp}}이면?분자 음수, 분모 양수r<0r\lt 0 (이질성)
실무 규칙 — 집단 개수가 다른 두 분할의 E-I를 직접 비교하지 말 것. 기준선 EIexpEI^{\text{exp}}이 다르기 때문이다. 비교하려면 rr을 쓰거나, 최소한 EIEIEIexpEI^{\text{exp}}을 나란히 적을 것. (§16에서 실제 사례를 본다)

13. 연속 속성: 차수 동류성 (Numeric Attributes: Degree Assortativity)

성별·인종은 범주지만, 성적·키·차수는 숫자다. 숫자 속성에는 델타 대신 피어슨 상관을 쓴다. 각 간선의 두 끝 값을 (je,ke)(j_e, k_e)라 하면

rnum=1Mejeke[1Meje+ke2]21Meje2+ke22[1Meje+ke2]2 r_{\text{num}}= \frac{\frac1M\sum_e j_e k_e-\left[\frac1M\sum_e \frac{j_e+k_e}{2}\right]^2} {\frac1M\sum_e \frac{j_e^2+k_e^2}{2}-\left[\frac1M\sum_e \frac{j_e+k_e}{2}\right]^2}

가장 널리 쓰이는 것이 속성 = 차수인 경우다. 15개 간선의 (차수, 차수)를 전부 적으면

#간선(je,ke)(j_e,k_e)jekej_ek_e#간선(je,ke)(j_e,k_e)jekej_ek_e
1S1–S2(2,2)49S8–S9(3,3)9
2S1–S3(2,6)1210S9–S10(3,3)9
3S2–S3(2,6)1211S7–S10(3,3)9
4S3–S4(6,3)1812S3–S7(6,3)18
5S4–S5(3,2)613S3–S8(6,3)18
6S4–S6(3,3)914S3–S9(6,3)18
7S5–S6(2,3)615S6–S10(3,3)9
8S7–S8(3,3)9합계166

세 개의 합을 각각 M=15M=15로 나눈다.

원합÷M\div M
ejeke\sum_e j_ek_e16611.06666711.066667
eje+ke2\sum_e \frac{j_e+k_e}{2}513.43.4
eje2+ke22\sum_e \frac{j_e^2+k_e^2}{2}20113.413.4
rdeg=11.066667(3.4)213.4(3.4)2=11.06666711.5613.411.56=0.4933331.84=0.268116 r_{\text{deg}}=\frac{11.066667-(3.4)^2}{13.4-(3.4)^2} =\frac{11.066667-11.56}{13.4-11.56} =\frac{-0.493333}{1.84} =-0.268116
0.268-0.268의 뜻 — 음수다. 인기 많은 학생이 조용한 학생과 이어진다. 표에서 눈으로 보이듯 차수 6인 S3은 차수 2·3인 학생들과만 이어져 있다. 전형적인 스타형(중심-주변) 구조. 소규모 학급에서 자주 나온다.
반대로 실제 고교 데이터(§15)는 +0.346+0.346 — 친구 많은 아이들끼리 뭉치는 양(+)의 차수 동류성. 사회 네트워크의 일반적 특징이다.
같은 네트워크, 다른 부호 — 성별로는 r=+0.444r=+0.444(동질적), 차수로는 rdeg=0.268r_{\text{deg}}=-0.268(이질적). 모순이 아니다. 어떤 속성으로 재느냐에 따라 답이 다를 뿐이다. “이 네트워크는 동질적이다”라는 말은 속성을 밝히지 않으면 무의미하다.

14. 순열 검정 (Permutation Test)

EI=0.4667EI=-0.4667이 기준선 +0.0667+0.0667보다 아래인 건 알았다. 그런데 이 정도 차이가 우연히 나올 수도 있지 않나? 10명뿐인데.

답하는 방법: 구조는 그대로 두고 라벨만 뒤섞는다. 15개 간선은 건드리지 않고, “남 6명 / 여 4명”이라는 라벨만 10명에게 다시 배분한다. 경우의 수는 (104)=210\binom{10}{4}=210가지 — 전부 셀 수 있다. (표본 추출이 아니라 완전열거이므로 pp값이 정확하다.)

210가지 라벨 배치의 E-I 귀무분포
210가지를 전부 센 귀무분포. 빨간 막대가 관측값 이하
E-I 값−0.600−0.467−0.333−0.200−0.067+0.067+0.200+0.333+0.467+0.600
경우의 수13121938584225111210

(E-I는 152IL15\frac{15-2IL}{15} 꼴이라 215=0.1333\frac{2}{15}=0.1333 간격으로만 값이 나온다.)

p=#{EIperm0.466667}210=1+3210=4210=0.019048 p=\frac{\#\{EI^{\text{perm}}\le -0.466667\}}{210}=\frac{1+3}{210}=\frac{4}{210}=0.019048
결론 p=0.019<0.05p=0.019\lt 0.05. 라벨을 아무렇게나 배분해서 이만큼 동질적인 배치가 나올 확률은 210가지 중 4가지, 1.9%. 10명짜리 작은 학급에서도 통계적으로 유의한 성별 동질성이다.

귀무분포의 평균 = 노드쌍 기준선 (정확히) (The Null Mean Equals the Dyad Baseline Exactly)

210가지의 평균은 정확히 +0.066667+0.066667, §9의 노드쌍 기준선과 소수점까지 같다. 우연이 아니라 필연이다. 간선 하나를 고정하고 라벨을 무작위로 배분하면, 그 간선의 두 끝이 같은 라벨을 받을 확률은

P(δ=1)=(62)+(42)(102)=15+645=2145=715 P(\delta=1)=\frac{\binom62+\binom42}{\binom{10}{2}}=\frac{15+6}{45}=\frac{21}{45}=\frac{7}{15}

이므로 E[IL]=15×715=7E[IL]=15\times\frac7{15}=7, E[EL]=8E[EL]=8, 따라서

E[EI]=8715=115=0.066667 ✔ E[EI]=\frac{8-7}{15}=\frac{1}{15}=0.066667\ ✔
정리라벨 순열 검정의 귀무 평균은 노드쌍 기준선과 같다. 순열 검정은 그 기준선에 퍼짐(sd = 0.2167)까지 덧붙여 주는 것이다. 그래서 “얼마나 아래인가”뿐 아니라 “유의한가”에도 답할 수 있다.

15. 실전: Faux Magnolia 고교 (Real Data: Faux Magnolia High)

ergm 패키지의 faux.magnolia.high. 실제 미국 고교 친구 네트워크(Add Health)를 통계 모형으로 재현한 시뮬레이션 자료다.

학생 수1461명간선 수974개밀도0.000913
성별여 768, 남 693
학년7학년 185, 8학년 210, 9학년 317, 10학년 299, 11학년 257, 12학년 193
인종White 1053, Black 261, Hisp 68, Asian 48, NatAm 24, Other 7

세 속성 비교 (Comparing Three Attributes)

속성집단 수ILILELEL관측 EIEI기대 EIexpEI^{\text{exp}}rr
학년 (Grade)6820154−0.6838+0.65290.8087
인종 (Race)6787187−0.6160−0.30470.4478
성별 (Sex)2689285−0.4148−0.03080.3962
FMH 세 속성의 관측 E-I, 기대 E-I, r
왼쪽: 관측과 기대를 나란히. 오른쪽: 기준선 보정 후의 rr
기준선이 없으면 못 보는 것
관측 E-I만 보면 인종(0.616-0.616)이 성별(0.415-0.415)보다 훨씬 동질적으로 보인다. 그런데 기준선이 각각 0.305-0.3050.031-0.031로 크게 다르다. 인종은 White가 72%를 차지해서 가만히 있어도 내부 간선이 많아진다. 보정하면 r=0.448r=0.4480.3960.396차이가 훨씬 줄어든다.
반면 학년은 기준선이 +0.653+0.653(6개 집단이 고르게 나뉘어 있어 우연이면 섞일 수밖에 없음)인데 관측이 0.684-0.684. 기준선 대비 낙차 1.3371.337, r=0.809r=0.809압도적 1위.

학년: 얼마나 강한가 (Grade: How Strong Is It)

학년 차이0 (같은 학년)1 (인접)234
간선 수8201143172
비율84.2%11.7%3.2%0.7%0.2%

같은 학년이거나 한 학년 차이인 간선이 820+114974=95.9%\frac{820+114}{974}=95.9\%. 학년을 두 칸 이상 건너뛰는 친구 관계는 40개뿐이다.

학년인원ILILELEL관측 EIEI기대(노드쌍)
718511017−0.7323+0.8655
821016529−0.7010+0.8458
931715250−0.5050+0.7573
1029915183−0.2906+0.7727
1125715280−0.3103+0.8078
121939049−0.2950+0.8592

저학년(7·8학년)이 0.73, 0.70-0.73,\ -0.70으로 가장 닫혀 있고, 고학년으로 갈수록 0.29-0.29까지 열린다. 학년이 올라갈수록 학년 경계를 넘는 관계가 늘어난다.

인종: 집단 크기 함정의 실제 사례 (Race: The Group-Size Trap in Practice)

집단인원ILILELEL관측 EIEI기대(노드쌍)관측 − 기대
Other705+1.0000+0.9959+0.004
NatAm24329+0.8125+0.9841−0.172
Asian48740+0.7021+0.9673−0.265
Hisp68157+0.9655+0.9530+0.013
Black2618573−0.0759+0.8045−0.880
White1053691170−0.6051−0.1263−0.479
0을 기준으로 읽으면 정반대로 해석하게 된다
Other(7명)의 EI=+1.0EI=+1.0은 “완벽히 융화”가 아니다. 7명이 서로 아는 사이일 확률 자체가 거의 없다(기대 +0.9959+0.9959). 정보가 거의 없는 값이다.
Hisp(68명)의 +0.9655+0.9655도 기대 +0.9530+0.9530보다 높다 — 기대보다도 더 흩어져 있다.
반대로 Black(261명)의 0.0759-0.0759는 0 근처라 “중립”처럼 보이지만 기대 +0.8045+0.8045 대비 0.88-0.88, 이 데이터에서 가장 강하게 뭉친 집단이다.
소수 집단의 E-I는 반드시 자기 크기의 기대값과 나란히 놓고 읽어야 한다.

순열 검정 (성별, 1000회) (Permutation Test on Sex)

관측 EIEI−0.4148순열 평균−0.0025순열 sd0.0335
순열 최소값−0.1129zz−12.31pp<0.001\lt 0.001

1000번 섞어서 가장 동질적이었던 배치조차 0.1129-0.1129로, 관측 0.4148-0.4148의 근처에도 못 갔다. 표본이 크면 이렇게 귀무분포가 좁아져서 작은 차이도 유의해진다 — 그래서 큰 데이터에서는 pp값보다 효과 크기(rr)를 봐야 한다.

16. 함정 ②: 동질성 ≠ 커뮤니티 (Trap 2: Homophily is not Community)

단원 3-4에서 배운 커뮤니티 탐지는 “구조가 말하는 집단”을 찾는다. 오늘의 동질성은 “미리 준 라벨”과 구조를 대조한다. 둘은 같지 않다.

10인 예시에 Louvain을 돌리면 3개 집단이 나온다.

분할집단QQILILELELEIEIEIexpEI^{\text{exp}}rr
성별 (2집단){S1…S6} / {S7…S10}0.2133114−0.4667−0.04000.4444
Louvain (3집단){S1,S2,S3} / {S4,S5,S6} / {S7,S8,S9,S10}0.3244105−0.3333+0.31560.4932

ARI(Louvain, 성별) =0.5872=0.5872 — 상당히 겹치지만 같지는 않다. Louvain은 남학생 6명을 둘로 쪼갠다(S3의 삼각형과 S4·S5·S6의 삼각형).

여기서 E-I가 사람을 속인다
Louvain 분할의 EI=0.3333EI=-0.3333은 성별의 0.4667-0.4667보다 덜 음수다. “성별이 더 강한 집단 기준”처럼 보인다. 그런데 rr0.49320.4932로 성별의 0.44440.4444보다 크다. 어느 쪽이 맞나?

rr이 맞다. 기준선이 다르기 때문이다. 3집단으로 쪼개면 우연히 같은 집단에 놓일 확률이 줄어들어 기준선이 0.04-0.04에서 +0.3156+0.3156으로 크게 올라간다. 같은 기준으로 재면:
분할EIexpEIEI^{\text{exp}}-EI (낙차)1+EIexp1+EI^{\text{exp}} (갈 수 있는 거리)rr
성별0.04(0.4667)=0.4267-0.04-(-0.4667)=0.42670.960.960.44440.4444
Louvain0.3156(0.3333)=0.64890.3156-(-0.3333)=0.64891.31561.31560.49320.4932
집단 수가 다른 분할끼리 E-I를 직접 비교하면 안 된다.

FMH에서는 어떤가 (What Happens in FMH)

분할QQ읽는 법
학년 (Grade)0.6684학년은 사실상 구조적 커뮤니티 그 자체
성별 (Sex)0.1920동질성은 있지만(r=0.396r=0.396) 덩어리를 만들지는 않음
인종 (Race)0.1557동질성은 학년 다음으로 강한데(r=0.448r=0.448) QQ는 가장 낮음
동질성과 커뮤니티의 관계
학년: 동질성 강함 + QQ 높음 → 속성이 곧 구조. 학년 벽이 물리적으로 존재한다.
인종: 동질성 강함(r=0.448r=0.448) + QQ 낮음(0.156) → 속성이 구조를 만들지는 않는다. 인종별 선호가 있어도, 인종이 학교를 덩어리로 쪼개지는 않는다 — 학년이 먼저 쪼개기 때문이다.

rr“선호가 있는가”를 재고, QQ“그 선호가 실제로 벽을 만들었는가”를 잰다. 두 질문은 다르다.

17. R 검증 (Verification in R)

주의sna/networkigraph는 같은 이름의 함수를 서로 가린다. igraph::degree(), network::mixingmatrix()처럼 패키지 이름을 붙여 부를 것. 또 E-I 지수는 sna·igraph 어디에도 내장 함수가 없다 — 직접 세야 한다.
library(igraph)

## ---- 예시 네트워크 ----
el <- rbind(c(1,2),c(1,3),c(2,3),c(3,4),c(4,5),c(4,6),c(5,6),   # 남 내부 7
            c(7,8),c(8,9),c(9,10),c(7,10),                       # 여 내부 4
            c(3,7),c(3,8),c(3,9),c(6,10))                        # 교차 4
g   <- graph_from_edgelist(el, directed = FALSE)
V(g)$name <- paste0("S", 1:10)
sex <- c(rep("남", 6), rep("여", 4))

## ---- E-I 지수 (직접 계산) ----
same <- sex[el[,1]] == sex[el[,2]]
IL <- sum(same); EL <- sum(!same)
c(IL = IL, EL = EL, EI = (EL - IL) / (IL + EL))
#   IL        EL        EI
#   11         4 -0.4666667

## ---- 기준선 ① 노드쌍 ----
ip <- sum(choose(table(sex), 2)); ep <- prod(table(sex))
(ep - ip) / (ep + ip)
# [1] 0.06666667

## ---- 기준선 ② 배열 모형 ----
d <- igraph::degree(g)
a <- tapply(d, sex, sum) / sum(d)          # 남 0.6, 여 0.4
EI_exp <- 1 - 2 * sum(a^2)
EI_exp
# [1] -0.04

## ---- 혼합행렬 e 와 동류성 계수 r ----
e <- matrix(0, 2, 2, dimnames = list(c("남","여"), c("남","여")))
for (k in seq_len(nrow(el))) {
  i <- sex[el[k,1]]; j <- sex[el[k,2]]
  if (i == j) e[i,i] <- e[i,i] + 1 else { e[i,j] <- e[i,j] + 0.5; e[j,i] <- e[j,i] + 0.5 }
}
e <- e / sum(e); round(e, 6)
#           남        여
# 남 0.466667 0.133333
# 여 0.133333 0.266667
r <- (sum(diag(e)) - sum(a^2)) / (1 - sum(a^2))
c(r_수식 = r, r_igraph = assortativity_nominal(g, as.integer(factor(sex))))
#    r_수식 r_igraph
# 0.4444444 0.4444444

## ---- §12 항등식 검증 ----
EI <- (EL - IL) / (IL + EL)
all.equal((EI_exp - EI) / (1 + EI_exp), r)
# [1] TRUE

## ---- 차수 동류성 ----
assortativity_degree(g)
# [1] -0.2681159

## ---- 정확 순열 검정: C(10,4) = 210가지 전부 ----
combs <- combn(10, 4)                       # 여학생이 될 4명을 고르는 모든 방법
vals  <- apply(combs, 2, function(f) {
  lab <- rep("남", 10); lab[f] <- "여"
  s <- lab[el[,1]] == lab[el[,2]]
  (sum(!s) - sum(s)) / 15
})
c(경우수 = length(vals), 평균 = mean(vals), p = mean(vals <= EI + 1e-9))
#     경우수       평균          p
# 210.00000000 0.06666667 0.01904762

## ---- 실전 데이터 ----
library(ergm); library(intergraph)
data(faux.magnolia.high)
G <- asIgraph(faux.magnolia.high)
E1 <- as_edgelist(G, names = FALSE)
for (a_nm in c("Grade", "Race", "Sex")) {
  lab <- igraph::vertex_attr(G, a_nm)
  s <- lab[E1[,1]] == lab[E1[,2]]
  cat(sprintf("%-6s E-I = %+.4f   r = %+.4f\n", a_nm,
      (sum(!s) - sum(s)) / length(s),
      assortativity_nominal(G, as.integer(factor(lab)))))
}
# Grade  E-I = -0.6838   r = +0.8087
# Race   E-I = -0.6160   r = +0.4478
# Sex    E-I = -0.4148   r = +0.3962

18. 교실 적용 (Classroom Application)

무엇을 언제 쓰는가 (Which Measure When)

알고 싶은 것도구주의
우리 반이 성별로 갈라졌나?전체 EIEI + EIexpEI^{\text{exp}}기준선 없이 EIEI만 보고하지 말 것
어느 집단이 더 닫혀 있나?집단별 EIkEI_k vs EIkexpEI^{\text{exp}}_k소수 집단은 ++가 정상. 0이 기준이 아니다
누가 다리 역할인가?개인별 EIiEI_iEIi0EI_i\approx 0이고 차수가 큰 학생
여러 속성 중 뭐가 제일 센가?rrEIEI로 비교하면 집단 수·크기에 속는다
우연일 가능성은?순열 검정라벨만 섞고 구조는 고정
그 선호가 벽을 만들었나?QQ (모듈도)rr이 높아도 QQ는 낮을 수 있다

실제 개입으로 옮기기 (Turning It Into an Intervention)

1. 모둠 편성EIi=1EI_i=-1인 학생(이성 친구 0명)을 찾아, EIi0EI_i\approx 0인 다리 학생과 같은 모둠에 넣는다. 우리 예시라면 S1·S2·S4·S5를 S3와 묶는다. 다리 학생 없이 이질 모둠만 만들면 모둠 안에서 다시 갈라진다.

2. 취약한 다리 점검 — 우리 예시에서 남녀를 잇는 학생은 S3(3개 선)과 S6(1개 선)뿐이다. S3 한 명을 빼면 교차 간선이 4개 → 1개로 줄어 EIEI11112=0.833\frac{1-11}{12}=-0.833까지 떨어진다. “한 명에게 의존하는 통합”은 통합이 아니다. 다리를 여러 개 만드는 것이 목표.

3. 소수 집단 보고서 쓰기 — “다문화 학생 3명의 E-I는 +0.87+0.87”이라고만 쓰면 읽는 사람이 반드시 오해한다. “기대 +0.91+0.91, 관측 +0.87+0.87 — 기대보다 낮음”으로 쓴다.

4. 학년 초 → 학년 말 비교 — 같은 학급을 두 번 재면 EIEI의 변화가 개입 효과다. 단, 간선 수가 바뀌었어도 EIEImm으로 나눠져 있어 비교 가능하다. 전학·결석으로 인원이 바뀌었다면 기준선도 다시 계산해야 한다.

5. 속성 여러 개를 한꺼번에 — 성별, 학원 여부, 출신 초등학교, 성취수준으로 각각 rr을 구해 막대그래프로 세우면 “우리 반을 실제로 가르는 축”이 무엇인지 한눈에 보인다. 성별이 제일 클 거라고 지레짐작하지 말 것 — FMH에서는 학년이 압도적이었다.
윤리 주의 — 개인별 EIi=1EI_i=-1 명단은 매우 민감한 정보다. “이 아이는 이성 친구가 없다”는 사실을 아이 본인이나 다른 학생에게 직접 전달하는 도구가 아니다. 교사가 모둠을 설계하는 데만 쓴다.

19. 연습문제 (Exercises)

연습문제 1. 12명 학급이다. 남 5명 S1~S5, 여 7명 S6~S12. 친구 관계 14개는 다음과 같다.
남 내부 (5개)S1–S2, S1–S3, S2–S3, S3–S4, S4–S5
여 내부 (7개)S6–S7, S6–S8, S7–S8, S9–S10, S10–S11, S11–S12, S9–S12
교차 (2개)S3–S6, S5–S9
(가) 14개 간선을 전부 분류해 ILIL, ELEL, 전체 EIEI를 구하라.
(나) 집단별 EIEI_{\text{남}}, EIEI_{\text{여}}를 구하고, 각 집단의 노드쌍 기대값과 비교해 어느 집단이 더 닫혀 있는지 판정하라.
(다) 12명 전원의 차수를 구하고, aa_{\text{남}}, aa_{\text{여}}, ak2\sum a_k^2, EIexpEI^{\text{exp}}를 구하라.
(라) 혼합행렬 ee를 만들고(합이 1인지 확인), rr정의식§12 항등식 두 가지 방법으로 각각 구해 일치하는지 확인하라.
(마) 개인별 EIiEI_i를 12명 전부 구하고, 가장 좋은 다리 학생을 지목하라.

§20 해설 — 먼저 풀고 맞춰 볼 것.
연습문제 2. 30명 학급에 전학생 3명이 있다. 학기 말에 재어 보니 이 3명 사이 친구 관계는 1개, 3명이 나머지 27명과 맺은 관계는 14개였다.

(가) 전학생 집단의 관측 EIEI를 구하라.
(나) k=3, n=30k=3,\ n=30일 때 노드쌍 기대값 EI3expEI^{\text{exp}}_3을 구하라.
(다) 담임이 “E-I가 +0.87+0.87로 양수이니 전학생들이 잘 융화되었다”고 보고서에 썼다. 이 해석이 맞는지 판정하고, 맞다면 왜 맞는지 / 틀리다면 어떻게 고쳐 써야 하는지 한 문장으로 쓰라.
(라) 이 학급(n=30n=30)에서 기대 E-I가 0이 되는 집단 크기를 공식으로 구하라. 정수가 아니라면, 실제로 양수/음수가 갈리는 두 정수를 찾아 값을 확인하라.

§20 해설 — 먼저 풀고 맞춰 볼 것.

20. 해설과 답 (Solutions)

연습문제 1 해설 (Solution to Exercise 1)

(가) 14개 간선 전부 분류

#간선gig_igjg_jδ\delta분류#간선gig_igjg_jδ\delta분류
1S1–S21내부8S7–S81내부
2S1–S31내부9S9–S101내부
3S2–S31내부10S10–S111내부
4S3–S41내부11S11–S121내부
5S4–S51내부12S9–S121내부
6S6–S71내부13S3–S60외부
7S6–S81내부14S5–S90외부
IL=5+7=12,EL=2,12+2=14=m ✔ IL=\underbrace{5}_{\text{남}}+\underbrace{7}_{\text{여}}=12,\qquad EL=2,\qquad 12+2=14=m\ ✔
답 (가) EI=ELILm=21214=1014=0.714286\displaystyle EI=\frac{EL-IL}{m}=\frac{2-12}{14}=\frac{-10}{14}=-0.714286
검산(다른 길): EI=12ILm=121214=12414=1014EI=1-2\cdot\frac{IL}{m}=1-2\cdot\frac{12}{14}=1-\frac{24}{14}=-\frac{10}{14}

값의 의미0.714-0.714[1,0][-1,0]의 71% 지점. 내부 비율 12/14=85.7%12/14=85.7\%, 외부 비율 14.3%14.3\%, 차이 71.471.4%p. 본문 예시(0.467-0.467)보다 훨씬 강한 동질성이다.

(나) 집단별 E-I와 그 기대값

집단kkILkIL_kELkEL_k관측 EIkEI_k내부 쌍 (k2)\binom k2외부 쌍 k(12k)k(12-k)기대 EIkexpEI^{\text{exp}}_k관측 − 기대
552257=0.428571\frac{2-5}{7}=-0.428571(52)=10\binom52=105×7=355\times7=35351045=+0.555556\frac{35-10}{45}=+0.5555560.984127-0.984127
772279=0.555556\frac{2-7}{9}=-0.555556(72)=21\binom72=217×5=357\times5=35352156=+0.250000\frac{35-21}{56}=+0.2500000.805556-0.805556
답 (나) 관측만 보면 여학생이 더 닫힌 듯하다(0.556<0.429-0.556 \lt -0.429).
그러나 기대 대비로 보면 남학생이 더 닫혀 있다: 낙차 0.984-0.9840.806-0.806.
소수 집단(남 5명)은 기대값이 +0.556+0.556으로 높은데도 0.429-0.429까지 내려왔기 때문이다.

왜 그 값인가 — 남학생은 5명뿐이라 “바깥”이 7명으로 더 넓다. 그런데도 5개 관계를 전부 안쪽에 쓰고 밖으로는 2개만 냈다. 반면 여학생은 7명이라 안쪽 상대가 이미 많다.

(다) 차수와 배열 모형 기준선

학생성별이웃차수학생성별이웃차수
S1S2, S32S7S6, S82
S2S1, S32S8S6, S72
S3S1, S2, S4, S64S9S10, S12, S53
S4S3, S52S10S9, S112
S5S4, S92S11S10, S122
S6S7, S8, S33S12S11, S92

차수 합 =2+2+4+2+2+3+2+2+3+2+2+2=28=2×14=2+2+4+2+2+3+2+2+3+2+2+2=28=2\times14

집단차수 합 전개aka_kak2a_k^2
2+2+4+2+22+2+4+2+2121228=37=0.428571\frac{12}{28}=\frac37=0.428571949=0.183673\frac9{49}=0.183673
3+2+2+3+2+2+23+2+2+3+2+2+2161628=47=0.571429\frac{16}{28}=\frac47=0.5714291649=0.326531\frac{16}{49}=0.326531
28 ✔1.0 ✔2549=0.510204\frac{25}{49}=0.510204
답 (다) a=37, a=47, ak2=2549=0.510204a_{\text{남}}=\frac37,\ a_{\text{여}}=\frac47,\ \sum a_k^2=\frac{25}{49}=0.510204
EIexp=122549=15049=149=0.020408\displaystyle EI^{\text{exp}}=1-2\cdot\frac{25}{49}=1-\frac{50}{49}=-\frac{1}{49}=-0.020408

값의 의미 — 기준선이 아주 살짝 음수다. 여학생이 인원도 많고(7명) 차수 합도 크지만(16), 그 차이가 크지 않아 배열 모형 기준선은 거의 0에 붙어 있다. 관측 0.714-0.714는 이 기준선보다 0.694-0.694 아래 — 거의 전부가 진짜 동질성이다.

(라) 혼합행렬과 rr

간선 개수 행렬: 대각선은 내부 간선 수, 비대각선은 교차 2개를 양쪽에.

52
27

정규화: ekk=mkkme_{kk}=\frac{m_{kk}}{m}, ek=mk2me_{k\ell}=\frac{m_{k\ell}}{2m} (m=14m=14, 2m=282m=28)

행합 aka_k
514=0.357143\frac5{14}=0.357143228=0.071429\frac2{28}=0.0714290.428571=370.428571=\frac37
228=0.071429\frac2{28}=0.071429714=0.500000\frac7{14}=0.5000000.571429=470.571429=\frac47

합 검산: 0.357143+0.071429+0.071429+0.500000=1.0000000.357143+0.071429+0.071429+0.500000=1.000000
행합이 (다)에서 차수로 구한 aka_k와 정확히 일치 ✔

kekk=0.357143+0.500000=0.857143=1214=ILm ✔ \sum_k e_{kk}=0.357143+0.500000=0.857143=\frac{12}{14}=\frac{IL}{m}\ ✔

방법 1 — 정의식

r=ekkak21ak2=0.8571430.51020410.510204=0.3469390.489796=0.708333 r=\frac{\sum e_{kk}-\sum a_k^2}{1-\sum a_k^2} =\frac{0.857143-0.510204}{1-0.510204} =\frac{0.346939}{0.489796} =0.708333

방법 2 — §12 항등식

r=EIexpEI1+EIexp=(0.020408)(0.714286)1+(0.020408)=0.6938780.979592=0.708333 r=\frac{EI^{\text{exp}}-EI}{1+EI^{\text{exp}}} =\frac{(-0.020408)-(-0.714286)}{1+(-0.020408)} =\frac{0.693878}{0.979592} =0.708333
답 (라) r=0.708333r=0.708333 — 두 방법이 정확히 일치. (R의 assortativity_nominal()0.7083330.708333)
본문 예시의 r=0.444r=0.444보다 훨씬 크다. 이 학급의 성별 분리는 상당히 심각한 수준이다.

(마) 개인별 E-I와 다리 학생

학생성별deg\degILiIL_iELiEL_iEIiEI_i 계산EIiEI_i
S1220(02)/2(0-2)/21.0000-1.0000
S2220(02)/2(0-2)/21.0000-1.0000
S3431(13)/4(1-3)/40.5000-0.5000
S4220(02)/2(0-2)/21.0000-1.0000
S5211(11)/2(1-1)/20.00000.0000
S6321(12)/3(1-2)/30.3333-0.3333
S7220(02)/2(0-2)/21.0000-1.0000
S8220(02)/2(0-2)/21.0000-1.0000
S9321(12)/3(1-2)/30.3333-0.3333
S10220(02)/2(0-2)/21.0000-1.0000
S11220(02)/2(0-2)/21.0000-1.0000
S12220(02)/2(0-2)/21.0000-1.0000

검산: iILi=2+2+3+2+1+2+2+2+2+2+2+2=24=2×12\sum_i IL_i=2+2+3+2+1+2+2+2+2+2+2+2=24=2\times12 ✔ · iELi=0+0+1+0+1+1+0+0+1+0+0+0=4=2×2\sum_i EL_i=0+0+1+0+1+1+0+0+1+0+0+0=4=2\times2

답 (마) EIi=0EI_i=0인 학생은 S5뿐이다(차수 2, 남 1명 여 1명). 그러나 가장 좋은 다리는 S3이라고 보아야 한다.
S5는 차수가 2라 이성 친구가 1명뿐 — 그 관계 하나가 끊기면 다리가 사라진다. S3은 EI3=0.5EI_3=-0.5로 값은 나쁘지만 차수 4에 같은 쪽 친구 3명 + 반대쪽 1명을 쥐고 있어 남학생 집단 전체를 여학생 쪽으로 끌어올 힘이 있다.
개인 E-I는 차수와 함께 읽어야 한다 — 차수 2에서 나온 0.00.0과 차수 6에서 나온 0.00.0은 전혀 다른 값이다.

교실 해석

이 학급의 남녀 연결은 S3–S6S5–S9 단 두 개다. 게다가 두 다리가 서로 다른 여학생 하위집단으로 이어진다(S6은 {S6,S7,S8} 삼각형, S9는 {S9,S10,S11,S12} 사각형). 두 관계 중 하나만 끊겨도 여학생 절반이 남학생 쪽과 완전히 단절된다. 남녀 혼합 모둠을 짤 때 S3와 S5를 서로 다른 모둠에 배치해 다리를 늘리는 것이 우선이다.

연습문제 2 해설 (Solution to Exercise 2)

(가) 관측 E-I

IL=1,EL=14,EI=ELILEL+IL=14115=1315=+0.866667 IL=1,\qquad EL=14,\qquad EI=\frac{EL-IL}{EL+IL}=\frac{14-1}{15}=\frac{13}{15}=+0.866667

(나) 기대값

계산
내부 쌍(32)=3×22\binom32=\frac{3\times2}{2}3
외부 쌍3×(303)=3×273\times(30-3)=3\times2781
기대 EI3expEI^{\text{exp}}_381381+3=7884\frac{81-3}{81+3}=\frac{78}{84}+0.928571+0.928571
답 (가), (나) 관측 EI=+0.8667EI=+0.8667, 기대 EI3exp=+0.9286EI^{\text{exp}}_3=+0.9286.
관측 − 기대 =0.0619=-0.0619 — 관측이 기대보다 낮다.

(다) 담임의 해석 판정

답 (다) — 틀렸다.
+0.87+0.87이 양수인 것은 융화의 증거가 아니라 3명이라는 집단 크기의 산물이다. 3명 사이에는 쌍이 3개뿐이고 바깥으로는 81개 쌍이 있으니, 관계를 아무렇게나 맺어도 E-I는 +0.93+0.93 근처가 나온다.

고쳐 쓰면: “전학생 3명의 E-I는 +0.87+0.87로, 같은 크기 집단의 기대값 +0.93+0.93보다 낮다. 즉 기대보다 자기들끼리 조금 더 뭉쳐 있으며, 융화되었다고 볼 근거는 없다.”

왜 그런가 — 원자료로 확인: 3명 사이 가능한 쌍 3개 중 1개가 실제 관계다(비율 1/31/3). 바깥으로 가능한 쌍 81개 중 14개(비율 14/81=0.17314/81=0.173). 안쪽 밀도가 바깥쪽의 약 1.9배다. E-I가 양수인 것과 아무 상관없이, 이 3명은 서로에게 더 붙어 있다.

(라) 기대 E-I가 0이 되는 집단 크기

k=2n+13=2×30+13=613=20.333 k=\frac{2n+1}{3}=\frac{2\times30+1}{3}=\frac{61}{3}=20.333\ldots

정수가 아니므로 20과 21을 직접 확인한다.

kk내부 쌍 (k2)\binom k2외부 쌍 k(30k)k(30-k)EIkexpEI^{\text{exp}}_k부호
20(202)=190\binom{20}2=19020×10=20020\times10=200200190390=+0.025641\frac{200-190}{390}=+0.025641양수
21(212)=210\binom{21}2=21021×9=18921\times9=189189210399=0.052632\frac{189-210}{399}=-0.052632음수
답 (라) k=61320.33k=\frac{61}{3}\approx20.33. 정수로는 k=20k=20까지 양수, k=21k=21부터 음수.
즉 30명 학급에서 어떤 집단의 E-I가 “0보다 작으니 동질적”이라고 말하려면 그 집단이 21명 이상이어야 한다. 그보다 작으면 E-I는 거의 항상 양수이고, 그 양수는 동질성에 대해 아무것도 말해 주지 않는다.
교실 — 이 연습문제가 주는 실무 규칙
학급 크기 nn에서 어떤 집단이든 E-I를 보고할 때는 반드시 k(nk)(k2)k(nk)+(k2)\frac{k(n-k)-\binom k2}{k(n-k)+\binom k2}를 같이 계산해 나란히 적는다. 특수교육 대상, 다문화 배경, 전학생, 특정 학원 수강생 — 학교에서 관심 갖는 집단은 거의 전부 소수 집단이고, 따라서 거의 전부 E-I가 양수로 나온다. 기준선 없는 E-I 보고는 “소수 집단은 잘 융화되어 있다”는 결론을 자동 생산하는 기계다.