단원 3-7Homophily and the E-I Index
동질성과 E-I 지수
“끼리끼리 논다”를 숫자 하나로 만드는 법 — 그리고 그 숫자 하나가 집단 크기 때문에 얼마나 쉽게 사람을 속이는지, 그 속임수를 기준선(baseline)으로 어떻게 걷어내는지.
- 지난 시간 연습문제 확인 (Review)
- 오늘의 질문: 구조에서 속성으로 (From Structure to Attributes)
- 오늘의 예시 네트워크 (The Working Example)
- E-I 지수의 정의 (Definition of the E-I Index)
- 손 계산 — 15개 간선 전부 분류 (Classifying All 15 Edges)
- 집단별 E-I (Group-level E-I)
- 개인별 E-I (Node-level E-I)
- 함정 ①: 집단 크기가 E-I를 좌우한다 (Trap 1: Group Size)
- 기준선: 무엇과 비교할 것인가 (Baselines)
- 혼합행렬 (The Mixing Matrix)
- 뉴먼의 동류성 계수 (Newman's Assortativity Coefficient)
- 은 기준선 보정된 E-I다 (r as a Baseline-corrected E-I)
- 연속 속성: 차수 동류성 (Degree Assortativity)
- 순열 검정 (Permutation Test)
- 실전: Faux Magnolia 고교 (Real Data)
- 함정 ②: 동질성 ≠ 커뮤니티 (Homophily ≠ Community)
- R 검증 (Verification in R)
- 교실 적용 (Classroom Application)
- 연습문제 (Exercises)
- 해설과 답 (Solutions)
1. 지난 시간 연습문제 확인 (Review of Last Session's Exercises)
연습문제 1 — 전원 참여 활동이 만드는 “밀도 1.0” 착시 (Exercise 1: The Density-1.0 Illusion)
5명(T1~T5), 3활동. E1은 학급 전체 봉사활동이라 다섯 명 모두 참여했다.
| E1 (전체봉사) | E2 | E3 | 행합 참여 활동 수 | |
|---|---|---|---|---|
| T1 | 1 | 1 | 0 | 2 |
| T2 | 1 | 1 | 0 | 2 |
| T3 | 1 | 0 | 1 | 2 |
| T4 | 1 | 0 | 1 | 2 |
| T5 | 1 | 0 | 0 | 1 |
| 열합 활동 크기 | 5 | 2 | 2 | 합계 9 |
이분 밀도 .
학생 투영 (대각선 0)의 10쌍을 전부 펼치면:
| 쌍 | 공유 활동 | 쌍 | 공유 활동 | ||
|---|---|---|---|---|---|
| (T1,T2) | E1, E2 | 2 | (T2,T4) | E1 | 1 |
| (T1,T3) | E1 | 1 | (T2,T5) | E1 | 1 |
| (T1,T4) | E1 | 1 | (T3,T4) | E1, E3 | 2 |
| (T1,T5) | E1 | 1 | (T3,T5) | E1 | 1 |
| (T2,T3) | E1 | 1 | (T4,T5) | E1 | 1 |
답 (나) 뉴먼 가중은 활동 크기 에 대해 쌍당 씩만 준다.
E1: · E2: · E3:
→ (T1,T2) , 나머지 8쌍 . 대비가 5배로 살아난다.
연습문제 2 — 같은 투영을 낳는 두 소속행렬 (역문제) (Exercise 2: Two Affiliation Matrices, One Projection)
| (가) 4인 활동 1개 | (나) 2인 활동 6개 | |
|---|---|---|
| 소속행렬 크기 | ||
| 이분 간선 수 | 4 | 12 |
| 학생 차수 | 1 1 1 1 | 3 3 3 3 |
| 투영 | 둘 다 가중치 전부 1인 — 완전히 동일 | |
| 뉴먼 가중 | ||
2. 오늘의 질문: 구조에서 속성으로 (From Structure to Attributes)
지금까지(단원 3-1 ~ 3-6) 우리는 선만 보았다. 누가 누구와 이어졌는지, 그 선들이 어떤 덩어리를 이루는지. 커뮤니티 탐지는 “데이터가 스스로 집단을 말하게” 하는 방법이었다.
그런데 학생에게는 이미 붙어 있는 라벨이 있다. 성별, 학년, 반, 출신 초등학교, 학원 여부, 성취수준, 다문화 배경, 특수교육 대상 여부. 오늘의 질문은 이것이다.
겹치면 동질성(homophily) — “비슷한 사람끼리 이어진다”
어긋나면 이질성(heterophily) — “다른 사람끼리 이어진다”
동질성은 사회학에서 가장 반복적으로 확인된 경험 법칙이다 (McPherson, Smith-Lovin & Cook 2001, Birds of a Feather). 오늘은 이것을 숫자로 재는 세 가지 도구를 배운다.
| 도구 | 기호 | 범위 | 부호 방향 | 강점 |
|---|---|---|---|---|
| E-I 지수 | 음수 = 동질성 | 손으로 셀 수 있다. 집단별·개인별로 쪼갤 수 있다 | ||
| 동류성 계수 | 양수 = 동질성 | 기준선이 이미 보정돼 있다 | ||
| 순열 검정 | — | “우연일 수 있나?”에 답한다 |
3. 오늘의 예시 네트워크 (The Working Example)
10명 학급. 남학생 6명 S1~S6, 여학생 4명 S7~S10. 친구 관계 15개(무방향).
| 학생 | 성별 | 이웃 | 차수 | 학생 | 성별 | 이웃 | 차수 |
|---|---|---|---|---|---|---|---|
| S1 | 남 | S2, S3 | 2 | S6 | 남 | S4, S5, S10 | 3 |
| S2 | 남 | S1, S3 | 2 | S7 | 여 | S3, S8, S10 | 3 |
| S3 | 남 | S1, S2, S4, S7, S8, S9 | 6 | S8 | 여 | S3, S7, S9 | 3 |
| S4 | 남 | S3, S5, S6 | 3 | S9 | 여 | S3, S8, S10 | 3 |
| S5 | 남 | S4, S6 | 2 | S10 | 여 | S6, S7, S9 | 3 |
차수 합 ✔ (악수 정리)
그림에서 눈으로 먼저 확인하자. 성별을 넘는 선은 S3에서 나가는 3개와 S6–S10 1개, 모두 4개뿐이다. 나머지 11개는 전부 같은 성 안에 있다.
4. E-I 지수의 정의 (Definition of the E-I Index)
학생 의 집단 라벨을 라 하고, 크로네커 델타를 쓴다.
무방향 인접행렬 에 대해 내부 간선 수 (Internal Links)과 외부 간선 수 (External Links)은
은 무방향이라 와 가 같은 간선을 두 번 세기 때문이다. 당연히 (전체 간선 수). 그리고
| 상황 | 해석 | |||
|---|---|---|---|---|
| 완전한 동질성 | 0 | 집단 간에 선이 하나도 없다 (완전 분리) | ||
| 절반씩 | 내부와 외부가 같은 수 | |||
| 완전한 이질성 | 0 | 같은 집단끼리는 선이 하나도 없다 |
간선 수가 다른 두 학급을 비교하기 위해서다. 30명 학급의 “외부 10, 내부 40”과 20명 학급의 “외부 5, 내부 20”은 원자료로는 다르지만 둘 다 으로 같은 성향이다.
5. 손 계산 — 15개 간선 전부 분류 (Classifying All 15 Edges)
정의를 그대로 따라 15개를 하나도 빼지 않고 센다. 이면 내부, 이면 외부.
| # | 간선 | 분류 | 한 줄 설명 | |||
|---|---|---|---|---|---|---|
| 1 | S1–S2 | 남 | 남 | 1 | 내부 | 남–남 |
| 2 | S1–S3 | 남 | 남 | 1 | 내부 | 남–남 |
| 3 | S2–S3 | 남 | 남 | 1 | 내부 | 남–남 |
| 4 | S3–S4 | 남 | 남 | 1 | 내부 | 남–남 |
| 5 | S4–S5 | 남 | 남 | 1 | 내부 | 남–남 |
| 6 | S4–S6 | 남 | 남 | 1 | 내부 | 남–남 |
| 7 | S5–S6 | 남 | 남 | 1 | 내부 | 남–남 |
| 8 | S7–S8 | 여 | 여 | 1 | 내부 | 여–여 |
| 9 | S8–S9 | 여 | 여 | 1 | 내부 | 여–여 |
| 10 | S9–S10 | 여 | 여 | 1 | 내부 | 여–여 |
| 11 | S7–S10 | 여 | 여 | 1 | 내부 | 여–여 |
| 12 | S3–S7 | 남 | 여 | 0 | 외부 | S3가 놓은 다리 |
| 13 | S3–S8 | 남 | 여 | 0 | 외부 | S3가 놓은 다리 |
| 14 | S3–S9 | 남 | 여 | 0 | 외부 | S3가 놓은 다리 |
| 15 | S6–S10 | 남 | 여 | 0 | 외부 | S6–S10, 유일한 또 하나의 다리 |
세어 보면
• 은 구간의 거의 절반 지점 — 상당히 강한 동질성.
• 다르게 읽으면: 내부 비율 , 외부 비율 . 차이가 %p, 그것이 곧 다.
• 즉 는 “내부 비율과 외부 비율의 차이”다.
이 관계를 식으로 정리해 두자. 이므로
검산: ✔ 이 형태 는 §12에서 결정적으로 쓰인다.
6. 집단별 E-I (Group-level E-I)
전체 하나로는 어느 쪽이 닫혀 있는지를 알 수 없다. 집단 에 대해 “한쪽 끝이라도 에 걸린 간선”만 보고 다시 센다.
| 집단 | 인원 | 내부 간선 | 어떤 간선인가 | 외부 간선 | 어떤 간선인가 | |
|---|---|---|---|---|---|---|
| 남 (6명) | 6 | 7 | S1–S2, S1–S3, S2–S3, S3–S4, S4–S5, S4–S6, S5–S6 | 4 | S3–S7, S3–S8, S3–S9, S6–S10 | |
| 여 (4명) | 4 | 4 | S7–S8, S8–S9, S9–S10, S7–S10 | 4 | S3–S7, S3–S8, S3–S9, S6–S10 |
내부는 잘 더해진다: ✔ (내부 간선은 한 집단에만 속한다)
외부는 안 된다: ✘ — 교차 간선은 양쪽 집단에서 각각 한 번씩, 총 두 번 세어지기 때문이다. 집단별 E-I는 “그 집단에서 본 세계”이지 전체의 부분이 아니다.
7. 개인별 E-I (Node-level E-I)
학생 한 명의 이웃만 보고 같은 식을 쓴다.
10명 전부 전개한다. (이웃 중 굵은 글씨가 다른 성별)
| 학생 | 성별 | 이웃 (다른 성별은 굵게) | 계산 | ||||
|---|---|---|---|---|---|---|---|
| S1 | 남 | S2, S3 | 2 | 2 | 0 | ||
| S2 | 남 | S1, S3 | 2 | 2 | 0 | ||
| S3 | 남 | S1, S2, S4, S7, S8, S9 | 6 | 3 | 3 | ||
| S4 | 남 | S3, S5, S6 | 3 | 3 | 0 | ||
| S5 | 남 | S4, S6 | 2 | 2 | 0 | ||
| S6 | 남 | S4, S5, S10 | 3 | 2 | 1 | ||
| S7 | 여 | S3, S8, S10 | 3 | 2 | 1 | ||
| S8 | 여 | S3, S7, S9 | 3 | 2 | 1 | ||
| S9 | 여 | S3, S8, S10 | 3 | 2 | 1 | ||
| S10 | 여 | S6, S7, S9 | 3 | 2 | 1 |
검산: ✔
(내부 간선은 양 끝에서 두 번 세어진다)
✔
개인 E-I의 평균은 전체 E-I가 아니다 (Averaging Individual E-I Is Not the Overall E-I)
전체 과 다르다. 그런데 차수로 가중하면 정확히 일치한다.
• S3만 이다. 차수도 6으로 가장 크다. 남녀 양쪽에 똑같이 3명씩 친구가 있는 유일한 균형 다리. 남녀 협동 모둠을 짤 때 이 학생이 핵심이다.
• S6도 다리지만 으로 약하다(여학생 친구 1명). S3가 결석하면 남녀 사이 연결은 S6–S10 단 하나로 줄어든다. 매우 취약한 구조.
• 인 네 명(S1, S2, S4, S5)은 이성 친구가 0명이다. 소외가 아니라 (차수는 2~3으로 정상) 성별 안에 완전히 갇힌 상태다.
8. 함정 ①: 집단 크기가 E-I를 좌우한다 (Trap 1: Group Size Drives E-I)
여기서부터가 이 단원의 핵심이다. 명 중 크기 인 집단을 생각하자. 간선이 완전히 무작위로 아무 쌍에나 놓인다고 하면, 이 집단에 걸리는 간선 중 내부가 될 쌍과 외부가 될 쌍의 개수는 이미 정해져 있다.
우리 예시에 적용 () (Applying It to Our Example)
| 집단 | 내부 쌍 | 외부 쌍 | 기대 | 관측 | 차이 | |
|---|---|---|---|---|---|---|
| 남 | 6 | |||||
| 여 | 4 |
여학생 집단의 은 “중립”이 아니다. 우연히 섞였다면 이 나왔어야 한다. 관측이 기대보다 0.6이나 아래 — 두 집단 중 여학생 쪽이 오히려 더 강하게 닫혀 있다 (남학생은 기대 대비 ).
소수 집단은 가만히 있어도 E-I가 에 가깝게 나온다. 상대할 “바깥”이 훨씬 넓기 때문이다.
기대 E-I가 0이 되는 지점 (Where the Expected E-I Is Zero)
이려면 분자가 0, 즉 외부 쌍 = 내부 쌍:
25명 학급이라면 . 17명(68%)이 되어야 비로소 기대 E-I가 0이다.
| (25명 중) | 1 | 2 | 3 | 5 | 8 | 10 | 13 | 15 | 17 | 20 | 24 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 기대 | +1.000 | +0.957 | +0.913 | +0.818 | +0.659 | +0.538 | +0.333 | +0.176 | 0.000 | −0.310 | −0.840 |
“다문화 배경 학생 3명의 E-I가 이니 잘 융화되어 있다.”
25명 학급에서 의 기대값은 이다. 은 기대보다 낮다. 즉 이 3명은 오히려 자기들끼리 더 뭉쳐 있다. 소수 집단의 E-I를 절대 0을 기준으로 읽지 말 것.
9. 기준선: 무엇과 비교할 것인가 (Baselines: What Do We Compare Against?)
함정 ①의 해법은 하나다. 관측값을 “우연이라면 얼마였을까”와 비교한다. 그 “우연”을 정의하는 방식이 두 가지 있다.
기준선 ① 노드쌍 기준 (node-pair baseline)
“간선이 개 쌍 중 아무 데나 똑같은 확률로 놓인다.”
| 쌍의 종류 | 계산 | 개수 |
|---|---|---|
| 남–남 쌍 | 15 | |
| 여–여 쌍 | 6 | |
| 내부 쌍 합계 | 21 | |
| 남–여 쌍 (외부) | 24 | |
| 전체 | 45 |
기준선 ② 배열 모형 (configuration model, degree-preserving)
노드쌍 기준은 차수를 무시한다. 그런데 S3 한 명이 차수 6이라 남학생 쪽 “간선 끝(edge stub)”이 훨씬 많다. 간선 끝을 무작위로 이어 붙인다면 남–남 간선이 저절로 많아진다.
집단 의 간선 끝 비율을 라 하자.
| 집단 | 차수 합 | ||
|---|---|---|---|
| 남 | |||
| 여 | |||
| 합 | 30 ✔ | 1.0 ✔ |
무작위로 이었을 때 한 간선이 내부일 확률은 , 외부일 확률은 . 따라서
검산: ✔
| 기준선 | 관측 | 관측 − 기준선 | 읽는 법 | |
|---|---|---|---|---|
| ① 노드쌍 | +0.0667 | −0.4667 | −0.5333 | 차수를 무시한 비교 |
| ② 배열 모형 | −0.0400 | −0.4667 | −0.4267 | 차수를 인정한 뒤의 순수 동질성 |
10. 혼합행렬 (The Mixing Matrix)
지금까지 센 것을 표 하나로 정리한 것이 혼합행렬이다. 먼저 간선 개수로:
| 남 | 여 | 행합 | |
|---|---|---|---|
| 남 | 7 | 4 | 11 |
| 여 | 4 | 4 | 8 |
대각선은 내부 간선 수 그대로, 비대각선은 교차 간선 4개가 양쪽에 한 번씩 적힌다. 이대로 다 더하면 이므로, 뉴먼은 합이 1이 되도록 다음처럼 정규화한다.
| 남 | 여 | 행합 | |
|---|---|---|---|
| 남 | |||
| 여 | |||
| 열합 | 0.600000 | 0.400000 | ✔ |
전개해서 합이 1인지 확인:
행합이 §9에서 차수로 구한 와 정확히 같다: ✔ (당연하다 — 행합은 “남학생에 붙은 간선 끝의 비율”이므로)
그리고 대각합은
: 실제로 같은 집단 안에 있는 간선의 비율
: 우연이라면 그랬을 비율
차이 : 초과분 — 이것이 곧 동질성의 크기다
11. 뉴먼의 동류성 계수 (Newman's Assortativity Coefficient)
§10의 “초과분 0.2133”을 그대로 쓰면 최대값이 상황마다 달라 비교가 안 된다. 가능한 최대 초과분은 일 때의 이므로, 그것으로 나눈다.
우리 예시에 대입하면
| 뜻 | 대응하는 | |
|---|---|---|
| 완전한 동질성 (집단 간 간선 0) | ||
| 우연과 구별되지 않음 | ||
| 음수 | 이질성 (기대보다 섞여 있음) |
을 대입하면 — 상관계수가 보다 작을 수는 없다. 모순 같지만, 실은 이 애초에 불가능하다. 남학생 쪽 간선 끝이 18개, 여학생 쪽이 12개이므로 교차 간선은 최대 12개, 따라서 남–남 간선이 최소 3개는 남는다. 그때 이고
.
차수 분포가 의 바닥을 정한다. 음수 을 “에서 얼마나 멀리”로 읽으면 안 된다.
12. 은 기준선 보정된 E-I다 (r as a Baseline-corrected E-I)
E-I와 은 부호도 반대고 식도 달라 보인다. 그런데 §5와 §9에서 이미 두 개의 다리를 놓았다.
이 둘을 뒤집어 의 정의식에 넣는다.
분자를 전개하면
분모를 전개하면
나누면 이 약분되어
수치로 검산 (Numerical Check)
§11에서 정의식으로 구한 , R의 assortativity_nominal()이 준
와 완전히 일치한다.
분자 = 관측이 기준선보다 얼마나 아래인가 (동질성의 크기)
분모 = 기준선에서 완전 동질성()까지 남은 거리
즉 은 “기준선에서 출발해 완전 동질성까지 가는 길의 몇 %를 갔는가”이다. E-I를 버리고 을 배우는 게 아니라, 은 E-I를 기준선으로 보정하고 0~1로 다시 눈금을 매긴 것이다.
| 확인 | 유도 | 결과 |
|---|---|---|
| 이면? | ||
| 이면? | 분자 | |
| 이면? | 분자 음수, 분모 양수 | (이질성) |
13. 연속 속성: 차수 동류성 (Numeric Attributes: Degree Assortativity)
성별·인종은 범주지만, 성적·키·차수는 숫자다. 숫자 속성에는 델타 대신 피어슨 상관을 쓴다. 각 간선의 두 끝 값을 라 하면
가장 널리 쓰이는 것이 속성 = 차수인 경우다. 15개 간선의 (차수, 차수)를 전부 적으면
| # | 간선 | # | 간선 | ||||
|---|---|---|---|---|---|---|---|
| 1 | S1–S2 | (2,2) | 4 | 9 | S8–S9 | (3,3) | 9 |
| 2 | S1–S3 | (2,6) | 12 | 10 | S9–S10 | (3,3) | 9 |
| 3 | S2–S3 | (2,6) | 12 | 11 | S7–S10 | (3,3) | 9 |
| 4 | S3–S4 | (6,3) | 18 | 12 | S3–S7 | (6,3) | 18 |
| 5 | S4–S5 | (3,2) | 6 | 13 | S3–S8 | (6,3) | 18 |
| 6 | S4–S6 | (3,3) | 9 | 14 | S3–S9 | (6,3) | 18 |
| 7 | S5–S6 | (2,3) | 6 | 15 | S6–S10 | (3,3) | 9 |
| 8 | S7–S8 | (3,3) | 9 | 합계 | 166 | ||
세 개의 합을 각각 로 나눈다.
| 항 | 원합 | |
|---|---|---|
| 166 | ||
| 51 | ||
| 201 |
반대로 실제 고교 데이터(§15)는 — 친구 많은 아이들끼리 뭉치는 양(+)의 차수 동류성. 사회 네트워크의 일반적 특징이다.
14. 순열 검정 (Permutation Test)
이 기준선 보다 아래인 건 알았다. 그런데 이 정도 차이가 우연히 나올 수도 있지 않나? 10명뿐인데.
답하는 방법: 구조는 그대로 두고 라벨만 뒤섞는다. 15개 간선은 건드리지 않고, “남 6명 / 여 4명”이라는 라벨만 10명에게 다시 배분한다. 경우의 수는 가지 — 전부 셀 수 있다. (표본 추출이 아니라 완전열거이므로 값이 정확하다.)
| E-I 값 | −0.600 | −0.467 | −0.333 | −0.200 | −0.067 | +0.067 | +0.200 | +0.333 | +0.467 | +0.600 | 합 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 경우의 수 | 1 | 3 | 12 | 19 | 38 | 58 | 42 | 25 | 11 | 1 | 210 |
(E-I는 꼴이라 간격으로만 값이 나온다.)
귀무분포의 평균 = 노드쌍 기준선 (정확히) (The Null Mean Equals the Dyad Baseline Exactly)
210가지의 평균은 정확히 , §9의 노드쌍 기준선과 소수점까지 같다. 우연이 아니라 필연이다. 간선 하나를 고정하고 라벨을 무작위로 배분하면, 그 간선의 두 끝이 같은 라벨을 받을 확률은
이므로 , , 따라서
15. 실전: Faux Magnolia 고교 (Real Data: Faux Magnolia High)
ergm 패키지의 faux.magnolia.high. 실제 미국 고교
친구 네트워크(Add Health)를 통계 모형으로 재현한 시뮬레이션 자료다.
| 학생 수 | 1461명 | 간선 수 | 974개 | 밀도 | 0.000913 |
| 성별 | 여 768, 남 693 | ||||
| 학년 | 7학년 185, 8학년 210, 9학년 317, 10학년 299, 11학년 257, 12학년 193 | ||||
| 인종 | White 1053, Black 261, Hisp 68, Asian 48, NatAm 24, Other 7 | ||||
세 속성 비교 (Comparing Three Attributes)
| 속성 | 집단 수 | 관측 | 기대 | |||
|---|---|---|---|---|---|---|
| 학년 (Grade) | 6 | 820 | 154 | −0.6838 | +0.6529 | 0.8087 |
| 인종 (Race) | 6 | 787 | 187 | −0.6160 | −0.3047 | 0.4478 |
| 성별 (Sex) | 2 | 689 | 285 | −0.4148 | −0.0308 | 0.3962 |
관측 E-I만 보면 인종()이 성별()보다 훨씬 동질적으로 보인다. 그런데 기준선이 각각 와 로 크게 다르다. 인종은 White가 72%를 차지해서 가만히 있어도 내부 간선이 많아진다. 보정하면 대 — 차이가 훨씬 줄어든다.
반면 학년은 기준선이 (6개 집단이 고르게 나뉘어 있어 우연이면 섞일 수밖에 없음)인데 관측이 . 기준선 대비 낙차 , 로 압도적 1위.
학년: 얼마나 강한가 (Grade: How Strong Is It)
| 학년 차이 | 0 (같은 학년) | 1 (인접) | 2 | 3 | 4 |
|---|---|---|---|---|---|
| 간선 수 | 820 | 114 | 31 | 7 | 2 |
| 비율 | 84.2% | 11.7% | 3.2% | 0.7% | 0.2% |
같은 학년이거나 한 학년 차이인 간선이 . 학년을 두 칸 이상 건너뛰는 친구 관계는 40개뿐이다.
| 학년 | 인원 | 관측 | 기대(노드쌍) | ||
|---|---|---|---|---|---|
| 7 | 185 | 110 | 17 | −0.7323 | +0.8655 |
| 8 | 210 | 165 | 29 | −0.7010 | +0.8458 |
| 9 | 317 | 152 | 50 | −0.5050 | +0.7573 |
| 10 | 299 | 151 | 83 | −0.2906 | +0.7727 |
| 11 | 257 | 152 | 80 | −0.3103 | +0.8078 |
| 12 | 193 | 90 | 49 | −0.2950 | +0.8592 |
저학년(7·8학년)이 으로 가장 닫혀 있고, 고학년으로 갈수록 까지 열린다. 학년이 올라갈수록 학년 경계를 넘는 관계가 늘어난다.
인종: 집단 크기 함정의 실제 사례 (Race: The Group-Size Trap in Practice)
| 집단 | 인원 | 관측 | 기대(노드쌍) | 관측 − 기대 | ||
|---|---|---|---|---|---|---|
| Other | 7 | 0 | 5 | +1.0000 | +0.9959 | +0.004 |
| NatAm | 24 | 3 | 29 | +0.8125 | +0.9841 | −0.172 |
| Asian | 48 | 7 | 40 | +0.7021 | +0.9673 | −0.265 |
| Hisp | 68 | 1 | 57 | +0.9655 | +0.9530 | +0.013 |
| Black | 261 | 85 | 73 | −0.0759 | +0.8045 | −0.880 |
| White | 1053 | 691 | 170 | −0.6051 | −0.1263 | −0.479 |
Other(7명)의 은 “완벽히 융화”가 아니다. 7명이 서로 아는 사이일 확률 자체가 거의 없다(기대 ). 정보가 거의 없는 값이다.
Hisp(68명)의 도 기대 보다 높다 — 기대보다도 더 흩어져 있다.
반대로 Black(261명)의 는 0 근처라 “중립”처럼 보이지만 기대 대비 , 이 데이터에서 가장 강하게 뭉친 집단이다.
소수 집단의 E-I는 반드시 자기 크기의 기대값과 나란히 놓고 읽어야 한다.
순열 검정 (성별, 1000회) (Permutation Test on Sex)
| 관측 | −0.4148 | 순열 평균 | −0.0025 | 순열 sd | 0.0335 |
| 순열 최소값 | −0.1129 | −12.31 |
1000번 섞어서 가장 동질적이었던 배치조차 로, 관측 의 근처에도 못 갔다. 표본이 크면 이렇게 귀무분포가 좁아져서 작은 차이도 유의해진다 — 그래서 큰 데이터에서는 값보다 효과 크기()를 봐야 한다.
16. 함정 ②: 동질성 ≠ 커뮤니티 (Trap 2: Homophily is not Community)
단원 3-4에서 배운 커뮤니티 탐지는 “구조가 말하는 집단”을 찾는다. 오늘의 동질성은 “미리 준 라벨”과 구조를 대조한다. 둘은 같지 않다.
10인 예시에 Louvain을 돌리면 3개 집단이 나온다.
| 분할 | 집단 | ||||||
|---|---|---|---|---|---|---|---|
| 성별 (2집단) | {S1…S6} / {S7…S10} | 0.2133 | 11 | 4 | −0.4667 | −0.0400 | 0.4444 |
| Louvain (3집단) | {S1,S2,S3} / {S4,S5,S6} / {S7,S8,S9,S10} | 0.3244 | 10 | 5 | −0.3333 | +0.3156 | 0.4932 |
ARI(Louvain, 성별) — 상당히 겹치지만 같지는 않다. Louvain은 남학생 6명을 둘로 쪼갠다(S3의 삼각형과 S4·S5·S6의 삼각형).
Louvain 분할의 은 성별의 보다 덜 음수다. “성별이 더 강한 집단 기준”처럼 보인다. 그런데 은 로 성별의 보다 크다. 어느 쪽이 맞나?
이 맞다. 기준선이 다르기 때문이다. 3집단으로 쪼개면 우연히 같은 집단에 놓일 확률이 줄어들어 기준선이 에서 으로 크게 올라간다. 같은 기준으로 재면:
| 분할 | (낙차) | (갈 수 있는 거리) | |
|---|---|---|---|
| 성별 | |||
| Louvain |
FMH에서는 어떤가 (What Happens in FMH)
| 분할 | 읽는 법 | |
|---|---|---|
| 학년 (Grade) | 0.6684 | 학년은 사실상 구조적 커뮤니티 그 자체 |
| 성별 (Sex) | 0.1920 | 동질성은 있지만() 덩어리를 만들지는 않음 |
| 인종 (Race) | 0.1557 | 동질성은 학년 다음으로 강한데() 는 가장 낮음 |
학년: 동질성 강함 + 높음 → 속성이 곧 구조. 학년 벽이 물리적으로 존재한다.
인종: 동질성 강함() + 낮음(0.156) → 속성이 구조를 만들지는 않는다. 인종별 선호가 있어도, 인종이 학교를 덩어리로 쪼개지는 않는다 — 학년이 먼저 쪼개기 때문이다.
은 “선호가 있는가”를 재고, 는 “그 선호가 실제로 벽을 만들었는가”를 잰다. 두 질문은 다르다.
17. R 검증 (Verification in R)
sna/network와 igraph는 같은 이름의 함수를
서로 가린다. igraph::degree(), network::mixingmatrix()처럼
패키지 이름을 붙여 부를 것. 또 E-I 지수는 sna·igraph
어디에도 내장 함수가 없다 — 직접 세야 한다.
library(igraph)
## ---- 예시 네트워크 ----
el <- rbind(c(1,2),c(1,3),c(2,3),c(3,4),c(4,5),c(4,6),c(5,6), # 남 내부 7
c(7,8),c(8,9),c(9,10),c(7,10), # 여 내부 4
c(3,7),c(3,8),c(3,9),c(6,10)) # 교차 4
g <- graph_from_edgelist(el, directed = FALSE)
V(g)$name <- paste0("S", 1:10)
sex <- c(rep("남", 6), rep("여", 4))
## ---- E-I 지수 (직접 계산) ----
same <- sex[el[,1]] == sex[el[,2]]
IL <- sum(same); EL <- sum(!same)
c(IL = IL, EL = EL, EI = (EL - IL) / (IL + EL))
# IL EL EI
# 11 4 -0.4666667
## ---- 기준선 ① 노드쌍 ----
ip <- sum(choose(table(sex), 2)); ep <- prod(table(sex))
(ep - ip) / (ep + ip)
# [1] 0.06666667
## ---- 기준선 ② 배열 모형 ----
d <- igraph::degree(g)
a <- tapply(d, sex, sum) / sum(d) # 남 0.6, 여 0.4
EI_exp <- 1 - 2 * sum(a^2)
EI_exp
# [1] -0.04
## ---- 혼합행렬 e 와 동류성 계수 r ----
e <- matrix(0, 2, 2, dimnames = list(c("남","여"), c("남","여")))
for (k in seq_len(nrow(el))) {
i <- sex[el[k,1]]; j <- sex[el[k,2]]
if (i == j) e[i,i] <- e[i,i] + 1 else { e[i,j] <- e[i,j] + 0.5; e[j,i] <- e[j,i] + 0.5 }
}
e <- e / sum(e); round(e, 6)
# 남 여
# 남 0.466667 0.133333
# 여 0.133333 0.266667
r <- (sum(diag(e)) - sum(a^2)) / (1 - sum(a^2))
c(r_수식 = r, r_igraph = assortativity_nominal(g, as.integer(factor(sex))))
# r_수식 r_igraph
# 0.4444444 0.4444444
## ---- §12 항등식 검증 ----
EI <- (EL - IL) / (IL + EL)
all.equal((EI_exp - EI) / (1 + EI_exp), r)
# [1] TRUE
## ---- 차수 동류성 ----
assortativity_degree(g)
# [1] -0.2681159
## ---- 정확 순열 검정: C(10,4) = 210가지 전부 ----
combs <- combn(10, 4) # 여학생이 될 4명을 고르는 모든 방법
vals <- apply(combs, 2, function(f) {
lab <- rep("남", 10); lab[f] <- "여"
s <- lab[el[,1]] == lab[el[,2]]
(sum(!s) - sum(s)) / 15
})
c(경우수 = length(vals), 평균 = mean(vals), p = mean(vals <= EI + 1e-9))
# 경우수 평균 p
# 210.00000000 0.06666667 0.01904762
## ---- 실전 데이터 ----
library(ergm); library(intergraph)
data(faux.magnolia.high)
G <- asIgraph(faux.magnolia.high)
E1 <- as_edgelist(G, names = FALSE)
for (a_nm in c("Grade", "Race", "Sex")) {
lab <- igraph::vertex_attr(G, a_nm)
s <- lab[E1[,1]] == lab[E1[,2]]
cat(sprintf("%-6s E-I = %+.4f r = %+.4f\n", a_nm,
(sum(!s) - sum(s)) / length(s),
assortativity_nominal(G, as.integer(factor(lab)))))
}
# Grade E-I = -0.6838 r = +0.8087
# Race E-I = -0.6160 r = +0.4478
# Sex E-I = -0.4148 r = +0.3962
18. 교실 적용 (Classroom Application)
무엇을 언제 쓰는가 (Which Measure When)
| 알고 싶은 것 | 도구 | 주의 |
|---|---|---|
| 우리 반이 성별로 갈라졌나? | 전체 + | 기준선 없이 만 보고하지 말 것 |
| 어느 집단이 더 닫혀 있나? | 집단별 vs | 소수 집단은 가 정상. 0이 기준이 아니다 |
| 누가 다리 역할인가? | 개인별 | 이고 차수가 큰 학생 |
| 여러 속성 중 뭐가 제일 센가? | 로 비교하면 집단 수·크기에 속는다 | |
| 우연일 가능성은? | 순열 검정 | 라벨만 섞고 구조는 고정 |
| 그 선호가 벽을 만들었나? | (모듈도) | 이 높아도 는 낮을 수 있다 |
실제 개입으로 옮기기 (Turning It Into an Intervention)
2. 취약한 다리 점검 — 우리 예시에서 남녀를 잇는 학생은 S3(3개 선)과 S6(1개 선)뿐이다. S3 한 명을 빼면 교차 간선이 4개 → 1개로 줄어 가 까지 떨어진다. “한 명에게 의존하는 통합”은 통합이 아니다. 다리를 여러 개 만드는 것이 목표.
3. 소수 집단 보고서 쓰기 — “다문화 학생 3명의 E-I는 ”이라고만 쓰면 읽는 사람이 반드시 오해한다. “기대 , 관측 — 기대보다 낮음”으로 쓴다.
4. 학년 초 → 학년 말 비교 — 같은 학급을 두 번 재면 의 변화가 개입 효과다. 단, 간선 수가 바뀌었어도 는 으로 나눠져 있어 비교 가능하다. 전학·결석으로 인원이 바뀌었다면 기준선도 다시 계산해야 한다.
5. 속성 여러 개를 한꺼번에 — 성별, 학원 여부, 출신 초등학교, 성취수준으로 각각 을 구해 막대그래프로 세우면 “우리 반을 실제로 가르는 축”이 무엇인지 한눈에 보인다. 성별이 제일 클 거라고 지레짐작하지 말 것 — FMH에서는 학년이 압도적이었다.
19. 연습문제 (Exercises)
| 남 내부 (5개) | S1–S2, S1–S3, S2–S3, S3–S4, S4–S5 |
|---|---|
| 여 내부 (7개) | S6–S7, S6–S8, S7–S8, S9–S10, S10–S11, S11–S12, S9–S12 |
| 교차 (2개) | S3–S6, S5–S9 |
(나) 집단별 , 를 구하고, 각 집단의 노드쌍 기대값과 비교해 어느 집단이 더 닫혀 있는지 판정하라.
(다) 12명 전원의 차수를 구하고, , , , 를 구하라.
(라) 혼합행렬 를 만들고(합이 1인지 확인), 을 정의식과 §12 항등식 두 가지 방법으로 각각 구해 일치하는지 확인하라.
(마) 개인별 를 12명 전부 구하고, 가장 좋은 다리 학생을 지목하라.
§20 해설 — 먼저 풀고 맞춰 볼 것.
(가) 전학생 집단의 관측 를 구하라.
(나) 일 때 노드쌍 기대값 을 구하라.
(다) 담임이 “E-I가 로 양수이니 전학생들이 잘 융화되었다”고 보고서에 썼다. 이 해석이 맞는지 판정하고, 맞다면 왜 맞는지 / 틀리다면 어떻게 고쳐 써야 하는지 한 문장으로 쓰라.
(라) 이 학급()에서 기대 E-I가 0이 되는 집단 크기를 공식으로 구하라. 정수가 아니라면, 실제로 양수/음수가 갈리는 두 정수를 찾아 값을 확인하라.
§20 해설 — 먼저 풀고 맞춰 볼 것.
20. 해설과 답 (Solutions)
연습문제 1 해설 (Solution to Exercise 1)
(가) 14개 간선 전부 분류
| # | 간선 | 분류 | # | 간선 | 분류 | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | S1–S2 | 남 | 남 | 1 | 내부 | 8 | S7–S8 | 여 | 여 | 1 | 내부 |
| 2 | S1–S3 | 남 | 남 | 1 | 내부 | 9 | S9–S10 | 여 | 여 | 1 | 내부 |
| 3 | S2–S3 | 남 | 남 | 1 | 내부 | 10 | S10–S11 | 여 | 여 | 1 | 내부 |
| 4 | S3–S4 | 남 | 남 | 1 | 내부 | 11 | S11–S12 | 여 | 여 | 1 | 내부 |
| 5 | S4–S5 | 남 | 남 | 1 | 내부 | 12 | S9–S12 | 여 | 여 | 1 | 내부 |
| 6 | S6–S7 | 여 | 여 | 1 | 내부 | 13 | S3–S6 | 남 | 여 | 0 | 외부 |
| 7 | S6–S8 | 여 | 여 | 1 | 내부 | 14 | S5–S9 | 남 | 여 | 0 | 외부 |
검산(다른 길): ✔
값의 의미 — 는 의 71% 지점. 내부 비율 , 외부 비율 , 차이 %p. 본문 예시()보다 훨씬 강한 동질성이다.
(나) 집단별 E-I와 그 기대값
| 집단 | 관측 | 내부 쌍 | 외부 쌍 | 기대 | 관측 − 기대 | |||
|---|---|---|---|---|---|---|---|---|
| 남 | 5 | 5 | 2 | |||||
| 여 | 7 | 7 | 2 |
그러나 기대 대비로 보면 남학생이 더 닫혀 있다: 낙차 대 .
소수 집단(남 5명)은 기대값이 으로 높은데도 까지 내려왔기 때문이다.
왜 그 값인가 — 남학생은 5명뿐이라 “바깥”이 7명으로 더 넓다. 그런데도 5개 관계를 전부 안쪽에 쓰고 밖으로는 2개만 냈다. 반면 여학생은 7명이라 안쪽 상대가 이미 많다.
(다) 차수와 배열 모형 기준선
| 학생 | 성별 | 이웃 | 차수 | 학생 | 성별 | 이웃 | 차수 |
|---|---|---|---|---|---|---|---|
| S1 | 남 | S2, S3 | 2 | S7 | 여 | S6, S8 | 2 |
| S2 | 남 | S1, S3 | 2 | S8 | 여 | S6, S7 | 2 |
| S3 | 남 | S1, S2, S4, S6 | 4 | S9 | 여 | S10, S12, S5 | 3 |
| S4 | 남 | S3, S5 | 2 | S10 | 여 | S9, S11 | 2 |
| S5 | 남 | S4, S9 | 2 | S11 | 여 | S10, S12 | 2 |
| S6 | 여 | S7, S8, S3 | 3 | S12 | 여 | S11, S9 | 2 |
차수 합 ✔
| 집단 | 차수 합 전개 | 합 | ||
|---|---|---|---|---|
| 남 | 12 | |||
| 여 | 16 | |||
| 합 | — | 28 ✔ | 1.0 ✔ |
값의 의미 — 기준선이 아주 살짝 음수다. 여학생이 인원도 많고(7명) 차수 합도 크지만(16), 그 차이가 크지 않아 배열 모형 기준선은 거의 0에 붙어 있다. 관측 는 이 기준선보다 아래 — 거의 전부가 진짜 동질성이다.
(라) 혼합행렬과
간선 개수 행렬: 대각선은 내부 간선 수, 비대각선은 교차 2개를 양쪽에.
| 남 | 여 | |
|---|---|---|
| 남 | 5 | 2 |
| 여 | 2 | 7 |
정규화: , (, )
| 남 | 여 | 행합 | |
|---|---|---|---|
| 남 | ✔ | ||
| 여 | ✔ |
합 검산: ✔
행합이 (다)에서 차수로 구한 와 정확히 일치 ✔
방법 1 — 정의식
방법 2 — §12 항등식
assortativity_nominal()도 )본문 예시의 보다 훨씬 크다. 이 학급의 성별 분리는 상당히 심각한 수준이다.
(마) 개인별 E-I와 다리 학생
| 학생 | 성별 | 계산 | ||||
|---|---|---|---|---|---|---|
| S1 | 남 | 2 | 2 | 0 | ||
| S2 | 남 | 2 | 2 | 0 | ||
| S3 | 남 | 4 | 3 | 1 | ||
| S4 | 남 | 2 | 2 | 0 | ||
| S5 | 남 | 2 | 1 | 1 | ||
| S6 | 여 | 3 | 2 | 1 | ||
| S7 | 여 | 2 | 2 | 0 | ||
| S8 | 여 | 2 | 2 | 0 | ||
| S9 | 여 | 3 | 2 | 1 | ||
| S10 | 여 | 2 | 2 | 0 | ||
| S11 | 여 | 2 | 2 | 0 | ||
| S12 | 여 | 2 | 2 | 0 |
검산: ✔ · ✔
S5는 차수가 2라 이성 친구가 1명뿐 — 그 관계 하나가 끊기면 다리가 사라진다. S3은 로 값은 나쁘지만 차수 4에 같은 쪽 친구 3명 + 반대쪽 1명을 쥐고 있어 남학생 집단 전체를 여학생 쪽으로 끌어올 힘이 있다.
개인 E-I는 차수와 함께 읽어야 한다 — 차수 2에서 나온 과 차수 6에서 나온 은 전혀 다른 값이다.
교실 해석 —
연습문제 2 해설 (Solution to Exercise 2)
(가) 관측 E-I
(나) 기대값
| 항 | 계산 | 값 |
|---|---|---|
| 내부 쌍 | 3 | |
| 외부 쌍 | 81 | |
| 기대 |
관측 − 기대 — 관측이 기대보다 낮다.
(다) 담임의 해석 판정
이 양수인 것은 융화의 증거가 아니라 3명이라는 집단 크기의 산물이다. 3명 사이에는 쌍이 3개뿐이고 바깥으로는 81개 쌍이 있으니, 관계를 아무렇게나 맺어도 E-I는 근처가 나온다.
고쳐 쓰면: “전학생 3명의 E-I는 로, 같은 크기 집단의 기대값 보다 낮다. 즉 기대보다 자기들끼리 조금 더 뭉쳐 있으며, 융화되었다고 볼 근거는 없다.”
왜 그런가 — 원자료로 확인: 3명 사이 가능한 쌍 3개 중 1개가 실제 관계다(비율 ). 바깥으로 가능한 쌍 81개 중 14개(비율 ). 안쪽 밀도가 바깥쪽의 약 1.9배다. E-I가 양수인 것과 아무 상관없이, 이 3명은 서로에게 더 붙어 있다.
(라) 기대 E-I가 0이 되는 집단 크기
정수가 아니므로 20과 21을 직접 확인한다.
| 내부 쌍 | 외부 쌍 | 부호 | ||
|---|---|---|---|---|
| 20 | 양수 | |||
| 21 | 음수 |
즉 30명 학급에서 어떤 집단의 E-I가 “0보다 작으니 동질적”이라고 말하려면 그 집단이 21명 이상이어야 한다. 그보다 작으면 E-I는 거의 항상 양수이고, 그 양수는 동질성에 대해 아무것도 말해 주지 않는다.
학급 크기 에서 어떤 집단이든 E-I를 보고할 때는 반드시 를 같이 계산해 나란히 적는다. 특수교육 대상, 다문화 배경, 전학생, 특정 학원 수강생 — 학교에서 관심 갖는 집단은 거의 전부 소수 집단이고, 따라서 거의 전부 E-I가 양수로 나온다. 기준선 없는 E-I 보고는 “소수 집단은 잘 융화되어 있다”는 결론을 자동 생산하는 기계다.