"소년만화 느낌이 나니까 다른 소년만화를 넣어보자." 흔한 접근이고, 저도 그럴 거라고 생각했습니다. 그런데 재보니 소년만화끼리는 서로 별로 안 닮았습니다.
MAL 데이터의 계층 태그(demographics)는 다섯 종입니다 — 소년(Shounen)· 청년(Seinen)·소녀(Shoujo)·여성(Josei)·아동(Kids). 이걸로 두 가지를 쟀습니다.
1. 계층별 고립도
먼저 장르 글과 같은 측정입니다. 작품마다 프랜차이즈를 뺀 최근접 이웃의 유사도를 구해 계층별로 모았습니다.
| 계층 | 편수 | 중앙값 | 0.7 미만 |
|---|---|---|---|
| Kids (아동) | 6 | 0.714 | 33% |
| Seinen (청년) | 108 | 0.722 | 36% |
| Shounen (소년) | 260 | 0.722 | 36% |
| Josei (여성) | 14 | 0.734 | 21% |
| 태그 없음 | 373 | 0.747 | 27% |
| Shoujo (소녀) | 42 | 0.788 | 17% |
여기서 이미 한 가지가 보입니다. 소녀만화(0.788)가 가장 쉽고, 소년· 청년만화(둘 다 0.722)가 가장 어렵습니다. 그리고 계층 태그가 아예 없는 373편(47%)이 태그 있는 대부분보다 오히려 덜 고립돼 있습니다.
2. 계층이 실제로 군집을 이루는가
고립도만으로는 "같은 계층끼리 가까운가"를 알 수 없습니다. 그래서 계층 쌍별 평균 유사도를 직접 구했습니다. 계층이 하나만 붙은 작품끼리, 같은 프랜차이즈는 제외했습니다.
| 소녀 | 여성 | 소년 | 청년 | 아동 | |
|---|---|---|---|---|---|
| 소녀 Shoujo | 0.613 | 0.572 | 0.522 | 0.506 | 0.490 |
| 여성 Josei | 0.573 | 0.594 | 0.489 | 0.495 | 0.483 |
| 소년 Shounen | 0.507 | 0.471 | 0.490 | 0.472 | 0.442 |
| 청년 Seinen | 0.490 | 0.482 | 0.478 | 0.474 | 0.455 |
| 아동 Kids | 0.480 | 0.483 | 0.450 | 0.456 | — |
밝은 값이 대각선, 즉 같은 계층끼리의 평균입니다. 아동-아동은 표본이 20쌍 미만이라 생략했습니다.
소녀·여성향은 군집이 맞습니다
소녀-소녀 0.613, 여성-여성 0.594. 둘 다 자기 계층이 자기 행의 최댓값이고, 서로(0.572·0.573)도 가깝습니다. 소녀만화와 여성만화는 실제로 하나의 이웃 동네를 이룹니다.
소년·청년향은 군집이 아닙니다
소년-소년 0.490 < 소년-소녀 0.507
청년-청년 0.474 < 청년-소녀 0.490
즉 소년만화는 다른 소년만화보다 소녀만화와 더 닮았습니다. 청년만화도 같습니다. 자기 계층이 자기 행의 최댓값이 아닙니다.
이유는 규모입니다. 소년만화 260편은 이 풀의 3분의 1이고, 그 안에 배틀물· 스포츠물·개그물·이세계물이 전부 들어 있습니다. "소년만화"는 이야기의 종류가 아니라 게재지의 독자층 표기일 뿐이라, 유사도가 읽는 줄거리 구조와는 대응하지 않습니다.
반면 소녀만화 42편은 규모가 작고 실제로 서사가 비슷합니다 — 관계와 감정이 중심이고 사건 구조가 반복됩니다.
3. 게임에서 어떻게 쓰나
- "소년만화 느낌"으로 후보를 좁히지 마세요. 0.49는 거의 무작위 수준입니다. 배틀물이 잡혔다면 "다른 소년만화"가 아니라 "다른 배틀물"로 좁혀야 합니다.
- 로맨스·관계 중심 신호가 오면 소녀·여성향으로 밀어보세요. 이쪽은 0.61로 실제 군집이라, 한 편이 걸리면 이웃이 따라옵니다.
- 0.5 근처는 "같은 계층"일 뿐인 값입니다. 계층만 맞은 상태이니 소재나 톤으로 축을 바꿔야 합니다.
- 계층보다 테마가 유용합니다. 테마 태그 34종은 0.643에서 0.853까지 갈리는데, 계층은 다 0.47~0.61 안에 뭉쳐 있습니다.
4. 한계
표에 비대칭이 있습니다 — 여성-청년 0.495인데 청년-여성 0.482입니다. 유사도 값 자체는 대칭이지만, 각 항목이 상위 3,000개 이웃만 저장하기 때문에 한쪽 목록에는 있고 다른 쪽에는 없는 쌍이 생깁니다. 소수점 셋째 자리를 신뢰하지 마시고, 0.49와 0.61 같은 큰 차이만 읽으세요.
여성(14편)·아동(6편)은 표본이 작습니다. 소녀(42편)도 크지 않습니다. 소년 (260편)·청년(108편)의 결론은 표본이 충분하지만, 소녀·여성향 군집은 더 많은 데이터에서 흔들릴 수 있습니다.
계층 태그는 유사도 계산의 구조 텍스트에 실제로 들어갑니다. 그런데도 같은 계층끼리 0.49밖에 안 나온다는 건, 태그가 차지하는 비중보다 줄거리 구조의 차이가 훨씬 크다는 뜻입니다. 계산 방식은 게임 소개 참고.
더 보기
장르보다 정확한 축은 테마 태그 34종으로, 어떤 장르가 가장 어려운가는 장르 17종으로 같은 측정을 수행한 결과입니다. 태그가 유사도와 어긋나는 개별 사례는 유사도가 배신하는 순간에 있습니다. 매일의 정답과 그 이웃 목록은 지난 정답 아카이브에 쌓입니다.