애니 시맨틀

소년만화끼리 찍는 건 전략이 아니다

← 게임으로 돌아가기

"소년만화 느낌이 나니까 다른 소년만화를 넣어보자." 흔한 접근이고, 저도 그럴 거라고 생각했습니다. 그런데 재보니 소년만화끼리는 서로 별로 안 닮았습니다.

MAL 데이터의 계층 태그(demographics)는 다섯 종입니다 — 소년(Shounen)· 청년(Seinen)·소녀(Shoujo)·여성(Josei)·아동(Kids). 이걸로 두 가지를 쟀습니다.

1. 계층별 고립도

먼저 장르 글과 같은 측정입니다. 작품마다 프랜차이즈를 뺀 최근접 이웃의 유사도를 구해 계층별로 모았습니다.

계층편수중앙값0.7 미만
Kids (아동)60.71433%
Seinen (청년)1080.72236%
Shounen (소년)2600.72236%
Josei (여성)140.73421%
태그 없음3730.74727%
Shoujo (소녀)420.78817%

여기서 이미 한 가지가 보입니다. 소녀만화(0.788)가 가장 쉽고, 소년· 청년만화(둘 다 0.722)가 가장 어렵습니다. 그리고 계층 태그가 아예 없는 373편(47%)이 태그 있는 대부분보다 오히려 덜 고립돼 있습니다.

2. 계층이 실제로 군집을 이루는가

고립도만으로는 "같은 계층끼리 가까운가"를 알 수 없습니다. 그래서 계층 쌍별 평균 유사도를 직접 구했습니다. 계층이 하나만 붙은 작품끼리, 같은 프랜차이즈는 제외했습니다.

소녀여성소년청년아동
소녀 Shoujo0.6130.5720.5220.5060.490
여성 Josei0.5730.5940.4890.4950.483
소년 Shounen0.5070.4710.4900.4720.442
청년 Seinen0.4900.4820.4780.4740.455
아동 Kids0.4800.4830.4500.456

밝은 값이 대각선, 즉 같은 계층끼리의 평균입니다. 아동-아동은 표본이 20쌍 미만이라 생략했습니다.

소녀·여성향은 군집이 맞습니다

소녀-소녀 0.613, 여성-여성 0.594. 둘 다 자기 계층이 자기 행의 최댓값이고, 서로(0.572·0.573)도 가깝습니다. 소녀만화와 여성만화는 실제로 하나의 이웃 동네를 이룹니다.

소년·청년향은 군집이 아닙니다

소년-소년 0.490 < 소년-소녀 0.507

청년-청년 0.474 < 청년-소녀 0.490

소년만화는 다른 소년만화보다 소녀만화와 더 닮았습니다. 청년만화도 같습니다. 자기 계층이 자기 행의 최댓값이 아닙니다.

이유는 규모입니다. 소년만화 260편은 이 풀의 3분의 1이고, 그 안에 배틀물· 스포츠물·개그물·이세계물이 전부 들어 있습니다. "소년만화"는 이야기의 종류가 아니라 게재지의 독자층 표기일 뿐이라, 유사도가 읽는 줄거리 구조와는 대응하지 않습니다.

반면 소녀만화 42편은 규모가 작고 실제로 서사가 비슷합니다 — 관계와 감정이 중심이고 사건 구조가 반복됩니다.

3. 게임에서 어떻게 쓰나

4. 한계

표에 비대칭이 있습니다 — 여성-청년 0.495인데 청년-여성 0.482입니다. 유사도 값 자체는 대칭이지만, 각 항목이 상위 3,000개 이웃만 저장하기 때문에 한쪽 목록에는 있고 다른 쪽에는 없는 쌍이 생깁니다. 소수점 셋째 자리를 신뢰하지 마시고, 0.49와 0.61 같은 큰 차이만 읽으세요.

여성(14편)·아동(6편)은 표본이 작습니다. 소녀(42편)도 크지 않습니다. 소년 (260편)·청년(108편)의 결론은 표본이 충분하지만, 소녀·여성향 군집은 더 많은 데이터에서 흔들릴 수 있습니다.

계층 태그는 유사도 계산의 구조 텍스트에 실제로 들어갑니다. 그런데도 같은 계층끼리 0.49밖에 안 나온다는 건, 태그가 차지하는 비중보다 줄거리 구조의 차이가 훨씬 크다는 뜻입니다. 계산 방식은 게임 소개 참고.

더 보기

장르보다 정확한 축은 테마 태그 34종으로, 어떤 장르가 가장 어려운가는 장르 17종으로 같은 측정을 수행한 결과입니다. 태그가 유사도와 어긋나는 개별 사례는 유사도가 배신하는 순간에 있습니다. 매일의 정답과 그 이웃 목록은 지난 정답 아카이브에 쌓입니다.