애니 시맨틀의 유사도는 장르 태그로 계산하지 않습니다. 작품의 줄거리와 구조를 문장 임베딩 모델에 넣어 나온 값입니다. 그래서 태그와 어긋나는 순간이 생각보다 자주 나옵니다.
그리고 그 어긋남이 이 게임에서 가장 중요한 단서입니다. "같은 장르를 계속 찍는데 점수가 안 오른다"거나 "전혀 상관없는 작품이 갑자기 0.8이 나왔다"면, 그건 버그가 아니라 모델이 뭔가 다른 걸 보고 있다는 뜻입니다.
실제 데이터에서 그런 쌍을 뽑아봤습니다.
1. 태그가 하나도 안 겹치는데 0.76을 넘는 쌍
장르 태그가 단 하나도 공유되지 않는데 유사도는 0.76 이상인 조합입니다. 같은 시리즈·속편은 전부 제외했습니다.
| 유사도 | 작품 A | 작품 B |
|---|---|---|
| 0.813 | 더 파블 Comedy / Suspense |
그레이트 프리텐더 Action / Adventure / Mystery |
| 0.785 | 어서와 실력 지상주의 교실에 2기 Drama / Suspense |
암살교실 2기 Action / Comedy |
| 0.779 | 극장판 이 멋진 세계에 축복을! 홍전설 Adventure / Comedy / Fantasy |
극장판 귀멸의 칼날: 무한열차편 Action / Supernatural |
| 0.770 | 센과 치히로의 행방불명 Adventure / Award Winning / Fantasy |
고바야시 씨네 메이드래곤: 쓸쓸한 용 Slice of Life / Supernatural |
| 0.768 | 역시 내 청춘 러브코메디는 잘못됐다. 속 OVA Comedy / Romance |
쇼와 겐로쿠 라쿠고 신주 Drama |
왜 이렇게 묶이는가
더 파블 ↔ 그레이트 프리텐더 (0.813) — 태그로는 "코미디"와 "액션"이라 정반대처럼 보입니다. 그런데 둘 다 사기꾼이 판을 짜고 한탕을 노리는 이야기입니다. 등장인물의 직업과 서사 구조가 거의 같습니다. 모델은 장르 칸이 아니라 이 구조를 읽습니다.
어서와 실력 지상주의 교실에 ↔ 암살교실 (0.785) — 하나는 심리 서스펜스, 하나는 액션 코미디로 분류됩니다. 공통점은 "특수한 규칙이 지배하는 학급"이라는 설정입니다. 줄거리 문장이 거의 같은 단어로 시작하니 임베딩도 가까워집니다.
센과 치히로 ↔ 메이드래곤 (0.770) — 지브리 명작과 일상 코미디입니다. 그런데 둘 다 인간이 이계의 존재와 부대끼며 사는 이야기죠. 분위기는 완전히 다른데 뼈대가 같습니다.
2. 태그를 3개나 공유하는데 0.35도 안 되는 쌍
반대 방향입니다. 장르 태그를 세 개 이상 공유하는데 유사도는 0.35 미만인 조합입니다.
| 유사도 | 작품 A | 작품 B | 공유 태그 |
|---|---|---|---|
| 0.260 | 강철의 연금술사: 브라더후드 | 샹그릴라 프론티어 | Action / Adventure / Fantasy |
| 0.304 | 플라네테스 | 극장판 카드캡터 사쿠라: 봉인된 카드 | Award Winning / Drama / Romance |
| 0.311 | 스틸 볼 런: 죠죠의 기묘한 모험 | 충사 속장 | Adventure / Mystery / Supernatural |
| 0.333 | 바나나 피시 | 진격의 거인: 파이널 시즌 완결편 | Action / Drama / Suspense |
| 0.336 | 데스 퍼레이드 | 리제로부터 시작하는 이세계 생활 2기 파트 2 | Drama / Fantasy / Suspense |
강철의 연금술사: 브라더후드 ↔ 샹그릴라 프론티어 (0.260)가 가장 극단적입니다. 액션·모험·판타지를 전부 공유하는데 0.26이면 사실상 "남남"입니다. 하나는 형제의 속죄와 국가 음모를 다루는 서사시고, 다른 하나는 게임 속에서 쓰레기 게임을 공략하는 이야기니까요. 태그는 "무엇이 나오는가"를 적고, 유사도는 "어떻게 이야기하는가"를 읽습니다.
정리하면 — 장르 태그는 작품에 붙은 라벨이고, 유사도는 줄거리 문장에서 뽑아낸 값입니다. 라벨이 같아도 이야기 방식이 다르면 멀어지고, 라벨이 달라도 구조가 같으면 붙습니다.
3. 게임에서 이걸 어떻게 쓰나
0.7 이상인데 장르가 전혀 다를 때 — 장르를 바꾸지 마세요. 모델이 잡은 건 장르가 아니라 이야기 구조입니다. 방금 넣은 작품의 줄거리를 떠올리고, 비슷한 뼈대를 가진 다른 작품을 찾으세요. "사기꾼물", "특수한 학급", "이계 동거" 같은 축입니다.
같은 장르를 계속 찍는데 0.4를 못 넘을 때 — 장르는 이미 맞았을 수도 있습니다. 위 2번 표처럼 태그가 3개 겹쳐도 0.26이 나옵니다. 태그를 버리고 톤으로 갈아타세요. 진지한가 가벼운가, 장편 서사시인가 단편 감성물인가.
0.5~0.65에서 정체될 때 — 큰 계열은 맞고 세부 계열이 틀린 구간입니다. 이세계·판타지 공략과 로맨스 공략에 이 구간을 쪼개는 방법을 장르별로 정리해뒀습니다.
4. 낮게 나오는 데는 다른 이유도 있습니다
솔직하게 덧붙이면, 유사도가 낮은 쌍 중 일부는 작품의 성격 때문이 아니라 데이터 때문입니다.
유사도 하위권을 뽑아보면 중국 애니메이션(도후아)이 유독 자주 등장합니다. 이 작품들은 원본 데이터의 줄거리 설명이 짧거나 번역이 얕은 경우가 많아, 모델이 읽을 문장 자체가 부족합니다. 작품이 정말 동떨어져서가 아니라 설명이 적어서 낮게 나오는 것에 가깝습니다.
게임에서 중국 애니가 정답일 때 유독 안 잡히는 느낌이 든다면 기분 탓이 아닙니다. 유사도 계산 방식과 그 한계는 게임 소개에 실측 근거와 함께 정리해뒀습니다.
더 보기
이 글에 쓴 유사도는 전부 게임이 실제로 쓰는 데이터에서 뽑았습니다. 유사 애니 추천에서는 같은 데이터를 "다음에 뭘 볼까"에 쓰는 방법을, 공략 가이드(메인)에서는 유사도 구간 기준표와 실전 워크스루를 확인할 수 있습니다. 매일의 정답과 그 이웃 목록은 지난 정답 아카이브에 쌓입니다.