AI 소설은
이렇게 써진다.
뤼튼에 "소설 써 줘"라고 치면 그 뒤에서 무슨 일이 벌어질까요. 노벨AI·수도라이트·AI 던전까지 뜯어 보면 속은 전부 같은 기계예요 — 모델 하나, 기억 장치 하나, 프롬프트 조립기 하나. 20강으로 갈라 봤고, 마지막엔 한 푼 안 들이고 같은 걸 돌리는 길을 세 갈래로 놓았어요.
목차 펼치기
뤼튼에 "소설 써 줘"라고 치면 벌어지는 일
뤼튼은 2023년 12월에 전면 무료가 됐고, 2025년 4월 「뤼튼 3.0」 개편 뒤로는 AI 서포터가 질문에 맞는 모델을 알아서 골라 불러요. 앱스토어 설명에는 GPT-4o·GPT-4.5·o1·Claude 3.7· Gemini 2.5를 작업에 맞춰 자동 호출한다고 적혀 있었고, 2025년 8월부터는 GPT-5를 무제한 무료로 열었어요. 그러니까 "소설 써 줘"라고 치면 뒤에서 일어나는 일은 이래요 —
여기서 두 가지가 보여요. 첫째, 뤼튼은 자기 모델이 아니라 남의 모델을 쓰고 있어요 — 2026년 4월 언론 인터뷰에서 "자체 모델 개발 역량을 갖춰 가고 있다"고만 했지 이름도 시점도 없어요. 둘째, 그래서 무료가 비싸요. 2025년 뤼튼테크놀로지스의 매출은 471억이었는데 API 같은 지급수수료가 611억, 영업손실은 588억이었어요. 그 구멍은 투자금이 메워요 — 2026년 8월에 1,000억을 더 받아 기업가치 1.4조가 됐어요.
돈이 되는 쪽은 크랙이에요. 2025년 4월에 뤼튼에서 떨어져 나온 스토리·캐릭터 앱인데, 여기는 Claude와 Gemini를 등급으로 나눠 크래커(≈1원)를 받아요. 고객센터 기준으로 파워챗 25 · 슈퍼챗 61 · 프로챗 73 · 하이퍼챗 102 · 페이블챗 230크래커가 한 턴 값이에요(2026-09-03). 등급의 모델명은 공식적으로 안 밝히는데, 사용자들 기록으로는 슈퍼챗이 Claude Sonnet, 하이퍼챗이 Claude Opus, 페이블챗이 Claude Fable 5예요. 무료였던 일반챗(Claude 3 Haiku)은 2026년 4월에 끝났어요.
- 사람 수로 보면 크기가 갈려요 — 2026년 7월 와이즈앱 추정 MAU는 제타 428만, 크랙 80만, 뤼튼 61만이에요(패널 추정치라 다른 조사와 3배까지 갈려요. 같은 출처 안에서만 비교하세요).
- 크랙의 스토리 제작 화면에는 이 교과서의 부품이 그대로 있어요 — 스토리 설정(커스텀 프롬프트), 시작 설정(첫 장면), 키워드북(켜지기 전엔 AI가 모르는 조건부 설정), 유저노트. 6·7강에서 이 이름들이 무엇의 다른 이름인지 알게 돼요.
국내 지도 — 뤼튼·크랙·제타·노벨챗, 그리고 집필 에디터들
국내는 두 갈래예요. 하나는 캐릭터와 대화하며 이야기를 굴리는 캐릭터챗이고, 다른 하나는 작가가 원고를 쓰는 데 AI를 붙인 집필 에디터예요. 뤼튼·크랙·제타가 앞쪽, 노벨라·펜시브·타이피가 뒤쪽이에요. 표의 "커뮤니티"는 회사가 공개하지 않아 사용자 기록으로만 확인된 값이에요.
| 서비스 | 무엇 | 모델 | 무료 범위 · 가격 | 기억 장치 |
|---|---|---|---|---|
| 뤼튼 | 범용 AI 포털. 소설 전용 기능 없음 | GPT-5 등 외부 모델 자동 선택 | 전면 무료 (비로그인도 무제한) | 대화 기록뿐 |
| 크랙 (뤼튼) | 스토리(세계관 탐험) + 캐릭터 1:1 | Claude·Gemini 등급제. 자체 모델 없음 | 무료 크래커 하루 350(커뮤니티) · 턴당 25~230크래커, 1크래커≈1원(웹) · 앱은 약 30% 비쌈 | 요약 시스템 v3 + 유저노트 500자 + 키워드북 |
| 제타 (스캐터랩) | 유저 제작 캐릭터·플롯 롤플레이 | 자체 소형 모델 Spotwrite, 약 2주 주기 배포 | 무료(중간 광고) · 웹 비구독 하루 90턴(커뮤니티) · 제타패스 웹 10,900원(커뮤니티) = 광고 제거 + 200피스 | 설정집(키워드 발동) · 스타일(시점·시제·길이) |
| 노벨챗 (노벨피아) | 웹소설 IP 캐릭터챗, 2026-03 출시 | 비공개 | 재화 '플링', 턴당 약 100원(커뮤니티) | 미확인 |
| 네이버웹툰 캐릭터챗 | 웹툰 캐릭터 1:1, 친밀도 | 하이퍼클로바X | 무료 메시지 소진 뒤 쿠키(100원) | 친밀도 모델 |
| 노벨라 | 웹소설 집필 에디터 + AI | ChatGPT 기반(커뮤니티) | Free(작품 7개) · Plus 5,900 · Pro 9,900 · Premium 17,900원/월 | 작품 단위 |
| 펜시브 | 집필 도구 + 설정 충돌 감지 AI | Google·Anthropic 기업용 API (학습 미사용 명시) | 기본 무료, AI는 선택 과금 | 설정 검토(Review) |
| 러비더비 · 채티 | 연애 시뮬 캐릭터챗 · 챗소설 | 자체(?)·외부 혼합 / 미확인 | 잼·풍선 재화 | 미확인 |
| 라이팅젤 | 2021년 나온 원조 AI 소설 도구 (GPT-3 + 클로바) | — | 2026-09-03 사이트 접속 불가 — 운영 여부 미확인 | — |
이 표에서 제일 눈여겨볼 줄은 제타예요. 외부 API를 안 쓰니 턴당 원가가 0에 가까워요. 그 덕에 스캐터랩은 2025년 매출 약 260억에 영업이익 30억으로 창사 첫 흑자를 냈고, 2026년 2월 국내 AI 앱 총사용시간 1위(1억 1,341만 시간 — ChatGPT의 두 배)였어요. 뤼튼이 611억을 지급수수료로 내는 동안 제타는 GPU 64장으로 자기 모델을 2주마다 새로 굽고 있었던 거예요.
집필 에디터 쪽은 아직 작아요. 노벨라·펜시브·타이피 셋 다 "AI가 대신 쓴다"보다 "작가가 쓰는 걸 돕는다"에 서 있고, 펜시브는 원고를 학습에 안 쓴다는 걸 상품으로 내걸었어요. 19강에서 볼 플랫폼 정책 때문이에요.
해외 지도 — 노벨AI·수도라이트·AI 던전·노벨크래프터·Character.AI
해외는 갈래가 더 뚜렷해요. 원고를 이어 쓰는 소설 도구(노벨AI·수도라이트·노벨크래프터), 주인공이 되어 노는 텍스트 어드벤처·롤플레이(AI 던전·Character.AI·재니터AI), 그리고 이 전부를 내 손으로 조립하는 오픈소스 프론트엔드(SillyTavern·KoboldCpp)예요.
| 서비스 | 무엇 | 모델 | 무료 · 가격 (월, USD) | 창 · 기억 |
|---|---|---|---|---|
| NovelAI | 채팅 턴 없는 "이야기 그대로" 이어 쓰기 | 자체 Xialong(GLM-4.6 355B 미세조정, 2026-04) · Erato(Llama 3 70B) · GLM-4.6 원본 | 체험 50회 · Tablet 10 · Scroll 15 · Opus 25 (Xialong은 Opus 전용) | 8,192 / 12,288 / 28,672 토큰 · Memory + Lorebook + Author's Note |
| Sudowrite | 스토리 바이블 → 장면 → 초안 | 자체 Muse 1.5 + Claude·GPT·Gemini·DeepSeek·Grok… | 체험 · Hobby 19 (연 결제 10) · Pro 29 · Max 59, 크레딧제 | 앞 2만 단어 + 연결 장, 바이블 자동 감지 |
| AI Dungeon | 텍스트 어드벤처·롤플레이 | 자체 Muse·Wayfarer·Hearthfire·Nova(오픈 웨이트) + DeepSeek·GLM·Gemma | 무료 있음(모델 8개, 4K 창) · Journey 14.99 · Legend 29.99 · Mythic 49.99 · Ultimate 99.99 | 4K → 32K, 크레딧으로 128K · 스토리 카드 + 벡터 메모리 뱅크 |
| Novelcrafter | 원고 + 코덱스(설정집) 작업대 | 내 API 키만 — OpenRouter·OpenAI·Anthropic·Groq·Ollama·LM Studio | 21일 체험 · Scribe 4(AI 없음) · Hobbyist 8 · Artisan 14 · Specialist 20 + 모델 요금 별도 | 모델의 창 · 코덱스 언급 감지 |
| Character.AI | 캐릭터 대화 + 스토리 | 자체 PipSqueak 2(오픈소스 모델 튜닝) · DeepSqueak(유료) | 무료(광고) · c.ai+ 9.99 | 비공개 · Story Memory·핀·Facts·로어북(베타) |
| SillyTavern · KoboldCpp | 오픈소스 프론트 (설치형) | 아무 백엔드 — 로컬 GGUF·OpenAI·Claude·Gemini·OpenRouter… | 무료 (AGPL) | World Info · 요약 · 벡터 저장소 · Context Shift |
| Janitor AI · Chub · CrushOn | 캐릭터 롤플레이 (성인 허용 쪽) | 자체 소형 + 내 키 | 무료 티어 · janitor+ 12.99 · Mercury 5(커뮤니티) · Standard 4.9 | 9K 안팎 · 8~24K |
| ChatGPT · Claude · Gemini | 범용 채팅을 소설에 쓰기 | GPT-5.6 · Claude Sonnet/Opus · Gemini 3.6 Flash | 셋 다 무료 티어 · Plus/Pro 20 · Gemini AI Plus 4.99 | 27K(무료)~400K · 200K · 1M(유료) · 메모리·프로젝트 |
| Dreamily | 중국 차이윈의 소설 앱 | — | 2026-04-21 서비스 종료, 데이터 전부 삭제 | — |
보이는 대로예요. 돈을 받는 소설 도구는 전부 자기 모델을 따로 길러요(노벨AI·수도라이트· AI 던전·Character.AI). 그리고 그 회사들 중 둘(AI 던전의 Latitude, Character.AI의 바탕)은 오픈 웨이트 위에 서 있어요 — 11강과 17강에서 이 사실이 "무료 경로"의 뿌리가 돼요.
Dreamily 줄을 굳이 남긴 이유가 있어요. 서비스가 문을 닫으면서 사용자 원고를 전부 지웠다고 공지했어요. 어느 서비스든 원고는 밖에 사본을 두세요 — 부록 점검표의 마지막 줄이에요.
셋으로 갈린다 — 빌려 쓰기, 직접 키우기, 키만 꽂기
이름이 스무 개라도 구조는 셋이에요. 모델을 어디서 가져오느냐, 그래서 무료의 값을 누가 내느냐로 갈려요.
남의 API 위에 화면
GPT·Claude·Gemini를 호출하고 화면과 조립기를 얹어요. 최상급 지능을 바로 쓰지만 턴마다 돈이 나가고, 모델이 바뀌면 문체가 바뀌고, 모델 회사의 정책이 그대로 내 한계가 돼요.
뤼튼 · 크랙 · 수도라이트의 외부 모델 · 노벨라 · 펜시브
자기 모델을 구워서
이야기 데이터로 모델을 따로 길러요. 원가가 0에 가까워져 흑자가 나고(제타), 취향에 딱 맞출 수 있지만(Wayfarer), 범용 지능은 최상급 API보다 낮아요.
제타 Spotwrite · 노벨AI Erato·Xialong · 수도라이트 Muse · AI 던전 Wayfarer · Character.AI PipSqueak
모델은 네가 골라
프론트엔드만 주고 모델은 사용자가 API 키나 로컬 파일로 꽂아요. 자유도가 가장 크고, 비용도 통제도 사용자 몫이에요. 무료 경로(15~17강)는 전부 여기서 나와요.
노벨크래프터 · SillyTavern · KoboldCpp · Mikupad · OpenWrite
같은 회사가 두 부류에 걸치기도 해요. 수도라이트는 자기 Muse(②)와 Claude(①)를 나란히 팔고, AI 던전은 자체 모델(②)에 DeepSeek·GLM(①)을 섞어요. 노벨AI는 미세조정 전 GLM-4.6 원본을 모든 티어에 열고, 미세조정한 Xialong은 Opus 티어에만 둬요 — 모델을 기르는 데 든 돈을 거기서 받는 거죠.
- ①의 약점은 종속이에요. 크랙의 무료 일반챗이 끝난 것도, 뤼튼의 말투가 모델 교체 때마다 바뀐다는 불만도 여기서 나와요.
- ②의 약점은 지능의 천장이에요. 12강의 리더보드에서 확인해요.
- ③의 약점은 손이에요. 설치와 설정을 내가 해야 해요. 대신 이 교과서를 읽고 나면 그 손이 생겨요.
모델은 다음 글자를 맞히는 기계다
어떤 서비스를 쓰든 한가운데에는 언어 모델 하나가 있어요. 이 기계가 하는 일은 한 가지예요 — 지금까지의 글을 보고 다음에 올 토큰(글자 조각)의 확률표를 만드는 것. 거기서 하나를 뽑아 붙이고, 붙인 글을 다시 보고, 또 확률표를 만들어요. "소설을 쓴다"는 건 이 뽑기를 수천 번 반복한 결과예요.
여기서 갈림길이 하나 있어요. 같은 기계도 두 가지 성격으로 길러져요. 베이스 모델은 순수하게 "이어 쓰기"만 배운 상태라, 내 글의 목소리·시점·시제를 그대로 이어 가요. 인스트럭트 모델은 그 위에 "사람 말에 비서처럼 대답하기"를 덧입힌 거예요 — ChatGPT·Claude·Gemini, 그리고 뤼튼처럼 채팅창으로 소설을 시키는 서비스는 전부 이쪽이에요.
- 인스트럭트에 "소설 써 줘" → 비서의 목소리가 섞여요. 요약하려는 버릇, 결말을 서두르는 버릇, 위험한 장면 앞에서 멈추는 거절층이 같이 따라와요.
- 베이스에 원고를 주고 이어 쓰게 하면 → 목소리는 이어지는데, 줄거리를 붙들어 줄 장치가 없으면 금방 삼천포로 가요. 그래서 6강의 조립기가 필요해요.
- 노벨AI는 채팅 턴이 없는 "이야기 그대로" 형식이라 후자에 가까워요. 명령을 내리고 싶으면 본문
안에
{기호로 인스트럭트 모드를 켜는 식이에요.
인스트럭트 학습이 다양성을 깎는다는 건 측정된 사실이에요 — 정렬(alignment)을 거친 Llama-2 계열은 토큰 예측의 엔트로피가 낮아지고 특정 "끌개 상태"로 수렴한다는 연구가 있어요 (arXiv 2406.05587). 비서 목소리가 밋밋하게 느껴지는 데는 이유가 있어요.
프롬프트 조립기 — 모델이 실제로 보는 다섯 층
내가 "다음 장면 써 줘"라고 치면 모델이 그 한 줄만 보는 게 아니에요. 도구가 뒤에서 여러 조각을 정해진 순서로 이어 붙여요. 이름은 서비스마다 다르지만 층은 다섯이에요.
| 층 | 무엇 | 노벨AI | SillyTavern | AI 던전 | 수도라이트 |
|---|---|---|---|---|---|
| ① 시스템 | 문체·장르·규칙 | ATTG 헤더(작가·제목·태그·장르) | Main Prompt / story string | AI Instructions | Style · Genre |
| ② 기억 | 손으로 쓴 요약, 항상 들어감 | Memory (맨 위) | 캐릭터 설명·요약 | Plot Essentials | Synopsis · Characters |
| ③ 로어북 | 키워드가 나올 때만 깨어나는 설정 | Lorebook | World Info | Story Cards | Story Bible Detection |
| ④ 본문 | 최근 원고, 예산에 맞춰 앞을 잘라냄 | 이야기 본문 | 대화 기록 | History | 앞 2만 단어 + 연결 장 |
| ⑤ 작가 노트 | 끝에서 몇 줄 위에 꽂는 짧은 지시 | Author's Note (끝에서 세 문단 위) | Author's Note (@depth) | Author's Note | Key Details |
순서가 곧 힘이에요. 모델은 끝에 가까운 글일수록 세게 따라요. 그래서 작가 노트는 짧아도 가장 센 조종간이고, 기억은 맨 위에 있어 "배경"으로만 작동해요. AI 던전은 예산 배분까지 공개했어요 — 필수 항목을 먼저 넣고, 남는 자리를 스토리 카드 25% · 본문 50% · 메모리 뱅크 25%로 나눠요.
아래에서 직접 조립해 보세요. 층을 끄고 켜고, 컨텍스트 창 크기를 바꾸면 모델이 실제로 받는 글이 어떻게 달라지는지 그 자리에서 보여요. 토큰 수는 설명용 예시예요.
로어북 — 키워드로 깨어나는 설정
세계관 설정을 전부 프롬프트에 넣으면 창이 금방 차요. 그래서 모든 소설 도구가 같은 꾀를 써요 — 설정을 항목별로 쪼개 두고, 본문 최근 부분에 그 항목의 키워드가 보일 때만 끼워 넣어요. 노벨AI는 로어북, SillyTavern은 World Info, AI 던전은 스토리 카드, 노벨크래프터는 코덱스, 수도라이트는 스토리 바이블 감지라고 불러요. Character.AI도 2026년 7월에 유료 베타로 "로어북"을 붙였어요.
규칙은 문서에 다 적혀 있어요. 노벨AI 기준으로 — 키는 대소문자를 안 가리고, 정규식도 되고, 검색 범위는 본문 끝에서 최대 10,000자까지예요. 항목마다 삽입 순서와 위치를 정하고, 예산을 전체 창의 몇 %로 잡아 두면 그 안에서만 깨어나요. SillyTavern은 "최근 몇 개의 메시지를 훑을지"를 스캔 깊이로 정하고, 예산이 다 차면 키워드가 있어도 더는 안 켜요.
아래 본문을 고쳐 보세요. 어떤 키워드를 쓰면 어떤 설정이 깨어나는지, 검색 범위를 줄이면 뭐가 잠드는지가 바로 보여요.
- 연쇄 발동(노벨AI cascading, SillyTavern recursion) — 깨어난 항목의 본문 안에 다른 키워드가 있으면 그것도 깨워요. 위 데모에서 "인쇄소"가 켜지면 그 안의 "청사진"이 따라 켜지는 식이에요.
- 항상 켬(Always On / constant) — 주인공처럼 매번 필요한 항목은 키워드 없이도 넣어요. 대신 예산을 상시로 먹어요.
- AI 던전은 여러 카드가 동시에 깨어나면 최근에·자주 발동한 순으로 줄을 세워요. 노벨크래프터는 항목끼리 관계를 걸어 두면 하나가 언급될 때 연결된 항목까지 딸려 들어가요.
기억의 한계 — 창, 요약, 벡터
모델이 한 번에 볼 수 있는 글의 양이 컨텍스트 창이에요. 이게 서비스 요금표의 진짜 단위예요. 노벨AI는 티어별로 8,192 · 12,288 · 28,672 토큰이고, AI 던전 무료는 4천이에요(유료로 32천, 크레딧을 쓰면 128천). 재니터AI 무료는 9천쯤이고, ChatGPT 무료는 즉답 모드 27K, Plus 54K, Claude Pro는 200K, Gemini 유료는 100만이라고 적혀 있어요. 장편 한 권이 한국어로 수십만 토큰이니 어느 창에도 통째로는 안 들어가요. 그래서 세 가지 처리법이 생겼어요.
앞을 버린다
창이 차면 오래된 본문부터 떨어뜨려요. 제일 단순하고 제일 흔해요. KoboldCpp의 Context Shift는 떨어뜨린 뒤에도 남은 부분을 다시 계산하지 않게 캐시를 밀어요.
노벨AI · KoboldCpp · 대부분의 채팅 UI
줄여서 남긴다
몇 메시지마다 모델에게 요약을 시켜 그 요약을 프롬프트 위쪽에 꽂아요. 세부가 뭉개지고 틀린 요약이 섞일 수 있다고 문서에도 적혀 있어요.
SillyTavern Summarize · CrushOn 자동 요약 · Character.AI 백그라운드 압축
비슷한 걸 찾아 온다
지난 글을 조각내 임베딩해 두고, 지금 장면과 뜻이 비슷한 조각만 골라 넣어요. 검색이라 놓치기도 하지만 창보다 훨씬 긴 이야기를 버텨요.
AI 던전 Memory Bank · SillyTavern 벡터 저장소 · Claude 프로젝트 RAG
숫자로 보면 더 실감 나요. AI 던전의 메모리 뱅크는 15턴마다 여섯 턴을 요약 모델로 줄이고 임베딩해 두었다가 유사도로 꺼내 와요. 가득 차면 가장 덜 쓰인 기억부터 "잊어요". SillyTavern의 벡터 저장소는 대화를 400자 조각으로 나눠, 최근 2개 메시지를 질의로 삼아 관련도 25% 이상인 조각 중 상위 3개를 끼워 넣어요 — 최근 5개 메시지는 손대지 않고요.
수도라이트는 다른 길을 갔어요. 요약을 자동으로 만드는 대신 작가가 스토리 바이블을 채우게 하고(줄거리 → 인물·세계관 → 개요 → 장면), 장면을 쓸 때 관련 항목만 끌어와요. 어느 항목이 이번 생성에 들어갔는지 "칩"으로 보여 주는 것까지가 이 방식의 정직함이에요.
캐릭터 카드 — 한 장짜리 인격
롤플레이 쪽에서는 인물 하나를 카드 한 장으로 주고받아요. PNG 그림 파일 안에 JSON을 숨겨 넣는 방식이라, 그림을 내려받으면 설정이 같이 따라와요. 규격이 공개돼 있어서 SillyTavern·재니터AI· Chub 같은 서비스끼리 카드가 호환돼요. V2 규격의 칸은 이래요.
| 칸 | 들어가는 것 | 조립기의 어느 층인가 |
|---|---|---|
| name · description · personality | 이름, 외모·배경, 성격 | ② 기억 (항상 들어감) |
| scenario | 지금 상황 | ② 기억 |
| first_mes · alternate_greetings | 첫 대사와 대안 첫 대사들 | ④ 본문의 시작 |
| mes_example | 말투 예시 대화 | ④ 본문 앞 (창이 차면 먼저 빠짐) |
| system_prompt · post_history_instructions | 시스템 지시, 본문 뒤에 붙는 지시 | ① 시스템 · ⑤ 작가 노트 자리 |
| character_book | 카드에 딸린 로어북 (keys · content · scan_depth · token_budget …) | ③ 로어북 |
| creator_notes · tags · creator · character_version | 만든 사람 메모와 분류 | 프롬프트에 안 들어감 — 규격이 금지 |
규격이 재밌는 건 "무엇을 넣지 말라"까지 적었다는 거예요. creator_notes는
프롬프트에 절대 쓰면 안 되고, 카드의 system_prompt는 프론트엔드의 전역
시스템 프롬프트를 대체하는 게 기본이며, 원래 것을 살리고 싶으면 {{original}}
자리표를 쓰라는 식이에요. RisuAI 쪽(kwaroran)이 제안한 V3 규격은 여기에 별명·다국어 메모·
자산 파일·생성일을 더하고, 로어북 항목에 정규식과 @@depth 같은 장식자를
넣었어요. 파일 형식도 PNG의 ccv3 청크와 .charx(zip)를 추가했고요.
온도 — 같은 프롬프트에서 다른 문장이 나오는 이유
5강의 "하나 뽑기"로 돌아와요. 확률표에서 늘 1등만 뽑으면 글은 안전하고 지루해져요. 그래서 온도(temperature)로 표를 눌렀다 폈다 해요 — 낮추면 1등이 더 커지고, 높이면 꼴찌에도 기회가 가요. 여기에 "누적 확률 상위 몇 %만 남기기"(top-p)나 "1등 대비 몇 % 이하는 버리기"(min-p)를 겹쳐서 엉뚱한 단어를 막아요.
슬라이더를 움직이고 "뽑기"를 여러 번 눌러 보세요. 같은 앞글에서 문장이 어떻게 갈리는지, min-p를 켜면 꼬리가 어떻게 잘리는지가 보여요. 확률은 설명용 예시예요.
실제 도구가 쓰는 값
- OpenAI API의 온도는 0~2, 기본 1이에요. 노벨AI의 최신 모델 Xialong은 기본 프리셋 온도가 0.85예요. llama.cpp 서버 기본값은 온도 0.8 · top-p 0.95 · min-p 0.05예요.
- min-p 0.05~0.1이 창의성과 일관성의 균형점이라는 게 논문의 결론이에요(ICLR 2025). min-p를 쓰면 온도를 1.5까지, 심지어 2~3까지 올려도 글이 안 무너져요.
- 반복을 막는 옛 방법(repetition penalty)은 문법을 뒤틀어요. 요즘은 DRY(이미 나온 문장 조각을 또 잇는 걸 벌함 — 배수 0.8 · 밑 1.75 · 허용 길이 2)와 XTC(확률 50%로 뻔한 1등 후보들을 치워 상투구를 깸)를 써요. 둘 다 오픈소스 백엔드에만 있어요.
- 노벨AI는 Erato 이후 "Unified" 샘플러 하나만 쓰기를 권해요. 샘플러를 겹치는 순서에 따라 결과가 예측 불가능하게 달라진다고 문서에 적어 뒀어요.
그리고 이게 오픈 모델로 사람들이 옮겨 가는 기술적 이유 중 하나예요. 상용 API는 min-p·DRY· XTC를 하나도 안 열어 줘요. Anthropic은 한발 더 나가서 4.6 이후 모델에서 온도·top-p·top-k 자체를 없앴어요(1.0만 받아요). 거기선 문체의 다양성을 샘플러가 아니라 프롬프트 — 문체 예시와 작가 노트 — 로 조종해야 해요.
소설 전용 모델은 뭐가 다른가
범용 모델을 그냥 쓰는 서비스도 있지만, 돈을 받는 곳들은 대개 자기 모델을 따로 길러요. 길러진 방식이 공개된 셋을 보면 "소설 전용"이 무슨 뜻인지 정확해져요.
| 모델 | 바탕 | 어떻게 길렀나 | 어디서 |
|---|---|---|---|
| Erato (노벨AI, 2024-09) | Llama 3 70B Base | 자체 문학 데이터로 수천억 토큰 추가 사전학습 뒤 스토리텔링 데이터로 미세조정. Kayra(13B, 1.6조 토큰)를 처음부터 만들 때보다 더 많은 컴퓨트를 썼다고 밝혔어요. | Opus 티어 전용 |
| Xialong (노벨AI, 2026-04) | GLM-4.6 355B MoE | 미세조정 + 반복을 벌하는 강화학습. 기본 온도 0.85, ATTG 헤더와 로어북 형식을 그대로 이어받았어요. | Opus 티어 전용 |
| Wayfarer 12B (Latitude, 2025-01) | Mistral Nemo Base | 지시 데이터 18만 건 → 8K 컨텍스트 합성 텍스트 어드벤처·롤플레이 반반. 다섯 가지 사용자 유형을 시뮬레이션해 만든 데이터예요. 설계 문장이 유명해요 — "요즘 모델은 너무 착해서 주인공을 실패하게 두지 않는다. 이 모델에선 실패가 잦고 주인공 보정이 없다." | Apache 2.0, 누구나 내려받음 |
| Muse (수도라이트, 2025-03) | 비공개 | 작가 동의 100%를 받은 데이터만으로 학습. "AI 상투구"를 학습 중에 측정해서 체계적으로 걷어냈다고 해요. 영어에서 가장 잘 돼요. | 수도라이트 안에서만 |
공통점이 보이죠. 셋 다 베이스 모델에서 출발하고(비서 목소리를 안 입히려고), 학습 데이터를 문학·이야기로 채우고, 상투구와 반복을 따로 벌해요. Latitude는 Muse 12B·Harbinger 24B· Hearthfire 24B·Nova 70B·Equinox 31B까지 한 계열을 전부 허깅페이스에 올렸어요 — 17강의 "내 컴퓨터" 경로가 가능한 건 이 회사들 덕이에요. Character.AI도 2025년 8월부터 "현대 오픈소스 모델을 튜닝해 쓴다"고 공식 블로그에 적었어요.
인스트럭트 모델을 프롬프트로 아무리 잘 구슬려도 넘기 힘든 벽이 여기예요. 5강에서 본 "끌개 상태"는 학습에서 생긴 거라 학습으로만 풀려요. 다만 소설 전용 모델은 줄거리를 스스로 붙들지 못하니, 6~8강의 조립기가 없으면 금방 흩어져요. 서비스가 파는 건 모델과 조립기의 세트예요.
2026년, 어떤 모델이 소설을 잘 쓰나
"잘 쓴다"를 재는 공개 지표는 EQ-Bench Creative Writing v3가 사실상 유일해요. 같은 과제로 짧은 글을 쓰게 하고 심판 모델(Claude Sonnet 4.6)이 짝 비교로 Elo를 매겨요. 별도의 Longform 지표는 8장짜리 중편을 쓰게 해 100점 만점으로 채점하고요. 2026-09-03에 사이트에서 직접 읽어 온 값이에요 — 영어 기준이라는 걸 잊지 마세요(한국어 얘기는 13강).
| 모델 | Elo (단편) | 장편 /100 | 크기 · 라이선스 | 어디서 굴리나 |
|---|---|---|---|---|
| Claude Opus 5 클로즈드 | 2116 | 86.3 | — | API · Claude 구독 |
| Kimi K3 | 2071 | 79.6 | 2.8T (활성 104B) · 자체 라이선스 | API |
| GLM-5.3 | 2062 | 81.8 | 753B MoE · 자체 라이선스 | API |
| Muse-Glimmer-30B (Meta) | 1789 | — | 29.6B dense · Apache 2.0 | 로컬 24GB (4비트 17GB) |
| GLM-5.2 | 1751 | 77.9 | ~744B (활성 40B) · MIT | OpenRouter 무료 |
| Kimi K2.6 | 1725 | 78.5 | ~1T · 수정 MIT | API (장편에서 떨어진다는 평) |
| Qwen3.8-27B | 1669 | 53.3 | 27B dense · Apache 2.0 | 로컬 24GB · Groq 무료 |
| DeepSeek V4-Flash / V4-Pro | 1556 / 1552 | 66.0 / 75.6 | MoE · MIT | API (매우 쌈) |
| Gemma 4 31B | 1366 | 56.5 | 31B · Apache 2.0 | 로컬 24GB · OpenRouter 무료 |
| Gemma 3 27B · Mistral Small 3.2 24B | 1263 · 1253 | 41.9 · 41.6 | dense | 로컬 16~24GB |
| gpt-oss-120b · 20b (OpenAI) | 959 · 663 | 35.8 · 21.2 | Apache 2.0 | Groq·Cerebras·Workers AI 기본값 — 소설엔 최악 |
| Mistral Nemo 12B | 879 | 28.7 | 12B · Apache 2.0 | 로컬 8~16GB (소설 파인튜닝의 단골 바탕) |
표가 말하는 것 — 첫째, 클로즈드 1등과 오픈 1등의 차이가 50점 안쪽이에요. "오픈 모델은 글을 못 쓴다"는 2024년 얘기예요. 둘째, 집에서 돌릴 수 있는 크기 중 최고는 Meta의 Muse-Glimmer-30B예요 — 라마의 후속으로 Meta가 이름을 "Muse"로 바꾼 계열이고, Apache 2.0이라 마음대로 써요(그 위의 Muse Spark 1.2는 가중치를 약속만 하고 아직 안 냈어요). 셋째, gpt-oss는 무료 API의 기본 모델로 자주 걸려 있는데 산문 점수가 가장 낮아요. 무료라고 그걸 고르면 "AI 소설은 역시 별로"가 돼요.
파인튜닝 — 롤플레이 쪽의 실물
리더보드 밖에서 롤플레이·성인 창작 커뮤니티가 쓰는 건 따로 있어요. TheDrummer의 Cydonia 24B v4.3(Mistral Small 3.2 바탕)과 2026년의 Artemis-31B·Skyfall-31B, Latitude의 Wayfarer 12B·Muse-12B·Harbinger 24B·Equinox-31B(Gemma 4 바탕, 2026-05), anthracite의 Magnum v4. 검열 없는 모델을 따로 재는 UGI 리더보드에서는 Cydonia 24B가 40점대예요. 이 계열은 대부분 Mistral Nemo 12B와 Mistral Small 24B 위에 서 있어요 — 라이선스가 자유롭고 문장이 부드럽고 16~24GB에 들어가서요.
한국어라는 변수 — 토큰이 두 배, 벤치마크는 없음
같은 글이라도 한국어는 토큰이 더 들어요. 한글 한 글자가 UTF-8로 3바이트이고 모델의 어휘표가 영어 중심이라서요. 2026-09-03에 웹소설풍 지문 두 편(725자·793자)으로 직접 세어 봤어요.
| 토크나이저 | 글자당 토큰 | 5,000자 한 회차 ≈ | 비고 |
|---|---|---|---|
| o200k (GPT-4o · 4.1 · 5.x) | 0.63~0.65 | 3,200 | 영어는 토큰당 4.3자 — 한국어가 2.7배 |
| cl100k (GPT-4 · 3.5) | 1.0 | 5,100 | 옛 세대. 한 글자 한 토큰 |
| Claude (4.6 이하, Haiku 4.5) | 1.13 | 5,700 | Bedrock CountTokens로 실측 |
| Claude (4.7 이후 · 5 · Fable) | ≈1.47 (추정) | ≈7,400 | Anthropic 문서: 새 토크나이저가 "약 30% 더" — 직접 실측은 못 했어요 |
| Gemini · DeepSeek · GLM · Qwen | 미실측 | — | 키가 없어 못 쟀어요. 14강 계산기는 추정값(0.8)을 쓰고 표시해요 |
그래서 가격표의 "토큰당 값"으로 비교하면 틀려요. 글자당 값으로 봐야 해요. 예를 들어 Claude Sonnet 5(출력 $10/1M)와 gpt-5.4($15/1M)를 5,000자 한 회로 비교하면 — Sonnet은 7,400토큰이라 $0.074, gpt-5.4는 3,200토큰이라 $0.048이에요. 토큰 단가는 gpt-5.4가 1.5배 비싼데 글자 단가는 Sonnet이 1.5배 비싸요. 14강 계산기가 이걸 자동으로 해 줘요.
존댓말이 흔들리는 문제
한국어에는 상대 높임이 여섯 등급이고, 모델은 이걸 자주 놓쳐요. 상대가 분명해지면 반말로 미끄러지는 경향이 측정됐고(LREC 2026), 한국어 지시 평가 KITE는 "높임법 전환 실패"를 따로 셀 만큼 흔한 오류로 봐요. 6강의 조립기로 다스리는 법이 있어요.
- ②기억에 서술 어미와 인물 간 말투 관계를 적어요 — "3인칭 과거 「~다」. 하은→도윤 반말,
도윤→하은 해요체." 카드의
description에 넣어도 돼요. - 같은 규칙을 ⑤작가 노트에 한 번 더 — 끝에 가까운 글이 이겨요.
- 원하는 문체의 문장 2~3개를 예시로 줘요. 번역투(문장마다 "그는", 대명사 남발)는 반례로 적어요.
- 뽑은 뒤 화자별 어미를 정규식으로 검사해요 —
-요/-습니다대-다/-냐/-어. 어긋난 줄만 다시 뽑아요. 18강 코드에 이 검사를 한 줄 붙이면 돼요.
한국어로 길러진 오픈 모델
2025~2026년에 국내 회사들이 가중치를 잔뜩 열었어요. 정부의 「독자 AI 파운데이션 모델」 사업이 불을 붙였고, 2026년 7~8월에 네 팀이 모두 거대 모델을 공개했어요. 다만 그 거인들은 집 컴퓨터에 안 들어가요. 실제로 쓸 수 있는 크기 위주로 추렸어요.
| 모델 | 크기 | 라이선스 | 어디서 |
|---|---|---|---|
| Kanana 1.5 (카카오) | 2.1B · 8B | Apache 2.0 | 로컬 8~16GB — 부담 없는 첫 선택 |
| Mi:dm 2.0 (KT) | 2.3B · 11.5B | MIT | 로컬 16GB |
| A.X 4.0 Light (SKT) | 7B | Apache 2.0 (72B는 Qwen 라이선스) | 로컬 8~16GB |
| HyperCLOVA X SEED (네이버) | 0.5B · 1.5B · 3B · Think 14B · Think 32B | 자체 — MAU 1,000만 미만·네이버와 비경쟁이면 상업 가능, "Powered by HyperCLOVA X" 표기 | 3B는 노트북, Think 32B는 24GB |
| EXAONE 4.0 (LG) | 1.2B · 32B | 비상업(NC) — 상업은 별도 계약 | 로컬 24GB (개인 창작은 OK) |
| Kanana-2 30B-A3B · K-EXAONE 2.0 750B · A.X K2 688B · Solar Open 2 250B · Motif 3 314B | 거대 MoE | NC · Apache · Apache · Solar · MIT(보도) | 서버급. 무료 API로 열린 곳은 2026-09-03 확인 못 함 |
한국어 창작을 재는 공개 벤치마크는 없어요. KoMT-Bench에 "글쓰기" 항목이 있는 정도라, 위 표의 어느 모델이 소설을 잘 쓰는지는 아무도 숫자로 몰라요. 20강에서 말할 "내 원고로 짝 비교"가 유일한 방법이에요. 참고로 글로벌 오픈 모델 중엔 Qwen3.8(201개 언어)·Gemma 4(140개 이상)· GLM·DeepSeek이 한국어를 받고, Llama 4는 지원 언어 12개에 한국어가 없어요.
비용의 실체 — 한 회에 몇 백 원, 문제는 다시 뽑기
2026-09-03 각 회사 공식 가격표에서 읽은 값이에요(100만 토큰당 USD, 입력/출력). 표에 없는 모델은 부록 출처의 링크에서 보세요.
| 모델 | 입력 | 출력 | 메모 |
|---|---|---|---|
| OpenAI gpt-5.6-sol · terra · luna | 4 · 2 · 0.20 | 20 · 12 · 1.20 | 캐시 입력은 10분의 1 |
| OpenAI gpt-5.5 · gpt-5.4 · gpt-5-mini | 5 · 2.5 · 0.25 | 30 · 15 · 2 | |
| Claude Fable 5.1 · Opus 5 · Sonnet 5 · Haiku 4.5 | 10 · 5 · 2 · 1 | 50 · 25 · 10 · 5 | 캐시 히트 0.25~0.10 · 배치 50% 할인 |
| Gemini 3.8 Flash · 3.5 Flash · 3.5 Flash-Lite | 0.75 · 1.5 · 0.30 | 3.75 · 9 · 2.50 | 3.8 Flash는 2027년부터 두 배 |
| Gemini 3.1 Pro · 2.5 Pro · 2.5 Flash-Lite | 2 · 1.25 · 0.10 | 12 · 10 · 0.40 | 20만 토큰 이하 기준 |
| DeepSeek V4-Flash · V4-Pro | 0.44 · 1.32 | 1.32 · 3.96 | 비피크(UTC 밤·주말)에 절반 |
| GLM-5.3 · GLM-4.6 (Z.ai) | 1.4 · 0.6 | 4.4 · 2.2 | GLM-4.7-Flash·4.5-Flash는 $0 |
| Kimi K3 · K2.6 · Qwen3.8-max · grok-4.6 | 3 · 0.95 · 2 · 2 | 15 · 4 · 6 · 6 | |
| Mistral Medium 3.5 · Small 4 · Llama 3.3 70B(Together) | 1.5 · 0.15 · 1.04 | 7.5 · 0.6 · 1.04 | Nemo는 2026-07 퇴역 |
| 구독 — ChatGPT Go · Plus · Pro / Claude Pro · Max / Google AI Plus · Pro · Ultra | 8 · 20 · 100~200 / 20 · 100~200 / 4.99 · 19.99 · 100~200 | 월, USD | |
계산기에 회당 글자 수와 월 회차를 넣어 보세요. 13강의 글자당 토큰이 모델마다 자동으로 들어가고, "호출 배수"는 개요·다시 뽑기·요약·검토까지 한 회에 모델을 몇 번 부르는지예요 — 실제 파이프라인은 3~5배가 보통이에요(이 배수는 제 경험치예요, 측정치가 아니에요).
손으로 한 번 — 5,000자 한 회, 입력 20,000토큰, 호출 1번
| 급 | 모델 | 한 회 | 30회 |
|---|---|---|---|
| 싼 | Gemini 2.5 Flash-Lite | $0.003 | $0.10 |
| 싼 | DeepSeek V4-Flash (비피크) | $0.007 | $0.20 |
| 중간 | gpt-5.4 · Claude Sonnet 5 · Gemini 3.5 Flash | $0.10 · $0.11 · $0.06 | $2.94 · $3.42 · $1.77 |
| 최상 | gpt-5.5 · Claude Opus 5 · Claude Fable 5.1 | $0.20 · $0.29 · $0.57 | $5.88 · $8.55 · $17.10 |
그러니까 모델 값 자체는 한 회에 몇 십 원에서 몇 백 원이에요. 한 달 원고를 최상급으로 뽑아도 커피 두 잔이에요. 진짜 비용은 배수에서 나와요 — 마음에 안 들어 다시 뽑고, 개요를 따로 뽑고, 요약을 갱신하고, 설정 충돌을 검사하는 호출이 한 회에 서너 번씩 붙으면 그 값이 곱해져요. 입력 컨텍스트를 캐시하면(Claude 캐시 히트 $0.20~0.25, OpenAI 10분의 1) 그 배수의 절반쯤은 되돌려 받아요.
① 서비스의 무료 티어로 — 가장 쉽고 가장 좁다
설치도 설정도 싫으면 여기예요. 2026-09-03 기준으로 무료 티어가 실제로 뭘 주는지 적었어요. "커뮤니티"는 회사가 안 밝혀 사용자 기록으로만 확인된 값이에요.
| 서비스 | 무료로 주는 것 | 조이는 것 | 소설에 쓸 때 |
|---|---|---|---|
| ChatGPT Free | 텍스트 대화 무제한(2026-08-06부터), GPT-5.6 Luna, Canvas 편집기 | 즉답 창 27K, 메모리 제한, 추론 모델은 유료 | 가장 큰 무료 창. Canvas로 원고를 붙여 두고 고치기 좋아요 |
| Claude Free | 메모리(2026-03부터), 프로젝트 5개, 웹 검색 | 사용량 제한, 창은 유료 200K | 프로젝트에 스토리 바이블을 파일로 두면 8강의 벡터 검색을 공짜로 써요 |
| Gemini Free | 3.6 Flash (2026-07부터 전원) | 일일 한도 | 긴 창이 필요할 땐 유료(1M) |
| 뤼튼 | GPT-5 무제한, 로그인 없이도 | 소설 전용 기능 없음 | ChatGPT Free와 같은 쓰임. 한국어 UI가 편하면 여기 |
| 제타 | 자체 모델 대화, 중간 광고 | 웹 비구독 하루 90턴(커뮤니티), 새 기능은 유료 모델 먼저 | 캐릭터 롤플레이용. 원고 이어 쓰기엔 안 맞아요 |
| 크랙 | 무료 크래커 하루 350(커뮤니티) → 파워챗 25로 하루 14턴 | 30일 소멸, 상위 모델은 유료 | 키워드북·유저노트가 있어 이 교과서의 조립기를 그대로 배워요 |
| AI Dungeon Free | 모델 8개(Muse·Wayfarer 등), 기억 25개 | 창 4K (2K인 모델도), 크레딧 0 | 텍스트 어드벤처의 무료 기준점. 4K는 한국어로 두어 장면이에요 |
| Character.AI Free · Janitor Free | 캐릭터 대화 / 창 9K쯤 | 광고·스와이프 제한 / 상위 모델 유료 | 캐릭터 대화용 |
| NovelAI | 체험 50회 (일회성) | 이후 월 $10부터 | 무료 티어가 아니라 시식이에요 |
여기서 최대한 뽑는 법
한계는 분명해요. 비서 목소리(5강), 작은 창(8강), 그리고 정책이에요. Anthropic의 이용 정책(2025-09-15)은 성행위 묘사·성적 대화·잔혹한 폭력 묘사를 금지하고 소설이라는 예외를 두지 않았어요. OpenAI의 모델 스펙(2026-08-18)은 예술적 맥락이면 민감한 내용을 허용하지만, 예고했던 성인 모드는 2026년 3월에 무기한 보류됐어요. Google도 예술적 고려로 예외를 둔다고만 적었어요. 장르가 여기 걸리면 ②·③으로 내려가야 해요.
② 무료 API + 오픈소스 프론트 — 서비스가 파는 걸 내가 조립한다
4강의 ③ "키만 꽂기" 프론트에 무료 API 키를 꽂는 길이에요. 2026년 들어 판이 크게 바뀌어서 작년 글은 대부분 틀려요 — GitHub Models는 2026-07-30에 문을 닫았고, Cerebras는 8월부터 카드를 요구하고, Groq는 6월에 Llama·Qwen3-32B를 무료 티어에서 뺐고, Google은 무료 한도표를 지웠어요. 2026-09-03에 살아 있는 걸 확인한 대로 적어요.
| 제공자 | 무료 한도 | 쓸 만한 모델 | 카드 | 내 원고를 학습에 쓰나 |
|---|---|---|---|---|
OpenRouter :free | 분당 20 · 하루 50회 (평생 한 번 $10 충전하면 하루 1,000회) | GLM-5.2(Elo 1751) · Gemma 4 31B · Nemotron 3 Ultra · MiniMax M3 — 목록이 매주 바뀜 | 불필요 | 제공자마다 달라요. 설정에서 학습하는 제공자 차단 가능. Inkling:free는 로그 명시 |
| Groq | 분당 30 · 하루 1,000회 · 분당 8K 토큰 · 하루 200K | Qwen3.8-27B (gpt-oss는 소설에 최악) | 불필요 | 미기재 |
| Google AI Studio | 모델별로 있음 — 공식 표 없음, 프로젝트마다 확인. Flash를 하루 20회로 깎은 사례(2025-12) | Gemini 3.x Flash · Flash-Lite · Gemma 4 | 불필요 | 예 — 공식 가격표에 "제품 개선에 사용: 예" |
| Mistral 무료 모드 | "평가용 최저 한도"만 공식. 월 10억 토큰설은 미확인 | Small 4 · Medium 3.5 | 전화 인증 | 학습 동의가 조건(커뮤니티) |
| Cloudflare Workers AI | 하루 10,000뉴런 — gpt-oss-20b 출력 ≈36만 토큰/일, Gemma 3 12B ≈20만, Llama 3.3 70B ≈5만 | Gemma 3 12B · Llama 3.x · DeepSeek V4 Flash | 불필요 | 미확인 |
| Z.ai | GLM-4.7-Flash·4.5-Flash $0, 한도 미공개 | Flash 계열 (문장은 약함) | 불필요 | 미기재 · 중국 관할 |
| NVIDIA NIM | 공식 한도 없음 (분당 40회쯤, 미확인) | DeepSeek V4 · Nemotron | 전화 인증 | 학습 안 한다(커뮤니티) |
| 죽었거나 너무 좁음 | GitHub Models(종료) · Cerebras(카드+30일 크레딧) · SambaNova(하루 20회) · Cohere(월 1,000회) · Hugging Face(월 $0.10) · Together·Fireworks(유료) | |||
프론트엔드는 목적에 따라 골라요. 원고 이어 쓰기면 KoboldCpp의 Story 모드나 Mikupad(HTML 파일 하나를 브라우저로 여는 게 설치의 전부예요 — 기억·작가 노트·World Info가 다 있어요), 캐릭터 대화면 SillyTavern, 노벨크래프터 같은 원고 작업대가 필요하면 오픈소스 판인 OpenWrite (코덱스 있음, AGPL)예요. 셋 다 OpenAI 호환 주소면 어디든 꽂혀요.
https://openrouter.ai/api/v1, 키를 붙여 넣어요.z-ai/glm-5.2:free. 목록이 바뀌면 OpenRouter의 모델 페이지에서 :free로 걸러요.주의 둘. 무료 엔드포인트는 피크 시간에 느려지고 예고 없이 사라져요 — 원고는 늘 내 파일에 있어야 해요. 그리고 학습 여부가 "미기재"인 곳에 민감한 원고를 넣지 마세요. 그런 원고는 17강이 답이에요.
③ 내 컴퓨터에서 — 한도도 정책도 로그도 없다
가중치 파일을 받아 내 기계에서 돌리는 길이에요. 파일 하나 받아 실행하는 KoboldCpp(Story 모드가 있어 원고 이어 쓰기에 제일 맞아요), 명령줄이 편하면 Ollama(MIT), 화면이 편하면 LM Studio(무료, 소스는 비공개)나 Jan(Apache). 모델은 GGUF라는 압축 형식으로 받는데, Q4_K_M 정도가 크기와 품질의 균형점이에요.
| 크기 | Q4_K_M 파일 | 예 | 필요한 메모리 (VRAM 또는 맥 통합 메모리) |
|---|---|---|---|
| 4B · 8B | 2.5 · 5.0 GB | Qwen3-8B · Kanana-1.5-8B · A.X 4.0 Light | 8GB면 여기까지 (창 8~16K) |
| 12B · 14B | 7.5 · 9.0 GB | Wayfarer 12B · Muse-12B · Mi:dm 2.0 11.5B · Gemma 4 12B | 16GB 편안. 8GB는 Q3나 CPU 분담 |
| 24B · 27B | 14.3 · 16.6 GB | Cydonia 24B · Qwen3.8-27B · Gemma 3 27B | 16GB는 IQ4에 짧은 창, 24GB 편안 |
| 30~32B | 17~20 GB | Muse-Glimmer-30B · Equinox-31B · EXAONE 4.0 32B · SEED Think 32B | 24GB (창 8~16K) · 맥 32GB면 Q5·Q6 |
| 70B | 42.5 GB (IQ2로 24GB) | Llama 3.3 70B · Wayfarer Large 70B | 48GB 이상. 24GB는 IQ2로 품질을 깎아야 해요 |
규칙 하나 — 모델 파일에 KV 캐시 1~3GB를 더한 값이 메모리의 90% 안에 들어야 해요. 속도는 메모리 대역폭이 정해요(써드파티 벤치, 참고치): 8B는 RTX 4090에서 초당 100~160토큰, M4 Max에서 50~75. 27~32B는 4090에서 30~45, M4 Max에서 25~30, 24GB M4 Pro에서 8~15. RTX 4060 8GB는 12B를 20~25로 돌려요. 초당 20토큰이면 5,000자 한 회가 3~6분이에요.
목적별 모델
- 영어 소설 품질 최우선 — Muse-Glimmer-30B(Apache 2.0, 24GB) 또는 Qwen3.8-27B. 12강 표의 로컬 1·2위예요.
- 롤플레이·성인·어두운 장르 — Cydonia 24B v4.3, Artemis-31B, Equinox-31B, 16GB면 Wayfarer 12B· Muse-12B. "주인공 보정 없음"으로 길러진 계열이에요(11강).
- 한국어 — 8~16GB면 Kanana-1.5-8B(Apache) · Mi:dm 2.0 11.5B(MIT) · A.X 4.0 Light 7B(Apache), 24GB면 HyperCLOVA X SEED Think 32B · EXAONE 4.0 32B(비상업). 13강 표예요.
- GPU가 없으면 — Google Colab의 KoboldCpp 노트북(T4 16GB, 24B가 상한. 2026년에도 도는지는 확인 못 했어요)이나 Kaggle(주 30 GPU시간, T4 두 장)로 임시 서버를 띄우고 Mikupad를 연결해요.
localhost:5001. Story 모드로 바꾸면 채팅 턴 없이 원고를 그대로 이어 써요.30줄로 직접 만들기 — 6강의 조립기를 코드로
이 교과서의 결론을 코드로 적으면 이만큼이에요. Cloudflare Workers AI는 하루 10,000뉴런을 무료로 주고(Gemma 3 12B 기준 출력 약 20만 토큰 — 5,000자 회차로 60편쯤), 계정에 카드가 없어도 돼요. 6강의 다섯 층이 각 줄에 그대로 있어요.
// wrangler.jsonc 에 "ai": { "binding": "AI" } 한 줄. 배포는 npx wrangler deploy. const LORE = [ // ③ 로어북 { keys: ["하은"], text: "하은 — 27세 기록보관소 직원. 왼눈이 회색. 거짓말을 못 견딘다." }, { keys: ["인쇄소"], text: "서교동 인쇄소 — 1980년대 활판 인쇄소. 지하에 청사진 금고." }, ]; const MEMORY = "3인칭 과거 「~다」 서술. 하은→도윤 반말, 도윤→하은 해요체. 장르: 도시 미스터리."; // ② const NOTE = "다음 장면은 200자 안. 대화 한 줄 이상. 결말을 서두르지 않는다."; // ⑤ export default { async fetch(req, env) { const { story } = await req.json(); // 지금까지의 원고 const tail = story.slice(-8000); // ④ 본문 — 창에 맞춰 앞을 자른다 const lore = LORE .filter(e => e.keys.some(k => tail.slice(-1500).includes(k))) // 끝 1,500자만 훑는다 (7강) .map(e => e.text).join("\n"); const messages = [ { role: "system", content: `당신은 이 소설의 공동 저자다. 이어서 쓴다.\n${MEMORY}\n${lore}` }, // ①+②+③ { role: "user", content: `${tail}\n\n[작가 노트: ${NOTE}]\n\n(이어서)` }, // ④+⑤ ]; const out = await env.AI.run("@cf/google/gemma-3-12b-it", { messages, max_tokens: 400, temperature: 1.0 }); return Response.json({ next: out.response }); } };
- 모델 ID와 뉴런 단가는 Workers AI 문서의 모델 목록에서 다시 확인하세요 — 목록이 자주 바뀌어요. gpt-oss-20b가 뉴런은 더 싸지만 12강대로 산문이 약해요.
- 13강의 어미 검사는
out.response를 받은 다음 정규식 한 줄로 붙여요. 어긋나면 한 번 더 부르고요 — 그게 14강의 "배수"예요. - 요약(8강)을 붙이고 싶으면 MEMORY를 상수 대신 KV에 두고, 열 장면마다 모델에게 갱신시켜요. 여기까지 하면 크랙의 스토리 화면과 구조가 같아져요.
저작권과 플랫폼 정책 — 한국 기준
한국 저작권법 제2조는 저작물을 "인간의 사상 또는 감정을 표현한 창작물"로 정해요. 그래서 AI가 혼자 만든 글은 원칙적으로 보호를 못 받아요. 한국저작권위원회는 2023년 12월 안내서에서 "AI 산출물 자체는 등록 불가, 인간이 수정·증감한 부분만 보호"라고 했고, 2025-06-30 「생성형 AI 활용 저작물의 저작권 등록 안내서」가 지금의 기준이에요(2026-09-03 확인, 이후 개정판 없음).
- 사람이 AI를 도구로 썼으면 등록할 수 있어요. 단, 신청서에 AI가 생성한 부분을 표시해야 해요.
- 오탈자 수정·색 바꾸기 같은 사소한 변경은 창작으로 안 쳐요. 인정되는 유형은 셋 — 내 저작물을 프롬프트로 넣었거나, 산출물을 실질적으로 고쳤거나, 여러 산출물을 창작적으로 골라 배열했거나.
- 창작 과정을 영상 등으로 기록해 두라고 권해요. 최종 판단은 법원이고요.
- AI 산출물을 사람이 만든 것처럼 허위 등록하면 저작권법 제136조로 처벌되고 등록이 취소돼요.
2026-01-22에 시행된 인공지능기본법은 생성물 표시 의무를 두지만 그 주체는 AI 사업자예요. ChatGPT로 쓴 글을 개인이 연재하는 건 "이용"이라 표시 의무가 없고, 단순 유통 플랫폼도 의무가 없어요 (자체 생성 기능을 제공할 때만). 계도 기간이 1년 이상이라 아직 과태료 사례도 없어요. 제타의 화면 워터마크, 크랙의 비가시성 워터마크가 이 법에 대한 사업자 쪽 대응이에요.
플랫폼은 어디까지 허용하나 (2026-09-03)
| 플랫폼 | 명시된 규정 | 근거 |
|---|---|---|
| 문피아 | 공모전 금지 — "본문 및 표지 등의 직접적인 AI 생성물 사용을 허용하지 않는다", 적발 시 심사 제외·당선 취소. 일반 연재는 명문 규정 미확인 | 고객센터 FAQ |
| 리디 | 공모전 금지 — "생성형 AI를 활용해 일부 또는 전부를 작성한 작품" 응모 불가. 일반 유통은 미확인 | 2025-07 공모 요강 |
| 노벨피아 | 명시 규정 없음. 2026-07 플러스 심사 재심 3회 제한 공지는 AI를 언급하지 않아요. 한편 자사 노벨챗으로 AI 사업 중 | FAQ · 공지 |
| 카카오페이지 · 네이버 시리즈 | 별도 규정 없음 (2023년 "가이드라인 마련 예정" 뒤 확인된 후속 없음) | 2026-03 보도 |
| 공통 | 고지 의무 없음, 심의는 폭력·선정성 중심이라 AI 판별 구조가 없어요. 실제 제재는 독자의 별점 — 연재가 중단된 사례가 이쪽이에요 | 2026-03 보도 |
그러니까 지금 한국의 실질 규칙은 법이 아니라 공모전 요강과 독자예요. 공모전은 두 곳이 명문으로 막았고, 연재는 막는 규정이 없지만 들키면 독자가 판정해요. 이 교과서가 "AI가 대신 쓰기"보다 "조립기를 알고 도구로 쓰기"에 무게를 둔 이유예요 — 그게 등록 안내서가 말하는 "도구로 썼다"의 뜻이기도 하고요.
공부 지도
여기까지 읽었으면 어떤 AI 소설 서비스를 봐도 "모델은 누구 거고, 조립기는 어떻게 생겼고, 값은 누가 내나"를 물을 수 있을 거예요. 더 가고 싶다면 이 순서예요.
먼저 — 원문
노벨AI의 Lorebook 문서와 SillyTavern의 World Info 문서를 한 번은 직접 읽어요. 7강은 요약이고 원문이 기준이에요. 캐릭터 카드는 V2 규격· V3 규격 원문이 짧아요.
그다음 — 리더보드를 직접
EQ-Bench Creative Writing은 새 모델이 나올 때마다 갱신돼요. 12강의 표는 2026-09-03의 스냅숏이라 몇 달 뒤엔 순위가 바뀌어 있을 거예요. 샘플 글까지 공개돼 있으니 점수 말고 글을 읽어 보세요.
논문 넷
min-p 샘플링(arXiv 2407.01082, ICLR 2025) · 정렬이 다양성을 깎는다(2406.05587) · 개요→초안→ 재정렬→수정의 Re³(2210.06774)와 그 후속 DOC(2212.10077). 10강과 5강, 그리고 수도라이트의 초안 파이프라인이 어디서 왔는지 보여요.
오래 걸리는 것 — 내 원고로 짝 비교
한국어 창작 벤치마크는 없어요(13강). 그러니 내 원고 한 장면을 같은 프롬프트로 모델 둘에 돌리고 나란히 읽는 습관이 유일한 잣대예요. 16강의 OpenRouter 무료 모델 둘이면 오늘 바로 시작할 수 있어요. 점수가 아니라 "어느 쪽이 내 목소리에 가까운가"를 적어 두세요.
경로 판정기 — 나는 어느 갈래로
다섯 개만 고르면 15~17강 중 어디로 갈지, 혹은 돈을 내는 게 나은지 그 자리에서 나와요.
시작 전 점검표 — 10문
어느 갈래로 가든 첫 회차를 뽑기 전에 한 바퀴 돌아요. 체크는 이 브라우저에 저장돼요.
출처와 확인일
이 페이지의 숫자는 전부 2026-09-03에 아래 원문에서 직접 읽었어요. 가격·한도·모델 목록은 빨리 바뀌니 인용 전엔 원문으로 다시 확인하세요. "커뮤니티"로 표시한 값은 회사가 공개하지 않아 사용자 기록으로만 확인된 것이고, "추정"은 실측이 아니에요.
국내
- 뤼튼 — 고객센터 · GPT-5 무료(ZDNet 2025-08-08) · 2025 실적(ZDNet 2026-04-14) · 1,000억 투자(서울경제 2026-08-26)
- 크랙 — 고객센터(등급별 크래커 소모량) · 스토리 만들기 가이드(키워드북) · 정산 개편(전자신문 2026-07-31)
- 제타 — 자체 모델 Spotwrite(Elice 사례) · 제타패스 공지(2026-02-26) · 흑자·시리즈D(서울경제 2026-06-14)
- 사용자 수 — 와이즈앱 2026-07 MAU · 2026-02 총사용시간(AI타임스)
- 노벨라 요금 · 펜시브 소개 · 노벨챗 사이트
- 플랫폼 정책 — 문피아 FAQ · 리디 공모 요강(2025-07) · 플랫폼 규정 현황(미디어스 2026-03-20)
- 저작권 — 생성형 AI 활용 저작물의 저작권 등록 안내서(2025-06-30) · 인공지능기본법 시행(정책브리핑 2026-01-21)
해외 서비스
- NovelAI — 모델 · 구독 · Xialong 발표 · Lorebook
- Sudowrite — 요금 · Muse
- AI Dungeon — 요금 · 컨텍스트 구성 · 메모리 뱅크 · Latitude 오픈 웨이트
- Novelcrafter 요금 · Character.AI 오픈소스 모델 튜닝(2025-08) · c.ai+ · Dreamily 종료 공지
- SillyTavern — World Info · 벡터 저장소 · KoboldCpp 저장소 · Mikupad 저장소
- ChatGPT 요금 · Claude 요금 · Google AI 플랜
모델·가격·원리
- API 가격 — OpenAI · Anthropic · Google · DeepSeek · Z.ai · Mistral
- 무료 한도 — OpenRouter · Groq · Google AI Studio · Workers AI · GitHub Models 종료 · Cerebras
- 리더보드 — EQ-Bench Creative Writing v3 · Longform · Muse-Glimmer-30B · GLM-5.2
- 한국어 모델 — Kanana 1.5 · Mi:dm 2.0 · A.X 4.0 Light · HyperCLOVA X SEED 라이선스 · EXAONE 4.0
- 토큰 실측 — tiktoken o200k·cl100k, Bedrock CountTokens(2026-09-03, 웹소설풍 지문 725·793자) · 한국어 토큰 병합 실험(Motif)
- 샘플링 — min-p · DRY · XTC · NovelAI Sampling Lab · Anthropic Messages API(온도 폐기)
- 파인튜닝 — Wayfarer 12B 모델 카드 · 정렬과 다양성
- 정책 — Anthropic 이용 정책(2025-09-15) · OpenAI Model Spec(2026-08-18) · Google 생성형 AI 금지 사용 정책
이 사이트에서 찾아보기
- 오픈웨이트는 오픈소스가 아니다 — 12·13강의 "Apache · MIT · NC" 표를 읽는 눈이 거기 있어요. 같은 틀로 쓴 자매 교과서예요.
- 새벽 세 시의 단편들 — 이 사이트 주인이 AI와 함께 쓴 단편들이에요. 이 교과서의 조립기가 실제로 굴러간 자리예요.
- 결 潔 — 인간이 의도의 해석을 AI에게 넘긴 시대의 장편소설. 사람이 쓴 쪽이에요.
- LLM 실전 위키 — API 실무·모델 스펙은 여기가 깊어요. UI/UX · 파는 감각도 같은 서가예요.
마지막 한 줄 — 뤼튼에 "소설 써 줘"라고 치는 것과 노벨AI에 월 $25를 내는 것과 내 컴퓨터에서 Muse-Glimmer를 돌리는 것은 같은 기계의 세 가지 값이에요. 무엇이 같은지 알면 값을 고를 수 있어요.
이 교과서는 계속 자라요 — 가격표와 무료 한도는 특히 빨리 낡으니, 부록의 확인일보다 오래됐으면 원문을 먼저 보세요. 고칠 곳을 찾으면 기록에 남길게요.