이 글은 Claude Fable 5.1 을 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.


들어가며#

Claude Code 와 OpenAI Codex 는 2026년 여름을 지나며 각각 세 개의 뚜렷한 가격 티어를 갖추게 되었습니다. Anthropic 쪽은 Fable 5.1 / Opus 5 / Sonnet 5, OpenAI 쪽은 GPT-6 Astra / GPT-5.6 Sol / GPT-5.6 Terra 입니다. 입력 토큰 기준으로 대략 10 : 5 : 2 의 가격 사다리이고, 두 회사의 사다리가 거의 같은 칸에 놓여 있습니다.

이 시리즈가 답하려는 질문은 하나입니다. 바이브 코딩(에이전트에게 코드를 맡기는 작업)의 어느 단계에서 어느 티어를 쓰고, 언제 갈아타야 비용 대비 효율이 가장 높은가. 답은 “항상 제일 좋은 모델” 도, “항상 제일 싼 모델” 도 아닙니다. 단계마다 토큰이 소비되는 모양이 다르고, 실수의 대가가 다르기 때문입니다.

시리즈 구성은 다음과 같습니다.

편내용
Part 1 (이 글)세 티어의 실제 가격표, “비용” 의 네 가지 정의, 토큰 단가와 작업당 비용이 어긋나는 이유, effort 와 캐시라는 더 큰 레버
Part 2바이브 코딩 세션을 여섯 단계로 쪼개고, 단계마다 토큰이 어떻게 소비되는지, 단계별 티어 매핑의 종합표
Part 3고가 티어(Fable·Astra)를 써야 하는 자리와 쓰면 안 되는 자리
Part 4중가·저가·바닥 티어(Opus·Sonnet·Haiku, Sol·Terra·Luna)의 역할 분담
Part 5실제 전환 메커니즘(/model, opusplan, 서브에이전트 모델 고정, Codex 프로파일), 에스컬레이션 규칙, 하루 운영 플레이북과 암기표

자료는 세 갈래로 모았습니다. Anthropic 과 OpenAI 의 공식 문서, Simon Willison·Addy Osmani·Gergely Orosz·Birgitta Böckeler·Steve Yegge·Every 등 직접 실험 결과를 공개하는 테크블로거, 그리고 Hacker News·X·GitHub 이슈·dev.to 의 실사용자 토론 입니다. 한 가지 미리 밝혀 둘 점은, reddit 은 2026년 9월 현재 자동화된 접근을 전면 차단하고 있어 이 글에서 직접 인용하지 못했습니다. 커뮤니티 의견은 Hacker News 의 대형 스레드(Fable 5.1 발표 1,395 댓글, GPT-6 Astra 발표 2,081 댓글 등)와 X 의 실사용자 게시물로 대신했습니다.


1. 2026년 9월의 가격표#

먼저 이름부터 확인합니다. 두 회사 모두 티어 이름을 자주 바꾸므로, 이 글에서 다루는 모델이 무엇인지 공식 문서 기준으로 고정합니다.

1.1 Anthropic — Fable 5.1, Opus 5, Sonnet 5, 그리고 Haiku 4.5#

Anthropic 의 모델 개요 문서와 가격 문서에 따르면 2026년 9월 현재 라인업은 다음과 같습니다.

모델모델 ID입력 $/M출력 $/M캐시 읽기 $/M컨텍스트출시
Claude Fable 5.1claude-fable-5-110500.251M2026-09-01
Claude Opus 5claude-opus-55250.501M2026-07-24
Claude Sonnet 5claude-sonnet-52100.201M2026-06-30
Claude Haiku 4.5claude-haiku-4-5150.10200K2025-10

세 가지를 짚어 둡니다.

  • Sonnet 5 의 $2/$10 은 출시 때 “2026년 8월 31일까지의 도입 가격” 이라고 발표되었지만, 가격 문서에 “예정되었던 $3/$15 인상은 시행하지 않는다” 는 문구가 붙어 정식 가격이 되었습니다. 2026년 8월 이전 자료를 보면 인상 예정으로 적혀 있는 경우가 많으니 주의가 필요합니다.
  • Fable 5.1 의 캐시 읽기 단가 $0.25 는 Fable 5 의 $1 에서 75% 내린 값입니다. 기본 입력 단가의 2.5% 입니다. 다른 모델은 10% 입니다. 이 숫자가 뒤에서 중요해집니다.
  • Anthropic 의 모델 선택 가이드는 “대부분의 워크로드는 Opus 5 에서 시작하라” 고 적고, Fable 5.1 은 “Opus 5 를 더 높은 effort 로 돌려도 평가 결과가 모자랄 때” 로 한정합니다. Fable 이 어느 요금제에서도 기본 모델이 아니라는 점은 Claude Code 문서에도 명시되어 있습니다.

1.2 OpenAI — GPT-6 Astra, GPT-5.6 Sol, GPT-5.6 Terra, 그리고 GPT-5.6 Luna#

OpenAI 쪽은 이름이 두 세대에 걸쳐 있습니다. Codex 의 모델 문서와 API 의 가격 문서를 기준으로 정리합니다.

모델모델 ID입력 $/M출력 $/M캐시 읽기 $/M컨텍스트출시
GPT-6 Astragpt-6-astra10501.001,050K2026-09-03
GPT-5.6 Solgpt-5.6-sol4200.401,050K2026-07-09
GPT-5.6 Terragpt-5.6-terra2120.201,050K2026-07-09
GPT-5.6 Lunagpt-5.6-luna0.201.200.021,050K2026-07-09

여기도 세 가지를 짚습니다.

  • Sol 의 $4/$20 은 프로모션 가격입니다. 출시가는 $5/$30 이었고, 2026년 8월 21일에 20% 이상 인하되어 “최소 2026년 11월 21일까지” 유지된다고 도움말에 적혀 있습니다. 이 글은 현재 가격을 씁니다.
  • Sol·Terra·Luna 는 GPT-5.6 한 세대의 세 티어이고, Astra 는 그 위에 얹힌 GPT-6 세대입니다. OpenAI 는 “Sol, Terra, Luna 는 지속되는 능력 티어를 가리키는 이름” 이라고 설명합니다. 즉 사용자가 부르는 “고가 Astra / 중가 Sol / 저가 Terra” 는 가격 사다리로는 정확하지만, 커뮤니티에서는 Terra 를 “균형형” 으로, Luna 를 “싼 티어” 로 부르는 경우가 더 많습니다. 이 시리즈는 가격 사다리를 기준으로 삼되, Haiku 4.5 와 Luna 를 바닥 티어 라는 네 번째 칸으로 따로 다룹니다.
  • Codex 의 모델 문서는 티어별 용도를 한 줄씩 정의합니다. Astra 는 “여러 단계와 도구를 가로지르는 가장 강한 능력이 필요한 작업”, Sol 은 “모호하거나 어렵거나 가치가 높은 작업”, Terra 는 “Sol 의 깊이가 필요 없는 일상 작업”, Luna 는 “좋은 결과가 무엇인지 아는, 구체적이고 반복되는 대량 작업” 입니다.

1.3 두 사다리를 겹쳐 보면#

flowchart LR
    subgraph HI["고가 티어 · $10 / $50"]
        F["Claude Fable 5.1"]
        A["GPT-6 Astra"]
    end
    subgraph MID["중가 티어 · $4-5 / $20-25"]
        O["Claude Opus 5"]
        S["GPT-5.6 Sol"]
    end
    subgraph LO["저가 티어 · $2 / $10-12"]
        N["Claude Sonnet 5"]
        T["GPT-5.6 Terra"]
    end
    subgraph FL["바닥 티어 · $0.2-1 / $1.2-5"]
        H["Claude Haiku 4.5"]
        L["GPT-5.6 Luna"]
    end
    HI --> MID --> LO --> FL
    style HI fill:#FFD700,color:#000000
    style MID fill:#87CEEB,color:#000000
    style LO fill:#90EE90,color:#000000
    style FL fill:#E0E0E0,color:#000000

입력 단가 기준으로 고가 : 중가 : 저가는 Claude 가 10 : 5 : 2, OpenAI 가 10 : 4 : 2 입니다. 출력 단가는 Claude 가 50 : 25 : 10, OpenAI 가 50 : 20 : 12 입니다. 한 칸 내려갈 때마다 대략 2~2.5배씩 싸집니다. 바닥 티어는 회사에 따라 차이가 큰데, Haiku 4.5 는 Sonnet 5 의 절반 값이지만 Luna 는 Terra 의 10분의 1 값입니다.


2. “비용” 은 네 가지다#

모델 티어 전략을 이야기할 때 사람마다 다른 비용을 머리에 두고 말합니다. 논의가 엇갈리는 이유의 절반은 여기 있습니다.

2.1 API 토큰 비용#

가장 단순한 비용입니다. 위 가격표 그대로입니다. 그러나 개인 개발자 대부분은 이 비용을 직접 내지 않습니다. Claude Code 의 비용 문서가 밝힌 기업 배포 평균은 “개발자 1인당 활동일 기준 약 $13, 월 $150~250, 90% 의 사용자가 하루 $30 미만” 입니다. 이 숫자가 의미 있는 것은 API 키로 쓰는 팀과 회사입니다.

2.2 구독 한도#

개인 사용자의 실제 비용은 주간·5시간 한도 입니다. Claude Max 는 5x($100) 와 20x($200) 두 종류가 있고, 세션 한도와 주간 한도가 모든 모델에 걸쳐 공유됩니다. Anthropic 도움말에 따르면 Max 와 Team Premium 에서는 Fable 모델을 주간 한도의 50% 까지만 쓸 수 있고, Pro 에서는 Fable 이 한도에 포함되지 않아 API 요율의 사용 크레딧으로 결제됩니다.

Codex 쪽은 가격 문서에 5시간당 “로컬 메시지” 범위가 티어별로 적혀 있습니다. Plus 기준으로 Astra 5~45, Sol 10~100, Terra 25~200, Luna 250~2,000 입니다. 같은 요금제 안에서 한 칸 내려갈 때마다 쓸 수 있는 메시지 수가 2~10배 늘어납니다. Pro $200 은 Plus 의 20배입니다.

구독 사용자에게 모델 티어를 낮추는 것은 “돈을 아끼는 것” 이 아니라 “이번 주에 할 수 있는 일의 양을 늘리는 것” 입니다. Hacker News 의 Fable 5.1 발표 스레드에서 Max 20x 사용자가 “첫 작업에서 한 시간이 안 되어 5시간 한도를 소진했다”, “Fable 5 와 Opus 5 는 주간 한도를 이틀 만에 다 쓰는데 Opus 4.8 은 일주일을 버텼다” 고 보고한 것이 이 비용의 실체입니다.

2.3 사람의 시간#

“제일 좋은 모델을 항상 써라” 진영의 근거입니다. Claude Code 를 만든 Boris Cherny 는 2026년 1월 X 에 “Opus 에 thinking 을 켜고 모든 일에 쓴다. 덜 조종해도 되니 결국 작은 모델보다 거의 항상 빠르다” 고 적었고, Fable 5.1 출시일에는 “모든 일에 이걸 쓰고 있다” 고 덧붙였습니다. Hacker News 의 한 사용자는 “작은 모델이 실수할 약간의 위험이 큰 모델을 늘 돌리는 것보다 비싸다” 고 정리했습니다. 개발자의 시급이 토큰 단가보다 훨씬 비싸다면 이 계산은 옳습니다.

2.4 재작업 비용#

가장 눈에 안 띄지만 가장 큰 비용입니다. 계획 단계에서 틀린 결정은 구현 단계 전체를 다시 하게 만듭니다. 저가 모델이 두 번 실패하고 결국 고가 모델로 올라가면 처음부터 고가로 한 것보다 비쌉니다. 반대로 잘 정의된 반복 작업에 고가 모델을 쓰는 것은 재작업이 없으므로 순수한 낭비입니다. Part 2 에서 단계별로 이 비용을 따집니다.

이 시리즈에서 “비용 대비 효율” 이라고 할 때는 네 가지를 합친 것 을 뜻합니다. 결론이 “항상 싼 모델” 이 되지 않는 이유가 여기 있습니다.


3. 토큰 단가와 작업당 비용은 다르다#

이 시리즈의 첫 번째 핵심 명제입니다. 단가가 5배 비싼 모델이 작업당 비용은 더 쌀 수 있습니다. 2026년에는 이것을 뒷받침하는 1차 자료가 여럿 나왔습니다.

3.1 Anthropic 의 자체 측정#

Anthropic 의 비용·지능 최적화 문서는 SWE-bench Pro 에서 다음을 보고합니다.

Claude Fable 5.1 at low effort solved 88.6% of tasks for $0.54 per solved task, against 77.4% for $0.84 from Claude Sonnet 5 … 11 more points for 35% less per solved task, despite a per-token price five times higher.

같은 문서에서 Opus 5 는 기본 effort 의 Fable 5.1 과 같은 정확도(91.7% 대 92.1%, 실행 간 오차 범위 안)를 해결 과제당 약 15% 싸게 냈습니다($1.01 대 $1.19). 그리고 어려운 과제(Terminal-Bench 3)에서는 Opus 4.7·4.8·5 가 과제당 $8~15 를 비슷하게 쓰지만 해결률이 7%·15%·41% 로 달라서, 해결 과제당 비용이 $183 → $63 → $28 로 떨어집니다. 강한 모델일수록 과제당 비용이 싸지는 구간이 분명히 존재합니다.

3.2 독립 벤치마크의 작업당 비용#

Artificial Analysis 는 2026년 9월 GPT-6 Astra 를 측정하면서 Fable 5.1 과 지능 지수가 동률(53)인데 지수 과제당 비용은 Astra $3.26 대 Fable 5.1 $7.63 이라고 보고했습니다. 단가는 같은데 Astra 가 “같은 점수를 내는 데 출력 토큰을 약 3분의 1만 쓰기” 때문입니다. 두 달 전 Opus 5 측정에서는 Opus 5(max) 가 지수 61 로 Fable 5(max) 의 60 을 넘으면서 과제당 비용은 $2.03 대 $2.75 로 더 쌌습니다.

OpenAI 도 최신 모델 가이드에서 Astra 가 “출력 토큰을 상당히 적게 쓰면서 더 강한 결과를 내므로, 토큰 단가가 높음에도 추정 API 비용은 과제당 더 낮다” 고 적었습니다.

3.3 그러나 실사용에서는 반대 보고도 있다#

여기서 정직해야 합니다. Every 의 Fable 5.1 Vibe Check는 자사 에이전트에서 Fable 5.1 이 “Opus 5 와 같은 일을 약 절반의 토큰으로” 한다고 했지만, Zvi Mowshowitz 의 정리 글에 모인 실사용자 보고 중에는 자기 루프에서 토큰 사용이 25~150% 늘었다 는 것도 여럿 있습니다. Anthropic 의 Fable 5.1 변경 사항 문서도 “작은 수정에 파일 전체를 다시 쓰는” 경향을 명시하고 있습니다.

정리하면 고가 모델의 실효 배율은 단가의 2배가 아니라 1배에서 4배 사이 어딘가 이고, 어느 쪽인지는 작업의 성격(벤치마크형 단일 과제인지, 긴 에이전트 루프인지)에 달려 있습니다. 이것이 “단계별로 나눠서 봐야 한다” 는 Part 2 의 출발점입니다.


4. 티어보다 큰 레버 두 개#

두 번째 핵심 명제입니다. 모델 티어를 한 칸 바꾸면 비용이 2~2.5배 움직이지만, 같은 모델 안에서 effort 를 바꾸면 8~33배가 움직입니다. 그리고 프롬프트 캐시는 그보다 더 큽니다.

4.1 effort#

Simon Willison 이 Fable 5.1 출시일에 같은 프롬프트를 다섯 effort 로 돌린 실측입니다.

effort출력 토큰비용시간
low1,998$0.1024초
medium1,977$0.1023초
high2,612$0.1330초
xhigh36,767$1.837분 51초
max65,927$3.3013분 54초

low 와 max 사이가 33배입니다. Fable 5.1 을 low 로 돌리면($0.10) Sonnet 5 를 max 로 돌리는 것보다 쌀 수 있다는 뜻입니다. Anthropic 의 최적화 문서도 코딩 작업에서 “medium 은 약 절반, low 는 약 4분의 3을 절약한다” 고 적고, 최적화 순서를 이렇게 못박습니다.

Sweep effort on your current model first. It is the cheapest experiment on this page, and most workloads end there.

Claude Code 의 모델 설정 문서에 정리된 effort 지침은 다음과 같습니다.

effort공식 지침
low짧고 범위가 좁으며 지연에 민감하고, 지능에 민감하지 않은 작업에 한정
medium지능을 약간 양보할 수 있는 비용 민감 작업에서 토큰 절감
high토큰과 지능의 균형. Opus 4.7 을 제외한 모든 모델의 기본값
xhigh더 깊은 추론, 더 많은 토큰
max까다로운 작업에서 도움이 될 수 있으나 수확 체감과 과잉 사고 경향. 넓게 적용하기 전에 테스트

Codex 도 같은 구조입니다. Codex 모범 사례는 “Low 는 빠르고 범위가 정해진 작업, Medium·High 는 복잡한 변경이나 디버깅, Extra High 는 길고 에이전트적이며 추론이 무거운 작업” 으로 나누고, 기본값은 Medium 입니다. Sol 과 Astra 에는 서브에이전트를 자동으로 띄우는 ultra 가 더 있습니다.

한 가지 반전도 있습니다. effort 를 올린다고 항상 좋아지지 않습니다. Hacker News 에서 여러 사용자가 Anthropic 시스템 카드와 OpenAI 벤치마크를 근거로 max 가 high 보다 낮은 점수를 낸 사례 를 지적했습니다. 높은 effort 가 “요청하지 않은 작은 변경을 더 얹기” 때문이라는 설명입니다. 쉬운 작업에 높은 effort 는 비용만이 아니라 품질도 해칩니다.

4.2 프롬프트 캐시#

Anthropic 의 최적화 문서는 이렇게 시작합니다.

Turn on prompt caching before any other lever … it cut agent-loop cost by a factor of 2.7 to 5.3.

에이전트 루프는 매 턴마다 대화 전체를 다시 보냅니다. Claude Code 의 비용 문서가 “하루 종일 열어 둔 세션에서 한 줄 질문을 해도 대화 전체만큼의 사용량이 든다” 고 경고하는 이유입니다. 캐시 읽기 단가가 입력 단가의 10%(Fable 5.1 은 2.5%) 이므로, 캐시가 살아 있는 한 긴 컨텍스트는 생각보다 싸고, 캐시가 깨지는 순간 생각보다 비쌉니다. 같은 문서는 10만 토큰 프리픽스의 캐시가 한 번 깨지면 Fable 5.1 에서 “$0.03 대신 $1.25, 읽기의 50배” 가 든다고 계산합니다.

구독 사용자에게도 같은 규칙이 적용됩니다. Claude Code 문서에 따르면 구독의 캐시 수명은 1시간이고, 사용 크레딧으로 넘어가면 5분으로 줄어듭니다. 한 시간 넘게 자리를 비웠다 돌아와서 첫 메시지를 보내면 컨텍스트 전체를 다시 처리합니다.

이 시리즈는 모델 티어에 집중하지만, 티어를 논하기 전에 effort 와 캐시가 먼저 라는 순서는 두 회사의 공식 입장이자 실측 결과입니다. Part 5 의 플레이북에서 이 순서를 다시 씁니다.


5. Part 1 의 결론#

  1. 세 티어의 가격 사다리는 두 회사가 거의 같습니다. 고가 $10/$50, 중가 $4~5/$20~25, 저가 $2/$10~12. 한 칸에 2~2.5배. 바닥 티어(Haiku 4.5, Luna)는 회사에 따라 저가의 절반에서 10분의 1.
  2. 개인 사용자의 비용은 달러가 아니라 주간 한도입니다. 티어를 낮추는 것은 이번 주에 할 수 있는 일의 양을 늘리는 일입니다.
  3. 토큰 단가와 작업당 비용은 다릅니다. 강한 모델이 적은 토큰으로 한 번에 끝내는 구간에서는 고가 모델이 더 쌉니다. 그러나 긴 에이전트 루프에서는 반대 보고도 있습니다.
  4. effort 와 프롬프트 캐시가 모델 티어보다 큰 레버입니다. 공식 권고 순서는 캐시 → effort → 모델 비교 → (그래도 모자라면) 멀티모델입니다.

이 네 가지를 깔고 나면 “어느 단계에서 어느 티어인가” 라는 질문이 비로소 의미를 갖습니다. 다음 편에서 바이브 코딩 세션을 여섯 단계로 쪼개고, 단계마다 토큰이 어떤 모양으로 소비되는지, 그리고 공식 문서·블로거·커뮤니티가 각 단계에 어떤 티어를 권하는지 한 표로 모읍니다.


References#

공식 문서 (2026)

실측·분석 (2026)

커뮤니티 (2026)