클로드 모델별 토큰 비용과 구독 플랜 사용량 한도 총정리
클로드(Claude)를 쓰다 보면 비용 이야기가 두 갈래로 나뉜다. 하나는 API 토큰 단가, 다른 하나는 claude.ai 구독 플랜의 사용량 한도다. 둘은 완전히 다른 체계인데 자주 혼동된다. 이 글은 모델별 API 단가와 작업 유형별 예상 비용을 먼저 정리하고, 이어서 Free·Pro·Max 구독의 한도 구조를 비교한다.
모델별 API 단가 비교
중요한 전제 하나. 클로드는 모델 자체가 토큰을 더 쓰거나 덜 쓰는 게 아니라, 토큰당 단가와 같은 텍스트를 토큰으로 쪼개는 방식이 모델별로 다르다. 그래서 "모델별 단가 × 작업별 토큰량 = 실제 비용"으로 비교하는 것이 가장 실용적이다.
| 모델 | 입력 ($/100만 토큰) | 출력 ($/100만 토큰) | 컨텍스트 | 비고 |
|---|---|---|---|---|
| Opus 4.8 (플래그십) | $5 | $25 | 1M | Fast mode는 $10/$50 |
| Opus 4.7 / 4.6 | $5 | $25 | 1M | 1M 컨텍스트 표준가 |
| Sonnet 4.6 | $3 | $15 | 1M | 속도·지능·비용 균형, 최대 출력 128K |
| Haiku 4.5 | $1 | $5 | 200K | 분류·라우팅·추출 등 고볼륨 작업용 |
공통 패턴이 하나 있다. 모든 현재 등급이 출력:입력 = 5:1 비율을 유지한다. 즉 비용을 결정하는 것은 프롬프트 길이보다 응답(출력) 길이다. 프롬프트 캐싱(캐시된 입력 최대 90% 절감)과 배치 API(전체 50% 절감)를 조합하면 절감폭이 더 커진다.
작업 유형별 예상 토큰 사용량과 비용
대표적인 작업 유형에 전형적인 토큰량을 가정하고 위 단가로 계산한, 1회 요청당 비용이다.
| 작업 유형 | 입력 / 출력 (토큰) | Haiku 4.5 | Sonnet 4.6 | Opus 4.8 |
|---|---|---|---|---|
| 짧은 챗·Q&A | 1K / 0.5K | $0.0035 | $0.011 | $0.018 |
| 분류·추출 | 2K / 0.2K | $0.003 | $0.009 | $0.015 |
| 긴 문서 요약 | 20K / 1K | $0.025 | $0.075 | $0.125 |
| 코딩 태스크 | 15K / 3K | $0.030 | $0.090 | $0.150 |
| 에이전트 세션(누적) | 100K / 20K | $0.20 | $0.60 | $1.00 |
대량 기준으로 보면 차이가 더 분명하다. 1,000만 입력 / 200만 출력 워크로드는 Haiku 4.5에서 $20, Sonnet 4.6에서 $60, Opus 4.8에서 $100 수준이다. 그래서 품질 기준을 통과하는 가장 저렴한 모델을 먼저 고르고, 그다음 배치·캐싱·컨텍스트 제어로 나머지를 줄이는 순서가 권장된다.
같은 작업이라도 토큰 수가 달라지는 변수
- 토크나이저 차이: Opus 4.7부터 도입된 새 토크나이저는 같은 입력 텍스트를 최대 35% 더 많은 토큰으로 변환할 수 있고, 4.8에서도 유지된다. 구버전에서 옮기면 단가가 같아도 실효 비용이 0~35% 오를 수 있으므로 실제 워크로드로 벤치마크가 필요하다.
- effort 제어: Opus 4.8의 effort 파라미터는 응답 전체(툴 호출 포함)의 토큰 소비량을 조절한다. 단순 작업을 low effort로 돌리면 출력 토큰이 high 대비 1/10 수준까지 떨어질 수 있다.
구독 플랜별 사용량 한도 - 이중 구조부터 이해하기
claude.ai 구독 한도는 "하루 몇 건" 방식이 아니라 5시간 단위 세션 한도 + 주간 한도의 이중 구조로 돌아간다. 세션 한도는 첫 메시지를 보낸 시점부터 5시간 롤링 윈도우로 리셋되고, 주간 한도는 7일 후 리셋된다. Max 플랜은 주간 한도가 두 개인데, 하나는 모든 모델 공통, 다른 하나는 Sonnet 모델 전용이다. 그리고 이 한도는 claude.ai 채팅, Claude Code, Cowork에 걸쳐 공유된다. 별도 쿼터가 아니다.
또 하나 알아둘 점. 보낼 수 있는 메시지 수는 메시지 길이(첨부 포함), 현재 대화 길이, 사용하는 모델·기능에 따라 달라지며, Anthropic은 정확한 메시지 숫자를 공식적으로 공개하지 않는다. 아래 표에서 배수(5x/20x)는 공식이고, 절대 메시지 수는 외부 테스트 기반 추정치다.
플랜별 한도 비교
| 플랜 | 가격(월, US) | 세션 한도(공식) | 세션당 메시지(추정) | Opus / Claude Code |
|---|---|---|---|---|
| Free | $0 | 기본 | 하루 약 30~100건 | × |
| Pro | $20 | Free 대비 최소 5배 | 5시간당 약 45건 | ✓ |
| Max 5x | $100 | Pro 대비 5배 | 5시간당 약 225건 | ✓ |
| Max 20x | $200 | Pro 대비 20배 | 5시간당 약 900건 | ✓ |
연간 결제 시 Pro는 할인되며, Max는 현재 월 구독만 제공된다. 플랜 포함 한도를 넘겨 계속 쓰고 싶으면 usage credits(종량제 크레딧)를 켜는 방법이 있고, 이는 Pro와 Max 모두 지원된다.
한도를 빨리 또는 늦게 소진시키는 변수
- 모델 선택: 같은 메시지라도 Opus가 Sonnet·Haiku보다 한도를 훨씬 빨리 깎는다. 계획·복잡 추론만 Opus로 보내고 실행·반복 작업은 Sonnet·Haiku로 라우팅하면 한도가 오래간다.
- 컨텍스트·첨부 길이: 대화가 길어지거나 큰 파일을 붙이면 한 메시지가 소비하는 양이 커진다. 대화를 분할하고 프로젝트 기능을 활용해 컨텍스트 누적을 줄이는 것이 효과적이다.
- 피크 시간대: 2026년 3월부터 평일 피크 시간(태평양시 오전 5~11시)의 5시간 한도가 축소되어, 같은 플랜이라도 시간대에 따라 체감 한도가 달라진다.
정리
- API 단가는 입력 기준 Opus 5 : Sonnet 3 : Haiku 1이고, 출력은 모두 입력의 5배다.
- 고볼륨·단순 작업은 Haiku, 대부분의 프로덕션은 Sonnet, 프런티어 추론·복잡 코딩만 Opus로 라우팅하는 것이 비용 효율적이다.
- 구독 한도는 세션(5시간) + 주간의 이중 구조이며 채팅·Code·Cowork가 한도를 공유한다.
- 한도를 늘리는 가장 효율적인 방법은 요금제 변경보다 모델 라우팅과 컨텍스트 관리다. 본인의 실시간 사용량은 앱 설정의 사용량(Usage) 화면에서 확인할 수 있다.
이 시리즈의 다른 글: 클로드 Fable 5와 Opus 4.8 비교 - 차이점, 가격, 접근 중단 사태까지 총정리
※ 이 글의 가격, 플랜 구성, 한도 정책은 2026년 기준이며 변경될 수 있습니다.
댓글
댓글 쓰기