Anthropic 공식 문서의 “약 30% 더 많은 토큰”은 영문 기준입니다. 한국어로 직접 재봤더니 증가가 없었습니다.
Anthropic 공식 문서에는 이렇게 적혀 있습니다.
Claude 4.7 이후 모델과 Claude Mythos Preview는 새로운 토크나이저를 사용하며, 같은 텍스트에 대해 약 30% 더 많은 토큰을 생성합니다. 정확한 증가폭은 콘텐츠와 워크로드 형태에 따라 다릅니다.
문제는 “콘텐츠에 따라 다르다”가 전부라는 점입니다. 한국어가 몇 %인지는 어디에도 없습니다. 해외 글들은 이 30%(어떤 곳은 35%)를 그대로 인용하고, 국내 글들도 그걸 받아 적습니다.
그래서 직접 쟀습니다.
Anthropic count_tokens API에 같은 텍스트를 넣고
구형·신형 토크나이저의 결과를 비교했습니다.
| 항목 | 값 |
|---|---|
| 구형 토크나이저 | claude-sonnet-4-6 |
| 신형 토크나이저 | claude-sonnet-5 |
| 측정일 | 2026년 8월 3일 |
| 샘플 | 한국어 4개 + 영문 대조군 1개, 합계 5,401자 |
count_tokens는 메시지 구조(role, 구분자 등)에 해당하는 고정 오버헤드를
함께 셉니다. 그대로 쓰면 짧은 텍스트일수록 왜곡이 큽니다.net = count(T + T) − count(T)| 샘플 | 글자 | 한글 | 구형 | 신형 | 증가율 | 신형 토큰/자 |
|---|---|---|---|---|---|---|
| 대화체 | 787 | 542 | 813 | 813 | 0% | 1.033 |
| 문서체 | 867 | 588 | 886 | 886 | 0% | 1.022 |
| 기사체 | 811 | 571 | 856 | 856 | 0% | 1.055 |
| 혼합 (한글 35%) | 1,091 | 384 | 769 | 809 | 5.2% | 0.742 |
| 영문 대조군 | 1,845 | 0 | 353 | 521 | 47.6% | 0.282 |
한글 위주 샘플 3개는 구형과 신형의 토큰 수가 완전히 같았습니다. 813=813, 886=886, 856=856. 서로 다른 문체의 독립된 샘플 3개에서 전부 일치했으니 우연이 아닙니다.
한글 비중이 35%로 낮은 혼합 샘플만 5.2% 늘었고, 순수 영문은 47.6% 늘었습니다. 증가분의 출처는 한국어가 아니라 ASCII 부분입니다.
혹시 몰라 조건을 더 좁혀 다시 쟀습니다.
| 샘플 | 글자 | 구형 | 신형 | 증가율 | 토큰/자 |
|---|---|---|---|---|---|
| 순수 한글 (공백 없음) | 62 | 64 | 64 | 0% | 1.032 |
| 한글 + 공백 | 58 | 62 | 62 | 0% | 1.069 |
| 한글 + 숫자·영문 | 70 | 57 | 61 | 7% | 0.871 |
같은 결론입니다. 한글만 있으면 0%, 영문·숫자가 섞이는 만큼만 늘어납니다.
글자 수를 넣으면 실측 기준 토큰 수와, 흔히 인용되는 “30% 증가설”로 계산했을 때의 차이를 보여줍니다.
Claude Sonnet 5는 2026년 9월 1일부터 $2/$10 → $3/$15로 오릅니다. 여기에 토크나이저 30%를 곱해 “실질 2배”라고 보는 계산이 도는데, 한국어에는 그 곱셈이 없습니다. 인상 내역 자세히 보기
9월부터 둘 다 $3/$15입니다. “표시가는 같아도 5가 더 나온다”는 설명은 영문 기준이라, 한국어 작업이면 성능이 나은 5를 쓰면 됩니다. 실질 순위 보기
Haiku 4.5는 구형 토크나이저라 “토큰까지 덜 먹어서 격차가 더 벌어진다”고 알려져 있는데, 한국어에서는 그 추가 이점이 없습니다. 물론 $1/$5 대 $3/$15라는 3배 차이는 그대로입니다. Haiku 전환 판단 기준
혼합 샘플에서 보셨듯 ASCII 비중만큼 증가율이 올라갑니다. 영문 문서를 통째로 넣거나 코드베이스를 다루는 작업이라면 30% 쪽에 가깝습니다. 그 구간은 아직 측정하지 않았습니다.
count_tokens 기준입니다. 실제 청구 토큰과 일치하는지는
별도 확인이 필요합니다스크립트와 원자료를 공개해 두었습니다. 같은 방법으로 직접 재보실 수 있습니다.
| 파일 | 내용 |
|---|---|
tools/measure-korean-tokens.ps1 | 측정 스크립트 |
tools/samples/ | 샘플 텍스트 5개 |
docs/한국어-토큰-측정.md | 측정 기록 전문 |
저장소에서
확인하실 수 있습니다. count_tokens는 토큰을 소모하지 않지만
계정 잔액이 있어야 접근됩니다.
의견 · 불편사항
측정 방법에 문제가 있거나 다른 결과가 나오셨다면 알려주세요. 로그인 없이 익명으로 작성할 수 있습니다.