토큰은 언어 모델이 입력과 출력을 처리할 때 사용하는 텍스트 조각의 단위다. 한 토큰이 한 단어일 수도 있지만, 단어 일부나 공백·문장부호와 결합된 조각일 수도 있다. 그래서 ‘단어 수’와 ‘토큰 수’는 서로 다른 값이며, 눈으로 글자 수를 세는 것만으로 정확한 토큰 수를 알 수 없다. [1] [2]
어디에서 만나나
텍스트를 토큰으로 나누는 규칙은 토크나이저와 모델에 따라 다르다. 언어, 띄어쓰기, 특수 문자, 입력 형식도 결과에 영향을 줄 수 있다. 한국어 문장에 고정된 글자 대 토큰 비율을 적용하면 실제 계산과 달라질 수 있으므로, API나 서비스가 제공하는 계산 도구가 있다면 그 도구를 기준으로 확인하는 편이 낫다. [1] [2]
토큰 수는 모델이 한 번에 처리할 수 있는 문맥 범위와 관련되고, 일부 API의 요금 산정에도 사용된다. 입력 토큰과 출력 토큰을 따로 집계하는 방식이나 무료·유료 기능은 서비스마다 다르다. 다른 제품에서 본 토큰 숫자나 비용 규칙을 모든 서비스에 적용하지 말아야 한다. 사용량을 정확히 알아야 한다면 해당 모델의 토크나이저나 서비스가 제공하는 계산 기능을 확인한다. [2]
작동과 사용 예
긴 보고서를 요약한다고 가정하면, 원문 전체가 한 번의 요청에 들어가는지 먼저 확인할 수 있다. 길이 제한에 걸리면 핵심 부분을 나누거나 자료를 압축해 전달하는 선택지가 있다. 실제 단위 수는 사용 중인 모델의 토크나이저로 계산해야 한다.
같은 문장도 모델이나 서비스가 쓰는 토크나이저에 따라 다른 개수로 나뉠 수 있다. 이미지나 음성 같은 입력은 텍스트 토큰 수와 별도의 방식으로 처리되기도 하므로, 모든 자료의 길이를 글자 수 하나로 비교하기 어렵다. 한도나 비용을 계산할 때는 사용하려는 서비스가 설명하는 입력 종류와 산정 규칙을 확인한다. [1] [2]
비슷한 개념과 주의점
토큰은 대규모 언어 모델이 문자를 내부적으로 다루는 표현 단위이지, 의미를 가진 단어나 문장과 같지 않다. 토큰이 많다고 내용이 반드시 더 풍부한 것도 아니다. 컨텍스트 창은 입력과 출력 등을 합쳐 처리하는 범위를 설명하며, 프롬프트의 문구도 그 범위에 포함될 수 있다. [1] [2]
출처와 확인
- Understanding and counting tokens · 공식 자료 · 확인 2026-10-08
- Machine Learning Glossary · 공식 자료 · 확인 2026-10-08