기본 개념
토큰 (Token)
언어 모델이 실제로 읽고 생성하는, 단어보다 더 잘게 쪼갠 텍스트 조각.
모델은 원문 글자나 단어 단위를 그대로 처리하지 않고, 학습 과정에서 익힌 고정된 어휘 집합을 기준으로 텍스트를 토큰(영어 기준 평균 3~4글자 정도)으로 쪼갭니다. “토큰화(tokenization)”는 텍스트를 이 단위로 바꾸고, 모델이 답할 때 다시 텍스트로 되돌리는 과정입니다.
토큰은 비용 측면에서도 중요합니다. 거의 모든 AI API는 토큰 단위로 요금을 매기고, 모델의 컨텍스트 윈도우도 단어나 글자가 아니라 토큰 수로 표시됩니다. AI 기능의 운영 비용을 가늠할 때 “토큰이 몇 개나 필요한가”가 가장 먼저 따져야 할 질문인 이유입니다.