- 2026년 9월 6일 오후 4:24
- 조회수: 68
김성범 교수님
Token이라는 용어를 이해하기 위해서는 먼저 이 단어가 인공지능
분야에서 사용되기 이전부터 가지고 있던 일반적인 의미를 살펴볼 필요가 있습니다. 일반적으로 token은 “a physical object, digital code, or
symbol that stands for something else or acts as a substitute for money,” 즉
어떤 다른 대상이나 가치를 대신하여 나타내는 물체, 디지털 코드 또는 기호를 의미합니다. 여기서 가장 중요한 의미는 “something that stands for
something else,” 즉 어떤 것을 대신하여 표현한다는 것입니다.
우리에게 친숙한 예가 과거 서울에서 사용되었던 bus token입니다. 서울에서는 1977년부터 시내버스 요금을 지불하기 위해 동전 모양의 token을 사용하였습니다. 승객은 현금을 직접 지불하는 대신 미리 구입한 token을 내고 버스를 이용할 수 있었습니다. 즉, 작은 금속 조각 자체가 화폐는 아니지만 일정한 버스 요금을 대신하는 물체였기 때문에 token이라고 불렀습니다. 서울의 bus token은 약 22년 동안 사용되다가 1996년 bus card가 등장한 이후 사용이 감소하였고, 1999년에 완전히 폐지되었습니다.
이러한 원래의 의미를 생각하면 인공지능에서 사용하는 token이라는
용어도 쉽게 이해할 수 있습니다. 인공지능 모델은 사람이 사용하는 문장이나 이미지와 같은 데이터를 그
자체로 이해하는 것이 아니라, 모델이 처리할 수 있는 작은 정보 단위로 변환합니다. 이때 원래 데이터의 일부를 대신하여 모델에서 처리되는 기본적인 정보 단위를
token이라고 할 수 있습니다. 과거의 bus
token이 실제 버스 요금을 대신하였다면, AI의
token은 원래의 문자, 단어 또는 데이터의 일부를 대신하여 표현한다고 생각할 수 있습니다.
예를 들어 “I love artificial intelligence.”라는
문장을 LLM에 입력하면 모델은 전체 문장을 그대로 처리하지 않고 I
| love | artificial | intelligence | . 와 같은 작은 단위로 나눕니다.
각각의 단위가 token입니다. 다만 하나의 token이 반드시 하나의 단어와 일치하는 것은 아닙니다. 긴 단어나
자주 사용되지 않는 단어는 여러 개의 subword token으로 나누어질 수 있으며, 구두점도 별도의 token이 될 수 있습니다. 이러한 token은 다시
token ID라는 숫자로 변환되고 embedding을 통해 vector로 표현되어 모델에서 계산됩니다. 따라서 대략적으로 original text → token → token ID → embedding → model의 과정을 거치게
됩니다.
LLM에서 token이
특히 중요한 이유는 문장을 생성하는 과정 자체가 다음 token을 예측하는 과정, 즉 next-token prediction이기 때문입니다. 예를 들어 “The capital of France is”라는 문장이
주어지면 모델은 지금까지 주어진 token들을 바탕으로 다음에 나타날
token들의 확률을 계산합니다. 이때 Paris에
높은 확률을 부여하여 이를 선택하였다면 다시 그 다음 token을 예측합니다. 이러한 과정을 반복하면서 하나의 문장 또는 긴 답변을 생성합니다. 따라서 LLM을 단순화하면 “지금까지 주어진 token들을 이용하여 다음 token을 예측하는 모델”이라고 설명할 수 있습니다.
최근에는 token의 개념이
text를 넘어 image, time-series, tabular data 등 다양한 형태의
데이터로 확장되고 있습니다. vision transformer에서는 이미지를 여러 개의 작은 patch로 나누어 각각을 image token으로 처리할 수 있습니다. Time-series transformer에서는 하나의 time step을 token으로 사용할 수도 있고, 여러 시점을 하나의 patch로 묶어 temporal token 또는 patch token으로 사용할 수도 있습니다. Tabular
transformer에서는 age, income, occupation과 같은 각각의 feature 또는 feature-value representation을 feature token으로 표현할 수 있습니다.
결국 일반적인 의미의 token과 인공지능에서의 token은 서로 동떨어진 개념이 아닙니다. bus token이 실제
화폐를 대신하여 버스 요금의 가치를 표현했던 것처럼, AI에서의
token은 원래 데이터의 일부를 대신하여 모델이 처리할 수 있는 형태로 표현한 기본적인 정보 단위입니다. 따라서 token의 핵심 개념은 분야가 달라져도 동일하게 representation 또는 substitute, 즉 “무언가를 대신하여 나타내는 것”이라고 이해할 수 있습니다.
이러한 관점에서 보면 text에서는
word나 subword가, image에서는 image patch가, time-series에서는 time step이나 temporal patch가, tabular data에서는 feature 또는 feature-value representation이 token의
역할을 할 수 있습니다. 특히 transformer는 서로
다른 형태의 데이터를 token sequence로 표현한 후
token들 사이의 관계를 attention을 통해 학습할 수 있다는 특징을 가지고 있습니다. 따라서 token은
transformer만의 개념은 아니지만, 현대의
transformer와 LLM을 이해하는 데 있어 가장 기본적이고 핵심적인 개념 중 하나라고
할 수 있습니다.