2026년 9월 28일

엔지니어링

지능을 계량하는 시대: 데이터센터에서 토큰 팩토리로

  • 허진호

    허진호

    테크니컬 라이터

2026년 9월 28일

엔지니어링

지능을 계량하는 시대: 데이터센터에서 토큰 팩토리로

  • 허진호

    허진호

    테크니컬 라이터

우리는 오랜 시간 동안 표준화된 계량을 해 왔습니다. 가장 대표적인 계량의 예시는 말입니다. 말 한 마리가 내는 힘을 1마력이라고 하죠. 보다 정확하게는 제임스 와트가 증기기관의 성능을 표현할 방법을 고민하다 만들어낸 어떠한 일률(Power)의 단위입니다. 이렇게 증기기관을 비롯한 기계장치의 일률을 이야기하는 단위가 생겼고, 자동차 엔진의 힘을 계량하기 위한 단위로 마력이 굳어졌습니다. 하지만 이 '마력'이라는 단위는 이름 그대로 '말의 힘' 관점에서 바라보면 정밀한 단위가 아닙니다. 말 한 마리가 낼 수 있는 힘은 개체별로 차이가 있을 텐데, 인간은 그러한 특성을 모두 무시하고 상업적인 활동에 필요한 기준을 만들기 위해 임의의 수치를 '1마력'이라고 정의하기 시작한 것입니다.

이후에 산업군이 발전하며 분야를 막론하고 새로운 단위들이 생겨나기 시작했습니다. 산업 교류가 활발해지며 여러 나라가 서로 물건을 주고받기 시작했고, 이 과정에서도 계측과 계량이 필요해졌습니다. 그런데 바다를 건너는 화물은 세기가 참 어려웠죠. 자루에 담긴 곡물과 상자에 넣은 기계 부품은 배의 관점에서 보면 동일한 화물인데, 차지하는 면적도 무게도 다르거든요. 마구잡이로 섞인 다양한 종류의 물건들 탓에 배 한 척이 짐을 얼마나 실을 수 있는지, 항구가 하루에 얼마나 처리할 수 있는지를 한마디로 말할 방법이 없었죠. 그래서 1960년대, ISO라는 표준화 기구가 컨테이너의 규격을 정했습니다. 20피트짜리 컨테이너 하나 분량을 1TEU로 세기 시작하면서 인류는 화물의 물동을 계산할 수 있게 된 것입니다.

계량이 가능하게 만드는 것들

이처럼 단위는 상업활동을 하기 위한 필수조건으로 인식됩니다. 단위가 생기면 비교하고, 값을 매기고, 그 단위에 맞춰 설계할 수 있게 되거든요. 앞서 설명한 TEU라는 단위가 무역에서 자리를 잡자, 배와 크레인, 트럭과 철도, 항만의 야적장이 모두 같은 규격에 맞춰 설계되기 시작했습니다. 마력도 TEU도 무언가를 정밀하게 재려고 만든 단위는 아닙니다. 두 단위는 개별의 차이를 일부러 무시했고, 인류는 그 대가로 모두가 함께 쓸 수 있는 표준을 얻게 된 것이죠.

그렇다면 같은 질문을 AI에도 던져 볼 수 있습니다. AI가 하는 일은 어떤 단위로 셀 수 있을까요? 글을 쓰고, 노래를 만들고, 영상을 만들고, 코드를 짜는 일은 서로 너무 달라서 표준화된 컨테이너가 등장하기 이전에 뒤섞여 실리던 짐만큼이나 세기 어려워 보이거든요.

지능을 세는 단위, 토큰

지금 우리가 가진 가장 현실적인 답은 '토큰'입니다. 마력이 물리적인 일률을 세는 단위였고 맨먼스가 지식 노동을 세는 단위였다면, 토큰은 그다음 단계에 해당합니다. 언어 모델이 내놓는 텍스트 한 조각, 음성 모델이 만들어 내는 소리의 단위, 영상의 한 프레임을 설명하는 정보가 모두 토큰입니다. 입력으로 들어간 토큰과 출력으로 나온 토큰을 셀 수 있고, 그 토큰에 비용을 연결할 수 있습니다. TEU를 계산할 때 컨테이너 안에 들어 있는 내용물이 중요하지 않듯이, 토큰도 그 안에 담긴 내용이 무엇인지 묻지 않습니다. 세는 데에는 그것이 중요하지 않기 때문입니다.

전기와 견주어 보면 단위의 쓰임새가 분명합니다. 전기를 사용하는 사용자는 요금을 킬로와트시 단위로 내지만, 발전소를 짓는 사업자는 킬로와트라는 단위를 상정합니다. 소비자는 사용한 양으로 값을 치르지만, 설비는 한 번에 낼 수 있는 힘을 기준으로 설계하는 것이죠. AI도 이와 같습니다. 사용자는 토큰으로 값을 치르고, 토큰을 만드는 설비는 1초에 토큰을 몇 개나 만들어 낼 수 있는지를 기준으로 설계하는 것입니다. 일의 양과 일률을 모두 같은 단위로 말할 수 있게 된 것이죠.

단위의 생성에 따르는 산업의 형성

단위는 인간의 가능성만 계량하는 것이 아니라, 돈의 방향과 흐름도 바꿀 수 있습니다. 새로운 기술에 따라오는 돈은 모험 자본과도 같습니다. 가능성을 보고, 이야기를 보고 들어오죠. 하지만 해당 산업이 크는 시점(Scale-up)이 되면 상황이 조금 달라집니다. 발전소를 짓고 항만을 건설하는 데 들어가는 돈은 더 이상 모험 자본이 아닙니다. 산업은 단가를 계산하고 수요를 예측할 수 있어야 움직이고, 그러려면 단위가 있어야 합니다. 예를 들어 볼까요? 전기는 사용량을 재는 계량기가 나온 뒤에야 쓴 만큼 값을 치르는 상품이 되었습니다. 클라우드 역시 서버 인스턴스를 시간 단위로 빌려주는 가격표가 붙은 뒤에야 누구나 자유롭게 판매하고 구매할 수 있는 자원으로 자리 잡았습니다. 기술은 단위 없이도 태어나지만, 기술이 산업으로 자리 잡으려면 결국 어떠한 종류든 단위가 필요한 것입니다.

AI에서는 지금 그 일이 일어나고 있습니다. NVIDIA의 CEO, 젠슨 황은 오늘날의 AI 데이터센터를 'AI 팩토리'라고 부릅니다. 단순히 GPU를 많이 팔아야 하는 기업의 마케팅적인 수사로 볼 수도 있지만, 실제로도 관점이 약간 달라졌다는 점에서 주목할 만합니다. 전통적인 관점에서 보면, 데이터센터는 데이터를 저장하고 요청받은 계산을 수행하는 컴퓨팅 공간이었습니다. 토큰 팩토리는 그 관점을 뒤집습니다. 토큰 팩토리는 전력과 하드웨어, 학습된 모델을 투입해 토큰이라는 제품을 출하하는 곳입니다. 원재료가 들어가고, 설비가 돌아가고, 셀 수 있는 제품이 나온다는 점에서 말 그대로 공장에 비유할 수 있게 되는 것이죠. 힘을 셀 수 있게 되자 공장을 지을 수 있었고 화물을 셀 수 있게 되자 항만을 설계할 수 있었듯이, 지능을 셀 수 있게 되자 지능을 생산하는 공장을 이야기할 수 있게 된 것입니다.

최근 모두가 이야기하는 AI 인프라의 무게 중심이 학습에서 추론으로 옮겨온 것도 비슷한 결에서 해석할 수 있습니다. 학습은 제품을 개발하는 일에 가깝고, 추론은 제품을 양산하는 것에 비유할 수 있습니다. 개발은 한 번 끝나면 되지만 생산은 주문이 들어오는 한 멈출 수 없고, 주문이 늘수록 단가와 납기가 중요해집니다. AI 인프라의 중심이 대규모 학습에서 실제 추론 서비스 운영으로 옮겨 가면서, 다양한 모델과 사용자의 요청을 효율적으로 처리하는 기술이 중요해지고 있는 상황입니다.

그래서 '토큰 팩토리'라는 정의로 다시 돌아와 봅시다. 우리가 어떠한 공장을 평가할 때, 공장이 보유한 기계의 수로 그 공장을 전부 평가하지는 않습니다. 공장을 평가하는 지표는 생산량, 단가, 납기를 지키는지, 수율은 얼마인지 등이죠. 토큰 팩토리는 결국 전력을 투입하여 토큰이라는 출력물을 내놓는 곳이므로, 토큰 팩토리는 와트당, 그리고 비용당 얼마나 많은 토큰을 내놓는지로 이야기하게 됩니다.

토큰 팩토리를 이루는 것들

그렇다면, 가속기를 많이 들여놓는다고 해서 토큰 팩토리를 만들 수 있을까요? 기계만 들여놓는다고 우리는 공장을 완공할 수 없습니다. 기계와 기계 사이를 채우는 운영, 기계를 기계답게 돌아가게 만들기 위한 운영도 필요합니다. 우리가 그동안 데이터센터를 공장이라고 부르지 않았던 이유는, 데이터센터가 해 온 일이 제조가 아니라 임대였기 때문입니다. 지금까지 인프라를 가진 조직이 내놓을 수 있는 것은 장비 가동 시간, 곧 기계를 빌려주는 일이었습니다. 메인프레임 시절에는 CPU를 쓴 시간만큼 요금을 냈고, GPU 클라우드는 GPU를 빌린 시간으로 값을 매겨 왔죠. 다만 이 단위는 기계를 얼마나 오래 빌렸는지를 말해 줄 뿐, 그동안 무엇이 얼마나 만들어졌는지는 말해 주지 않습니다. 또한, 장비를 빌린 사람은 빌린 기계 위에 모델을 올리고, 서빙 환경을 꾸리고, 성능을 맞추는 일까지 직접 해야 했죠. 이건 확실히 '공장'의 개념은 아닙니다. 이런 구조를 공장으로 변화시키려면, 투입과 산출을 모두 잴 수 있어야 하고, 그 사이에서 주문을 알맞은 라인으로 보내는 일도 누군가 맡아야 합니다.

token-factory-ko-v2@2x.png

토큰 팩토리의 구성 요소를 크게 세 가지로 나누어 보면, 생산 라인, 분배기, 그리고 관제실로 나눌 수 있습니다. 생산 라인은 토큰이 찍혀 나오는 공간입니다. 토큰을 실제로 만들어 내는 가속기들과 그 위에 올라가 있는 모델들을 의미하죠. 생산 라인은 멈추지 않고 언제나 최대 효율을 내야만 하기에, 효율적으로 장비를 관리할 수 있는 운영 계층이 중요합니다. 래블업이 만드는 Backend.AI와 같은 소프트웨어가 해당 계층을 담당하죠.

Backend.AI는 물리 GPU 한 장을 여러 조각으로 나누어 여러 모델과 사용자에게 할당할 수 있습니다. 라인을 쉬지 않게 돌리는 일, 그리고 GPU를 '한 장' 단위로만 세던 눈금을 촘촘하게 만드는 일이 이 계층이 하는 일입니다.

두 번째는 분배기입니다. 사용자의 추론 요청을 공장에 들어오는 주문으로 비유한다면, 토큰팩토리는 N명의 거래선으로부터 주문이 들어오는 카오스 상황이라고 해석할 수 있습니다. 그렇기 때문에 공장을 제대로 가동하려면 이러한 주문을 병목을 최소화하며 효율적으로 분배해서 처리하기 위한 운영 전략이 필수적이죠. 래블업의 Continuum Router가 이러한 계층을 담당합니다. Continuum Router는 이 요청들에 OpenAI 호환 엔드포인트 하나를 제공하고, 부하 분산과 자동 장애 전환을 처리하며 각 요청을 알맞는 백엔드로 보내죠. 그리고 모든 주문이 이곳을 지나가기 때문에, 토큰의 계량은 여기에서 담당합니다.

세 번째는 관제실입니다. 공장의 모든 장비와 입출고를 관리하는 관제실이 필요하듯, 토큰팩토리 역시 공장의 모든 면면을 볼 수 있는 장소가 필요합니다. 래블업의 Continuum Hub가 이러한 역할을 수행하는데, Hub는 Router들이 처리한 요청의 정책과 비용을 중앙에서 관리합니다. 누가 어떤 모델을 얼마나 썼는지, 그 비용이 어느 팀과 프로젝트에 속하는지를 기록하는 곳이죠. 가장 중요한 점은, 관제 자체가 병목이 되어서는 안 된다는 원칙에 따라 실제 요청이 처리되는 경로와 관리를 위한 경로가 나뉘어 있다는 것입니다. 그래서 관제실에 문제가 생겨도 생산 라인은 멈추지 않습니다.

세 요소가 함께 있을 때 공장은 앞에서 말한 조건을 갖춥니다. Backend.AI는 GPU가 얼마나 쓰였는지를 알고, Continuum은 그동안 토큰이 얼마나 나왔는지를 알고 있습니다. 두 가지 조건을 조합하면 투입과 산출을 모두 잴 수 있게 되는 것이죠. 이런 요건이 모여 만들어진 결과물이 바로 '토큰 팩토리'가 되는 것입니다.

서로 다른 토큰도 하나의 셈법으로

여기까지 오면 한 가지 문제가 눈에 들어옵니다. 토큰은 아직 완성된 단위가 아닙니다. 모델마다 토큰의 크기가 달라서, 같은 문장이 어떤 모델에서는 100토큰이고 다른 모델에서는 120토큰일 수 있습니다. 아직까지는 작은 모델이 만들어낸 토큰과 깊은 추론을 거친 대형 모델의 토큰이 해내는 일도 다르죠. 앞에서 이야기했던 컨테이너도 처음에는 그랬습니다. ISO가 규격을 정하기 전에는 회사마다 상자의 사이즈가 표준화되지 않았거든요. 지능을 세는 단위는 아직 그러한 시기를 지나고 있는 셈입니다.

그래서 한 공장에서 여러 모델을 돌리는 경우에는 토큰 수를 단순하게 더할 수는 없고, 환산이 필요합니다. 이러한 환산은 관제실 역할을 수행하는 Hub의 몫입니다. Continuum Hub에서는 모델별로 가격을 설정할 수 있습니다. Router가 추적한 토큰에 모델별 단가를 적용하면 서로 다른 모델의 사용량이 비용이라는 형태로 계량 가능하게 됩니다. 마력과 TEU가 그랬듯이 거친 셈법이지만, 적어도 한 공장 안에서는 서로 다른 모델의 토큰을 하나의 단위로 셀 수 있게 된 것입니다.

토큰 팩토리를 사용한다는 것

사용자에게 토큰 팩토리는 이미 익숙한 모습입니다. OpenRouter 같은 서비스들을 예시로 생각할 수 있습니다. 엔드포인트 하나에 연결하면 수백 개의 모델을 골라 쓸 수 있고, 모델마다 일정한 수의 토큰에 해당하는 가격이 붙어 있죠. 눈여겨볼 점은 같은 모델을 여러 회사가 서로 다른 가격으로 공급하고 있다는 것입니다. 토큰이라는 단위가 통일되자 그 위에 시장이 생겼고, 그 시장에 이름을 올린 공급자 하나하나가 곧 토큰 팩토리인 것입니다.

이런 식으로 '계량된 지능'을 사용한다는 것은 우리들의 AI 사용 환경을 바꿉니다. 우리가 전기를 사용할 때 발전소를 생각하지 않듯, '이 업무에는 얼마만큼의 지능이 필요한지'를 보게 되는 것이죠. 회의록 요약처럼 가벼운 일에는 작은 모델을 쓰고, 복잡한 분석에는 큰 모델을 쓰는 식으로 업무마다 필요한 만큼의 지능을 골라 쓸 수 있습니다. 우리가 골라 사용한 지능만큼 과금이 되는 것이고, 토큰이 어느 기계에서 만들어지는지 몰라도 필요한 만큼의 지능을 주문할 수 있게 되는 것입니다.

글을 맺으며

마력은 말의 힘을 정확하게 재기 위한 단위가 아니었고, TEU도 화물의 가치를 재기 위한 단위는 아니었습니다. 이 둘은 미래를 위한 추진력을 얻기 위해 정해진 규격이었습니다. 토큰도 마찬가지입니다. 토큰을 셀 수 있게 되면서 단순히 기계장치를 시간 단위로 빌려주던 데이터센터는 어떠한 표준화된 형태의 제품을 출하하는 공장이 되었고, 데이터센터가 공장이 되었기에 우리는 전통적인 제조업에서 의미를 가지던 개념인 원가와 가격, 공급의 안정성을 이야기할 수 있게 되었습니다. 래블업은 2025년 9월 개최된 lab|up >/conf/5에서 특정 과업에 필요한 지능의 양을 전력량처럼 정량적으로 측정하고 안정적으로 공급하는 기업이 되겠다고 밝혔습니다. 래블업의 토큰 팩토리는 Backend.AI, Continuum Router & Hub와 함께 그 과정으로 가는 첫걸음이 될 것입니다. 그 미래를 9월 29일 개최되는 lab|up >/conf/6에서 확인해보세요.

도움이 필요하신가요?

내용을 작성해 주시면 곧 연락 드리겠습니다.

문의하기
lablup

본사 및 HPC 연구소

KR Office: 서울특별시 강남구 선릉로 577 CR타워 8층 US Office: 3003 N First st, Suite 221, San Jose, CA 95134

  • facebook
  • youtube
  • Linkedin
  • GitHub

© Lablup Inc. All rights reserved.

개인정보를 소중히 여깁니다

쿠키는 사이트 트래픽 분석, 방문자 이용 방식 파악, 서비스 개선에 사용됩니다. 사이트 기본 동작에 필요한 필수 쿠키는 항상 활성화됩니다. 자세히 보기

"모두 수락"을 클릭하면 분석 쿠키가 기기에 저장되는 것에 동의하게 됩니다. 필수 쿠키만 허용하시려면 "모두 거부"를, 직접 선택하시려면 "상세 설정"을 눌러주세요. 설정은 언제든지 변경할 수 있습니다.