Nota AI

노타가 Backend.AI FastTrack 3으로 Solar Open 2 모델을 효율적으로 경량화하는 방법

독자 AI 파운데이션 모델 프로젝트에서 노타는 모델 경량화를 통해 대규모 LLM을 더 적은 GPU로 구동할 수 있도록 최적화했으며, Backend.AI와 FastTrack을 활용해 반복 실험과 자원 관리를 효율화했습니다.

Nota AI

박한철, 이건호

'독자 AI 파운데이션 모델 프로젝트'는 대한민국 정부가 한국적 정체성과 언어에 최적화된 AI 모델을 개발하기 위해 추진하는 국가 주도 사업입니다. 래블업이 참여하는 업스테이지 컨소시엄은 치열한 경쟁을 거쳐 2차수 기준 4개 정예팀에 선정되어 프로젝트를 수행하고 있는데, 컨소시엄 안에는 모델을 만드는 업스테이지, 인프라를 맡는 래블업 외에도 각자의 전문 영역을 가진 파트너들이 있습니다. 그중 노타(Nota AI)는 완성된 모델을 더 적은 GPU로 돌릴 수 있게 만드는 일, 다시 말해 모델 경량화를 담당하고 있습니다.

지난 업스테이지 인터뷰에서는 1차수 사업에서 500장이 넘는 GPU로 대규모 학습을 안정적으로 운영한 이야기를 다뤘습니다. 같은 컨소시엄 안에서도 노타는 성격이 다른 작업을 담당합니다. 업스테이지가 수백 장의 GPU를 묶어 하나의 학습을 오래 돌린다면, 노타는 업스테이지가 만든 모델을 양자화하고 평가하는 실험을 짧은 주기로 반복합니다. 노타가 이 반복 실험을 Backend.AI와 Backend.AI FastTrack 3 위에서 어떻게 진행했는지, 업스테이지의 Solar Open 2가 어떻게 H100 두 장에 올라가게 되었는지를 소개합니다.

노타, AI 모델 경량화 · 최적화 기업

Nota AI personnels standing infront of Nota AI logo.
좌측부터 Nota AI 김태호 CTO(창업자), 박한철 Tech Lead, 이건호 Edge AI Engineer
 

노타는 AI 모델을 경량화하고 최적화하는 기업입니다. 자체 플랫폼인 NetsPresso®로 GPU부터 NPU까지 다양한 칩셋에서 AI 모델이 실행되도록 최적화하는 기술을 쌓아 왔고, 온디바이스 AI 분야를 중심으로 사업을 키워 왔습니다. 독자 AI 파운데이션 모델 프로젝트 컨소시엄 안에서 노타가 맡은 일을 한 문장으로 정리하면 '솔라 모델이 GPU 자원을 최대한 적게 쓰면서 성능을 유지하도록 만드는 것' 입니다.

AI 모델은 매개변수가 많을수록 성능이 올라가는 경향이 있어, 최고 수준의 성능을 겨냥하는 파운데이션 모델은 규모를 키우는 방향으로 개발됩니다. 반면 모델을 도입하려는 조직은 더 적은 자원으로 모델을 운용하기를 원합니다. 노타가 현장에서 가장 많이 들은 요청도 'GPU 사용을 줄이고 싶다'였습니다.

최근 다양한 모델에서 채택하고 있는 MoE(Mixture of Experts) 구조는 양자화 오차가 라우터의 전문가(expert) 선택을 바꿔 놓을 수 있어 경량화가 까다롭습니다. 이에 노타는 모든 전문가가 골고루 활성화되도록 캘리브레이션 데이터를 합성하고, 양자화 후에도 라우터의 결정이 유지되도록 파라미터를 학습하는 기법을 개발했습니다. 여기에 레이어마다 다른 수의 전문가를 남기는 비균일 전역 프루닝을 더해 모델 크기를 한 번 더 줄였습니다.

이렇게 모델 크기를 줄였기 때문에 노타는 서빙에 필요한 GPU 장수를 줄이는 데에도 성공했습니다. 대형 모델은 가중치를 GPU 여러 장에 나눠 싣는 텐서 병렬화(tensor parallelism)로 서빙하는데, 이때 GPU는 2장, 4장처럼 2의 거듭제곱 단위로 묶어서 사용하는 것이 일반적입니다. 예를 들어 GPU 4장 구성을 2장 구성으로 바꾸려면 가중치와 KV 캐시를 합친 모델 전체가 GPU 2장의 합산 메모리 용량 안에 들어와야 하고, 거기까지 줄이지 못하면 GPU는 3장이 아니라 여전히 4장이 필요하게 됩니다. 노타는 자체 기술력을 바탕으로 독자 AI 파운데이션 모델 프로젝트 1차수에서 Solar Open 100B 모델을 H100 1장으로 서빙할 수 있도록 만들었습니다. 통상적으로 100B 규모의 모델을 서빙하는데 필요한 GPU를 절반으로 줄인 것입니다. 독자 AI 파운데이션 모델 프로젝트 2차수에서는 업스테이지의 Solar Open 2 250BNVFP4 및 INT4로 양자화, 서빙에 필요한 GPU 8장 구성을 2장으로 줄였습니다.

Backend.AI로 구성하는 유연하고 접근성 높은 환경

Tech Lead 박한철 님은 유연성을 Backend.AI에서 가장 편리했던 지점으로 꼽았습니다.

"자체 인프라에서는 노드 조합이 고정되어 있어 원하는 규모로 GPU를 묶기 어려웠고, 클라우드는 계약 구성이 정해져 있어 원하는 형태를 만들기 어려운데, Backend.AI를 통해 자원 할당을 훨씬 유연하게 할 수 있었습니다."

박한철 / Tech Lead, Nota AI

노타는 컨소시엄을 통해 GPU 8장짜리 노드 3개를 배정받아 두 노드는 양자화 알고리즘 개발에, 한 노드는 캘리브레이션 데이터 합성에 사용했습니다. 상황에 따라 이 배치를 계속 바꿨고, 원본 모델 전체를 메모리에 올려야 하는 프로파일링처럼 한 노드의 8장보다 많은 GPU가 필요한 작업은 Backend.AI의 멀티노드 클러스터 세션으로 여러 노드에 걸쳐 12장을 하나의 작업으로 묶어 실행하기도 했습니다.

노타가 수행하는 R&D의 핵심은 반복 실험입니다. 유연하게 실험 환경을 구성하지 못하면 중간중간 환경을 맞추는 데 드는 시간이 그대로 비효율이 되어버립니다. GPU 분할 가상화 기술을 통해 유연하게 자원을 할당하고, 세션을 만들 때 유휴 자원량을 실시간으로 확인할 수 있도록 설계되어 있는 Backend.AI 덕분에, 노타 팀은 자원 예약이나 대기 없이 필요한 만큼 GPU를 할당받아 곧바로 다음 실험을 시작할 수 있었습니다.

"SSH 키를 등록하고 접속 정보를 설정하는 사전 절차 없이 VPN만 켜 놓으면 웹에서 바로 터미널에 들어가서 필요한 작업을 처리할 수 있었습니다."

이건호 / Edge AI Engineer, Nota AI

급하게 파일을 다뤄야 할 때는 웹에서 VS Code를 바로 붙여 쓰고, 짧은 확인 작업은 웹 터미널로 처리하는 식으로 활용했습니다. 또한 노타는 실험 환경 관리를 위해 공유 스토리지에 uv 가상환경을 만들어 두고 패키지 캐시 경로도 같은 곳으로 지정해서, 작업마다 새 컨테이너로 세션이 실행되어도 같은 환경을 바로 불러와 쓰는 구조를 만들었다고 합니다. 이를 통해 부트스트랩 타임, 다시 말해 작업을 시작하기까지 드는 준비 시간을 그만큼 줄일 수 있었던 것입니다. 박한철 님은 "처리해야 하는 급한 작업이 있는데, vim까지는 켜기 싫을 때에 VS Code를 바로 붙여서 쓰는 것이 너무 도움이 되는 기능이었다"고 덧붙였습니다.

Backend.AI Dialog that runs VS Code as extension.
VS Code 및 터미널을 바로 열어서 사용할 수 있는 Backend.AI Session 화면

양자화 파이프라인 처리 시간을 25% 줄인 FastTrack 자동화

노타의 양자화 워크플로우를 단계별로 보면 GPU 요구량의 편차가 드러납니다. 양자화에 필요한 통계를 수집하는 프로파일링 단계는 원본 가중치 모델 전체를 메모리에 올려 추론해야 하므로 GPU가 가장 많이 필요합니다. 양자화 자체는 디코더 블록 단위로 나눠 처리하기 때문에 대부분 80GB 메모리를 가진 GPU 1장으로 충분합니다. 양자화된 모델의 정확도를 측정하는 평가 단계는 통상적으로 GPU 1~2장을 쓰는데, 여러 벤치마크가 서로 독립적으로 실행되므로 동시에 돌릴수록 효율이 오르는 구조입니다.

이건호 님은 벤치마크마다 파이썬 의존성이 달라 실행 환경을 분리하는 것이 필수였고, 알고리즘과 설정을 바꿔가며 같은 워크플로우를 반복해야 했다고 말합니다. GPU 규모와 실행 환경이 단계마다 다른 데다 순서 의존성까지 있는 작업 묶음을 사람이 수동으로 관리하면 그만큼 시간이 더 들 수밖에 없습니다. 노타는 독자 AI 파운데이션 모델 프로젝트를 진행하며 이러한 워크플로우를 Backend.AI FastTrack으로 자동화함으로써, 전체 실험에 걸리는 시간을 단축할 수 있었다고 합니다. Backend.AI FastTrack은 Backend.AI의 세션 및 자원 관리를 기반으로 동작하는 워크플로우 플랫폼으로, 여러 세션을 파이프라인으로 연결하고 단계별 GPU 배정과 의존성 관리를 자동화합니다. 설정을 바꿔 같은 파이프라인을 반복 실행할 수 있는 템플릿 기능도 제공되어 반복 실험을 자동화하는데 적합합니다.

FastTrack pipeline that NotaAI created.
노타에서 구축한 Backend.AI FastTrack 3를 활용한 모델 양자화 및 평가 파이프라인
 

노타는 FastTrack 위에서 프로파일링과 양자화, vLLM 동작 확인을 거친 뒤 HumanEval·AIME·GPQA 벤치마크와 추론 속도 측정을 병렬로 진행하는 파이프라인을 구축했습니다. 이건호 님은 파이프라인 구축을 통해 GPU 배정과 반복 실행을 자동화할 수 있었다고 이야기합니다. 블록마다 필요한 GPU 수를 정의해 두면 프로파일링, 양자화, 벤치마크 각각이 유휴 자원에 맞춰 자동으로 배정받아 실행되기 때문에 사람이 개입해야 하는 지점이 줄어든 것입니다. FastTrack을 사용하면 사람이 직접 파이프라인을 관리하는 경우와 비교하여 전체 소요 시간을 약 25%* 줄일 수 있게 되고, 모델 종류나 알고리즘, 비트 수와 같은 설정도 환경 변수로 교체한 뒤 파이프라인 템플릿을 재사용할 수 있어 반복 실행이 편리했다고 합니다.

"처음에는 약간 헤맸지만, 한번 감이 잡히니 어떻게 돌려야 할지 보였습니다. 배시 스크립트로 단계를 순서대로 돌리던 기존 방식과 비교하면 GPU를 통제하기가 확실히 용이했습니다." 이건호 님은 파이프라인 도구를 써 본 것이 이번이 처음이었다고 합니다. 그러나 FastTrack을 경험한 후에는 실험 환경을 구성하고 관리하는 시간 대신 결과물의 품질에 집중할 수 있었다고 말합니다.

* H100 8장 환경에서 100B 규모 MoE 모델의 양자화 및 평가 파이프라인을 10회 반복하는 경우, 노타 자체 계산 기준

H100 두 장에 올라간 250B 크기의 모델

Solar Open 2는 총 매개변수 250B, 토큰당 활성 매개변수 15B의 MoE 구조를 가진 에이전트 특화 오픈웨이트 LLM으로, 문서 처리·코딩·도구 호출 등 실무 에이전트 시나리오에 맞춰 설계되었습니다. Solar Open 2의 원본 BF16 모델은 가중치 500.6GB와 KV 캐시 20GB(256K 컨텍스트 기준)를 합쳐 520.6GB를 차지합니다. 이 크기를 서빙하려면 H100 8장이 필요합니다. 노타는 INT4 양자화로 가중치를 142.9GB까지 줄였고, 전문가 프루닝을 결합해 117.8GB까지 낮췄습니다. KV 캐시를 포함한 전체 크기는 137.8GB로, H100 2장의 합산 메모리 한도 160GB 안에 들어옵니다. 서빙에 필요한 GPU는 8장에서 2장으로 줄었습니다.

스크린샷 2026-07-30 220845.png

경량화된 모델임에도 품질 하락은 최소화되었습니다. 에이전트, 수학, 코드, 한국어를 포함한 15개 추론 태스크 벤치마크 평균에서 원본 BF16은 81.57점, INT4 양자화 모델은 81.17점을 기록했습니다. 전문가 프루닝까지 더한 모델도 별도의 3개 태스크 평균에서 83.99점 대비 83.39점으로 0.6점 차이를 유지했습니다. GPU 사용량을 4분의 1로 줄이면서도 모델 품질을 지켜낸 셈입니다.

데이터센터로 향하는 길: Backend.AI, FastTrack과 함께

DSC04843_1.jpg

"독자 AI 파운데이션 모델 프로젝트는 데이터센터용 최적화로 나아갈 수 있는 가장 큰 지름길이었습니다. 래블업이 Backend.AI로 인프라를 갖춰 둔 덕분에 노타는 하드웨어 환경 구성과 자원 관리에 시간을 뺏기지 않고, 온디바이스에서 쌓은 경량화 기술을 데이터센터 규모의 모델로 확장하는 알고리즘 개발에 집중할 수 있었습니다."

박한철 / Tech Lead, Nota AI


노타가 거대한 사이즈의 언어모델을 양자화하여 더 적은 수의 하드웨어에서 AI를 시작할 수 있게 도와주듯이, 래블업 또한 Backend.AI를 통해 더 많은 조직이 인프라와 환경 구성의 어려움 없이 비즈니스에 집중할 수 있도록 만들고 있습니다. 각 단계마다 자원 요구가 다른 반복적인 실험을 운영하고 있다면, Backend.AI와 FastTrack이 여러분의 비즈니스 환경을 어떻게 도와줄 수 있는지 확인해 보세요.

도움이 필요하신가요?

내용을 작성해 주시면 곧 연락 드리겠습니다.

문의하기
lablup

본사 및 HPC 연구소

KR Office: 서울특별시 강남구 선릉로 577 CR타워 8층 US Office: 3003 N First st, Suite 221, San Jose, CA 95134

  • facebook
  • youtube
  • Linkedin
  • GitHub

© Lablup Inc. All rights reserved.

개인정보를 소중히 여깁니다

쿠키는 사이트 트래픽 분석, 방문자 이용 방식 파악, 서비스 개선에 사용됩니다. 사이트 기본 동작에 필요한 필수 쿠키는 항상 활성화됩니다. 자세히 보기

"모두 수락"을 클릭하면 분석 쿠키가 기기에 저장되는 것에 동의하게 됩니다. 필수 쿠키만 허용하시려면 "모두 거부"를, 직접 선택하시려면 "상세 설정"을 눌러주세요. 설정은 언제든지 변경할 수 있습니다.