리소스백서

RNGD meets Backend.AI:
주권 AI 시대를 위한 AI 추론 인프라

벤치마크로 알아본 추론 특화 가속기 RNGD와 Backend.AI 통합 구성

RNGD meets Backend.AI: 주권 AI 시대를 위한 AI 추론 인프라

추론 전용 가속기는 같은 서빙 작업을 더 적은 전력으로 처리하도록 설계되어, 상시 운영되는 추론 서비스의 운영 비용을 낮춥니다. 국내에서 설계된 FuriosaAI의 추론 가속기 RNGD를 Backend.AI 단일 운영 체계에서 할당·서빙하는 통합 구성과, 동등 조건 벤치마크로 알아본 처리량·전력 효율 특성을 확인해보세요.

국산 NPU로 구성하는 LLM 추론 인프라

FuriosaAI(퓨리오사에이아이)의 RNGD(레니게이드)는 카드당 TDP 180W의 데이터센터 추론 전용 가속기(NPU)로, 학습에 필요한 범용 연산을 덜어낸 대신 추론 단계의 지연시간과 처리량, 전력 효율에 설계를 최적화했습니다. 국내에서 설계한 추론 칩과 국내에서 개발한 오픈소스 기반 운영 플랫폼의 조합은 폐쇄망 운영, 해외 벤더에 종속되지 않는 공급망 선택지, 코드 수준의 검증 가능성이라는 주권 AI(Sovereign AI)의 실무 요건에 대응합니다.

Qwen3-32B 모델을 FP8 정밀도로 서빙한 벤치마크에서 RNGD 4장은 동급 사양의 최신 GPU 4장 대비 동시 요청 256 기준 약 95%의 처리량을 기록하면서, 가속기 합산 전력은 56~70% 수준에 머물렀습니다. 전력당 처리량으로 환산하면 측정한 모든 동시성 구간에서 RNGD가 약 1.3~1.5배 높았고, 첫 토큰 응답 시간(TTFT) 역시 전 구간에서 더 짧았습니다.

Backend.AI는 가속기 플러그인 아키텍처로 RNGD를 GPU와 같은 세션 단위 자원으로 추상화합니다. 할당, 격리, 모델 서빙, 생애 주기 관리가 기존 GPU 클러스터와 같은 방식으로 이루어지므로, 운영 도구를 새로 익히지 않고 GPU와 NPU를 한 클러스터에서 병행 운영할 수 있습니다.

벤치마크 측정 환경과 동시성 구간별 상세 결과, 워크로드별 활용 시나리오와 도입을 권장하는 환경 조건은 백서 전문에서 확인해보세요.

관련 서비스

Backend.AI

Backend.AI는 자체 개발한 오케스트레이션 및 작업 스케줄러를 기반으로 하는 벤더 중립적 가속 워크로드 호스팅 플랫폼으로, 클라우드 또는 온프레미스(에어갭) 클러스터 위에서 실행됩니다.

서비스 살펴보기
FuriosaAI

FuriosaAI는 데이터센터 추론용 AI 가속기를 설계하는 기업입니다. Tensor Contraction Processor 아키텍처 기반의 RNGD는 카드당 TDP 180W로 대규모 언어모델을 높은 전력 효율로 서빙하도록 설계되었습니다.

자세히 보기

도움이 필요하신가요?

내용을 작성해 주시면 곧 연락 드리겠습니다.

문의하기
lablup

본사 및 HPC 연구소

KR Office: 서울특별시 강남구 선릉로 577 CR타워 8층 US Office: 3003 N First st, Suite 221, San Jose, CA 95134

  • facebook
  • youtube
  • Linkedin
  • GitHub

© Lablup Inc. All rights reserved.

개인정보를 소중히 여깁니다

쿠키는 사이트 트래픽 분석, 방문자 이용 방식 파악, 서비스 개선에 사용됩니다. 사이트 기본 동작에 필요한 필수 쿠키는 항상 활성화됩니다. 자세히 보기

"모두 수락"을 클릭하면 분석 쿠키가 기기에 저장되는 것에 동의하게 됩니다. 필수 쿠키만 허용하시려면 "모두 거부"를, 직접 선택하시려면 "상세 설정"을 눌러주세요. 설정은 언제든지 변경할 수 있습니다.