래블업과 퓨리오사에이아이는 RNGD와 Backend.AI의 결합이 실제 LLM 워크로드에서 어떤 성능과 운영 효율을 보이는지 정리한 백서, 「RNGD meets Backend.AI」를 발간했습니다. Backend.AI는 다양한 GPU와 AI 가속기를 하나의 플랫폼에서 통합 운영할 수 있도록 지원해 왔습니다. 래블업과 퓨리오사에이아이는 이번 백서를 통해 Backend.AI 환경에서 FuriosaAI RNGD를 활용해 대규모 언어모델을 운영할 때의 처리량, 지연 시간, 전력 효율, 멀티 GPU 확장 가능성을 벤치마크 결과와 함께 소개합니다.
RNGD와 Backend.AI가 만났을 때
Backend.AI는 GPU, NPU, TPU를 포함한 다양한 가속기를 하나의 플랫폼에서 관리할 수 있도록 설계되어 있으며, 이번 백서는 그중에서도 FuriosaAI RNGD와의 연동 결과를 집중적으로 다룹니다. 특히 Backend.AI의 세션 기반 실행 환경과 Sokovan 오케스트레이션을 통해 RNGD를 안정적으로 배치하고, Prefill와 Decode가 혼재된 LLM 워크로드를 효율적으로 운영하는 방식을 설명합니다.
RNGD는 48GB HBM3와 180W TDP를 갖춘 NPU로, AI 추론에 필요한 높은 메모리 대역폭과 전력 효율을 동시에 겨냥한 장치입니다. 백서에서는 이러한 하드웨어 특성이 Backend.AI의 자원 관리 및 격리 기능과 결합될 때, 실제 서비스 운영 관점에서 어떤 장점을 만드는지 보여줍니다.
RNGD 벤치마크
래블업과 퓨리오사에이아이는 4대의 퓨리오사에이아이 레니게이드(RNGD) 환경에서 Qwen3-32B FP8 모델을 활용하여 벤치마크 테스트를 구성했습니다. 벤치마크 환경에서 RNGD는 비교군 대비 더 낮은 전력으로 경쟁력 있는 처리량을 보여주며, 특히 동시성이 높아질수록 전력 효율과 처리량 측면에서 강점을 드러냅니다. 또한 TTFT와 TPOT 측정에서도 RNGD는 높은 동시성 구간에서 안정적인 응답 특성을 보였습니다.
백서에서 확인할 수 있는 내용
- Backend.AI와 RNGD 연동 구조
- FuriosaAI RNGD의 하드웨어 특성 및 LLM 적합성
- Qwen3-32B FP8 기준 성능 검증 결과
- 동시성별 처리량, TTFT, TPOT 비교
- 전력 효율과 멀티 GPU 운영 관점의 분석
Backend.AI와 FuriosaAI RNGD의 결합이 어떤 의미를 갖는지 더 자세히 확인하려면, 다음 링크에서 백서 본문을 확인하세요.

RNGD meets Backend.AI: 주권 AI 시대를 위한 AI 추론 인프라
국내에서 설계된 FuriosaAI의 추론 가속기 RNGD를 Backend.AI 단일 운영 체계에서 할당·서빙하는 통합 구성과, 동등 조건 벤치마크로 알아본 처리량·전력 효율 특성을 확인해보세요.