quickmenu
PC 뉴스 홈  

엔비디아, 추론 성능 가속화하는 새로운 소프트웨어 텐서RT-LLM 출시

2023-09-12 10:45
편집부 press@bodnara.co.kr

엔비디아(www.nvidia.co.kr)가 새로운 소프트웨어 엔비디아 텐서RT-LLM(NVIDIA TensorRT-LLM)을 출시했다고 밝혔다.


텐서RT-LLM은 대규모 언어 모델이 발전함에 따라 오픈 소스 모듈식 파이썬 API(Python API)를 통해 사용 편의성과 확장성을 개선하고, 쉽게 사용자 맞춤화할 수 있다. 파이썬 API는 새로운 아키텍처와 개선 사항을 정의, 최적화, 실행할 수 있다. 예를 들어, 모자이크ML은 텐서RT-LLM 위에 필요한 특정 기능을 원활하게 추가하고 추론 서비스에 통합했다.

H100은 단독으로도 A100보다 4배 빠른 속도를 보여준다. 인플라이트 배칭 등 텐서RT-LLM의 성능을 추가하면 속도가 총 8배로 증가해 최고의 처리량을 제공한다.최근 메타가 출시한 언어 모델 라마2(Llama 2)는 생성형 AI를 통합하려는 여러 조직에서 널리 사용되고 있다. 이 라마2에서 텐서RT-LLM은 A100 GPU에 비해 추론 성능을 4.6배 가속화할 수 있다.


라마2와 같은 최신 대규모 언어 모델에서는 700억 개의 파라미터를 사용하더라도 고객은 A100 기준 대비 4.6배의 성능 속도 향상을 실현한다. 이로써 총소유비용은 3배, 소비 에너지는 3.2배 절감할 수 있다.

텐서RT-LLM은 개별 가중치 행렬을 여러 디바이스에서 분할하는 모델 병렬 처리의 일종인 텐서 병렬 처리(Tensor Parallelism)를 사용한다. 이를 통해 개발자의 개입이나 모델 변경 없이도 각 모델이 NV링크(NVLink)를 통해 연결된 여러 GPU와 서버에서 병렬로 실행돼 대규모 추론을 효율적으로 수행할 수 있게 됐다.

또한 텐서RT-LLM에는 오늘날 프로덕션 환경에서 널리 사용되는 많은 대규모 언어 모델의 최적화되고 바로 실행 가능한 버전이 포함돼 있다. 여기에는 메타의 라마 2, 오픈AI(OpenAI)의 GPT-2 와 GPT-3, 팔콘(Falcon), 모자이크 MPT(Mosaic MPT), 블룸(BLOOM) 등 12가지가 포함되며, 모두 사용이 간편한 텐서RT-LLM 파이썬API로 구현할 수 있다.

이러한 기능을 통해 개발자는 사실상 모든 업계의 요구 사항을 충족하는 맞춤형 대규모 언어 보델을 더 빠르고 정확하게 만들 수 있다.


인플라이트 배칭을 사용하면 전체 요청이 완료될 때까지 기다렸다가 다음 요청 세트로 넘어가는 대신, 텐서RT-LLM 런타임이 완료된 시퀀스를 배치에서 즉시 제거한다. 그런 다음 다른 요청이 아직 전송 중인 동안 새 요청을 실행한다. 인플라이트 배칭과 추가적인 커널 수준 최적화를 통해 GPU 사용량을 개선하고 H100 텐서 코어 GPU의 실제 대규모 언어 모델 요청 벤치마크에서 처리량을 최소 두 배 이상 증가시켜 총소유비용을 최소화하고 에너지 비용을 절감한다.

텐서RT-LLM이 탑재된 엔비디아 H100 GPU(H100 GPU)를 사용하면 모델 가중치를 새로운 FP8 형식으로 쉽게 변환하고, 최적화된 FP8 커널을 자동으로 활용하도록 모델을 컴파일할 수 있다. 이는 호퍼 트랜스포머 엔진(Hopper Transformer Engine) 기술을 통해 가능하며, 별도로 모델 코드를 변경할 필요가 없다.

H100에 도입된 FP8 데이터 포맷을 통해 개발자는 모델을 정량화하고 모델 정확도를 저하시키지 않으면서 메모리 소비를 획기적으로 개선한다. FP8 양자화는 INT8 또는 INT4와 같은 다른 데이터 형식에 비해 높은 정확도를 유지하면서도 가장 빠른 성능을 달성하고 가장 간단한 구현을 제공한다.

텐서RT-LLM은 프로덕션 환경에서 추론을 위한 대규모 언어 모델을 정의, 최적화, 실행하기 위한 간단한 오픈 소스 파이썬 API에 텐서RT의 딥 러닝 컴파일러, 최적화된 커널, 사전, 사후 처리, 멀티 GPU/멀티 노드 통신으로 구성된다.


엔비디아 텐서RT-LLM은 현재 얼리 액세스 버전으로 제공된다. 아울러 보안, 안정성, 관리 용이성, 지원 등을 갖춘 엔터프라이즈급 AI 소프트웨어 플랫폼인 엔비디아 AI 엔터프라이즈(AI Enterprise)의 일부인 엔비디아 네모 프레임워크에 통합될 예정이다. 개발자와 연구자는 NGC의 네모 프레임워크 또는 깃허브(GitHub)의 소스 레포지토리를 통해 텐서RT-LLM에 액세스할 수 있다.

얼리 액세스 릴리스를 신청하려면 엔비디아 개발자 프로그램(Developer Program)에 등록돼 있어야 한다. 또한 기업용 이메일 주소로 로그인해야 한다. 지메일(Gmail), 야후(Yahoo), 큐큐(QQ) 또는 기타 개인 이메일 계정을 사용하는 계정에서는 신청을 받을 수 없다.

닉네임 lock
비회원

보드나라 많이 본 뉴스
보드나라 많이 본 기사

보드나라 최신 기사
[09/12] MSI, 10월 한 달 푸짐한 혜택! 다채로운 PC 부품 이벤트 진행!  
[09/12] HP 인기 게이밍 노트북 2종, 11번가 십일절 초특가 프로모션 참여  
[09/12] 서린씨앤아이, HYTE 홀로라이브 사쿠라 미코 콜라보 제품 예약 판매 진행  
[09/12] LG전자, 오는 11일까지 성수동서 LG전자 서울숲 아트포레스트 진행  
[09/12] 삼성전자 갤럭시 생태계의 새식구 공개, 갤럭시 탭 S12 시리즈와 클립형 버즈 스마트태그3  
[09/12] 게임위, 확률형 아이템 표시의무 위반한 해외게임물 관련 이용 주의 당부  
[09/12] 에스라이즈, 11번가 월간 십일절서 ASUS TUF A18&GAMING V16 프로모션 진행  
[09/12] 라스트 에포크, 시즌 5 ‘서리화신의 분노’ 업데이트 진행  
[09/12] 'Pokemon Pokopia', 본편부터 익스팬션 패스까지 하나로.. 10월 29일 합본 패키지 출시  
[09/12] 포트나이트, ‘포트나이트의 악몽 2026’ 시작  
[09/12] 아마존 중고샵서 RTX 5090 샀더니 쿨러만? PCB 통째로 사라진 제품 배송  
[09/12] 엔비디아 GTX 700/ 900/ 10 시리즈 보안 업데이트용 드라이버 582.78 버전 배포  
[09/12] 디앤디컴, PC방 특화 메인보드 ‘MAXSUN 마일스톤 H610M 2.5G V3’ 출시  
[09/12] MSI QD-OLED로 공중 전투, 에이스 컴뱃 8 시브의 날개 프로모션 증정 이벤트  
[09/12] 하이엔드 설계의 진화, 마이크로닉스 프리미엄 PC 케이스 ‘HAVN HS 360’ 출시  
[09/12] 야마하뮤직코리아, 드러머를 위한 차세대 디지털 믹서 EAD50 국내 공식 론칭  
[09/12] 스타트럭코리아, 트럭 탄생 130주년 기념 120+10 프로모션 진행  
[09/12] IBM, 기업 AI 주권 거버넌스 강화 위한 IBM 밥 자체 호스팅 배포 버전 출시  
[09/12] TCL, 4-in-1 페이퍼 태블릿 '노트 A1 넥스트페이퍼' 국내 정식 출시  
[09/12] 단 5일! 게이밍 PC 구매 찬스.. MSI, G마켓 월첫세일 데스크탑 특가  
로그인 | 이 페이지의 PC버전
Copyright NexGen Research Corp. 2010