
NVIDIA 공식 기술 블로그에 따르면 회사는 Blackwell GPU 기반 기밀 컴퓨팅 환경에서 AI 추론 보안을 적용해도 일반 환경 대비 최대 98% 수준의 성능을 유지했다는 자체 벤치마크를 공개했다. 기업이 AI 모델과 데이터를 추론 중에도 보호해야 한다는 요구가 커지는 가운데, 보안 적용에 따른 성능 저하를 정량적으로 제시한 점이 눈에 띈다.
이번 발표의 초점은 NVIDIA Confidential Computing이다. NVIDIA는 이 기술이 실리콘, 인터커넥트, 시스템 소프트웨어 전반에 보안 계층을 적용해 데이터와 코드, 모델의 무결성과 기밀성을 보호한다고 설명했다. Blackwell 계열 GPU에는 하드웨어 루트 오브 트러스트가 포함되며, HGX B200과 HGX B300은 여러 GPU에 걸친 기밀 컴퓨팅과 NVLink 암호화를 지원한다.
원격 검증 절차도 핵심 요소로 제시됐다. NVIDIA에 따르면 기밀 워크로드는 비밀값을 받기 전에 GPU 하드웨어 보고서와 CPU TEE 측정값을 묶은 증거를 NVIDIA Remote Attestation Service가 검증한다. 검증된 기밀 가상머신에는 모델 복호화 키 같은 민감한 정보가 배포될 수 있다. NVIDIA는 이 절차가 일반적으로 시작 시점에 한 번 수행되며, 실행 중인 개별 추론 요청에는 지연 시간을 추가하지 않는다고 밝혔다.
성능 테스트는 Blackwell Ultra 기반 HGX B300에서 진행됐다. NVIDIA는 Qwen 3.5 397B-A17B 모델을 FP8 정밀도로 구동하고, SGLang 서버 환경에서 입력·출력 토큰 길이와 동시 요청 수를 바꿔가며 기밀 컴퓨팅 적용 전후를 비교했다. 테스트 환경에는 Intel TDX, Ubuntu 24.04.4 LTS 게스트, NVIDIA 드라이버 595.71.05, CUDA 13.2, NCCL 2.28.9-1 등이 포함됐다.
NVIDIA가 공개한 표에 따르면 기밀 컴퓨팅을 켠 상태의 처리량과 토큰당 지연 시간 감소 폭은 테스트 구성별로 대체로 한 자릿수였다. 1024개 입력 토큰과 1024개 출력 토큰 조건에서는 동시 요청 수에 따라 처리량 감소가 2.0%에서 7.5% 사이로 나타났다. 8192개 입력 토큰과 1024개 출력 토큰 조건에서는 처리량 감소가 1.0%에서 3.6% 사이였다. 회사는 이를 근거로 보안을 적용하면서도 생산 환경에 가까운 추론 성능을 유지할 수 있다고 설명했다.
성능 보완에는 추론 프레임워크 최적화도 함께 언급됐다. NVIDIA는 FlashInfer의 기밀 컴퓨팅 안전 자동 튜닝, SGLang의 비동기 D2H 복사 워커, 프리필과 혼합 배치에 대한 CUDA 그래프 재생 지원이 보안 작업 제출 지연과 암호화된 전송 대역폭의 영향을 줄이는 데 기여한다고 설명했다.
이 발표는 AI 인프라 경쟁이 단순한 연산 성능을 넘어 데이터 보호와 규제 대응 능력으로 확장되고 있음을 보여준다. 금융, 의료, 공공, 제조처럼 민감한 데이터를 다루는 조직은 모델 학습뿐 아니라 추론 과정에서도 데이터와 모델 가중치 보호를 요구한다. 다만 이번 성능 수치는 NVIDIA가 특정 하드웨어와 소프트웨어 구성에서 측정한 자체 벤치마크인 만큼, 실제 서비스 환경에서는 모델 크기, 배치 전략, 네트워크 구성, 워크로드 특성에 따라 결과가 달라질 수 있다.
출처: NVIDIA Technical Blog https://developer.nvidia.com/blog/hardware-rooted-ai-security-that-wont-slow-you-down/