AI 학습/추론 인프라를 위한 GPU 수량 계산 도구 - Leaders Systems
이 계산기는 NVIDIA 공식 벤치마크 (NIM Benchmarking, NIM-LLM, NIM-VLM, GenAI-Perf, NeMo Framework, Training, Conversational AI, AI Inference, 🥇 MLPerf™ v6.1)와 🏆 MLCommons Inference 표준, MLCommons 학습 표준을 적용합니다. 📚 상세: Megatron Bridge
🆕 2026-09-23 추가: DeepSeek V4, GPT-OSS 20B, Nemotron 3/3.5, Qwen3.5/3.6, Kimi K2.5/K3, MiniMax M2.5/M3 | 모델을 선택하면 자동으로 파라미터가 설정됩니다
또는 위에서 모델을 선택하세요
Tier 1: Megatron-Bridge 공식 — LLaMA3-8B: micro_batch=2, 405B: micro_batch=1. Global batch = micro × GPU수 × grad_accum.
일반적으로 1~5 epoch
일반적으로 75~90%
전체 가중치 업데이트. Tier 3: Megatron-LM 논문 기준 (Shoeybi et al. 2019, NVIDIA)
LoRA/QLoRA는 NVIDIA 공식 메모리 수식이 없어 KO 페이지에서 지원하지 않습니다.
길수록 활성화 메모리 증가
GPU당 메모리 감소. TP4 이상은 NVLink 필요
대규모 클러스터(100B+ 모델) 전용. 버블 오버헤드 = (PP-1)/(PP×m)
마이크로 배치 수가 많을수록 버블 감소. Megatron-LM / NeMo 사용 시 필수 설정.