딥러닝 양자화(Quantization) 정리 PTQ와 QAT, 수식으로 비교해보기
모델을 실제 엣지 디바이스나 NPU에 배포하려다 보면 양자화를 피하기 어렵습니다.특히 VisionicNet 개발 과정에서 INT8 배포를 시도하며 PTQ가 왜 실패하는지, QAT가 내부적으로 어떻게 동작하는지를 직접 겪었는데, 이번에 개념을 처음부터 다시 정리해봤습니다.수식과 가상 예시를 통해 두 방식의 차이를 단계별로 비교합니다. 양자화란FP32(32비트 부동소수점)로 표현되는 가중치와 활성화 값을 INT8 등 낮은 비트의 정수형으로 변환하여 메모리 사용량을 줄이고 추론 속도를 높이는 기법입니다.대표적인 방식이 PTQ와 QAT 두 가지입니다. PTQ (Post-Training Quantization, 훈련 후 양자화)이미 학습이 완료된 모델의 파라미터를 추가 재학습 없이 직접 양자화하는 방식입니다. 기..