- 정보 이론 기반 지표
- 비디오 품질 지표
- 도메인 특화 지표
- 세그멘테이션 기반 지표
1. SSIM과 PSNR의 비교 #
SSIM(Structural Similarity Index Measure)은 두 이미지 간의 유사도를 측정하는 지표이다. 단순한 픽셀 차이(MSE, PSNR 등)와 달리, 인간의 시각 시스템(HVS)이 이미지를 인식하는 방식을 모방해 설계되었다.
SSIM의 핵심 아이디어
인간의 눈은 절대적인 밝기 차이보다 구조적인 패턴에 더 민감하다. SSIM은 이를 반영해 세 가지 요소를 비교한다.
| 요소 | 의미 | 수식 기호 |
|---|---|---|
| 휘도 (Luminance) | 평균 밝기 비교 | μ (mu) |
| 대비 (Contrast) | 밝기의 분산/변화량 비교 | σ (sigma) |
| 구조 (Structure) | 픽셀 간 상관관계 비교 | σ_xy |
수식
$$SSIM(x, y) = \frac{(2\mu_x\mu_y + C_1)(2\sigma_{xy} + C_2)}{(\mu_x^2 + \mu_y^2 + C_1)(\sigma_x^2 + \sigma_y^2 + C_2)}$$
- μ_x, μ_y : 각 이미지의 평균 (휘도)
- σ_x, σ_y : 각 이미지의 표준편차 (대비)
- σ_xy : 두 이미지의 공분산 (구조)
- C1, C2 : 분모가 0이 되는 것을 막는 안정화 상수
결과값 해석
| SSIM 값 | 의미 |
|---|---|
| 1.0 | 두 이미지가 완전히 동일 |
| 0.9 이상 | 매우 유사 (육안으로 거의 구별 불가) |
| 0.5 ~ 0.9 | 눈에 띄는 차이 존재 |
| 0 이하 | 구조적으로 반대에 가까운 이미지 |
PSNR과의 비교
| PSNR | SSIM | |
|---|---|---|
| 기반 | 픽셀 단위 수치 오차 | 인간 시각 특성 |
| 단위 | dB | 없음 (0~1) |
| 한계 | 지각 품질과 괴리 발생 가능 | 지각적 품질과 더 잘 일치 |
예를 들어, 이미지를 약간 이동(shift)시키면 PSNR은 크게 떨어지지만, 사람 눈에는 거의 차이가 없다. SSIM은 이런 경우를 더 잘 반영한다.
활용 분야
- 이미지 압축 품질 평가 (JPEG, WebP 등)
- 영상 복원 / 노이즈 제거 알고리즘 평가
- Super Resolution 모델 성능 평가
- 딥러닝 손실 함수 (SSIM Loss)로 활용
- 의료 영상 품질 검증
SSIM의 한계
- 로컬 윈도우 기반으로 계산하기 때문에 전역적인 구조 변화에 취약할 수 있음
- 색상(Color) 정보를 직접 다루지 못해 보통 휘도 채널(Y)에만 적용
- 이를 보완한 MS-SSIM(Multi-Scale SSIM) 도 널리 사용됨
SSIM은 이미지 품질 평가의 사실상 표준(de facto standard)으로, 논문이나 산업에서 매우 광범위하게 쓰이는 지표이다.
2. 이미지 색상 차이 지표 Delta-E #
Delta-E도 이미지 유사도/색상 차이를 측정하는 데 사용되지만, SSIM과는 목적과 설계 철학이 다르다.
Delta-E란?
Delta-E(ΔE)는 두 색상 간의 지각적 차이를 수치화한 지표이다. 핵심은 "인간의 눈이 느끼는 색상 차이" 를 정량화하는 것이다.
- CIE(국제조명위원회)에서 표준화
- CIE Lab 색공간 기반으로 계산
- 숫자가 클수록 색 차이가 큼
CIE Lab 색공간
Delta-E를 이해하려면 Lab 색공간을 알아야 한다.
| 채널 | 의미 | 범위 |
|---|---|---|
| L* | 밝기 (Luminance) | 0 (검정) ~ 100 (흰색) |
| a* | 빨강 ↔ 초록 축 | -128 ~ +127 |
| b* | 노랑 ↔ 파랑 축 | -128 ~ +127 |
Lab 색공간은 지각적으로 균일(perceptually uniform) 하도록 설계되어, 수치 차이가 실제 시각적 차이와 잘 대응된다.
Delta-E의 버전 역사
버전이 발전할수록 인간 시각에 더 정밀하게 맞춰진다.
ΔE76 (CIE 1976) — 가장 단순
$$\Delta E = \sqrt{(\Delta L^*)^2 + (\Delta a^*)^2 + (\Delta b^*)^2}$$
단순한 유클리드 거리. 빠르지만 인간 시각과 괴리 존재.
ΔE94 (CIE 1994) — 개선판
채도(Chroma)와 색상(Hue) 영역별로 가중치를 다르게 적용. 인간의 눈이 채도 변화보다 밝기 변화에 더 민감하다는 점을 반영.
ΔE2000 (CIE 2000) — 현재 산업 표준
$$\Delta E_{00} = \sqrt{\left(\frac{\Delta L'}{k_L S_L}\right)^2 + \left(\frac{\Delta C'}{k_C S_C}\right)^2 + \left(\frac{\Delta H'}{k_H S_H}\right)^2 + R_T \cdot \frac{\Delta C'}{k_C S_C} \cdot \frac{\Delta H'}{k_H S_H}}$$
- 회전 항(R_T) 추가: 파란색 계열에서의 지각 보정
- 가장 복잡하지만 인간 시각과 가장 잘 일치
- 인쇄, 디스플레이, 섬유 업계 표준
ΔE2000 결과값 해석
| ΔE 값 | 의미 |
|---|---|
| 0 ~ 1 | 인간이 감지 불가능한 차이 |
| 1 ~ 2 | 숙련된 전문가만 겨우 감지 |
| 2 ~ 3 | 일반인도 약간 감지 가능 |
| 3 ~ 5 | 명확하게 다른 색으로 인식 |
| 5 이상 | 누구나 확연히 다른 색으로 인식 |
SSIM vs Delta-E 비교
| SSIM | Delta-E | |
|---|---|---|
| 주요 목적 | 이미지 구조/품질 비교 | 색상 차이 측정 |
| 측정 대상 | 밝기, 대비, 구조 | 색상 (L, a, b) |
| 색공간 | 주로 YCbCr/Gray | CIE Lab |
| 주요 사용처 | 압축, 복원, SR 품질 평가 | 인쇄, 디스플레이 색 교정 |
| 전역 vs 로컬 | 로컬 윈도우 기반 | 픽셀(또는 평균) 단위 |
| 구조 인식 | ✅ | ❌ |
| 색 지각 정확도 | 보통 | ✅ 매우 높음 |
SSIM과 함께 쓰이는 경우
두 지표는 상호 보완적이라 같이 사용하면 효과적이다.
- SSIM → 이미지의 구조/텍스처가 잘 보존되었는가?
- Delta-E → 색상이 정확하게 재현되었는가?
예를 들어 색 보정(Color Grading), 디스플레이 캘리브레이션, 인쇄 품질 검수 같은 작업에서는 Delta-E가 SSIM보다 훨씬 중요한 지표가 된다.
3.1. 이미지 구조 비교 지표 #
픽셀 기반 (Pixel-based)
| 지표 | 설명 | 특징 |
|---|---|---|
| MSE (Mean Squared Error) | 픽셀 차이의 제곱 평균 | 가장 단순, 지각과 괴리 큼 |
| MAE (Mean Absolute Error) | 픽셀 차이의 절대값 평균 | MSE보다 이상치에 덜 민감 |
| PSNR (Peak Signal-to-Noise Ratio) | MSE를 dB 단위로 변환 | 압축 품질 평가의 전통적 표준 |
지각 기반 (Perceptual)
| 지표 | 설명 | 특징 |
|---|---|---|
| SSIM | 휘도·대비·구조를 동시에 비교 | 지각적 품질과 잘 일치 |
| MS-SSIM (Multi-Scale SSIM) | 여러 해상도에서 SSIM 계산 | SSIM보다 더 정확 |
| FSIM (Feature Similarity) | 위상 일치(Phase Congruency) + 그래디언트 | 엣지/텍스처 인식에 강함 |
| GMSD (Gradient Magnitude Similarity Deviation) | 그래디언트 크기 편차 비교 | 빠르고 SSIM에 준하는 성능 |
| VIF (Visual Information Fidelity) | 정보 이론 기반, 채널 용량으로 비교 | 인간 시각 모델링에 충실 |
딥러닝 기반 (Deep Learning-based)
| 지표 | 설명 | 특징 |
|---|---|---|
| LPIPS (Learned Perceptual Image Patch Similarity) | VGG/AlexNet 특징맵 거리 비교 | 현재 지각 유사도의 사실상 표준 |
| FID (Fréchet Inception Distance) | Inception 특징의 분포 거리 비교 | GAN 생성 이미지 품질 평가에 표준 |
| DISTS (Deep Image Structure and Texture Similarity) | 구조+텍스처를 분리해서 비교 | 기하학적 변형에 강인 |
| NIQE / BRISQUE | 참조 이미지 없이 품질 평가 (No-Reference) | 원본 없이도 사용 가능 |
정보 이론 기반
| 지표 | 설명 |
|---|---|
| NMI (Normalized Mutual Information) | 두 이미지의 상호 정보량 비교, 의료 영상 정합에 많이 사용 |
| NCC (Normalized Cross-Correlation) | 템플릿 매칭, 이동/조명 변화에 강인 |
3.2. 색상 차이 측정 지표 #
CIE 표준 Delta-E 계열
| 지표 | 연도 | 특징 |
|---|---|---|
| ΔE76 | 1976 | 단순 유클리드 거리, 빠르지만 정확도 낮음 |
| ΔE94 | 1994 | 채도/색상에 가중치 적용 |
| ΔE2000 | 2000 | 현재 산업 표준, 파란색 계열 보정 포함 |
| ΔE CMC | 1984 | 섬유/염색 업계 특화 표준 |
색공간 거리 기반
| 지표 | 색공간 | 특징 |
|---|---|---|
| RGB Euclidean Distance | RGB | 가장 단순, 지각과 괴리 큼 |
| HSV Distance | HSV | 색상(Hue) 차이에 집중할 때 유용 |
| Lab Distance | CIE Lab | 지각적으로 균일, Delta-E의 기반 |
| Luv Distance | CIE Luv | Lab과 유사, 색도 계산에 유리 |
통계/히스토그램 기반
| 지표 | 설명 | 특징 |
|---|---|---|
| 히스토그램 교차(Histogram Intersection) | 색상 분포의 겹치는 영역 비교 | 빠르고 단순, 공간 정보 무시 |
| EMD (Earth Mover's Distance / Wasserstein) | 색상 분포를 다른 분포로 옮기는 최소 비용 | 분포 차이를 직관적으로 표현 |
| Bhattacharyya Distance | 두 분포의 겹침 정도 | 색상 분포 비교에 유용 |
3.3. 전체 지표 선택 가이드 #
목적에 따른 추천 지표
구조 비교
├── 빠른 기본 평가 → PSNR, SSIM
├── 지각 품질 정밀 → MS-SSIM, LPIPS
├── 생성 모델 평가 → FID
└── 참조 이미지 없음 → NIQE, BRISQUE
색상 비교
├── 산업/인쇄 표준 → ΔE2000
├── 색상 분포 비교 → EMD, 히스토그램
└── 단순 빠른 비교 → RGB/HSV 거리
각 지표는 단독보다 조합해서 사용할 때 더 강력하다. 예를 들어 Super Resolution 논문에서는 보통 PSNR + SSIM + LPIPS 를 함께 보고한다.
4. 딥러닝 기반의 이미지 유사도 측정 지표와 전통적인 메트릭 기반 지표의 차이와 장단점 #
핵심 철학 차이
| 전통적 지표 | 딥러닝 기반 지표 | |
|---|---|---|
| 설계 방식 | 수학적 공식으로 명시적 정의 | 데이터로부터 학습 |
| 기반 | 픽셀/신호 처리 이론 | 신경망 특징 공간 |
| 해석 | 완전히 투명함 | 블랙박스적 요소 존재 |
| 보편성 | 도메인 무관 | 학습 데이터에 의존 |
전통적 지표 (PSNR, SSIM)
✅ 장점
1. 해석 가능성 (Interpretability) - 수식이 명확하고 결과값의 의미가 직관적 - PSNR 40dB, SSIM 0.95 같은 수치가 무엇을 뜻하는지 명확 - 논문/산업 현장에서 기준값으로 쓰기 용이
2. 재현성 (Reproducibility) - 동일 입력 → 항상 동일 출력 - 구현체 간 차이가 없음 - 외부 모델/가중치 의존성 없음
3. 계산 효율성 - 매우 빠름 (CPU에서도 실시간 계산 가능) - 메모리 부담 없음 - 임베디드/엣지 환경에서도 사용 가능
4. 범용성 - 어떤 도메인이든 적용 가능 (의료, 위성, 자연 이미지 등) - 학습 데이터 없이 즉시 사용
5. 역사적 축적 - 수십 년간의 벤치마크 데이터 존재 - 레거시 시스템과 호환
❌ 단점
1. 지각적 괴리 (Perceptual Gap) — 가장 큰 문제 - 사람 눈에는 좋아 보이는 이미지가 낮은 점수를 받을 수 있음 - 대표적 예시:
원본 이미지를 1픽셀 shift → PSNR 급락, 눈에는 동일
블러 처리된 이미지 → PSNR 높음, 눈에는 흐릿함
GAN 생성 이미지 → PSNR 낮음, 눈에는 매우 선명
2. 고주파 정보 무시 - 텍스처, 세밀한 패턴, 엣지의 미세한 차이를 잘 잡지 못함
3. 의미론적 정보 부재 - "개"와 "고양이" 이미지의 픽셀값이 비슷하면 유사하다고 판단 - 콘텐츠의 의미를 전혀 고려하지 않음
4. 왜곡 유형 구분 불가 - 블러, 노이즈, 압축 아티팩트를 같은 방식으로 처리 - 왜곡의 종류에 따라 신뢰도가 달라짐
딥러닝 기반 지표 (LPIPS, FID, DISTS 등)
✅ 장점
1. 지각적 정확도 (Perceptual Accuracy) - 인간의 시각 판단과 훨씬 높은 상관관계 - LPIPS는 인간 평가자와의 일치도에서 SSIM을 크게 능가함이 실험으로 증명됨
2. 의미론적 이해 - 신경망이 학습한 고수준 특징(객체, 텍스처, 장면)을 활용 - 픽셀이 달라도 의미가 같으면 유사하다고 판단 가능
3. 고주파/텍스처 민감도 - 사람 눈이 중요하게 보는 텍스처, 엣지 디테일 차이를 잘 포착
4. 생성 모델 평가에 적합 - GAN, Diffusion 모델처럼 픽셀 단위 정답이 없는 경우에도 품질 평가 가능 - FID는 이미지 분포 자체를 비교하므로 다양성(Diversity)까지 측정
5. 인간 평가 대체 - 대규모 사용자 실험(Human Study) 없이도 지각 품질 추정 가능
❌ 단점
1. 블랙박스 문제 - 왜 그 점수가 나왔는지 설명하기 어려움 - 신뢰 임계값 설정이 모호 ("LPIPS 0.1이면 좋은 건가?")
2. 학습 데이터 편향 - ImageNet 등 자연 이미지로 학습된 경우, 의료/위성 이미지에서 신뢰도 저하 - 도메인이 다르면 별도 파인튜닝 필요
3. 계산 비용 - GPU 필요, 실시간 처리 어려움 - 모델 가중치 로딩, 메모리 사용량 큼 - FID는 통계 계산을 위해 대량의 이미지 필요
4. 재현성 문제 - 모델 버전, 구현체에 따라 결과가 달라질 수 있음 - 외부 의존성(pretrained weight)이 존재
5. 절대값 기준 부재 - 도메인마다 "좋은 점수"의 기준이 달라 비교가 어려움
지각적 괴리 — 핵심 예시로 비교
각 상황에서 각 지표가 어떻게 반응하는지 차이
| 왜곡 유형 | PSNR | SSIM | LPIPS | 실제 지각 품질 |
|---|---|---|---|---|
| 1픽셀 shift | 🔴 급락 | 🟡 소폭 하락 | 🟢 거의 유지 | 🟢 차이 없음 |
| 가우시안 블러 | 🟡 보통 | 🟡 보통 | 🔴 하락 | 🔴 흐릿함 |
| GAN 초해상도 | 🔴 낮음 | 🔴 낮음 | 🟢 높음 | 🟢 선명함 |
| JPEG 압축 | 🟡 보통 | 🟡 보통 | 🟡 보통 | 🟡 블록 아티팩트 |
| 노이즈 제거 과도 | 🟢 높음 | 🟢 높음 | 🔴 하락 | 🔴 과도하게 평탄 |
현업/연구에서의 실제 사용 전략
Super Resolution / 이미지 복원 논문
→ PSNR + SSIM (전통 기준 유지) + LPIPS (지각 품질) 함께 보고
GAN / Diffusion 생성 모델 평가
→ FID (분포 품질) + LPIPS (개별 이미지 품질)
실시간 시스템 (스트리밍, 임베디드)
→ PSNR / SSIM (속도 우선)
의료 영상 / 특수 도메인
→ 도메인 특화 지표 + SSIM (범용성 우선)
결론
딥러닝 기반 지표가 지각적 정확도에서 압도적으로 우수하지만, 전통 지표를 완전히 대체하지는 못한다. 그 이유는 전통 지표의 해석 가능성, 재현성, 속도가 여전히 실용적으로 중요하기 때문이다. 현재 연구 트렌드는 두 계열을 상호 보완적으로 함께 사용하는 방향으로 자리잡고 있다. 예를 들어 Super Resolution 논문에서는 보통 PSNR + SSIM + LPIPS 를 함께 보고한다.
5.1. 해시 기반 지표 (Perceptual Hashing) #
이미지 검색/중복 탐지에 특화된 영역
| 지표 | 설명 |
|---|---|
| pHash (Perceptual Hash) | DCT 기반 해시, 유사 이미지 검색 |
| dHash (Difference Hash) | 인접 픽셀 차이로 해시 생성 |
| aHash (Average Hash) | 평균 밝기 기반 해시 |
| wHash (Wavelet Hash) | 웨이블릿 변환 기반 |
→ 소셜미디어 중복 이미지 탐지, 저작권 보호에 실제로 많이 쓰임
5.3. 비디오/시계열 확장 지표 #
정적 이미지를 넘어 영상 품질 평가 지표
| 지표 | 설명 |
|---|---|
| VMAF (Video Multimethod Assessment Fusion) | Netflix 개발, 영상 품질 평가 표준 |
| MOVIE | 시간축 SSIM 확장 |
| ST-RRED | 시공간 정보 엔트로피 기반 |
5.4. No-Reference 지표 #
참조 이미지 없이 품질을 평가하는 지표군
| 지표 | 설명 |
|---|---|
| BRISQUE | 자연 장면 통계 기반 (위에서 언급만 함) |
| CORNIA | 코드북 기반 No-Reference |
| HyperIQA | 딥러닝 No-Reference |
| CLIP-IQA | CLIP 모델 기반 품질 평가 |
6. 참고문헌 #
SSIM / MS-SSIM
Wang, Z., Bovik, A. C., Sheikh, H. R., & Simoncelli, E. P. (2004). Image quality assessment: From error visibility to structural similarity. IEEE Transactions on Image Processing, 13(4), 600–612. https://doi.org/10.1109/TIP.2003.819861
Wang, Z., Simoncelli, E. P., & Bovik, A. C. (2003). Multiscale structural similarity for image quality assessment. Asilomar Conference on Signals, Systems and Computers. https://doi.org/10.1109/ACSSC.2003.1292216
PSNR / MSE
- Salomon, D. (2004). Data Compression: The Complete Reference. Springer. https://link.springer.com/book/10.1007/978-1-84628-603-2
FSIM
- Zhang, L., Zhang, L., Mou, X., & Zhang, D. (2011). FSIM: A feature similarity index for image quality assessment. IEEE Transactions on Image Processing, 20(8), 2378–2386. https://doi.org/10.1109/TIP.2011.2109730
GMSD
- Xue, W., Zhang, L., Mou, X., & Bovik, A. C. (2014). Gradient magnitude similarity deviation: A highly efficient perceptual image quality index. IEEE Transactions on Image Processing, 23(2), 684–695. https://doi.org/10.1109/TIP.2013.2293423
VIF
- Sheikh, H. R., & Bovik, A. C. (2006). Image information and visual quality. IEEE Transactions on Image Processing, 15(2), 430–444. https://doi.org/10.1109/TIP.2005.859378
LPIPS
- Zhang, R., Isola, P., Efros, A. A., Shechtman, E., & Wang, O. (2018). The unreasonable effectiveness of deep features as a perceptual metric. CVPR 2018. https://doi.org/10.1109/CVPR.2018.00068
FID
- Heusel, M., Ramsauer, H., Unterthiner, T., Nessler, B., & Hochreiter, S. (2017). GANs trained by a two time-scale update rule converge to a local Nash equilibrium. NeurIPS 2017. https://arxiv.org/abs/1706.08500
DISTS
- Ding, K., Ma, K., Wang, S., & Simoncelli, E. P. (2020). Image quality assessment: Unifying structure and texture similarity. IEEE Transactions on Pattern Analysis and Machine Intelligence. https://doi.org/10.1109/TPAMI.2020.3043737
BRISQUE / NIQE
Mittal, A., Moorthy, A. K., & Bovik, A. C. (2012). No-reference image quality assessment in the spatial domain. IEEE Transactions on Image Processing, 21(12), 4695–4708. https://doi.org/10.1109/TIP.2012.2214050
Mittal, A., Soundararajan, R., & Bovik, A. C. (2013). Making a completely blind image quality analyzer. IEEE Signal Processing Letters, 20(3), 209–212. https://doi.org/10.1109/LSP.2012.2227726
Delta-E / CIE Color Difference
Sharma, G., Wu, W., & Dalal, E. N. (2005). The CIEDE2000 color-difference formula: Implementation notes, supplementary test data, and mathematical observations. Color Research & Application, 30(1), 21–30. https://doi.org/10.1002/col.20070
CIE Publication 142 (2001). Improvement to industrial colour-difference evaluation. CIE Central Bureau, Vienna. https://cie.co.at/publications/improvement-industrial-colour-difference-evaluation
NMI / NCC (정보 이론 기반)
- Studholme, C., Hill, D. L. G., & Hawkes, D. J. (1999). An overlap invariant entropy measure of 3D medical image alignment. Pattern Recognition, 32(1), 71–86. https://doi.org/10.1016/S0031-3203(98)00091-0
EMD (Earth Mover's Distance)
- Rubner, Y., Tomasi, C., & Guibas, L. J. (2000). The earth mover's distance as a metric for image retrieval. International Journal of Computer Vision, 40(2), 99–121. https://doi.org/10.1023/A:1026543900054
참고: 일부 DOI 링크는 저널 구독이 필요할 수 있으며, arXiv 버전이 있는 경우 무료로 열람 가능합니다. LPIPS, FID 등은 arXiv에서 무료 접근이 가능합니다.