TL;DR
- MNIST 60,000개 이미지를 784차원에서 2차원으로 투영할 때, t-SNE가 전체 공간의 최근접 이웃 관계를 가장 잘 보존하는 최적의 지도임.
- t-SNE는 784차원에서 존재하는 최근접 이웃 연결의 42.5%를 유지하며, 무작위 2D 투영 3.9%, 우연에 의한 수준 0.67%를 크게 웃돎.
- 데이터는 28×28 픽셀, 0~255 grayscale, 결측값 없음으로 구성되어 모든 방법이 동일한 행렬을 입력으로 사용함.
- 픽셀 공간에서 최근접 이웃의 8.3%는 서로 다른 숫자 레이블을 가지므로, 2차원 지도에서 복원 가능한 이웃 관계에도 상한이 존재함.
- 선형 기준선인 PCA는 첫 두 주성분으로 전체 분산의 16.8%만 보존하며, 90% 보존에는 86개 성분이 필요함.
데이터와 발견 내용
- 2차원 지도가 어떤 그림자를 만드는지 평가하려면 그 그림자를 만드는 대상인 MNIST 데이터가 필요함.
- 손으로 쓴 숫자 이미지로, 학습용 60,000개와 테스트용 10,000개로 구성됨.
- 각 이미지는 784개 픽셀로 구성된 grayscale 데이터이며, 원래 형태는 28×28 격자임.
- 사전 탐색 결과 원시 픽셀값은 0~255 전체 범위에 걸쳐 있으며, 두 데이터 분할 모두 결측값이 없음.
- 따라서 대치(imputation)를 수행하지 않음.
- 11개 방법 모두 동일한 행렬을 입력으로 사용해 비교에서 달라지는 요소를 방법 자체로 제한함.
- 클래스 분포는 거의 균일함.
- 가장 많은 숫자는 1이며, 60,000개 이미지 중 6,742개를 차지함.
- 가장 많은 숫자만 항상 예측하는 다수 클래스 기준 정확도는 0.1124임.
- 2차원에서 보고하는 정확도는 0을 기준으로 보지 않고 이 기준선과 비교해야 함.
- 픽셀 공간만으로는 이웃 관계가 모호함.
- 2,000개 이미지로 구성된 탐색 집합에서 각 이미지의 784차원 최근접 이웃이 다른 레이블을 갖는 빈도를 측정함.
- 그중 167개, 즉 8.3%는 픽셀 공간에서 가장 가까운 이웃이 다른 숫자임.
- 이는 2차원 지도가 가질 수 있는 상한임. 원래 공간에 존재하지 않는 이웃 연결은 어떤 2차원 지도도 복원할 수 없음.
- 따라서 리더보드의 최고 성능은 실패가 아니라 데이터가 제공하는 상한으로 해석해야 함.
- 모든 이미지를 해시해 정확한 중복을 탐지했으며, 제거할 중복은 발견되지 않음.
- 픽셀의 80.9%가 정확히 0으로 확인됨.
- 유용한 분산이 소수의 픽셀에 집중되어 있음.
- 평균 이미지가 강력한 기준선으로 작동하므로 이를 넘어서는 재구성이 필요함.
선형 및 커널 방법
- 첫 번째 그림자 투영 방식은 선형 투영임.
- 선형 지도는 각 784차원 이미지를 몇 개 방향의 가중합으로 표현함.
- 주성분 분석(PCA)은 분산이 가장 큰 방향을 선택함.
- 설명 분산(explained variance)은 선택한 방향들이 전체 데이터 분산 중 얼마나 보존하는지 나타냄.
- PCA는 고정된 6,000개 이미지 집합에 적합했으며, 픽셀값은 0~1 범위로 스케일링함.
- 첫 번째 주성분은 분산의 9.9%를 보존하고, 첫 두 주성분은 합쳐서 16.8%를 보존함.
- 분산의 90%를 보존하려면 86개 성분이 필요함.
- 이 수치는 데이터의 실제 차원성이 784보다 훨씬 낮다는 점을 보여줌.
- MNIST가 압축하기는 쉽지만 2차원으로 그리기는 어려운 이유가 됨.
- 첫 두 주성분은 전체 분산 중 작은 일부만 담으므로 2차원 PCA 그림은 그림자의 그림자에 해당함.
- 재구성 평가에서는 각 성분 개수별 평균제곱오차(MSE)를 계산함.
- 평균 이미지는 최선의 상수 재구성이므로 기준선 MSE는 0.06724임.
- PCA 재구성은 이 기준선보다 낮은 MSE를 달성해야 의미가 있음.
- 성분 개수를 2, 10, 50, 200개로 바꿔 재구성 오차를 비교함.
- 다음 절차는 평균 이미지를 기준선으로 계산한 뒤, PCA 좌표와 주성분을 사용해 각 성분 수에 따른 복원 이미지를 만들고 MSE를 출력함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요