TL;DR
- UCI 가정용 전력 소비 데이터의 시간당 사용량을 대상으로 여러 상태·필터·함수 기반 모델을 살펴보며, 세 상태 은닉 마르코프 모형은 고부하 상태를 균형 정확도 0.905로 판별하고 일별 조화를 추가한 칼만 필터는 수준·추세 필터보다 오차를 줄임.
- 분석 데이터는 2006년 12월부터 2010년 11월까지 한 가구에서 수집한 약 200만 건의 1분 간격 측정값이며, 강한 계절성과 비정상성이 특징임.
- 전압과 전역 전류는 목표값을 대수적으로 재구성하므로 정보 누출 변수로 제외하고, 학습 구간만으로 고부하 기준값을 계산해 미래 정보가 라벨에 들어가지 않도록 함.
- 일별 사용량 주기가 가장 강하며, 시간당 평균 사용량은 오후 8시에 1.806kWh, 오전 4시에 0.446kWh로 정점과 저점의 비율이 4.05임.
- 그래프 모형에서는 연쇄 구조의 효율적 추론과 충돌자 조건화에 따른 의존성 변화를 다루며, 주말과 저녁 첨두 시간은 고부하 조건화 후 조건부 상호정보량 0.00026으로 의존성을 보임.
데이터 살펴보기
- 분석 대상은 UCI 가정용 전력 소비 데이터로, 2006년 12월부터 2010년 11월까지 한 가구에서 수집한 약 200만 건의 1분 간격 측정값임. 데이터는 길고 계절성이 강하며 비정상적이어서 은닉 상태를 적합할 이유가 있고 가우스 과정(Gaussian Process)의 시험에도 적합한 사례임.
- 노트북은 CUDA 장치에서 처음부터 끝까지 실행되며, 사용한 패키지 버전은
numpy2.5.1,pandas2.3.3,scikit-learn1.9.0,statsmodels0.14.6,torch2.13.0,pymc6.3.2임. - 모델링에 앞서 데이터를 확인한 결과, 분당 간격의 2,075,259개 행과 실수형 측정값 7개로 파싱되며 불러오는 데 2.9초가 걸림.
- 두 변수는 정보 누출 위험이 있음.
Global_intensity는Global_active_power에 1000을 곱한 뒤Voltage로 나눈 값으로 정의되며, 계산값과 기록값 사이의 절대 오차 중앙값은 0.0805임. 분의 98.23%에서 차이는 1암페어 이내임. Global_intensity와Voltage를 함께 사용하면 목표값이 대수적으로 재구성되므로 두 변수 모두 아래의 모든 모델 입력에서 제외함.- 목표값이 결측인 분은 전체의 1.252%이며, 시간당 평균을 계산할 때 결측값을 건너뛰므로 34,168시간 중 421시간만 비어 있음. 어느 단계에서도 대체값을 넣지 않음.
- 일별 주기가 다른 변동보다 압도적으로 큼. 사용량 정점은 20시의 1.806kWh/시간, 저점은 4시의 0.446kWh/시간이며, 정점 대 저점 비율은 4.05임. 매일 하루 안에서 수준이 네 배로 움직이는 구조를 은닉 상태가 포착할 수 있음.
- 주간 주기는 훨씬 약하며, 주말과 평일의 차이는 0.153kWh/시간임. 계절성은 크고, 겨울 사용량은 여름보다 0.629kWh/시간 높음.
- 1시간, 24시간, 48시간 시차의 자기상관은 각각 0.692, 0.438, 0.410이며 부분 자기상관은 24시간 시차에서 급증함. 자기상관은 시계열과 시차를 둔 복사본 사이의 상관이고, 부분 자기상관은 더 짧은 시차의 영향을 먼저 제거한 상관임.
- 이 패턴에는 일별 조화를 포함한 무작위 보행 상태 공간 모형이 적절하며, 뒤에서 이를 구성함.
- 여섯 개의 그림은 모델 적용 전 문제의 형태를 보여줌. 고부하 라벨을 정의하는 기준값, 전체 기록의 계절 변동, 세 가지 달력 주기의 비교, 시간당 평균이 감추는 세부 구조, 일별 조화를 뒷받침하는 시차 구조, 이후 모든 분석에 고정해 쓰는 데이터 분할을 제시함.
- 데이터는 2010-08-30을 기준으로 나눔. 학습 구간은 14,272시간 및 600일, 시험 구간은 2,047시간 및 87일임.
- 고부하 기준값은 학습 구간에서만 계산한 1.535kWh/시간이며, 따라서 라벨에 미래 정보가 포함되지 않음. 아래의 모든 모델은 같은 분할을 사용함.
그래프 모형
- 분할을 고정하고 일별 주기를 확인한 다음에는 변수 사이의 의존성을 표현하는 방법을 살펴봄. 베이즈 네트워크(Bayesian network)는 방향성 비순환 그래프 위에서 결합분포를 인수분해하며, 시퀀스에서는 연쇄 구조 덕분에 정확한 추론을 효율적으로 수행할 수 있음.
- d-분리(d-separation)는 그래프에서 조건부 독립성을 판독하는 규칙임. 연쇄나 분기 경로는 가운데 노드를 조건화하면 막히지만, 충돌자 경로는 충돌자에 조건화하기 전까지 막힘. 이 비대칭성은 조건화가 의존성을 제거할 뿐 아니라 새로 만들 수도 있는 이유임.
- 마르코프 무작위장(Markov random field)은 방향을 없애고 파벌 위의 음이 아닌 퍼텐셜을 곱하는 구조를 사용함. 신념 전파(belief propagation)는 간선을 따라 메시지를 전달하며, 트리에서는 정방향 한 번과 역방향 한 번의 순회로 수렴함.
- 학습 구간의 시간별 자료로 충돌자 규칙을 직접 확인함. 주말 여부와 저녁 첨두 시간은 각각만 보면 독립적이며, 주변 상호정보량은 소수점 여섯째 자리에서 사실상 0임.
- 고부하 충돌자를 조건화하면 두 변수는 의존성을 보이며 조건부 상호정보량은 0.00026임. 이는 d-분리의 예측과 일치함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요