혼합 타입 데이터의 군집화를 위한 그래프 오토인코더 기반의 데이터 임베딩 기법

Graph Autoencoder-Based Data Embedding Technique for Clustering Mixed-Type Data

초록

데이터를 구성하는 객체의 속성은 크게 수치형 속성과 범주형 속성, 그리고 혼합형 속성으로 나뉜다. 거리 계산법이 다른 두 속성을 가진 혼합형 데이터에 대하여는 범주형 속성을 수치형 속성으로 변화시켜 유사도를 계산하거나, 각 유형의 속성별 유사도를 이용해 통합거리를 계산하여 군집화시키는 방식을 사용하고 있다. 다만 두 방법 모두 원본 유형 속성의 변화하는 과정에서 생겨나는 원본 특징의 손실이라는 단점이 있다. 해당 문제에 착안하여 본 논문에서는 혼합 유형의 데이터들을 그래프로 변환하여 생성하는 효과적인 방법과, 이렇게 생성한 그래프에 GAE(Graph Auto Encoder)를 적용하여 구한 노드 임베빙 벡터를 사용하여 K-평균 군집화를 시행하는 새로운 혼합형 데이터의 임베딩 기법을 제시한다. 제안된 방식은 실험된 데이터셋 내에서 purity의 경우 최대 4%, inverse purity의 경우 최대 16%의 성능 향상을 이루어냈다.

키워드

혼합 타입 데이터군집화그래프 오토인코더노드 임베딩mixed-type dataclusteringgraph autoencodernode embedding
제목
혼합 타입 데이터의 군집화를 위한 그래프 오토인코더 기반의 데이터 임베딩 기법
제목 (타언어)
Graph Autoencoder-Based Data Embedding Technique for Clustering Mixed-Type Data
저자
이정민정성원
발행일
2024-12
저널명
정보과학회 컴퓨팅의 실제 논문지
30
12
페이지
619 ~ 625