음성신호를 직접 이용한 마비말장애 환자의 조음기관 MRI 데이터 생성 및 3D 시각화

Direct Speech-Based Generation of Articulatory Organ MRI Data and 3D Visualization for Dysarthric Patients

초록

본 연구에서는 기존 연구들과 달리 마비말장애(dysarthria) 환자의 음성을 텍스트 또는 음성 기호로 변환하지 않고, Wav2Vec 기반 인코더로 음향 특성을 직접 추출하여 Latent Diffusion Model(LDM)에 조건으로 적용함으로써 조음기관(articulatory organ) MRI 영상을 생성하고, 이를 토대로 3D 구강 모델을 구축하는 과정을 제안한다. 이 방법은 텍스트 기반 대비 FID(Frechet Inception Distance)가 184.42에서 72.21로 약 2.5배 개선되었으며, 환자의 고유 음성 특성이 유지된다. 생성된 2D MRI 영상에서 혀(tongue)·입술(lips) 등 주요 조음기관의 랜드마크를 추출하여 Morphing 기법을 적용, 연속적인 고정밀 3D 표면 모델을 구현하였다. 정성적·정량적 실험을 통해 우수성을 입증하였으며, 본 3D 모델은 재활 치료 보조 및 중증도 예측 모델 학습용 데이터로 활용할 수 있음을 확인하였다.

키워드

latent diffusion modelsynthetic data generationdysarthriaarticulatory organ MRI3D oral animation확산 기반 생성형 인공지능합성 데이터 생성마비말장애조음기관 MRI3D 구강구조 애니메이션
제목
음성신호를 직접 이용한 마비말장애 환자의 조음기관 MRI 데이터 생성 및 3D 시각화
제목 (타언어)
Direct Speech-Based Generation of Articulatory Organ MRI Data and 3D Visualization for Dysarthric Patients
저자
음승호심윤섭박운상
발행일
2025-08
유형
Y
저널명
정보과학회 컴퓨팅의 실제 논문지
31
8
페이지
359 ~ 365