상세 보기
음성신호를 직접 이용한 마비말장애 환자의 조음기관 MRI 데이터 생성 및 3D 시각화
Direct Speech-Based Generation of Articulatory Organ MRI Data and 3D Visualization for Dysarthric Patients
- 음승호;
- 심윤섭;
- 박운상
초록
본 연구에서는 기존 연구들과 달리 마비말장애(dysarthria) 환자의 음성을 텍스트 또는 음성 기호로 변환하지 않고, Wav2Vec 기반 인코더로 음향 특성을 직접 추출하여 Latent Diffusion Model(LDM)에 조건으로 적용함으로써 조음기관(articulatory organ) MRI 영상을 생성하고, 이를 토대로 3D 구강 모델을 구축하는 과정을 제안한다. 이 방법은 텍스트 기반 대비 FID(Frechet Inception Distance)가 184.42에서 72.21로 약 2.5배 개선되었으며, 환자의 고유 음성 특성이 유지된다. 생성된 2D MRI 영상에서 혀(tongue)·입술(lips) 등 주요 조음기관의 랜드마크를 추출하여 Morphing 기법을 적용, 연속적인 고정밀 3D 표면 모델을 구현하였다. 정성적·정량적 실험을 통해 우수성을 입증하였으며, 본 3D 모델은 재활 치료 보조 및 중증도 예측 모델 학습용 데이터로 활용할 수 있음을 확인하였다.
키워드
latent diffusion model; synthetic data generation; dysarthria; articulatory organ MRI; 3D oral animation; 확산 기반 생성형 인공지능; 합성 데이터 생성; 마비말장애; 조음기관 MRI; 3D 구강구조 애니메이션
- 제목
- 음성신호를 직접 이용한 마비말장애 환자의 조음기관 MRI 데이터 생성 및 3D 시각화
- 제목 (타언어)
- Direct Speech-Based Generation of Articulatory Organ MRI Data and 3D Visualization for Dysarthric Patients
- 저자
- 음승호; 심윤섭; 박운상
- 발행일
- 2025-08
- 유형
- Y
- 권
- 31
- 호
- 8
- 페이지
- 359 ~ 365