상세 보기
지능형혼합현실을위한 멀티모달 RAG 아키텍처 설계
- 김한얼;
- 배종환;
- 정원영;
- 박상훈
초록
인공지능(AI)과 혼합현실(MR) 기술의융합한 사용자인터랙션 관련 연구가 활발히 진행되고 있으나, 시각 정보가 중요한 MR 환경에서 기존 텍스트 중심 챗봇 방식에는 한계가 명확하다. 본 연구는 이러한 문제를 해결하기 위해 사용자의 음성 명령과 이미지를 동시에 처리할 수 있는 새로운 멀티모달 RAG(검색-증강 생성) 아키텍처를 제안한다. 제안하는 아키텍처는 ColQwen2.5를 검색 엔진으로, GPT-4.1 nano를 비전 및 생성 엔진으로 활용한다. PDF 문서 내용으로부터 실시간으로 구축된 인메모리 벡터 데이터베이스에서 사용자의 멀티모달 쿼리(query)와 가장 관련성 높은 컨텍스트를 검색한 후, 이를 기반으로 GPT-4.1이 최종 답변을 생성하는 구조이다. 본 아키텍처의유용성을 검증하기 위해 BMW 차량 매뉴얼 기반 챗봇을 Meta Quest 3 환경에서 구현하였다. 실험 결과, 평균 응답 시간 2.46초를 달성했으며, 텍스트만 사용하면서 자동차 부품의 명시적 지칭(예:”트렁크”, CR 99.3%)을 한 경우와 멀티모달 검색에서 지시대명사(예:”이것”, CR 94.6%)를 사용한 경우의 성능 차이 가 불과 4.7%에 불과해, 시각 정보가 언어적 모호성을 효과적으로 해소함을 명확히 입증하였다. 본 연구는 멀티모달 접근법이 단순히 텍스트의 한계를 보완하는 것을 넘어, 사용자가 정확한 용어를 모르는 상황에서도 시각 정보를 통해 효과적인 정보 검색이 가능함을 보여주어, 실용적인 MR 기반 검색 시스템 구축에 중요한 시사점을 제공한다.
키워드
- 제목
- 지능형혼합현실을위한 멀티모달 RAG 아키텍처 설계
- 제목 (타언어)
- Design of Multimodal RAG Architecture for Intelligent Mixed Reality
- 저자
- 김한얼; 배종환; 정원영; 박상훈
- 발행일
- 2025-07
- 유형
- Y
- 저널명
- 한국컴퓨터그래픽스학회논문지
- 권
- 31
- 호
- 3
- 페이지
- 57 ~ 66