상세 보기
초록
자연어 생성 모델 간의 상징적 지식 증류 프롬프트 엔지니어링 기법을 제안한다. 이 기법은 특정 다운스트림 태스크에 대한 각 모델의 추론 결과 텍스트를 '상징적 증류 지식' (Symbolic Distilled Knowledge)으로 정의한다. 아울러 각 생성 모델이 다른 생성 모델에서 증류한 지식을 학습하도록 하여 인간의 노동력을 최소화하는 방식으로 다운스트림 태스크에 대한 추론 능력을 향상하는 것을 목표로 한다. 이 연구에서는 모델 구조와 파라미터 규모에 차이가 있는 GPT-J와 T5 모델로 실험하였다. 그 결과 상호 상징적 지식 증류를 진행한 모델들이 실험 대상 다운스트림 태스크에서 베이스라인 대비 우수하거나 유사한 성능을 나타내었다. 일례로 Intent Classification 태스크 벤치마크 SLURP에 대해서는 GPT-J의 증류 지식을 학습한 T5는 일반 T5보다 10% 이상 향상된 81.95%의 정확도를, T5의 증류 지식을 학습한 GPT-J는 일반 GPT-J보다 7.38% 오른 29.76%의 정확도를 기록했다.
키워드
생성형 언어모델; 상징적 지식 증류; 프롬프트 엔지니어링; 데이터 생성; 사전학습; 트랜스포머; generative language model; . symbolic knowledge distillation; prompt engineering; data generation; pre-training; Transformer
- 제목
- T5-GPT 간 상징적 증류 지식 활용 프롬프트 엔지니어링
- 제목 (타언어)
- Prompt Engineering for Cross-Model Symbolic Knowledge Distillation between T5-GPT
- 저자
- 백지수; 방나모; 연희연; 김민주; 구명완
- 발행일
- 2024-03
- 권
- 30
- 호
- 3
- 페이지
- 137 ~ 142