상세 보기
N-gram을 활용한 중국 법률 텍스트의 정형 표현 분석 – 중국 민법전을 중심으로
- 최승혁;
- 강병규
초록
본 연구는 고정된 형태의 단어 조합인 정형 표현(formulaic expression)이 어휘와 같이 하나의 언어 단위로 인식할 수 있다는 점에 착안하여 AntConc의 N-gram, Cluster 기능을 활용해 중국 민법전의 N-gram 유형과 연어 관계를 고찰하였다. N-gram 유형은 자유 결합과 표현 문형으로 나누어 살펴보았다. 2-gram은 자유 결합의 비중이 높게 나타났고, 3-gram부터는 공기나 결합 관계에 제약에 있는 연어(collocation) 형태가 보이기 시작했다. 4-gram은 하나의 덩어리(chunk)로써 단독으로 쓸 수 있는 표현 문형이 다수 출현했다. 5-gram, 6-gram에서는 표현 문형이 절대적으로 큰 비중을 나타냈으며, 자유 결합은 거의 나타나지 않았다. 연어 관계는 명사성 연어 관계, 동사성 연어 관계로 나누어 고빈도 연어 관계를 분석하였다. 명사성 연어 관계에서는 일반 텍스트에서 관찰되지 않는 법률 관련 명사구가 많이 출현했다. 동사성 연어 관계에서는 3-gram 유형의 자유 결합에서 나타난 연어의 구체적인 실례를 살펴볼 수 있었다. 이 밖에도 법률 텍스트의 정형 표현을 기계번역에 학습시켜 특화할 때 얻을 수 있는 효과와 활용 방안에 있어서, 번역의 일관성 제고와 의미의 모호성 감소에 대한 효과, 번역 교육과 포스트에디팅에서의 활용 가치를 살펴보았다. 비록 분석 대상인 민법전의 코퍼스 규모가 크지 않은 한계가 있지만, N-gram을 활용해 중국 민법전의 정형 표현을 분석하고 중한 법률 도메인 특화 기계번역에의 활용 가능성을 고찰하였다는 점에서 의미가 크다.
키워드
- 제목
- N-gram을 활용한 중국 법률 텍스트의 정형 표현 분석 – 중국 민법전을 중심으로
- 제목 (타언어)
- Analyzing the formulaic expressions in Chinese Legal Texts using N-grams : With a focus on the Chinese Civil Code
- 저자
- 최승혁; 강병규
- 발행일
- 2023-09
- 저널명
- 중국어문학지
- 호
- 84
- 페이지
- 437 ~ 465