영어와 한국어의 불용어 처리

Submitted by hyacinth @

영어의 불용어 처리

루씬(lucene)에서는 영어의 불용어를 다음 34개의 단어로 정의하고 있습니다.

'a', 'and', 'are', 'as', 'at', 'be', 'but', 'by', 'for', 'if', 'in', 'into', 'is', 'it', 'no', 'not', 'of', 'on', 'or', 's', 'such', 't', 'that', 'the', 'their', 'then', 'there', 'these', 'they', 'this', 'to', 'was', 'will', 'with'

Rijsbergen(1975)은 250개의 불용어 목록을 제시하고 있으며, 100만 어절 Brown corpus로부터 추출한 불용어의 개수는 425개로 그 예는 아래와 같습니다.

- a, about, above, across, after, against, all,...
- b, back, backed, backing, backs, be, because,...
- c, came, can, cannot, case, cases, certain,...

빈도가 높은 단어 중에는 time, war, home, life, water 등 색인어로서 중요하게 사용되는 것도 있습니다. 또한, 컴퓨터 분야에서 computer, program, language, windows 등은 색인어로서 가치가 낮기 때문에 동일한 용어에 대해서도 분야별로 색인어의 중요도를 계산하는 방법이 달라질 수 있습니다.

특히, 자동색인에서 불용어로 간주하여 제거된 색인어는 검색이 되지 않기 때문에 불용어 처리는 매우 신중해야 하며, 상업적인 정보검색 시스템에서는 불용어가 거의 없습니다. 예를 들어, ORBIT search service는 an, and, by, from, of, the, with 등 8개만을 불용어로 간주하고 있습니다.


한국어의 불용어 처리

한국어에서 불용어로 간주되는 용어는 품사 불용어와 명사 불용어, 그리고 숫자 불용어 등이 있습니다. 일반적으로 체언을 제외한 모든 품사(조사, 어미, 동사, 형용사, 관형사, 부사, 감탄사)는 불용어로 간주합니다. 체언 중에서도 대명사, 수사, 1음절 명사는 색인어로서 가치가 매우 낮으므로 불용어로 간주할 수 있습니다. 또한, 일반적으로 '1999년','1,200원', '제1절' 등 한글과 숫자가 혼합된 것과 'x값','y축' 등 한글과 영어가 혼합된 것도 불용어인 경우가 대부분입니다.

다만 한글, 영문자, 숫자, 문자 등이 혼합된 경우에도 'LG전자', '비타민 A','C++','B 트리' 등은 색인어로서 매우 중요합니다. '3.1절', '한글97', '윈도 3.1', '비주얼 베이직 6' 등 '3.1'이나 ‘6’과 같은 숫자도 색인어의 일부로서 가치가 매우 높은 경우가 있습니다.

수사 어절의 경우 아라비아 숫자와 한글의 혼용 및 띄어쓰기에 따라 '230000원', '230,000원', '이십 삼만원', '이십삼만원' 등 다양하게 표현이 가능합니다. 따라서 수사 어절은 표준화기법에 의해 동일한 표현으로 정규화함으로써 불용어로 처리할 수 있습니다.

품사 불용어로 간주되는 용어들도 문서 유형에 따라 혹은 특정 문서에서는 색인어로서 매우 중요한 경우도 발생하기 때문에 형태소 분석결과만으로 불용어를 제거하는 방법은 바람직하지 않습니다. 따라서 형태소 분석결과에 의한 불용어 제거 기법보다는 구문분석이나 복합명사 결합 기법에 의해 색인어의 중요도를 계산하는 방법에 의해 해결되어야 할 문제입니다.

» track back

이 글에는 0 개의 댓글이 있습니다.