왜 한국어 중심 ChatGPT가 필수적인가
*이 글은 외부 필자인 성원용님의 기고입니다. ChatGPT 또는 BARD와 같은 인공신경망 기반의 거대언어모델은 한글로 입력해도 많은 경우 답을 잘합니다. 그런데 왜 '한국어 중심' ChatGPT 가 필요한가요? 그리고 한국어 중심이라는 의미는 무엇인가요? 한국에 관한 질문 또는 한글로 하는 질문에 대답을 더 잘하면 한국어 중심인가요? 아니면 다른 기준이 있을까요? 이런 질문들이 나오곤 합니다. 이 문제에 대해 오늘 설명을 하겠습니다. 영어와 한국어, 토큰의 차이 ChatGPT 또는 GPT-4, BARD에 한글로 질문할 때 예리한 분은 그 답의 질이 영어로 질문한 경우와 비교했을 때 떨어진다는 생각을 할 수 있습니다. 우선 ChatGPT의 사전학습 모델인 GPT-3 훈련에 사용된 한국어 데이터는 전체 학습데이터의 불과 0.016%에 지나지 않습니다. (참조 - ChatGPT가 촉발한 초거대 AI시대 우리의 대응 전략|하정우 NAVER AI Lab 연구소장) 이 때문에 한국과 관련된 정보는 좀 부실하게 대답을 합니다. 그렇지만 앞으로 구글이나 OpenAI도 한국어 훈련 데이터를 더 많이 사용하여 대형언어모델을 훈련하면 한 국어 관련 성능이 더 좋아지지 않을까 생각할 수 있습니다. 실제로 GPT-4는 한국어를 비롯하여 영어 외의 다른 언어의 훈련데이터를 더 많이 보강하였다 알려져 있고 또 여러 테스트에 의하면 GPT-4의 한국어 성능이 ChatGPT 대비 상당히 좋다고 합니다. 한국어 중심 언어모델 또는 한국어 ChatGPT 가 필요한 더 근본적인 이유는 토큰화(tokenization) 방법에 있습니다. 토큰은 어떤 문장을 인공신경망에서 표현할 때 사용하는 기본 글자라 생각할 수 있습니다.