3. 토크나이저(Tokenizer)
·
LLM
LLM에 대해 확실한 기본기를 다지기 위해공부하고 정리한 내용입니다. 이전 포스팅에서 모델을 다운로드하고 추론하는 두가지 방식을 진행해 보았다. LLM모델의 입력값으로 텍스트가 주어질 때, 텍스트를 숫자로 변환하는 과정을 수행해야 하는데이 과정에서 '토크나이저'가 꼭 필요하다. 각 모델마다 모델이 인식하는 단어와 토큰 매핑값이 존재하며 실제 모델 파일에서 'tokenizer.json' 파일을 통해 확인할 수 있다.이 파일을 바탕으로 실제 모델에 문장을 입력으로 넣고 추론을 실행하는 경우, 내부적으로 token(정수)로 변환된 뒤 처리된다.실습1. 토크나이저 다운로드from transformers import AutoTokenizer# HugginFace에서 tokenizer.json 파일을 다운로드to..