[밑바닥부터 만들면서 배우는 LLM] 1장 - 대규모 언어 모델 이해하기

2026. 3. 30. 23:17·Study

스터디의 일환으로 정리한 글 입니다.

 

1.1 LLM이란 무엇인가요?


• LLM은 대규모 데이터에서 훈련된 많은 수의 파라미터를 가진 신경망이다.
  - 신경망은 많은 머신러닝 알고리즘 중 하나로 텍스트, 이미지와 같은 데이터를 처리하는데 효율적이다.
  - 파라미터가 많을수록 복잡한 패턴을 감지하는데 유리하다.
  - 신경망은 하나의 거대한 수학 함수이며 파라미터는 이런 수학 함수의 계수로 표현할 수 있다.
  - 신경망 == 딥러닝

• 트랜스포머(transformer)라는 구조의 신경망을 사용합니다.
  - 트랜스포머는 기계 번역을 위해 고안된 신경망 구조이다.
  - 신경망에는 트랜스포머 외에도 많은 구조가 존재한다(GPT는 트랜스포머 사용).
 


1.2 LLM 애플리케이션

 
LLM은 텍스트 처리에 뛰어나다.

• 텍스트 분류, 요약
  - 구글, 빙(Bing)과 같은 검색 엔진의 결과를 개선한다.
  - 범용 또는 전문적인 텍스트 데이터에서 지식을 추출할 수 있다(Q&A).

• 사용자의 지시를 따라 응답한다.
  - 구글의 Gemini, 오픈AI의 ChatGPT, 앤트로픽의 Claude 등과 같은 챗봇 또는 가상 비서

• 언어 번역이나 언어 교육에 활용할 수 있다.
  - (컴퓨터의 언어인) 프로그래밍 코드를 작성할 수 있다.

• 주어진 이미지를 이해하고 응답에 참고할 수 있다.
  - 이미지 캡셔닝, 이미지 설명하기 등

• 이 외에도 가능한 LLM 애플리케이션이 매우 많다.
 
 

1.3 LLM의 구축 단계


• 머신러닝 분야는 공개된 정보가 풍부하다.
• 많은 LLM이 오픈 소스로 공개되어 있다.
• 전부는 아니지만 대부분 LLM 모델을 구현하는데 파이토치(PyTorch)를 사용한다.

 
 
 

1.4 트랜스포머 구조 소개

Attention Is All You Need
: 구글 연구자들이 공개한 논문
*원래 기계 번역을 위해 고안된 신경망 구조이다.

 

 

인코더 기반 모델/ 디코더 기반 모델

 

 
최근 LLM 모델은 디코더 기반 모델이 대다수이다.
 
디코더 기반 모델의 활용
 

 

1.5 대규모 데이터셋 활용하기

GPT-3의 훈련 데이터셋은 웹 크롤링 데이터, 인터넷 기반 도서 말뭉치, 고품질 텍스트 등으로 구성되어있다.
 

1.6 GPT 구조 자세히 살펴보기

 

디코더는 사전훈련 + 지시 미세 튜닝 방식으로 진행된다.

 

1.7 대규모 언어 모델 만들기

 
이미지와 같이 크게 3단계로 나누어져있지만, 세부적으로는 9단계로 구성되어있다. 
 

요약

 
- LLM은 명시적인 규칙 기반 시스템과 간단한 통계적 방법에 대부분 의존했던 자연어 처리 분야를 변화시켰다.
- 최신 LLM 훈련은 크게 2개의 주요 단계로 이루어진다.   

  • 레이블이 없는 대규모 텍스트 말뭉치에서 문장에 있는 다음 단어(레이블)을 예측하는 방식으로 사전 훈련된다.
  • 이후, 지시를 따르거나 분류작업을 수행하기 위해 레이블이 있는 작은 타깃 데이터셋에서 미세튜닝된다. 

- LLM은 트랜스포머 구조를 기반으로 한다. 트랜스포머 구조의 핵심 아이디어는 어텐션 메커니즘인데,
  이를 통해 LLM이 한 번에 한 단어씩 생성할 때 전체 입력 시퀀스를 선택적으로 참조할 수 있다.
- 트랜스포머의 원래 구조는 텍스트를 해석하는 인코더와 텍스트를 생성하는 디코더로 구성되어있다.
- GPT-3과 ChatGPT와 같이 텍스트를 생성하고 지시를 수행하기 위한 LLM은 디코더 모듈로만 구현되므로 구조가 더 단순하다. 
- 수십억 개의 단어로 구성된 대규모 데이터셋은 LLM을 사전 훈련하는 데 필수적이다.
- LLM을 사전 훈련하여 만든 파운데이션 모델을 다양한 후속 작업에 맞게 효율적으로 미세 튜닝할 수 있다.
- 사용자 정의 데이터셋에 미세튜닝된 LLM은 특정 작업에서의 범용 LLM의 성능을 능가할 수 있다. 
 

 

2장 정리

 

[밑바닥부터 만들면서 배우는 LLM] 2장 - 텍스트 데이터 다루기

스터디의 일환으로 정리한 글 입니다. 2장의 주요 내용대규모 언어 모델 훈련을 위한 텍스트를 준비힌다.텍스트를 단어와 부분단어인 토큰으로 나눈다.고급 텍스트 토큰화 방법인 바이트 페어

dev-hyena.tistory.com

 

'Study' 카테고리의 다른 글

[밑바닥부터 만들면서 배우는 LLM] 2장 - 텍스트 데이터 다루기  (0) 2026.03.30
[강화학습] Introduction_RL_2  (0) 2025.04.08
[강화학습] 1.Introduction_RL_1  (0) 2025.04.05
[Git/Github] 협업을 위한 Github_간단 정리  (0) 2025.03.15
[소프트웨어 공학] 애자일(Agile) 방법론  (0) 2025.03.03
'Study' 카테고리의 다른 글
  • [밑바닥부터 만들면서 배우는 LLM] 2장 - 텍스트 데이터 다루기
  • [강화학습] Introduction_RL_2
  • [강화학습] 1.Introduction_RL_1
  • [Git/Github] 협업을 위한 Github_간단 정리
dev-hyena
dev-hyena
차곡차곡 쌓아나가는 중📚
  • dev-hyena
    우당탕탕 개발일지
    dev-hyena
  • 전체
    오늘
    어제
    • 분류 전체보기 (15)
      • Study (11)
      • MS ai school (1)
      • LLM (3)
  • 블로그 메뉴

    • 홈
    • 태그
    • 방명록
  • 링크

  • 공지사항

  • 인기 글

  • 태그

    패러다임불일치
    Java
    토크나이저
    김영한
    Agent
    llm
    밑바닥부터 만들면서 배우는 LLM
    게시판 만들기
    pr 순서
    스프링부트
    JPA
    RL
    백엔드
    ORM
    강화학습
    로컬 llm
    springdata
    자바
    Reinforcement Learning
    강화 학습 기초
  • 최근 댓글

  • 최근 글

  • hELLO· Designed By정상우.v4.10.3
dev-hyena
[밑바닥부터 만들면서 배우는 LLM] 1장 - 대규모 언어 모델 이해하기
상단으로

티스토리툴바