디지털·가전제품

테라바이트급 인터넷 정보가 어떻게 몇 기가바이트짜리 AI 가중치(Weight)로 압축될까요?

로컬 LLM을 돌려보면, 전 세계의 방대한 텍스트를 다 학습했다는데 정작 모델 파일 크기는 몇 기가바이트밖에 안 되잖아요. 수많은 문장과 팩트들이 텍스트 그대로 저장되는 게 아니라, 신경망 속 노드들의 수학적인 연결 강도(확률)로 쪼개져 압축된다는 게 머리로는 알면서도 이 무시무시한 데이터 압축 기술의 찐 원리가 참 신비롭습니다

2개의 답변이 있어요!

  • 인간의 모든 지식이 담겨 있는 백과사전의 텍스트 용량이 겨우 수십메가바이트입니다

    사실 숫자만으로 수십기가라는건 결코 적은 정보량이 아니죠

    언어라는건 결국 단어의 순서일 뿐이니까요

  • 핵심은 **“텍스트를 저장하는 게 아니라 패턴을 저장하고 학습시킨다로 보여 집니다.

    AI 답을 인용하자면 

    학습 과정에서 수천억 개의 문장을 읽으며 “이 단어 다음엔 어떤 단어가 올 확률이 높은가”를 수백억 개의 숫자(가중치)로 압축 저장하는데, 이는 마치 악보 수백만 곡을 다 듣고 난 후 악보 자체가 아닌 “음악의 규칙과 감각”만 뇌에 남기는 것과 같습니다. 원본 텍스트는 학습 후 전부 버려지고 신경망 연결 강도값만 남기 때문에, 7B 모델 기준 약 14GB로 인터넷 전체 텍스트 수백 TB가 압축되는 것입니다. 단, 이 압축은 손실 압축이라 원문을 그대로 복원할 수는 없고, 대신 맥락을 이해하고 추론하는 능력으로 변환된다는 점이 zip 파일 압축과 근본적으로 다릅니다.