
Ollama 모델 이름은 llama3.2:3b, qwen3:8b-q4_K_M처럼 생겼다.
읽는 법을 알면 고르기가 쉬워진다.
읽는 법은 두 가지다.
숫자+B는 파라미터 수, Q로 시작하는 표기는 양자화 단계다.
이 둘이 모델 파일 크기를 정하고, 그 크기가 내 VRAM에 들어가느냐를 정한다.
들어가면 빠르고, 넘치면 느리다.
Ollama 시리즈 2편이다. 1편에서 ollama ps가 CPU로 나왔다면 여기서 답이 나온다.
빠른 판단
- 7B는 파라미터 70억 개다. 숫자가 클수록 똑똑하고 무겁다.
- Q4는 양자화 단계다. 숫자가 낮을수록 가볍고 품질이 조금 떨어진다.
- 모델 용량 + 컨텍스트가 VRAM에 들어가야 GPU에서 돈다.
- 컨텍스트는 VRAM에 따라 자동이다. 24GiB 미만이면 4k로 잡힌다.
- 판단은
ollama ps의 PROCESSOR가 100% GPU인지로 한다.
Ollama 모델의 파라미터 수 읽기
모델 이름의 3b, 8b, 70b가 파라미터 수다.
B는 billion, 즉 10억이다.
| 크기 | 대략의 위치 |
|---|---|
| 1~4B | 가볍다. 요약·분류·간단한 질의 |
| 7~9B | 균형점. 대부분의 개인 PC에서 현실적 |
| 13~14B | 품질이 올라가지만 VRAM 요구가 커진다 |
| 30B 이상 | 고사양 GPU나 대용량 통합 메모리 필요 |
파라미터가 많을수록 답이 낫지만 선형으로 좋아지지 않는다.
3B에서 8B로 갈 때 체감이 크고, 그 위로는 작업 종류에 따라 갈린다.
요약이나 번역처럼 형식이 정해진 작업은 작은 모델로도 충분한 경우가 많다.
추론이 필요한 작업에서 큰 모델의 차이가 드러난다.
양자화가 용량을 반으로 줄인다

같은 8B 모델인데 파일 크기가 다른 경우가 있다.
양자화(quantization) 때문이다.
모델의 숫자들을 더 적은 비트로 표현해 용량을 줄이는 기술이다.
Q8이면 8비트, Q4면 4비트로 표현한다는 뜻이다.
| 표기 | 성격 |
|---|---|
| Q8 | 원본에 가깝다. 용량이 크다 |
| Q5 | 중간 |
| Q4 | 가장 널리 쓰인다. 용량 대비 품질이 괜찮다 |
| Q2~Q3 | 아주 가볍지만 품질 저하가 눈에 띈다 |
뒤에 붙는 K_M, K_S 같은 표기는 양자화 방식의 세부 구분이다.
K_M이 보통 무난한 선택으로 쓰인다.
실무 기준은 단순하다.
Q4로 시작하고, VRAM이 넉넉하면 Q5나 Q8로 올린다.
Q2까지 내려가면서 큰 모델을 억지로 넣는 것보다, 한 단계 작은 모델을 Q4로 쓰는 편이 대체로 낫다.
태그를 생략하면 기본값이 적용된다.
ollama run qwen3처럼 쓰면 Ollama가 정해둔 기본 태그를 받는다.
내 VRAM에 뭐가 들어갈까요
계산은 대략적이지만 방향은 잡힌다.
모델 파일 크기 + 컨텍스트가 쓰는 메모리가 VRAM 안에 들어가야 한다.
파일 크기는 모델 페이지에 표시되고, 컨텍스트는 길이에 비례해 늘어난다.
그래서 여유를 둬야 한다.
VRAM이 8GB라면 파일 6GB 안팎이 무난하고, 딱 8GB짜리를 넣으면 컨텍스트 자리가 없어 CPU로 밀린다.
확인은 실행 후에 한다.
ollama ps
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now
PROCESSOR가 100% GPU면 성공이다.
70% GPU / 30% CPU처럼 나뉘면 일부가 램에서 도는 것이고, 그만큼 느려진다.
이때 선택지는 셋이다.
더 작은 모델로 내리거나, 양자화 단계를 낮추거나, 컨텍스트를 줄이는 것이다.
컨텍스트는 자동으로 잡힌다
1편에서 기본값을 4,096토큰이라고 했는데, 정확히는 VRAM에 따라 달라진다.
공식 문서 기준은 이렇다.
| VRAM | 기본 컨텍스트 |
|---|---|
| 24GiB 미만 | 4k |
| 24~48GiB | 32k |
| 48GiB 이상 | 256k |
일반적인 개인 PC는 첫 줄에 해당해 4k로 잡힌다.
그런데 작업에 따라 이걸로는 부족하다.
공식 문서는 웹 검색, 에이전트, 코딩 도구처럼 큰 컨텍스트가 필요한 작업은 최소 64,000토큰으로 설정하라고 안내한다.
늘리는 방법은 둘이다.
앱 설정의 슬라이더를 옮기거나, 서버를 띄울 때 환경변수 OLLAMA_CONTEXT_LENGTH를 지정한다.
다만 대가가 있다.
컨텍스트를 키우면 메모리를 더 쓴다.
64k로 올렸다가 모델이 CPU로 밀려나면 오히려 손해이므로, 올린 뒤 ollama ps로 다시 확인하는 순서가 필요하다.
ollama ps의 CONTEXT 열에 지금 할당된 길이가 그대로 찍힌다.
Ollama 모델, 어떤 조합으로 시작할까
정답은 기계마다 다르지만 순서는 같다.
VRAM 8GB 안팎이면 7~8B 모델의 Q4부터 본다.
파일이 5GB 전후라 컨텍스트 자리가 남는다.
VRAM 12~16GB면 같은 8B를 Q5나 Q8로 올리거나, 13~14B를 Q4로 시도할 수 있다.
애플 실리콘 맥은 통합 메모리라 계산이 다르다.
시스템 메모리를 함께 쓰므로 16GB 이상이면 8B급이 무난하고, 32GB 이상이면 더 큰 모델도 돈다.
VRAM이 없거나 아주 작은 경우는 1~3B 모델로 시작한다.
CPU로 돌더라도 작은 모델은 쓸 만한 속도가 나온다.
개인적으로는 같은 작업을 두세 조합으로 돌려보는 방식을 권한다.
벤치마크 점수보다 내 질문에 어떻게 답하는지가 실제 기준이고, 모델을 지우고 받는 데는 몇 분이면 된다.
용량 관리도 해야 한다
모델은 파일이 크다.
몇 개만 받아도 수십 GB가 금방 찬다.
ollama ls
로 목록을 보고, 안 쓰는 건 지운다.
ollama rm 모델명
받아만 두고 안 쓰는 모델이 쌓이는 게 흔한 패턴이다.
한 달에 한 번 목록을 훑는 것만으로 저장 공간이 정리된다.
자주 묻는 질문 (FAQ)
7B와 13B 중 뭐가 낫나요?
13B가 답 품질은 낫지만 VRAM을 더 쓴다.
GPU에 안 들어가면 7B가 실질적으로 더 유용하다.
양자화하면 답이 나빠지나요?
Q4 수준에서는 차이가 크지 않다는 게 일반적인 평가다.
Q2~Q3로 내려가면 눈에 띈다.
태그를 생략하면 어떻게 되나요?
Ollama가 정해둔 기본 태그가 적용된다.
컨텍스트 기본값이 얼마인가요?
VRAM에 따라 다르다.
24GiB 미만이면 4k로 잡힌다.
GGUF 파일을 직접 쓸 수 있나요?
Modelfile에서 불러올 수 있다.
다만 Ollama가 양자화를 해주지는 않아 미리 변환된 파일이어야 한다.
오늘 바로 할 것
- 내 VRAM 용량을 확인한다. 모든 판단의 출발점이다.
- 7~8B의 Q4부터 받아 돌려본다. 파일 5GB 전후가 기준이다.
ollama ps의 PROCESSOR를 본다. 100% GPU가 아니면 크기를 내린다.- 코딩·에이전트 용도면 컨텍스트를 64k 이상으로 올리고 다시 확인한다.
ollama ls로 정리한다. 안 쓰는 모델이 용량을 먹는다.
내 PC에서 모델을 돌리는 예시는 Ollama로 Mistral 3 실행하기에도 정리해뒀고, 다음 3편에서는 받아둔 모델로 문서 요약·번역·코드 작업을 어떻게 시키는지 정리한다.
출처
- Ollama 공식 문서 — Context length — VRAM별 기본 컨텍스트(24GiB 미만 4k / 24~48GiB 32k / 48GiB 이상 256k), 64,000토큰 권장 작업, 앱 설정과
OLLAMA_CONTEXT_LENGTH,ollama ps의 PROCESSOR·CONTEXT 열 - Ollama 공식 문서 — Importing a Model · CLI Reference — GGUF 불러오기와 양자화 미지원, 모델 관리 명령어
- 모델별 권장 사양은 계속 바뀐다. 받기 전에 모델 페이지의 파일 크기를 확인하는 편이 정확하다.
'IT 제품&프로그램 팁' 카테고리의 다른 글
| Ollama 연동 (2026) — VS Code와 코딩 도구에 붙이기 (0) | 2026.10.01 |
|---|---|
| Ollama 활용법 (2026) — 요약·번역·이미지 읽기까지 (1) | 2026.09.30 |
| Ollama 시작하기 (2026) — 내 PC에서 AI 돌리는 첫 단계 (0) | 2026.09.27 |
| ChatGPT 데이터 설정 (2026) — 회사 자료 넣기 전 끌 것 둘 (0) | 2026.09.25 |
| ChatGPT 워드 애드인 (2026) — 무료 범위와 올리면 안 될 것 (0) | 2026.09.23 |
댓글