
Ollama 연동은 생각보다 간단하다.
설치하는 순간 이미 API 서버가 떠 있기 때문이다.
주소는 localhost:11434이고, OpenAI와 Anthropic 호환 규격을 지원한다.
이미 그 SDK로 짠 코드가 있다면 주소와 모델 이름만 바꾸면 로컬로 돌아간다.
Ollama 시리즈 4편이다. 1편 설치, 2편 모델 고르기, 3편 활용법에 이어진다.
빠른 판단
- 기본 주소는
http://localhost:11434다. 설치하면 자동으로 뜬다. - OpenAI 호환 엔드포인트를 제공한다.
base_url만 바꾸면 된다. - Anthropic 호환도 지원해 Claude Code를 로컬 모델로 돌릴 수 있다.
- VS Code는 전용 확장이 있다. 채팅 모델 선택기에 Ollama 항목이 생긴다.
ollama launch로 외부 도구를 바로 띄울 수 있다.
기존 코드에 Ollama 연동하기
가장 간단한 경로는 OpenAI SDK다.
이미 OpenAI로 짠 코드가 있다면 클라이언트 생성 부분만 손보면 된다.
base_url을 로컬 주소로 바꾸고, 모델 이름을 받아둔 모델로 바꾸는 게 전부다.
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # 로컬은 아무 값이나
)
로컬은 인증이 필요 없어서 API 키 자리에 임의 값을 넣는다.
클라우드 모델을 쓸 때는 다르다.
https://ollama.com/v1에 실제 API 키를 넣는 방식이고, 이때는 Ollama 설치 없이도 호출된다.
Anthropic 호환 엔드포인트도 제공된다.
Claude용으로 짠 코드를 로컬 모델로 돌려볼 때 쓴다.
VS Code에 붙이기

전용 확장이 있다.
마켓플레이스에서 Ollama 확장을 설치하고 VS Code 채팅을 열면, 모델 선택기 아래쪽에 Ollama 섹션이 생긴다.
거기서 받아둔 모델을 고르면 된다.
확장은 http://127.0.0.1:11434를 기본으로 탐색한다.
Ollama가 떠 있기만 하면 별도 설정이 없다.
요구사항이 있다.
VS Code 1.127 이상이어야 하고, 그 이전 버전은 요청 취소가 안정적으로 동작하지 않는다.
클라우드 모델 로그인과 모델 정보 표시를 제대로 쓰려면 Ollama 0.17.6 이상이 권장된다.
쓰는 순서는 단순하다.
먼저 모델을 받고, 확장을 설치하고, 채팅에서 고른다.
ollama pull qwen3.6
코딩 에이전트도 로컬로
ollama launch 명령이 외부 도구를 Ollama에 연결해 띄운다.
ollama launch claude
이 한 줄로 Claude Code가 로컬 모델로 뜬다.
Anthropic 호환 API를 통해 연결되는 구조다.
지원 목록이 꽤 넓다.
Claude Code, Codex CLI, VS Code, Cline, JetBrains, Zed, Xcode, Goose, n8n 등이 공식 문서에 정리돼 있다.
여기서 현실적인 기대치를 짚어둘 필요가 있다.
로컬 모델로 코딩 에이전트를 돌리면 클라우드만큼 나오지 않는다.
에이전트 작업은 긴 컨텍스트와 도구 호출 정확도를 요구하는데, 개인 PC에서 돌릴 수 있는 크기의 모델에는 부담이 큰 조합이다.
그래서 쓰임이 갈린다.
외부에 코드를 보낼 수 없는 환경이거나, 간단한 반복 작업에 맞는다.
복잡한 리팩토링을 맡기려면 클라우드 쪽이 현실적이다.
컨텍스트를 반드시 올린다
코딩 도구를 붙일 때 가장 자주 겪는 문제다.
공식 문서는 웹 검색·에이전트·코딩 도구는 최소 64,000토큰으로 설정하라고 안내한다.
기본값 4k로는 파일 몇 개만 읽어도 앞부분을 잊는다.
문제는 메모리다.
64k로 올리면 그만큼 VRAM을 더 쓰고, 모델이 CPU로 밀리면 에이전트가 실용적이지 않을 만큼 느려진다.
그래서 순서가 이렇다.
컨텍스트를 올리고 → ollama ps로 100% GPU인지 확인하고 → 밀렸으면 모델 크기를 낮춘다.
코딩 용도에서는 모델을 한 단계 작게 쓰고 컨텍스트를 키우는 쪽이 대체로 낫다.
다른 앱은 어떻게 붙일까요
직접 지원이 없어도 방법이 있다.
OpenAI 호환 API를 받는 앱이면 대부분 붙는다.
설정에 base_url이나 "API 엔드포인트" 항목이 있으면 http://localhost:11434/v1을 넣으면 된다.
주의할 점 둘이 있다.
주소를 확인한다.
localhost가 안 되면 127.0.0.1로 바꿔본다.
도커 안에서 돌리는 앱이면 컨테이너 기준 주소가 달라진다.
모델 이름을 정확히 쓴다.
ollama ls에 나오는 이름 그대로여야 한다.
태그까지 포함해 적는 게 안전하다.
개인적으로는 Ollama 연동 전에 curl로 한 번 찔러보는 순서를 권한다.
API가 응답하는지부터 확인하면, 안 될 때 앱 설정 문제인지 서버 문제인지가 바로 갈린다.
자주 묻는 질문 (FAQ)
API 키가 필요한가요?
로컬은 필요 없다.
값을 요구하는 클라이언트에는 아무 문자열이나 넣으면 된다.
기존 OpenAI 코드를 그대로 쓸 수 있나요?
base_url과 모델 이름을 바꾸면 대체로 동작한다.
일부 기능은 지원 범위가 다르다.
VS Code에 어떻게 붙이나요?
Ollama 확장을 설치하면 채팅 모델 선택기에 나타난다.
VS Code 1.127 이상이 필요하다.
Claude Code도 되나요?
ollama launch claude로 연결된다.
Anthropic 호환 API를 쓴다.
왜 답이 짧게 끊기나요?
컨텍스트가 부족한 경우가 많다.
코딩 도구는 64,000토큰 이상을 권장한다.
오늘 바로 할 것
- curl로
localhost:11434를 찔러 서버가 살아 있는지 본다. - 기존 코드가 있으면
base_url만 바꿔 돌려본다. - VS Code는 Ollama 확장을 설치하고 모델 선택기를 연다.
- 코딩 도구를 붙였다면 컨텍스트를 64k 이상으로 올린다.
- 올린 뒤
ollama ps로 GPU 비중을 다시 확인한다.
Codex나 Claude Code 같은 클라우드 코딩 에이전트와 비교하려면 Codex와 Claude Code 심층 비교를 함께 보면 판단이 쉬워진다.
다음 5편에서는 Modelfile로 내 용도에 맞는 모델을 만드는 법을 다룬다.
출처
- Ollama 공식 문서 — OpenAI compatibility —
base_url설정, 로컬·클라우드 호출 차이, API 키 - Ollama 공식 문서 — VS Code · Claude Code — 확장 설치와
127.0.0.1:11434탐색, VS Code 1.127·Ollama 0.17.6 요건,ollama launch claude - Ollama 공식 문서 — Context length — 에이전트·코딩 도구 64,000토큰 권장
- 연동 도구와 요구 버전은 계속 바뀐다. 설정 전 공식 문서의 통합 목록을 확인하는 편이 정확하다.
'IT 제품&프로그램 팁' 카테고리의 다른 글
| Modelfile 만들기 (2026) — 내 용도에 맞춘 모델 (0) | 2026.10.01 |
|---|---|
| 딥리서치 보고서 (2026) — 조사 결과를 문서·PPT로 바로 받기 (0) | 2026.10.01 |
| Ollama 활용법 (2026) — 요약·번역·이미지 읽기까지 (1) | 2026.09.30 |
| Ollama 모델 고르기 (2026) — 7B와 Q4가 무슨 뜻인가 (0) | 2026.09.30 |
| Ollama 시작하기 (2026) — 내 PC에서 AI 돌리는 첫 단계 (0) | 2026.09.27 |
댓글