Ollama로 로컬 AI(LLM) 내 컴퓨터에서 무료로 돌리는 법

안녕하세요, 우리들의 주파수 구독자 여러분! ChatGPT나 클로드 같은 AI 챗봇을 매달 구독료 내며 쓰다가, “이거 내 컴퓨터에서 공짜로는 못 돌리나?” 생각해본 적 있으신가요? 결론부터 말하면 가능합니다. Ollama라는 무료 프로그램을 쓰면 인터넷 연결 없이, 구독료 없이, 내 컴퓨터 안에서 AI 모델을 직접 돌릴 수 있습니다. 오늘은 설치부터 실제 대화 실행, 자주 나는 오류까지 한 번에 정리해드리겠습니다.
목차
- Ollama란 무엇인가
- 시작 전 확인할 최소 사양
- 설치하는 법 (Windows / macOS)
- 첫 AI 모델 다운로드 및 실행
- 채팅 UI로 편하게 쓰는 법 (Open WebUI 연동)
- Ollama vs LM Studio 비교
- 자주 겪는 오류와 해결법 (FAQ)
- 핵심 요약
1. Ollama란 무엇인가
Ollama는 라마(Meta), 미스트랄, 젬마(구글), 큐원(알리바바) 같은 오픈소스 대형언어모델(LLM)을 내 컴퓨터에 다운로드해서 로컬로 실행할 수 있게 해주는 무료 프로그램입니다. 명령어 한 줄로 모델을 내려받고 바로 대화할 수 있고, 백그라운드에서 API 서버로도 돌아가서 다른 프로그램과 연동하기도 좋습니다.
왜 로컬로 돌리나요?
- 구독료 없음 (모델 사용료 0원, 전기세만 발생)
- 인터넷이 끊겨도 사용 가능
- 대화 내용이 외부 서버로 전송되지 않음 (개인정보·회사 문서 작업 시 안심)
- 원하는 만큼 무제한으로 질문 가능 (사용량 제한 없음)
대신 ChatGPT-5나 클로드 같은 최상위 상용 모델보다는 답변 품질이 떨어질 수 있고, 컴퓨터 사양에 따라 속도 차이가 큽니다. “가벼운 작업은 로컬, 복잡한 작업은 유료 AI”로 나눠 쓰는 게 현실적인 활용법입니다.
2. 시작 전 확인할 최소 사양
로컬 AI는 모델 크기(파라미터 수)만큼 메모리와 저장공간을 잡아먹습니다. 시작하기 전에 아래 표로 대략적인 사양을 확인하세요.
| 모델 크기 | 필요 RAM(최소) | 디스크 용량 | 참고 |
|---|---|---|---|
| 1B~3B (초경량) | 4~8GB | 1~3GB | 구형 노트북도 가능, 답변 품질 낮음 |
| 7B~8B (표준) | 8~16GB | 4~5GB | 대부분의 일반 PC 권장 시작점 |
| 13B~14B | 16~32GB | 8~9GB | 사무용 대화·요약에 충분 |
| 30B 이상 | 32GB+ | 20GB+ | 그래픽카드(VRAM) 없으면 매우 느림 |
- 그래픽카드(GPU)가 있으면 훨씬 빠릅니다. 엔비디아 GPU라면 VRAM 6GB 이상을 권장합니다. GPU가 없어도 CPU+RAM만으로 실행은 되지만 답변이 느립니다.
- Mac은 M1/M2/M3/M4 계열이면 통합 메모리를 GPU처럼 활용해 의외로 빠르게 돌아갑니다.
- 저장공간은 모델을 여러 개 받으면 금방 늘어나니 최소 20GB 이상 여유를 두는 걸 권장합니다.
3. 설치하는 법 (Windows / macOS)
Windows
- ollama.com 접속 → Download for Windows 클릭
- 다운로드된
OllamaSetup.exe실행 → 별도 옵션 없이 “Install” 진행 - 설치가 끝나면 자동으로 백그라운드에서 Ollama 서비스가 실행됩니다 (트레이 아이콘 확인 가능)
Win + R→cmd입력 → 명령 프롬프트에서 아래 명령으로 정상 설치를 확인합니다.
ollama --version
버전 번호가 뜨면 설치 성공입니다.
macOS
- ollama.com 접속 → Download for macOS 클릭
- 다운로드된
.zip압축을 풀면 나오는 Ollama 앱을응용 프로그램폴더로 드래그 - 앱을 실행하면 메뉴바에 라마 아이콘이 나타나며 백그라운드 서버가 켜집니다
- 터미널(Terminal) 앱을 열고 아래 명령으로 확인합니다.
ollama --version
Homebrew를 쓴다면 brew install ollama 로도 설치할 수 있습니다.
4. 첫 AI 모델 다운로드 및 실행
설치가 끝났다면 이제 실제 모델을 받아 대화해봅니다. 터미널(또는 명령 프롬프트)에서 아래처럼 입력하세요.
ollama run llama3.2
처음 실행하면 모델 파일(약 2GB)을 자동으로 다운로드한 뒤, 다운로드가 끝나자마자 바로 채팅 프롬프트(>>>)가 뜹니다. 여기에 질문을 입력하면 됩니다.
>>> 대한민국 수도가 어디야?
한글 답변이 자연스러운 모델을 찾는다면 아래 모델들도 추천합니다.
ollama run gemma3 # 구글 젬마3, 한국어 준수
ollama run qwen2.5 # 알리바바 큐원, 한국어 강점
ollama run mistral # 프랑스 미스트랄, 영어권에 강함
모델 이름 뒤에 파라미터 크기를 붙이면 특정 버전을 지정할 수 있습니다. 예: ollama run qwen2.5:14b
자주 쓰는 명령어 정리
| 명령어 | 기능 |
|---|---|
ollama list | 내 컴퓨터에 받아둔 모델 목록 확인 |
ollama pull <모델명> | 대화 없이 모델만 미리 다운로드 |
ollama rm <모델명> | 모델 삭제(용량 확보) |
ollama ps | 현재 메모리에 로드되어 실행 중인 모델 확인 |
/bye | 채팅 중 대화 종료 |
5. 채팅 UI로 편하게 쓰는 법 (Open WebUI 연동)
검은 화면 터미널이 불편하다면, ChatGPT처럼 생긴 웹 채팅 화면을 붙일 수 있습니다. 대표적으로 Open WebUI를 많이 씁니다. Docker가 설치되어 있다면 명령 한 줄로 끝납니다.
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
실행 후 브라우저에서 http://localhost:3000 접속하면 회원가입(로컬 계정, 외부 전송 없음) 후 바로 웹 채팅 UI로 Ollama 모델과 대화할 수 있습니다. Docker 설치가 부담스럽다면 Chatbox, Msty 같은 데스크톱 앱도 Ollama를 그대로 인식해 GUI로 붙여줍니다.
6. Ollama vs LM Studio 비교
로컬 LLM 실행 도구로 가장 많이 비교되는 두 프로그램을 정리했습니다.
| 항목 | Ollama | LM Studio |
|---|---|---|
| 사용 방식 | 명령어(CLI) 중심, API 서버 내장 | 그래픽 인터페이스(GUI) 중심 |
| 난이도 | 명령어에 익숙하면 더 빠름 | 클릭만으로 조작, 초보자 친화적 |
| 모델 관리 | ollama pull로 커맨드 관리 | 검색창에서 클릭으로 다운로드 |
| 개발 연동 | REST API 기본 제공, 코드 연동 쉬움 | API 서버 옵션 제공(최근 버전) |
| 리소스 사용 | 가볍고 백그라운드 상주형 | GUI 앱이라 상대적으로 무거움 |
| 추천 대상 | 개발자, 자동화·API 연동 목적 | 터미널이 낯선 일반 사용자 |
결론: 코드로 다른 프로그램과 연동하거나 서버처럼 계속 켜두고 쓰려면 Ollama, 마우스 클릭만으로 모델을 골라 바로 채팅하고 싶다면 LM Studio가 편합니다. 둘 다 무료이니 두 개 다 설치해보고 손에 맞는 쪽을 쓰는 것도 방법입니다.
7. 자주 겪는 오류와 해결법 (FAQ)
Q. ollama 명령어가 인식되지 않는다고 나옵니다.
설치 후 터미널(명령 프롬프트)을 새로 열지 않아서 발생하는 경우가 대부분입니다. 기존 창을 닫고 새로 연 뒤 다시 시도하세요. Windows는 재부팅하면 대부분 해결됩니다.
Q. 모델 다운로드가 너무 느려요. 모델 파일이 수GB 단위라 네트워크 속도에 그대로 영향을 받습니다. 다운로드 도중 끊겼다면 같은 명령을 다시 입력하면 이어받기가 됩니다.
Q. 답변이 너무 느립니다.
CPU만으로 큰 모델을 돌리면 느릴 수밖에 없습니다. 더 작은 모델(예: llama3.2 3B급)로 바꾸거나, ollama ps로 확인해 다른 프로그램이 메모리를 많이 쓰고 있지 않은지 점검하세요. 그래픽카드가 있는데도 느리다면 최신 GPU 드라이버로 업데이트해보세요.
Q. “model requires more system memory” 오류가 뜹니다. 선택한 모델이 내 컴퓨터 RAM보다 큽니다. 2번 표를 참고해 더 작은 파라미터의 모델로 바꿔서 실행하세요.
Q. 포트 11434가 이미 사용 중이라고 나옵니다. Ollama는 기본적으로 11434 포트로 API 서버를 띄웁니다. 다른 프로그램이 같은 포트를 쓰고 있다면 해당 프로그램을 종료하거나, Ollama를 재시작(작업 관리자에서 프로세스 종료 후 재실행)하면 해결됩니다.
Q. 완전히 삭제하고 싶어요.
Windows는 설정 > 앱에서 Ollama를 제거하면 되고, macOS는 응용 프로그램 폴더에서 앱을 휴지통으로 옮기면 됩니다. 다운로드한 모델 파일까지 지우려면 ollama rm <모델명>으로 먼저 삭제한 뒤 프로그램을 제거하세요.
8. 핵심 요약
- Ollama는 무료로 내 컴퓨터에서 AI 모델을 돌릴 수 있는 프로그램이다.
- 설치 →
ollama run <모델명>한 줄이면 바로 AI와 대화 시작. - 컴퓨터 RAM/그래픽카드 사양에 맞는 모델 크기를 골라야 속도가 안 나온다.
- 예쁜 채팅 화면이 필요하면 Open WebUI, Chatbox 같은 프로그램을 얹으면 된다.
- 클릭 위주로 쓰고 싶다면 LM Studio, 개발·자동화 연동이 목적이면 Ollama가 더 유리하다.
인터넷 없이도, 매달 구독료 걱정 없이도 나만의 AI 비서를 만들 수 있는 시대입니다. 이번 주말엔 노트북에 Ollama 하나 깔아서 직접 대화해보시는 건 어떨까요? 오늘도 읽어주셔서 감사합니다!