Зачем это нужно
Если вы хоть раз пытались запустить open-source LLM локально, вы знаете этот путь: скачать модель, поставить Python, поставить PyTorch, поставить CUDA, поставить bitsandbytes, поставить… и через два часа выяснить, что у вас не та версия драйвера. Ollama убирает весь этот ад.
Что внутри
Ollama — это самодостаточный бинарник на Go, который:
- Скачивает модели прямо из своего реестра (
ollama pull llama3.2) - Запускает inference через llama.cpp под капотом, но с простым CLI
- Управляет моделями — загрузка, выгрузка, список, удаление
- Даёт REST API —
POST /api/generateи/api/chatработают сразу послеollama serve - Работает на CPU, но автоматически ускоряется на Apple Silicon и NVIDIA GPU
Почему это интересно разработчикам
Три причины.
1. Прототипирование без биллинга. Тестировать промпты на Mistral 7B или CodeLlama 13B можно вообще без интернета. Это дешевле и быстрее, чем гонять запросы через OpenAI.
2. Конфиденциальность по умолчанию. Данные не уходят из машины. Для медицинских, юридических и enterprise-задач это часто hard requirement.
3. OpenAI-совместимый API. Можно поднять локальный сервер и переключить свой код одной строкой — OPENAI_API_BASE=http://localhost:11434/v1.
Что попробовать в первую очередь
# Установить
curl -fsSL https://ollama.com/install.sh | sh
# Запустить модель (скачается ~4.7 GB)
ollama run llama3.2
# Или меньшую, для экспериментов
ollama run phi3.5
# REST API
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Расскажи анекдот про программистов"
}'
Что внутри репозитория
server/— Go-сервер с маршрутами и очередямиllm/— обёртки над llama.cppcmd/— CLI-фронтендdiscover/иdiskmgr/— управление моделями на дискеgpu/— обнаружение и инициализация GPU (Apple Metal, NVIDIA CUDA, AMD ROCm)
Проект активный, релизы выходят каждые 2–3 недели. Поддерживается командой из 4–5 человек, плюс большой контрибьюторский пул.
Когда Ollama не подойдёт
- Нужно inference на серьёзном enterprise-уровне — смотрите в сторону vLLM или TGI.
- Хотите fine-tuning, а не только inference — Ollama это не умеет, используйте unsloth или axolotl.
- Нужны модели больше 70B на слабом железе — используйте llama.cpp напрямую.
Итог
Лучший способ познакомиться с open-source LLM без боли. Поставил — и через 5 минут у тебя работает Mistral, CodeLlama или Phi-3 на ноутбуке.