Зачем это нужно

Если вы хоть раз пытались запустить open-source LLM локально, вы знаете этот путь: скачать модель, поставить Python, поставить PyTorch, поставить CUDA, поставить bitsandbytes, поставить… и через два часа выяснить, что у вас не та версия драйвера. Ollama убирает весь этот ад.

Что внутри

Ollama — это самодостаточный бинарник на Go, который:

  • Скачивает модели прямо из своего реестра (ollama pull llama3.2)
  • Запускает inference через llama.cpp под капотом, но с простым CLI
  • Управляет моделями — загрузка, выгрузка, список, удаление
  • Даёт REST APIPOST /api/generate и /api/chat работают сразу после ollama serve
  • Работает на CPU, но автоматически ускоряется на Apple Silicon и NVIDIA GPU

Почему это интересно разработчикам

Три причины.

1. Прототипирование без биллинга. Тестировать промпты на Mistral 7B или CodeLlama 13B можно вообще без интернета. Это дешевле и быстрее, чем гонять запросы через OpenAI.

2. Конфиденциальность по умолчанию. Данные не уходят из машины. Для медицинских, юридических и enterprise-задач это часто hard requirement.

3. OpenAI-совместимый API. Можно поднять локальный сервер и переключить свой код одной строкой — OPENAI_API_BASE=http://localhost:11434/v1.

Что попробовать в первую очередь

# Установить
curl -fsSL https://ollama.com/install.sh | sh

# Запустить модель (скачается ~4.7 GB)
ollama run llama3.2

# Или меньшую, для экспериментов
ollama run phi3.5

# REST API
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Расскажи анекдот про программистов"
}'

Что внутри репозитория

  • server/ — Go-сервер с маршрутами и очередями
  • llm/ — обёртки над llama.cpp
  • cmd/ — CLI-фронтенд
  • discover/ и diskmgr/ — управление моделями на диске
  • gpu/ — обнаружение и инициализация GPU (Apple Metal, NVIDIA CUDA, AMD ROCm)

Проект активный, релизы выходят каждые 2–3 недели. Поддерживается командой из 4–5 человек, плюс большой контрибьюторский пул.

Когда Ollama не подойдёт

  • Нужно inference на серьёзном enterprise-уровне — смотрите в сторону vLLM или TGI.
  • Хотите fine-tuning, а не только inference — Ollama это не умеет, используйте unsloth или axolotl.
  • Нужны модели больше 70B на слабом железе — используйте llama.cpp напрямую.

Итог

Лучший способ познакомиться с open-source LLM без боли. Поставил — и через 5 минут у тебя работает Mistral, CodeLlama или Phi-3 на ноутбуке.

#llm#local#golang
Опубликовано 13 января 2026 г.