Установка Ollama на Ubuntu VPS: запуск локальной AI-модели за несколько минут
Ollama — это бесплатный инструмент с открытым исходным кодом для запуска больших языковых моделей (LLM) на собственном компьютере или VPS. С его помощью можно использовать модели DeepSeek, Qwen, Llama, Gemma, Mistral и другие без подписок на облачные сервисы.
Ollama автоматически загружает выбранную модель и предоставляет простой HTTP API, совместимый со многими AI-приложениями, имеет веб интерфейс, предоставляет полный контроль над данными и является простым в установке.
Почему стоит использовать VPS
Запуск Ollama на VPS дает несколько преимуществ:
- постоянный доступ к модели по API;
- работа 24/7 без включенного домашнего компьютера;
- возможность подключаться с любого устройства;
- удобная интеграция с Open WebUI, Continue, Aider и другими инструментами;
- полный контроль над окружением.
Системные требования
Сам Ollama практически не потребляет ресурсов. Основную нагрузку создает выбранная модель.
Рекомендуемые конфигурации:
| Модель | CPU | RAM |
|---|---|---|
| Gemma 3 1B | 2 vCPU | 2 ГБ |
| Qwen 2.5 3B | 2–4 vCPU | 4–8 ГБ |
| Llama 3.2 3B | 4 vCPU | 8 ГБ |
| DeepSeek R1 7B | 8 vCPU | 16–32 ГБ |
Важно:
Ollama поддерживает работу без GPU, но генерация на CPU будет заметно медленнее. Для крупных моделей рекомендуется сервер с видеокартой или достаточным объемом оперативной памяти.
Для знакомства с Ollama и тестирования возможностей обычно достаточно модели 1B–3B и VPS с 2–8 ГБ RAM.
Подключение к серверу
Подключитесь по SSH:
ssh root@IP_СЕРВЕРА
Быстрая установка
Если вы уже знакомы с VPS и хотите просто запустить Ollama, то одна команда сделает всё автоматически:
curl -fsSL https://raw.githubusercontent.com/Litnets-com/ollama-server/main/install.sh | bash
Скрипт обновит систему, установит Ollama, настроит автозапуск и скачает подходящую модель исходя из объёма RAM на вашем сервере.
Скрипт работает на Ubuntu 22/24, Debian.
Подходит не только для работы на VDS litnets, но и на любом VDS или компьютере.
Дополнительные параметры:
# Выбрать конкретную модель
curl -fsSL https://raw.githubusercontent.com/Litnets-com/ollama-server/main/install.sh | bash -s -- --model llama3.2:3b
# Установить вместе с веб-интерфейсом Open WebUI
curl -fsSL https://raw.githubusercontent.com/Litnets-com/ollama-server/main/install.sh | bash -s -- --webui
# Обновить уже установленную Ollama
curl -fsSL https://raw.githubusercontent.com/Litnets-com/ollama-server/main/install.sh | bash -s -- --update
Исходный код скрипта и документация: github.com/Litnets-com/ollama-server
Если требуется установка вручную, то вы можете следовать шагам далее.
Установка Ollama
Обновите систему:
apt update
apt upgrade -y
Разработчики предоставляют официальный установочный скрипт.
Выполните:
curl -fsSL https://ollama.com/install.sh | sh
Важно:
Если сервер без GPU, при установке вы увидите предупреждение «No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode» (медленная работа). В этом случае выбирайте небольшие модели (1–4B параметров) и увеличивайте таймауты прокси.
Проверьте установку:
ollama --version
Запуск первой модели
Загрузите модель:
ollama run gemma3:1b
При первом запуске Ollama автоматически скачает модель.
Это может занять некоторое время.
После загрузки можно сразу начать общение:
Важно:
Конкретно модель gemma3:1b не является заменой чат ботам или AI-ассистентам, она маленькая, плохо понимает контекст, часто ошибается и галлюцинирует.
Но она легкая, быстрая, не требовательная к ресурсам. Её чаще используют как классификатор, для простых задач, не связанных с генерацией.
Подробно протестировали для чего можно использовать эту модель в статье Тестирование Gemma 3 1B: реальные возможности маленькой языковой модели. Более 50-ти реальных тестов.
После загрузки можно проверить список
ollama list
Какие модели доступны
Посмотреть каталог моделей можно на официальном сайте Ollama.
Наиболее популярные:
| Модель | Назначение |
|---|---|
| Gemma 3 | Универсальная модель Google |
| Qwen 2.5 | Код и общие задачи |
| Llama 3.2 | Универсальная |
| DeepSeek R1 | Логика и программирование |
| Mistral | Быстрые ответы |
Для большинства VPS оптимальным выбором являются модели размером до 3B.
Работа через API
После запуска Ollama автоматически открывает локальный API.
Пример запроса:
curl http://localhost:11434/api/generate \
-d '{
"model":"gemma3:1b",
"prompt":"1+1=",
"stream": false
}'
Ответ возвращается в формате JSON.
Благодаря этому Ollama можно подключить практически к любому приложению.
Запуск как системной службы
После установки сервис обычно запускается автоматически.
Проверить состояние можно командой:
systemctl status ollama
Если требуется запустить вручную:
systemctl start ollama
Добавить в автозагрузку:
systemctl enable ollama
Что установить вместе с Ollama
После установки Ollama можно дополнить сервер другими инструментами:
- Open WebUI — веб-интерфейс для общения с моделями.
- LiteLLM — единый API для локальных и облачных моделей.
- Continue — AI-помощник для VS Code.
- Aider — работа с кодом через терминал.
- n8n — автоматизация с использованием локальных моделей.
Почему VPS подходит для Ollama
Размещение Ollama на VPS позволяет создать собственный AI-сервер, доступный из любой точки мира и работающий 24/7.
Вы можете использовать его для разработки, тестирования приложений, автоматизации и интеграции с другими сервисами без необходимости держать домашний компьютер постоянно включенным.
Для небольших моделей подойдут недорогие VPS с 2GB RAM, а для моделей 7B и выше лучше выбирать серверы с увеличенным объемом RAM или GPU.
Заключение
Ollama — один из самых простых способов развернуть локальные языковые модели на собственном сервере.
Установка занимает несколько минут, не требует регистрации или подписки, а готовый HTTP API позволяет подключить практически любое приложение.
В сочетании с VPS вы получаете постоянно доступный AI-сервер, который полностью контролируете самостоятельно.