Якщо ти хочеш використовувати потужний ШІ без залежності від інтернету, хмарних серверів та щомісячної підписки — локальні LLM моделі це саме те, що тобі потрібно. Цей туторіал допоможе встановити Ollama, завантажити три популярні моделі (Qwen3, Gemma3 і DeepSeek-R2), порівняти їх у реальних задачах і вибрати ту, що підходить саме для твоїх потреб. На все знадобиться приблизно 60–90 хвилин залежно від швидкості завантаження. Для старту потрібен ПК або ноутбук з мінімум 16 ГБ RAM і 20 ГБ вільного місця на диску.
🛠️ Що знадобиться
- Ollama — безкоштовний рушій для запуску локальних моделей на Windows, macOS і Linux. Це твій головний інструмент — він завантажує моделі та запускає локальний API-сервер
- Open WebUI — безкоштовний веб-інтерфейс у стилі ChatGPT, який підключається до Ollama. Встановлюється через Docker або pip, дозволяє зручно перемикатись між моделями
- Docker Desktop — безкоштовний (для особистого використання) інструмент для запуску Open WebUI у контейнері. Альтернативно можна встановити Open WebUI через Python без Docker
- Мінімум 16 ГБ RAM — для комфортної роботи з 7B-моделями. Для 14B-моделей потрібно 32 ГБ. GPU з VRAM від 8 ГБ суттєво прискорить генерацію, але не є обов’язковим
📋 Покрокова інструкція
Крок 1: Встановлення Ollama
Відкрий браузер і перейди на сайт ollama.com, натисни велику кнопку Download і обери свою ОС. На Windows запусти завантажений інсталятор OllamaSetup.exe і пройди стандартне встановлення — Next → Next → Install. На macOS відкрий .dmg файл і перетягни Ollama у папку Applications. На Linux виконай у терміналі одну команду: curl -fsSL https://ollama.com/install.sh | sh. Після встановлення Ollama запускається автоматично у системному треї — переконайся, що бачиш іконку лами у рядку завдань або меню статусу.

Крок 2: Завантаження трьох моделей для порівняння
Відкрий термінал (на Windows — PowerShell або CMD) і виконай три команди по черзі. Спочатку завантаж Qwen3: ollama pull qwen3:8b — це займе 5–10 хвилин, розмір близько 5 ГБ. Потім завантаж Gemma3: ollama pull gemma3:9b — близько 6 ГБ. Нарешті DeepSeek: ollama pull deepseek-r2:8b — близько 5 ГБ. Важливо: не закривай термінал під час завантаження — якщо з’єднання перерветься, просто запусти ту саму команду знову, Ollama підхопить завантаження з місця зупинки. Перевір що всі моделі завантажені командою ollama list — у списку мають з’явитись усі три.
Крок 3: Встановлення Open WebUI через Docker
Завантаж і встанови Docker Desktop з сайту docker.com — обери версію для своєї ОС, запусти інсталятор і перезавантаж комп’ютер після встановлення. Переконайся що Docker запущений (іконка кита у треї). Тепер відкрий термінал і виконай одну команду: docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main. Docker автоматично завантажить образ і запустить контейнер. Якщо не хочеш використовувати Docker — альтернатива: pip install open-webui і потім open-webui serve.
Крок 4: Підключення та перше тестування моделей
Відкрий браузер і введи адресу http://localhost:3000. При першому запуску Open WebUI попросить створити акаунт адміністратора — введи будь-який email і пароль, це локальний акаунт тільки на твоєму комп’ютері. Після входу натисни на випадаючий список моделей у верхній частині сторінки — ти побачиш усі три завантажені моделі: qwen3:8b, gemma3:9b, deepseek-r2:8b. Обери qwen3:8b і напиши тестове повідомлення: “Поясни що таке рекурсія простими словами”. Зверни увагу на швидкість відповіді та якість пояснення — це буде твоя точка відліку для порівняння.
Крок 5: Порівняння моделей і вибір оптимальної для твоїх задач
Проведи однакові тести для всіх трьох моделей з одними і тими ж промптами. Для Qwen3:8b — найкраще підходить для багатомовних задач, аналізу коду та роботи з українськими текстами: попроси “Напиши функцію на Python для сортування списку і поясни її”. Для Gemma3:9b — оптимальна для логічних міркувань та структурованих відповідей: попроси “Склади покроковий план запуску стартапу”. Для DeepSeek-R2:8b — показує найкращі результати у математиці та аналітичному мисленні з видимим ланцюжком думок: попроси “Вирішив задачу: поїзд їде 120 км/год…”. Після тестів у налаштуваннях Open WebUI (іконка шестерні → Models) постав зірочку навпроти тієї моделі, яка найкраще відповіла на твої задачі — вона буде обиратись за замовчуванням. У підсумку ти матимеш повністю офлайн-систему ШІ з красивим інтерфейсом, що працює навіть без підключення до інтернету.
⚠️ Типові помилки та як їх уникнути
- Ollama не відповідає після встановлення — перевір чи запущений сервіс. На Windows відкрий PowerShell і введи
ollama serve. На Linux виконайsudo systemctl start ollama. Потім перевір що сервер відповідає:ollama listмає вивести список моделей без помилок - Модель генерує текст надто повільно (менше 3 токенів/сек) — причина в тому, що модель повністю завантажена в RAM і не використовує GPU. Якщо маєш відеокарту NVIDIA, встанови CUDA toolkit і перевстанови Ollama — вона автоматично виявить GPU. Перевір використання GPU командою
ollama psу терміналі під час генерації - Open WebUI не бачить моделей Ollama — це трапляється коли Docker не може достукатись до Ollama на хості. Переконайся що у команді запуску Docker є параметр
--add-host=host.docker.internal:host-gateway. Також перевір у Settings → Connections що адреса Ollama вказана якhttp://host.docker.internal:11434, а не localhost - Комп’ютер зависає під час роботи моделі — ти намагаєшся запустити модель більшу ніж дозволяє твій RAM. Переключись на менші версії: замість 8b спробуй
qwen3:4bабоgemma3:4b. Команда:ollama pull qwen3:4b
💡 Поради для кращого результату
Використовуй Modelfile для налаштування системного промпту. Створи файл Modelfile з текстом: FROM qwen3:8b та SYSTEM “Ти україномовний асистент. Відповідай завжди українською мовою.” — і виконай ollama create miy-asystent -f Modelfile. Тепер у тебе є персоналізована модель, яка завжди відповідає українською без додаткових інструкцій. Для DeepSeek-R2 обов’язково вмикай режим “Think” — у Open WebUI перед відправкою повідомлення є перемикач Thinking Mode. Увімкни його для складних задач: модель покаже весь ланцюжок міркувань і дасть більш точну відповідь. Зменш параметр num_ctx якщо хочеш прискорити відповіді. У налаштуваннях моделі в Open WebUI зміни Context Length з 8192 до 4096 — швидкість зросте вдвічі при незначній втраті якості на коротких задачах. Запускай кілька моделей паралельно для A/B порівняння — у Open WebUI є режим Arena (іконка меча у верхньому меню), де одне повідомлення надсилається одночасно до двох моделей і ти голосуєш яка відповіла краще.
❓ Часті запитання (FAQ)
1. Чи працюватиме це на ноутбуці без дискретної відеокарти?
Так, Ollama чудово працює на CPU — просто повільніше. На сучасному ноутбуці з процесором Intel Core Ultra або Apple M-серії моделі 7-8B генерують 5–15 токенів на секунду в CPU-режимі, що цілком комфортно для роботи. MacBook з чіпами M3/M4 взагалі показує чудову продуктивність завдяки уніфікованій пам’яті.

2. Яка з трьох моделей найкраща для роботи з українською мовою?
Qwen3 показує найкращі результати з українськими текстами — модель навчалась на великому масиві багатомовних даних. Gemma3 на другому місці. DeepSeek-R2 іноді переходить на англійську або китайську у складних відповідях, тому для суто україномовних задач його краще не використовувати без системного промпту.
3. Чи можна підключити локальну модель до VSCode або інших інструментів?
Так, Ollama надає OpenAI-сумісний API на адресі http://localhost:11434. У розширенні Continue для VSCode просто обери провайдер Ollama і введи назву моделі — наприклад qwen3:8b. Так само можна підключити до Cursor, Obsidian з плагіном LocalGPT та інших інструментів що підтримують OpenAI API.
4. Наскільки безпечно зберігати приватні дані в локальній моделі?
Повністю безпечно — локальна модель не надсилає жодних даних в інтернет. Це одна з головних переваг: можна передавати конфіденційні документи, код комерційних проєктів або особисті дані без ризику витоку. Єдина умова — переконайся що Open WebUI та Ollama доступні лише з localhost (порти не відкриті назовні).
5. Як оновити модель якщо вийшла нова версія?
Просто виконай ту саму команду pull: ollama pull qwen3:8b. Ollama перевірить чи є нова версія у реєстрі і завантажить лише змінені шари — це набагато швидше ніж перше завантаження. Переглянути доступні версії моделей можна на сайті ollama.com/library.
🏁 Підсумок
Ти встановив Ollama, завантажив три актуальні моделі (Qwen3, Gemma3 і DeepSeek-R2), підняв зручний веб-інтерфейс Open WebUI і навчився порівнювати моделі для різних задач — тепер у тебе є повноцінний офлайн-асистент, що працює без інтернету, підписок і передачі даних на сторонні сервери.
Почни прямо зараз: відкрий термінал і виконай ollama pull qwen3:8b — поки модель завантажується, встанови Docker Desktop. За годину матимеш готовий локальний ШІ-асистент. Якщо виникнуть питання — спільнота Ollama на Reddit (/r/ollama) та Discord Open WebUI допоможуть вирішити будь-яку проблему.
РОЗСИЛКА
📬 Щотижневий AI-дайджест
Найкращі статті про ШІ та автоматизацію — без спаму, лише суть
Без спаму · Відписатись будь-коли

