Як запустити локальні LLM моделі на своєму комп’ютері — розраховуємо реальні витрати на електроенергію

Як запустити LLM моделі локально та розрахувати реальні витрати електроенергії для домашнього комп'ютера

Хочеш використовувати ChatGPT-рівень штучного інтелекту без щомісячної підписки та без передачі своїх даних у хмару? Локальні LLM — саме те рішення, але багатьох лякає питання: скільки це коштуватиме в рахунку за електрику? Цей туторіал покаже, як за 30–40 хвилин запустити модель на власному ПК через Ollama, виміряти реальне енергоспоживання та порахувати точну місячну вартість у гривнях.

🛠️ Що знадобиться

  • Ollama — безкоштовний інструмент для завантаження та запуску LLM моделей локально; підтримує Windows, macOS, Linux
  • Open WebUI — безкоштовний веб-інтерфейс для зручного спілкування з моделями через браузер, як ChatGPT
  • HWiNFO64 (Windows) або powerstat (Linux) — безкоштовні утиліти для моніторингу реального енергоспоживання комп’ютера в реальному часі
  • ПК з мінімум 8 ГБ RAM — для запуску малих моделей (7B); для 13B+ моделей потрібно 16 ГБ і більше
  • Docker Desktop — безкоштовний, потрібен для розгортання Open WebUI як контейнера

📋 Покрокова інструкція

Крок 1: Встановлення Ollama та завантаження першої моделі

Зайди на сайт ollama.com, натисни велику кнопку Download у центрі сторінки та обери свою операційну систему. Після завантаження запусти інсталятор і натискай Next → Install → Finish. Коли встановлення завершиться, відкрий термінал (Win+R → cmd → Enter) і введи команду: ollama pull llama3.2:3b — це завантажить легку 3-мільярдну модель розміром близько 2 ГБ. Якщо у тебе 16 ГБ RAM і дискретна відеокарта — спробуй ollama pull mistral:7b для значно кращої якості відповідей.

Крок 2: Перший запуск моделі та тест через термінал

Після завантаження моделі одразу перевір її роботу: введи в термінал ollama run llama3.2:3b і натисни Enter. З’явиться запрошення >>> — напиши будь-яке запитання, наприклад: Explain quantum computing in simple terms, і натисни Enter. Модель почне генерувати відповідь прямо в терміналі. Щоб вийти з чату, введи /bye. Підводний камінь: перший запуск займає 20–60 секунд, поки модель завантажується в пам’ять — це нормально, далі буде швидше.

Крок 3: Розгортання Open WebUI для зручного інтерфейсу

Встанови Docker Desktop з сайту docker.com — це займе 5 хвилин. Після запуску Docker відкрий термінал і вставте цю одну команду цілком: docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main та натисни Enter. Docker сам завантажить та запустить інтерфейс. Через 2–3 хвилини відкрий браузер і перейди на адресу http://localhost:3000 — ти побачиш сторінку реєстрації Open WebUI. Зареєструйся (дані зберігаються локально), обери модель у лівому меню та спілкуйся як у ChatGPT.

Крок 4: Вимірювання реального енергоспоживання

Тепер найцікавіше — дізнаємося, скільки реально їсть твій ПК під час роботи з LLM. На Windows: завантаж HWiNFO64 з сайту hwinfo.com, запусти його, натисни Sensors у головному вікні та знайди рядок Total System Power або CPU Package Power — значення показується у Ватах. Запиши три показники: 1) у стані спокою, 2) під час генерації відповіді моделлю. На Linux відкрий термінал і введи: sudo apt install powerstat && sudo powerstat -R 1 60 — отримаєш вимірювання кожну секунду протягом хвилини. Типові значення: простий ПК споживає 60–120 Вт у спокої, під час роботи LLM — 150–350 Вт залежно від CPU/GPU.

Крок 5: Розрахунок реальних витрат на електроенергію

Маючи дані про споживання, рахуємо за простою формулою. Приклад: твій ПК споживає 200 Вт під час роботи з LLM. Тариф в Україні у 2026 році — близько 4,32 грн/кВт·год (перший блок до 250 кВт·год). Розрахунок: 200 Вт = 0,2 кВт; за годину роботи = 0,2 × 4,32 = 0,86 грн/год. Якщо використовуєш LLM по 4 години щодня: 0,86 × 4 × 30 = ~103 грн/місяць — і це за необмежену кількість запитів без підписки. Для порівняння: ChatGPT Plus коштує ~850 грн/місяць. Запиши свої реальні цифри в таблицю: стовпці — Потужність (Вт), Годин/день, Тариф (грн), Результат (грн/місяць) — і ти точно знатимеш свої витрати.

⚠️ Типові помилки та як їх уникнути

  • Вибір надто великої моделі для свого заліза — якщо у тебе 8 ГБ RAM, не намагайся запустити 13B модель; комп’ютер почне використовувати swap і все буде жахливо повільно. Завжди перевіряй: розмір моделі у ГБ має бути вдвічі меншим за твій RAM.
  • Ігнорування VRAM відеокарти — якщо є GPU з 6+ ГБ VRAM, Ollama автоматично перенесе обрахунки на нього, що дасть у 3–5 разів вищу швидкість і менше навантаження на CPU. Переконайся, що встановлені свіжі драйвери NVIDIA або AMD.
  • Рахувати витрати лише за CPU — при вимірюванні обов’язково враховуй повне споживання системи (монітор, вентилятори, диски), бо HWiNFO показує тільки CPU Package. Найточніший спосіб — розумна розетка з лічильником енергії типу Gosund або TP-Link Tapo P110.
  • Не перезапускати Ollama після зміни моделі — якщо переключаєшся між моделями і помічаєш дивні відповіді, введи в терміналі ollama stop llama3.2:3b, а потім запусти нову модель. Дві завантажені моделі одночасно з’їдять весь RAM.

💡 Поради для кращого результату

Використовуй квантизовані моделі формату Q4_K_M — вони займають вдвічі менше місця і RAM порівняно з повними версіями, але втрачають менше 5% якості. У Ollama при команді ollama pull mistral:7b-instruct-q4_K_M ти отримаєш оптимальний баланс. Вимикай монітор під час довгих генерацій — 27-дюймовий IPS-монітор споживає 40–60 Вт, і якщо чекаєш відповіді кілька хвилин, це зайві гроші. Налаштуй Ollama на автозапуск тільки коли потрібен — відкрий Диспетчер завдань → Автозапуск → знайди Ollama → клацни правою кнопкою → Вимкнути, якщо не використовуєш LLM щодня. Для порівняння моделей використовуй Open WebUI Arena — у меню є режим порівняння двох моделей поруч, де ти сам обираєш переможця; це найшвидший спосіб зрозуміти, яка модель підходить саме для твоїх завдань.

❓ Часті запитання (FAQ)

1. Чи можна запустити LLM на ноутбуці?
Так, але є нюанси. Ноутбук з 16 ГБ RAM впорається з моделями 7B у форматі Q4. Проблема в охолодженні — під тривалим навантаженням ноутбук може перегріватися і знижувати продуктивність. Обов’язково постав на охолоджувальну підставку та слідкуй за температурою через HWiNFO.

2. Які моделі найкраще розуміють українську мову?
У 2026 році найкращу підтримку української мають моделі сімейства Mistral (7B і 22B), Gemma 3 від Google та Llama 3.3. Для роботи суто з українським текстом спробуй: ollama pull gemma3:12b — вона непогано обробляє кирилицю навіть без окремого налаштування.

3. Чи безпечно зберігати приватні дані в локальній LLM?
Так, це одна з головних переваг. Ollama працює повністю офлайн — жоден запит не покидає твій комп’ютер. Перевір у налаштуваннях роутера, що Ollama не має зовнішніх з’єднань, або просто відімкни інтернет під час чутливих сесій.

4. Скільки місця на диску потрібно для моделей?
Залежить від розміру: 3B модель займає ~2 ГБ, 7B — близько 4–5 ГБ, 13B — 8–10 ГБ, 70B — 40+ ГБ. Всі моделі зберігаються в папці ~/.ollama/models. Список завантажених моделей та їхній розмір побачиш командою ollama list у терміналі.

5. Чи можна підключити локальну LLM до інших програм?
Так, Ollama запускає локальний API сервер на порту 11434. Будь-яка програма, що підтримує OpenAI-сумісний API (VS Code з Copilot-альтернативами, Obsidian, n8n тощо), може підключитися до нього, вказавши адресу http://localhost:11434 замість серверів OpenAI — повністю безкоштовно і без ліміту запитів.

🏁 Підсумок

Ти навчився встановлювати Ollama, запускати локальні LLM моделі, розгортати зручний веб-інтерфейс та — найголовніше — точно вимірювати і розраховувати реальні витрати на електроенергію, щоб свідомо порівнювати їх із вартістю хмарних сервісів. Типовий результат: 80–150 грн/місяць за необмежений приватний ШІ-асистент проти 850+ грн за підписку.

Починай прямо зараз: скачай Ollama, введи в терміналі ollama run llama3.2:3b і постав своє перше запитання — весь процес займе менше 10 хвилин. Після першого успішного тесту встанови Open WebUI для комфортної роботи та виміряй своє споживання через HWiNFO, щоб мати реальні цифри на руках.

РОЗСИЛКА

📬 Щотижневий AI-дайджест

Найкращі статті про ШІ та автоматизацію — без спаму, лише суть

Без спаму · Відписатись будь-коли

Telegram