- Це дозволяє запускати потужні мовні моделі (LLM) локально, гарантуючи повну конфіденційність та роботу без підключення до Інтернету.
- Він сумісний з Windows, macOS та Linux, в першу чергу вимагаючи значної кількості відеопам'яті в графічному процесорі для оптимальної продуктивності.
- Він пропонує широку бібліотеку моделей, що спеціалізуються на загальному чаті, програмуванні та розширеному мисленні, які можна інтегрувати через API або графічні інтерфейси.
Як завантажити та запустити свою першу модель за допомогою Ollama? Уявіть собі потужний штучний мозок, що живе безпосередньо у вашому комп’ютері, без необхідності платити щомісячну підписку чи турбуватися про те, що якась компанія в Каліфорнії читає ваші секрети. Запускати моделі для місцевих мов Це стало напрочуд простим завдяки інструментам, які усувають усі технічні труднощі, дозволяючи нам перейти від нуля до розумного чату за лічені хвилини.
Саме тут і з'являється Ollama, платформа, яка по суті діє як Docker для штучного інтелектуЙого магія полягає в управлінні всім виснажливим процесом: від завантаження моделі та оптимізації пам'яті до виконання, пропонуючи плавний досвід як для програмістів, так і для тих, хто просто хоче спробувати ШІ, не порушуючи нічого на цьому шляху.
Навіщо встановлювати штучний інтелект локально?

Головною причиною, безсумнівно, є абсолютна конфіденційністьКоли ви користуєтеся хмарними сервісами, ваші дані передаються через Інтернет; з Ollama інформація ніколи не залишає ваш комп’ютер, що життєво важливо, якщо ви маєте справу з конфіденційними документами або чутливими даними. Крім того, ви забуваєте про витрати на один токен або щомісячну плату у розмірі 20 євро, оскільки після завантаження моделі її використання є повністю безкоштовним.
Ще однією сильною стороною є здатність працювати без інтернетуВи можете взяти свій ноутбук у літак або поїхати в сільську місцевість і все одно мати помічника, здатного програмувати або писати тексти. Зрештою, гнучкість повна: ви можете створювати нестандартні моделі через файли конфігурації, що називаються Modelfiles, налаштовуючи особистість та поведінку ШІ на ваш смак.
Апаратне забезпечення: Що потрібно, щоб воно не працювало на педалях?
Вам не потрібен суперкомп'ютер, але потрібно реалістично оцінювати свої ресурси. Вузьким місцем завжди буде... відеопам'ять відеокартиЯкщо у вас є графічний процесор NVIDIA або AMD, Ollama скористається його перевагами для миттєвого реагування. Якщо у вас є лише центральний процесор, він працюватиме, але швидкість різко знизиться, від генерації десятків слів за секунду до лише кількох.
- Легкі моделі (1-3B): З 8 ГБ оперативної пам'яті та 4 ГБ відеопам'яті цього буде більш ніж достатньо. Такі моделі, як Gemma 2 2B, ідеально підходять для простих завдань.
- Середні моделі (7-8B): Тут стандартом є 16 ГБ оперативної пам'яті та 8 ГБ відеопам'яті. Це територія Llama 3.1 8B або Mistral, які пропонують Ідеальний баланс між якістю та швидкістю.
- Великі моделі (13-70B+): Тепер ми вступаємо на професійну територію. Для моделі 70B вам знадобиться щонайменше 64 ГБ оперативної пам'яті та відеокарти з 40 ГБ відеопам'яті або більше.
Для тих, хто користується Кремнієвий корпус Apple (M1, M2, M3, M4)Досвід фантастичний завдяки об'єднаній пам'яті, яка дозволяє графічному процесору отримувати доступ до всієї оперативної пам'яті системи.
Покрокове керівництво з встановлення

Встановлення Ollama здійснюється майже одним клацанням миші, залежно від вашої операційної системи:
- У Windows: Завантажте файл .exe з офіційного веб-сайту, встановіть його, і ви побачите значок Ollama в системному треї. Якщо хочете змінити шлях до збереження моделей (оскільки диск C швидко заповнюється), вам потрібно створити змінну середовища під назвою МОДЕЛІ_ПЕЧЕЙ із шляхом до потрібної вам папки.
- На macOS: Просто завантажте файл .dmg та перетягніть програму до папки «Програми».
- У Linux: Це робиться за допомогою одного командного рядка:
curl -fsSL https://ollama.com/install.sh | shЦе автоматично налаштовує службу systemd.
Щоб перевірити, чи все гаразд, відкрийте термінал і введіть ollama --versionЯкщо повертається номер версії, ви в грі.
Ваші перші кроки з моделями
Щоб запустити ШІ, не потрібно нічого складного налаштовувати, просто скористайтеся командою бігти. Наприклад, якщо ви пишете ollama run llama3.1Система автоматично завантажить шаблон і відкриє інтерактивний чат у терміналі. Щоб вийти, просто введіть /bye.
Каталог рекомендованих моделей

Не всі моделі підходять для однієї й тієї ж мети. Залежно від вашої мети, одна чи інша буде більш підходящою:
- Загальне використання: Llama 3.3 70B – це звір для складних міркувань, тоді як Llama 3.1 8B – більш універсальний варіант для щоденного використання.
- Програмування: DeepSeek Coder та Qwen 2.5 Coder – це потужні інструменти для... помилки автозаповнення коду та налагодження безпосередньо у вашому редакторі.
- Розширене мислення: DeepSeek-R1 – ідеальний вибір, якщо вам потрібен штучний інтелект, який покроково обмірковує ситуацію, перш ніж реагувати, наближаючись до можливостей найкращих моделей на ринку.
- Мультимодальність: LLaVA ідеально підходить, якщо вам потрібен штучний інтелект аналізувати зображення та опишіть, що в них міститься.
Виводимо Ollama на новий рівень: інтерфейси та API
Якщо термінал здається вам занадто спартанським, ви можете встановити Відкрити веб-інтерфейс користувачаЦе веб-інтерфейс, який повторює роботу ChatGPT, але підключається до вашої локальної Ollama. Він легко встановлюється за допомогою Docker та дозволяє керувати історіями, завантажувати PDF-файли для запитань (RAG) та перемикатися між моделями одним клацанням миші.
Для розробників Ollama пропонує REST API на порту 11434 який повністю сумісний з OpenAI. Це означає, що ви можете інтегрувати свій локальний ШІ в будь-який застосунок Python або JavaScript, просто змінивши URL-адресу сервера. Існують навіть розширення, такі як Continue.dev для VS Code, які перетворюють Ollama на вашого власного особистого другого пілота.
Поради щодо оптимізації та обслуговування
Для польоту системи рекомендується використовувати квантовані моделі (як Q4_K_M), що зменшує розмір моделі з мінімальною втратою якості. Якщо ви помітили, що в моделі чогось бракує, ви можете розгорнути контекстне вікно за допомогою параметра --num-ctxКрім того, оновлення драйверів NVIDIA є важливим для використання таких технологій, як Блискавична увага, що зменшує споживання пам'яті.
Ollama зробив локальний штучний інтелект доступним, дозволяючи будь-кому з пристойним ПК розгортати все: від помічників програмування до приватних систем аналізу документів. Завдяки простій архітектурі командного рядка, інтеграції з візуальними інтерфейсами, такими як Open WebUI, та сумісності з величезною бібліотекою моделей з відкритим кодом, більше не потрібно покладатися на хмару, щоб використовувати можливості LLM.
Захоплювався технікою з дитинства. Я люблю бути в курсі подій у секторі та, перш за все, повідомляти про це. Ось чому я вже багато років присвячую комунікації на веб-сайтах технологій і відеоігор. Ви можете знайти, як я пишу про Android, Windows, MacOS, iOS, Nintendo або будь-яку іншу пов’язану тему, яка спадає вам на думку.