- Inštalácia balíka nvidia-container-toolkit je nevyhnutnou požiadavkou na umožnenie komunikácie medzi Dockerom a grafickým hardvérom.
- Použitie špecifických obrazov kontajnerov s označeniami cublas alebo cuda v závislosti od verzie nainštalovanej v systéme.
- Podrobná konfigurácia súborov YAML na správu presunu vrstiev modelu do VRAM.
Pri nastavovaní vlastného AI servera doma ste si pravdepodobne všimli, že spúšťanie modelov iba s procesorom môže byť kvôli pomalosti poriadnou bolesťou hlavy. Aby ste sa tomu vyhli, je dobré... aktivovať NVIDIA GPU v LocalAI, neuveriteľne všestranný nástroj, ktorý vám umožňuje mať ekosystém kompatibilný s OpenAI, ale pod vašou úplnou kontrolou, čím sa zabráni odosielaniu údajov do externých cloudov a ušetria sa vám náklady na tokeny.
Hoci softvér môže bežať na akomkoľvek kávovare bez potreby špecializovaného hardvéru, využitie... Grafická karta NVIDIA Úplne to mení zážitok. Prechod z pomalej reakcie na takmer okamžitá inferencia Toto je možné, ak správne nakonfigurujeme softvérovú vrstvu, ktorá spája kontajner s jadrami CUDA, čo umožní VRAM vykonávať ťažkú prácu.
Predpoklady a príprava prostredia
Aby všetko fungovalo hladko pri aktivácii grafickej karty NVIDIA v LocalAI, nestačí len zapojiť kartu do základnej dosky. Prvým a najdôležitejším krokom je mať sada nástrojov pre kontajnery nvidia správne nainštalovaný. Bez tohto komponentu je Docker v podstate slepý a nedokáže zistiť, či je k dispozícii GPU, čo by viedlo k tomu, že LocalAI by sa štandardne vrátil k používaniu CPU.
Je nevyhnutné overiť, ktorú verziu CUDA máte nainštalovanú vo svojom operačnom systéme. Zistíte to spustením príkazu nvidia-smi alebo nvcc – verzia vo vašom termináli. Ak používate distribúcie ako OpenSUSE Tumbleweed, budete musieť pridať oficiálne repozitáre NVIDIA a nainštalovať príslušné proprietárne balíky ovládačov a výpočtové nástroje, aby ste zabezpečili stabilitu.
Po nainštalovaní ovládačov sa dôrazne odporúča nakonfigurovať runtime prostredie Docker. Musíte spustiť konfiguráciu sady nástrojov, aby Docker daemon.js Rozpoznajte grafickú kartu (GPU). V niektorých špecifických prípadoch systému Linux môže byť potrebné upraviť konfiguračný súbor runtime prostredia NVIDIA tak, aby sa zakázalo alebo povolilo používanie cgroups v závislosti od používanej verzie jadra.
Nasadenie LocalAI s akceleráciou CUDA
Kľúčom k úspešnému povoleniu grafickej karty NVIDIA v LocalAI je výber správneho obrazu kontajnera. Nie všetky obrazy Lokálna umelá inteligencia Sú rovnaké; ak chcete využiť výhody NVIDIA, mali by ste hľadať tie s označením cublas alebo gpu-nvidia-cudaV závislosti od vášho hardvéru môžete potrebovať verziu pre CUDA 11, 12 alebo dokonca 13.
Ak používate Docker Compose, súbor YAML musí obsahovať časť rezervy zdrojovJe dôležité špecifikovať, že ovládač je od NVIDIA a že funkcie zahŕňajú aj GPU. Ak spustíte kontajner pomocou jednoduchého príkazového riadka, nezabudnite pridať príznak. –všetky gpusyV opačnom prípade systém ignoruje grafickú kartu, aj keď je nainštalovaná.
Pre tých, ktorí hľadajú jednoduchší zážitok, sú tu obrázky. Všetko v jednom (AIO)Tieto verzie už majú predkonfigurovanú podporu CUDA a niektoré modely sú pripravené na testovanie, čo drasticky znižuje počiatočné trenie a umožňuje vám rýchlo potvrdiť, či je akcelerácia aktívna, pozorovaním využitia pamäte v nástrojoch ako nvtop.
Pokročilý model a konfigurácia VRAM
Po spustení servera je ďalším krokom k povoleniu grafického procesora NVIDIA v LocalAI oznámiť modelu presné využitie grafického procesora. Toto sa robí prostredníctvom konfiguračných súborov YAML. Pre modely založené na súbore llama.cpp je kľúčovým parametrom vrstvy_gpuAk zadáme veľké číslo (napríklad 999), systém prinútime načítať všetky možné vrstvy do pamäte karty.
Pri práci s generovaním obrazu pomocou difúzorov sa konfigurácia mierne zmení. Je potrebné aktivovať túto možnosť. cuda: pravda A ak máte to šťastie a vlastníte viacero grafických kariet, môžete si pohrať s tensor_parallel_size a rozdeliť pracovnú záťaž medzi rôzne zariadenia.
Pre dosiahnutie maximálneho výkonu sa odporúča aktivovať túto možnosť f16: pravda v súbore YAML, čo umožňuje použitie strednej presnosti a znižuje spotrebu VRAM bez výraznej straty kvality. Okrem toho, ak je model úplne viazaný na GPU, nastavenie vlákien CPU na 1 zabraňuje konfliktom v riadení procesov, ktoré by mohli spomaliť časy odozvy.
Riešenie bežných problémov a optimalizácia
Je celkom bežné, že systém spočiatku naďalej využíva procesor, a to aj po vykonaní krokov. V takýchto prípadoch je potrebné najprv povoliť premennú prostredia. DEBUG=true analyzovať protokoly. Ak vidíte, že grafická karta nie je detekovaná, skontrolujte, či sada nástrojov nvidia-container-toolkit správne reaguje pomocou základného testovacieho kontajnera Ubuntu.
Ďalším bežným problémom pri aktivácii grafickej karty NVIDIA v LocalAI sú chyby Nedostatok pamäte (OOM)Keď sa VRAM zaplní, inferencia sa zastaví alebo sa stane extrémne pomalou. Ak to chcete vyriešiť, môžete zmenšiť veľkosť kontextu modelu (context_size) alebo použiť kvantizované verzie (ako Q4_K_M), ktoré zaberajú oveľa menej miesta bez toho, aby obetovali príliš veľa inteligencie.
Ak si všimnete nepravidelný výkon, zvážte implementáciu Správa VRAMTáto funkcia umožňuje LocalAI uvoľniť neaktívne modely z grafickej pamäte, aby uvoľnila miesto pre iné, čím sa optimalizuje pracovný postup pri neustálom prepínaní medzi textovým modelom a modelom generovania obrázkov.
Stručne povedané, povolenie grafickej karty NVIDIA v LocalAI vyžaduje koordináciu inštalácie ovládača na hostiteľovi, konfiguráciu sady nástrojov Docker a jemné doladenie parametrov načítavania v súbore YAML každého modelu. Podľa tohto pracovného postupu transformujete konvenčný stroj na výkonnú pracovnú stanicu s lokálnou inferenciou, ktorá dokáže spracovať všetko od zložitých LLM až po generovanie obrázkov s vysokým rozlíšením s prekvapivou efektivitou.
Redaktor špecializovaný na problematiku technológií a internetu s viac ako desaťročnými skúsenosťami v rôznych digitálnych médiách. Pracoval som ako redaktor a tvorca obsahu pre e-commerce, komunikáciu, online marketing a reklamné spoločnosti. Písal som aj na ekonomické, finančné a iné sektorové weby. Moja práca je zároveň mojou vášňou. Teraz prostredníctvom mojich článkov v Tecnobits, snažím sa každý deň preskúmať všetky novinky a nové možnosti, ktoré nám svet technológií ponúka na zlepšenie nášho života.