- Mulighet til å integrere tilpassede klemmende ansikt-modeller som ikke er i det offisielle Ollama-registeret.
- Fleksibilitet til å velge forskjellige kvantiseringsnivåer avhengig av tilgjengelig VRAM-minne.
- Avansert støtte for lasting av fragmenterte GGUF-modeller på tvers av flere filer.
- Mulighet til å kjøre private modeller ved å konfigurere SSH-nøkler.
Hvis du liker å tukle med kunstig intelligens, har du sannsynligvis lagt merke til at Ollamas offisielle katalog noen ganger kommer til kort, og du trenger en veldig spesifikk modell som bare er tilgjengelig i GGUF-format. Heldigvis, Ollama lar deg importere disse filene manuelt, noe som åpner døren for at du kan bruke enhver kvantisering du finner der ute, spesielt de som Hugging Face-fellesskapet laster opp.
For nybegynnere kan prosessen virke litt skremmende fordi dokumentasjonen noen ganger ikke forklarer trinnene tydelig nok. Men når du først forstår det, koker det ned til å lage en konfigurasjonsfil kalt ModelfileProsessen blir en barnemat, og du kan ha din tilpassede AI oppe og går på få minutter.
Last ned og klargjør modellen

Det første du må gjøre er å gå til Hugging Face og søke etter modellen du er interessert i. Du vil se at det finnes mange kvantiserte versjoner, som for eksempel Q4_K_M, Q5_K_M eller Q8_0Ikke bekymre deg for mye om navnene; i bunn og grunn, jo lavere tallet er, desto mindre RAM eller VRAM vil modellen bruke, selv om den vil miste litt nøyaktighet. Velg den som passer best til maskinvaren din og last ned .gguf-filen.
Når du har filen på datamaskinen din, anbefaler jeg plasser den i en fast mappe Og sørg for at filnavnet ikke inneholder mellomrom eller spesialtegn. Hvis navnet er en tull, endre det til noe enkelt for å unngå feil når du skriver stier i terminalen.
Hvis du er en Windows-bruker, kan du la filen ligge i Nedlastinger-mappen, men sørg for å kjenner den nøyaktige ruten (for eksempel C:\Brukere\DittNavn\Nedlastinger\modell.gguf), siden det vil være nøkkelen Ollama trenger for å finne modellen.
Opprette modellfilen og registrere den i Ollama
Det er her magien skjer. Du må opprette en ren tekstfil. Du kan åpne Notisblokk og skrive en enkelt linje: fra «C:\sti\til\fil\modell.gguf»Det er viktig at stien er riktig og omsluttet av anførselstegn hvis det er mellomrom. Når den er skrevet, lagrer du filen med navnet Modellfil (uten .txt på slutten), men hvis du har problemer med å fjerne filtypen, kan du lagre den som Modelfile.txt og deretter gi den nytt navn manuelt i mappen.
Nå er det på tide å gjøre noe med konsollen. Åpne CMD eller din favorittterminal og kjør kommandoen. ollama opprett ditt-modellnavn -f ModellfilPå dette tidspunktet vil Ollama lese instruksjonene, behandle GGUF-filen og opprette et nytt lag på ditt lokale system. Alt som gjenstår er å vente på at prosessen er ferdig og at du ser suksessmeldingen.
Hvis du er nysgjerrig på hvordan de offisielle modellene er konfigurert, kan du bruke kommandoen olivama show – modellfil llama3.2Dette lar deg se hvordan systemprompten og malene er organisert, noe som er veldig nyttig hvis du vil tilpass AI-ens oppførsel utover å bare importere filen.
Avanserte metoder og automatisering
For de som ønsker å jobbe raskere, er det mulig å kjøre modeller direkte fra Hugging Face uten å opprette en manuell modellfil. Hvis modellen er offentlig, kan du bruke syntaksen rocama run hf.co/user/repositorySom standard vil Ollama prøve å bruke Q4_K_M-kvantisering, men hvis du ønsker en annen, kan du velge den fra GGUF-visningsprogrammet på Hugging Face-nettstedet og kopiere den genererte kodebiten.
I tilfelle du jobber med private modellerProsessen krever et ekstra sikkerhetstrinn. Du må kopiere Ollama SSH-nøkkelen din (vanligvis plassert i ~/.ollama/id_ed25519.pub) og legge den til i Hugging Face-kontoinnstillingene dine. Når du har gjort dette, vil du kunne få tilgang til dine private arkiver direkte fra terminalen uten problemer.
Et annet vanlig problem oppstår når modellen er så stor at den er delt inn i flere GGUF-filerDette pleide å være et hodebry, men nå støtter `create`-kommandoen import av flere filer. Du trenger bare å liste opp alle `.gguf`-filene i `Modelfile` eller sende dem inn i `create`-kommandoen for at Ollama skal kunne koble dem sammen riktig.
Ytelses- og tilpasningsinnstillinger
Det er ikke nok at modellen lastes inn; vi vil at den skal reagere riktig. Hvis du merker at AI-en oppfører seg merkelig, må du sannsynligvis justere chatmalOllama prøver å oppdage den automatisk fra GGUF-filens metadata, men hvis det mislykkes, kan du opprette en fil kalt "mal" i depotet ditt eller definere den i modellfilen ved hjelp av Gos malformat.
Du kan også optimalisere opplevelsen ved å opprette en fil kalt «params» i JSON-format for å juster samplingsparametrenesom temperatur eller top_p. Dette er grunnleggende hvis du vil at AI-en skal være mer kreativ, eller tvert imot, mye mer deterministisk og streng i sine svar.
Integrering av eksterne GGUF-filer lar deg omgå begrensningene til det offisielle biblioteket, slik at du kan velge den nøyaktige kvantiseringen for VRAM-en din og tilpasse systemprompten. Enten du oppretter en modellfil manuelt, kjører direkte fra hf.co eller administrerer fragmenterte og private modeller, har Ollama blitt et fleksibelt verktøy for å distribuere enhver LLM lokalt med minimal innsats.
Jeg er en teknologientusiast som har gjort sine "geek"-interesser til et yrke. Jeg har brukt mer enn 10 år av livet mitt på å bruke banebrytende teknologi og fikse med alle slags programmer av ren nysgjerrighet. Nå har jeg spesialisert meg på datateknologi og videospill. Dette er fordi jeg i mer enn 5 år har skrevet for forskjellige nettsteder om teknologi og videospill, og laget artikler som prøver å gi deg den informasjonen du trenger på et språk som er forståelig for alle.
Hvis du har spørsmål, spenner min kunnskap fra alt relatert til Windows-operativsystemet samt Android for mobiltelefoner. Og mitt engasjement er til deg, jeg er alltid villig til å bruke noen minutter og hjelpe deg med å løse eventuelle spørsmål du måtte ha i denne internettverdenen.

