- Implementering av lokale RAG-systemer for å samhandle med private dokumenter uten å sende data til skyen.
- Fleksibel konfigurasjon av språkmodeller og innebygginger gjennom Ollama-integrasjon.
- Avansert kunnskapshåndtering gjennom uavhengige arbeidsområder med tillatelseskontroll for flere brukere.
AnythingLLM og Ollama lar deg opprette en assistent som konsulterer dine egne dokumenter. bruker modeller som kjører på datamaskinen eller serveren. Ollama håndterer lasting av språkmodellen, mens AnythingLLM sørger for grensesnittet, organiserer filene og henter relevant informasjon ved hjelp av RAG.
Når alle komponenter er konfigurert lokalt, trenger ikke dokumenter og spørringer å sendes til en leverandør av skymodeller. Dette personvernet Det avhenger av at du heller ikke aktiverer nettsøk, eksterne API-er eller andre verktøy. som formidler informasjon utenfor teamet.
Det du trenger før du kobler AnythingLLM til Ollama

Du må ha Ollama installert og kjørende, samt AnythingLLM Desktop eller en Docker-distribuert instans. Desktop er enklere for en enkelt bruker, mens Docker tillater tilgang fra nettleseren og del installasjonen.
Ressursene som kreves avhenger av den valgte modellen, kvantiseringen og kontekstlengden. En liten modell kan kjøre utelukkende på CPU-en, selv om den vil være tregere. Modeller med 7.000 eller 8.000 milliarder parametere krever vanligvis mer minne og gir en bedre opplevelse når Ollama kan bruke en kompatibel GPU.
Det er ikke tilrådelig å sette et minimumskrav til RAM som gjelder for alle tilfeller. Før du laster ned en stor modell, sjekk størrelsen og sørg for at du har nok minne til operativsystemet, AnythingLLM og vektordatabasen.
Last ned en chatmal og en innebyggingsmal
Ollama trenger en modell for å generere svarene Og hvis du også vil bruke den som en innebyggingsleverandør, er det en annen modell som spesialiserer seg på å transformere dokumenter til vektorer.
Du kan laste ned to eksempelmaler ved å bruke:
ollama pull llama3.1:8b
ollama pull nomic-embed-text
Den første modellen brukes til å snakke og skrive svar. nomic-embed-text Den genererer bare innebygde elementer og kan ikke brukes som en chatmal. Du kan sjekke tilgjengelige maler med:
ollama list
Disse navnene er eksempler, ikke krav. Du kan velg en mindre chatmal hvis teamet har begrensede ressurserFor dokumenter som hovedsakelig er på spansk, kan du også være interessert i en flerspråklig innebyggingsmal som er tilgjengelig i Ollama-biblioteket, for eksempel bge-m3.
Innbyggingsmodellen må velges før indeksering av et stort bibliotek. Hvis du endrer den senere, må du behandle dokumentene på nytt for å generere kompatible vektorer.
Slik kobler du AnythingLLM Desktop til Ollama
Åpne AnythingLLM-innstillingene og velg Ollama som språkmodellleverandør.Hvis begge programmene kjører på samme datamaskin, bruker du vanligvis denne adressen:
http://127.0.0.1:11434
AnythingLLM skal vise de nedlastede malene. Velg den du vil bruke til chatten og test den før du legger til dokumentene.
Deretter åpner du innstillingene for innebyggingsleverandøren. Du kan Velg den innebygde modellen AnythingLLM, eller velg Ollama og bruk innebyggingsmodellen. tidligere nedlastet. LanceDB kan beholdes som en lokal vektordatabase hvis du ikke trenger et annet system.
Ikke angi et forhøyet kontekstvindu bare fordi modellen støtter det. Å øke konteksten øker minneforbruket og kan redusere hastigheten på responsene. Start med konfigurasjonen som Ollama oppdager, og endre den bare hvis situasjonen krever det.
Slik kobler du AnythingLLM i Docker med Ollama

Når AnythingLLM kjøres inne i en container, localhost Den peker til selve beholderen, ikke vertsdatamaskinen. I Docker Desktop for Windows eller macOS kan du bruke:
http://host.docker.internal:11434
På Linux er kanskje ikke det navnet automatisk tilgjengelig. Du kan legge til en tilordning når du starter containeren, eller inkludere den i Docker Compose:
extra_hosts:
- "host.docker.internal:host-gateway"
Det kan også være nødvendig Konfigurer Ollama til å lytte på en adresse som er tilgjengelig fra Docker-nettverketIkke eksponer port 11434 direkte til Internett, ettersom Ollamas lokale API ikke er ment å publiseres uten et ekstra lag med beskyttelse.
Hvis Ollama og AnythingLLM kjører som tjenester fra den samme Docker Compose-filen, er det enklere å innlemme dem i et felles privat nettverk og bruke tjenestenavnet, for eksempel:
http://ollama:11434
Etter at du har lagret adressen, må du bekrefte at AnythingLLM kan vise de installerte modellene før du fortsetter.
Legg til dokumenter og konfigurer RAG
Opprett et arbeidsområde og last opp dokumentene du vil konsultere. For å gjøre dem tilgjengelige via RAG, må du legge dem til i arbeidsområdet og begynne å behandle dem. AnythingLLM vil dele teksten inn i fragmenter, generere innebyggingene og lagre dem i vektordatabasen.
Når du stiller et spørsmål, henter systemet noen relaterte fragmenter og innlemmer dem i konteksten som sendes til modellen. Dette reduserer mengden tekst som behandles, men det betyr at modellen Den leser ikke alle dokumenter automatisk i hver konsultasjon.
Hvis et svar utelater relevant informasjon, må du gjennomgå det maksimale antallet hentede fragmenter og likhetsterskelen. En svært restriktiv terskel kan forkaste fragmentet som inneholder svaret. Dokumentasjonen anbefaler å midlertidig prøve det ubegrensede alternativet når RAG ikke finner informasjon som finnes i filene.
Referansene som vises av AnythingLLM hjelper med å identifisere dokumentet som er brukt, men de garanterer ikke at svaret er riktig eller at det nøyaktige sidetallet alltid er angitt. Det anbefales å bekrefte kilden før du bruker resultatet i viktige avgjørelser.
Det løser de vanligste problemene
Hvis AnythingLLM ikke oppdager Ollama, må du først sjekke at tjenesten kjører og at den konfigurerte adressen er tilgjengelig fra samme miljø som AnythingLLM kjører. Du kan også bekrefte det lokale API-et ved å bruke:
curl http://localhost:11434/api/tags
Hvis modellen vises i Ollama, men ikke i AnythingLLM, oppdater modelllisten og sjekk at du har valgt riktig leverandør. I Docker er problemet vanligvis relatert til misbruk av localhost eller med en nettverkskonfigurasjon som hindrer at verten kan nås.
Når svarene er upresise, sjekk innebyggingsmodellen, dokumentspråket, fragmentstørrelsen og likhetsterskelen. En større chattemodell vil ikke fikse dårlig gjenfinning hvis de riktige fragmentene ikke når konteksten.
Bruk av Ollama unngår kostnadene ved å spørre et eksternt API, men det innebærer fortsatt strømforbruk, lagringsplass og vedlikehold av utstyr. Hovedfordelen med denne kombinasjonen er muligheten til å kontrollere hvor dokumenter behandles og tilpasse modellen til tilgjengelige ressurser.
Jeg er en teknologientusiast som har gjort sine "geek"-interesser til et yrke. Jeg har brukt mer enn 10 år av livet mitt på å bruke banebrytende teknologi og fikse med alle slags programmer av ren nysgjerrighet. Nå har jeg spesialisert meg på datateknologi og videospill. Dette er fordi jeg i mer enn 5 år har skrevet for forskjellige nettsteder om teknologi og videospill, og laget artikler som prøver å gi deg den informasjonen du trenger på et språk som er forståelig for alle.
Hvis du har spørsmål, spenner min kunnskap fra alt relatert til Windows-operativsystemet samt Android for mobiltelefoner. Og mitt engasjement er til deg, jeg er alltid villig til å bruke noen minutter og hjelpe deg med å løse eventuelle spørsmål du måtte ha i denne internettverdenen.