- Implementering av ett privat ekosystem för artificiell intelligens genom att kombinera Open WebUI och Ollama.
- Använda RAG-tekniken för att interagera med PDF-dokument och lokala filer utan att data lämnar servern.
- Avancerade anpassningsmöjligheter via Pipelines, Functions och MCP-protokollet för att ansluta externa verktyg.
- Fleranvändarhantering och åtkomstkontroll, idealisk för företagsmiljöer som kräver regelefterlevnad och integritet.
¿Hur man frågar PDF-filer med hjälp av Open WebUI och en lokal AI? Tänk dig att ha kraften hos en avancerad assistent som ChatGPT, men att köra helt på din egen dator, utan att behöva förlita dig på månadsabonnemang eller oroa dig för att dina konfidentiella data hamnar på en teknikjättes servrar. Denna möjlighet är nu verklighet tack vare kombinationen av Öppna WebUI och Ollama, en dynamisk duo som låter dig distribuera omfattande språkmodeller (LLM) lokalt och privat, vilket ger oss tillbaka total kontroll över vår information.
Den verkliga magin uppstår när vi slutar behandla AI som ett orakel som bara vet vad det lärt sig i sin träning och istället gör det till en expert på våra egna data. Genom att implementera RAG (Recovery Augmented Generation)Vi kan få AI att "läsa" våra manualer, kontrakt eller tekniska anteckningar i realtid. Det handlar inte om att omskola modellen, vilket skulle vara en långsam och dyr process, utan snarare om att ge den rätt dokument precis innan den svarar, och säkerställa att svaret baseras på relevant information. verkliga och lokala bevis.
Förstå arkitekturen: Open WebUI och Ollama
För att undvika förvirring med begreppen är det viktigt att förstå att vi talar om två olika delar. Ollama är motornDen ansvarar för att ladda ner modellerna (som Llama 3.2 eller DeepSeek), ladda dem till GPU- eller CPU-minnet och hantera den tekniska exekveringen. Å andra sidan, Open WebUI är det synliga ansiktet, ett högkvalitativt webbgränssnitt som låter oss chatta, hantera användare och ladda upp dokument intuitivt.
Kommunikation mellan de två sker via ett HTTP API, vanligtvis på port 11434. Denna separation är viktig eftersom Open WebUI inte bara fungerar för Ollama, utan också kan ansluta till alla backend-enheter som är kompatibla med OpenAI, som Lokal AI med öppet webbgränssnitt eller vLLM. Denna flexibilitet gör det till det föredragna valet för dem som söker ett system robust och utdragbar istället för en enkel skrivbordsapplikation.

Snabb installation och driftsättning
Det enklaste sättet att få igång allting är att använda HamnarbetareOm du redan har Ollama installerat på ditt system, kör helt enkelt ett container-kommando för att starta gränssnittet. En viktig detalj för Linux-användare är att lägga till flaggan host.docker.internal:host-gatewayUtan detta kommer gränssnittsbehållaren inte att kunna "se" Ollama-motorn som körs på värddatorn.
För de som letar efter något mer stabilt och produktionsorienterat är den ideala lösningen att använda Docker ComposeDetta låter dig definiera namngivna volymer för chatthistoriken och kunskapsbasen. överleva omstarterna eller avbildningsuppdateringar. I Apple Silicon-miljöer rekommenderas det att köra Ollama direkt för att dra nytta av GPU Metal-accelerationmedan Open WebUI kan fortsätta att köras bekvämt i Docker.
Bemästra PDF-frågor med RAG

Open WebUI:s inbyggda RAG-system är det som verkligen ger mervärde i vardagen. För att börja bläddra bland filer måste vi gå till avsnittet Arbetsyta och skapa en kunskapssamlingDet är här vi laddar upp våra PDF-filer, Word-filer eller Markdown. Systemet tar hand om att dela upp texten i hanterbara bitar och konvertera dem till numeriska vektorer med hjälp av en inbäddningsmodell. nomic-embed-text det rekommenderade alternativet på grund av dess balans mellan hastighet och precision.
När vi ställer en fråga i chatten söker inte AI:n igenom hela dokumentet efter det exakta ordet, utan utför istället en semantisk sökningLeta reda på de fragment som bäst passar frågans avsikt och sätt in dem i modellens kontext. Det är viktigt att justera fragmentens storlek: om de är för stora mättar vi modellens kontextfönster; om de är för korta, vi tappar tråden av informationen.
En mycket viktig punkt för IT-proffs är aktiveringen av OCR (Optical Character Recognition)Många företags-PDF:er är faktiskt skannade bilder; utan OCR aktiverat skulle dessa filer hamna i databasen helt tomma. Genom att aktivera det här alternativet säkerställer vi att vilket läsbart dokument som helst vara korrekt indexerade så att assistenten kan citera exakt den sida och det stycke som svaret är hämtat från.
Förbättra systemet: Pipelines, funktioner och MCP
Om vi vill ta lokal AI till nästa nivå erbjuder Open WebUI verktyg som lämnar konkurrenter som LM Studio offlineDen Rörledningar Det här är externa Python-tjänster som låter dig filtrera meddelanden eller omdirigera frågor. Vi kan till exempel skapa ett filter som radera personuppgifter (PII) innan frågan når modellen, vilket lägger till ett extra säkerhetslager.
Dessutom finns det FunktionerDessa är inbäddade Python-skript som lägger till åtgärdsknappar eller förbehandlingssteg. Detta är utöver stöd för... Modellkontextprotokoll (MCP)Detta gör att modellen kan interagera med externa verktyg som GitHub, Slack eller SQL-databaser. I huvudsak omvandlar vi AI från en enkel chattapplikation till en... agent som kan operera i vår arbetsmiljö.
Hårdvara och prestandaöverväganden
En superdator är inte nödvändig, men en viss grad av konsekvens är det. Ett grafikkort med 16 GB VRAM Det är den perfekta platsen för att köra medelstora modeller (som de med 7B- eller 8B-parametrar) tillsammans med inbäddningssystemet utan märkbar fördröjning. På Mac är prestandan fantastisk tack vare enhetligt minne, vilket gör att större modeller kan köras. marginellt användbar för dokumentläsningsuppgifter.
När det gäller förvaring är det viktigt att använda ihållande volymer i Docker. Om vi inte gör detta kommer varje programuppdatering att radera vår kunskapsbas och konversationshistorik. För fleranvändardistributioner i ett företag, ändra den interna databasen från SQLite till PostgreSQL Det kommer att drastiskt förbättra svarshastigheten och samtidigheten.
Säkerhet och driftsättning i verkliga miljöer
När vi driftsätter detta för ett team kommer säkerheten först. Vi bör aldrig exponera port 3000 direkt mot internet. Det klokaste tillvägagångssättet är att använda en omvänd proxy som Caddy eller Nginx för att hantera SSL-certifikat (HTTPS) och säkra den inkommande anslutningen. När administratörskontona har skapats är det absolut nödvändigt inaktivera offentlig loggning av användare i de allmänna inställningarna för att förhindra att alla som hittar URL:en skapar ett konto.
För de som behöver total isolering, möjligheten att offline-drift Det är kronjuvelen. Genom att inte vara beroende av något externt API försvinner risken för dataläckor. Vi kan ha en assistent som känner till alla rollback-processer i ett serverkluster eller detaljerna i ett juridiskt kontrakt utan att en enda byte blir stulen. lämna det lokala nätverket av företaget.
Denna arkitektur, baserad på Open WebUI och Ollama, förändrar hur vi interagerar med privat information, vilket gör att AI kan fungera som en ultraeffektiv bibliotekarie som hittar nålen i en höstack med tusentals PDF-filer. Från enkel distribution med Docker till kraften i lokala inbäddningar och utökningsmöjligheterna för pipelines, har vi ett professionellt verktyg som garanterar fullständig integritet och responsivitet baserat på verkliga data, eliminerar de typiska hallucinationerna hos generiska modeller och ger en säker och skalbar arbetsmiljö för alla tekniska team.
Brinner för teknik sedan han var liten. Jag älskar att vara uppdaterad inom branschen och framför allt kommunicera den. Det är därför jag har varit dedikerad till kommunikation på teknik- och videospelswebbplatser i många år nu. Du kan hitta mig som skriver om Android, Windows, MacOS, iOS, Nintendo eller något annat relaterat ämne som du tänker på.
