Hur man frågar PDF-filer med Open WebUI och en lokal AI

Senaste uppdatering: 23/07/2026
Författare: Cristian Garcia

  • Implementering av ett privat ekosystem för artificiell intelligens genom att kombinera Open WebUI och Ollama.
  • Använda RAG-tekniken för att interagera med PDF-dokument och lokala filer utan att data lämnar servern.
  • Avancerade anpassningsmöjligheter via Pipelines, Functions och MCP-protokollet för att ansluta externa verktyg.
  • Fleranvändarhantering och åtkomstkontroll, idealisk för företagsmiljöer som kräver regelefterlevnad och integritet.

Hur man frågar PDF-filer med Open WebUI och en lokal AI

¿Hur man frågar PDF-filer med hjälp av Open WebUI och en lokal AI? Tänk dig att ha kraften hos en avancerad assistent som ChatGPT, men att köra helt på din egen dator, utan att behöva förlita dig på månadsabonnemang eller oroa dig för att dina konfidentiella data hamnar på en teknikjättes servrar. Denna möjlighet är nu verklighet tack vare kombinationen av Öppna WebUI och Ollama, en dynamisk duo som låter dig distribuera omfattande språkmodeller (LLM) lokalt och privat, vilket ger oss tillbaka total kontroll över vår information.

Den verkliga magin uppstår när vi slutar behandla AI som ett orakel som bara vet vad det lärt sig i sin träning och istället gör det till en expert på våra egna data. Genom att implementera RAG (Recovery Augmented Generation)Vi kan få AI att "läsa" våra manualer, kontrakt eller tekniska anteckningar i realtid. Det handlar inte om att omskola modellen, vilket skulle vara en långsam och dyr process, utan snarare om att ge den rätt dokument precis innan den svarar, och säkerställa att svaret baseras på relevant information. verkliga och lokala bevis.

Förstå arkitekturen: Open WebUI och Ollama

För att undvika förvirring med begreppen är det viktigt att förstå att vi talar om två olika delar. Ollama är motornDen ansvarar för att ladda ner modellerna (som Llama 3.2 eller DeepSeek), ladda dem till GPU- eller CPU-minnet och hantera den tekniska exekveringen. Å andra sidan, Open WebUI är det synliga ansiktet, ett högkvalitativt webbgränssnitt som låter oss chatta, hantera användare och ladda upp dokument intuitivt.

Importera konversationer från ChatGPT till Open WebUI
Relaterad artikel:
Hur du migrerar dina ChatGPT-chattar till Open WebUI och konfigurerar din egen lokala AI

Kommunikation mellan de två sker via ett HTTP API, vanligtvis på port 11434. Denna separation är viktig eftersom Open WebUI inte bara fungerar för Ollama, utan också kan ansluta till alla backend-enheter som är kompatibla med OpenAI, som Lokal AI med öppet webbgränssnitt eller vLLM. Denna flexibilitet gör det till det föredragna valet för dem som söker ett system robust och utdragbar istället för en enkel skrivbordsapplikation.

Exklusivt innehåll - Klicka här  Hur man arbetar med Amazon

Lokal RAG-konfiguration

Snabb installation och driftsättning

Det enklaste sättet att få igång allting är att använda HamnarbetareOm du redan har Ollama installerat på ditt system, kör helt enkelt ett container-kommando för att starta gränssnittet. En viktig detalj för Linux-användare är att lägga till flaggan host.docker.internal:host-gatewayUtan detta kommer gränssnittsbehållaren inte att kunna "se" Ollama-motorn som körs på värddatorn.

samband mellan Dify och Ollamama
Relaterad artikel:
Hur man kopplar Dify till Ollama för att skapa lokal AI

För de som letar efter något mer stabilt och produktionsorienterat är den ideala lösningen att använda Docker ComposeDetta låter dig definiera namngivna volymer för chatthistoriken och kunskapsbasen. överleva omstarterna eller avbildningsuppdateringar. I Apple Silicon-miljöer rekommenderas det att köra Ollama direkt för att dra nytta av GPU Metal-accelerationmedan Open WebUI kan fortsätta att köras bekvämt i Docker.

Bemästra PDF-frågor med RAG

Ta bort tomma sidor och redigera filer i Stirling PDF

Open WebUI:s inbyggda RAG-system är det som verkligen ger mervärde i vardagen. För att börja bläddra bland filer måste vi gå till avsnittet Arbetsyta och skapa en kunskapssamlingDet är här vi laddar upp våra PDF-filer, Word-filer eller Markdown. Systemet tar hand om att dela upp texten i hanterbara bitar och konvertera dem till numeriska vektorer med hjälp av en inbäddningsmodell. nomic-embed-text det rekommenderade alternativet på grund av dess balans mellan hastighet och precision.

När vi ställer en fråga i chatten söker inte AI:n igenom hela dokumentet efter det exakta ordet, utan utför istället en semantisk sökningLeta reda på de fragment som bäst passar frågans avsikt och sätt in dem i modellens kontext. Det är viktigt att justera fragmentens storlek: om de är för stora mättar vi modellens kontextfönster; om de är för korta, vi tappar tråden av informationen.

Anslut en lokal AI till Google Drive
Relaterad artikel:
Hur man ansluter en lokal AI till Google Drive och din egen lagring

En mycket viktig punkt för IT-proffs är aktiveringen av OCR (Optical Character Recognition)Många företags-PDF:er är faktiskt skannade bilder; utan OCR aktiverat skulle dessa filer hamna i databasen helt tomma. Genom att aktivera det här alternativet säkerställer vi att vilket läsbart dokument som helst vara korrekt indexerade så att assistenten kan citera exakt den sida och det stycke som svaret är hämtat från.

Exklusivt innehåll - Klicka här  Hur skickar man en Word-fil till WhatsApp?

Förbättra systemet: Pipelines, funktioner och MCP

Om vi ​​vill ta lokal AI till nästa nivå erbjuder Open WebUI verktyg som lämnar konkurrenter som LM Studio offlineDen Rörledningar Det här är externa Python-tjänster som låter dig filtrera meddelanden eller omdirigera frågor. Vi kan till exempel skapa ett filter som radera personuppgifter (PII) innan frågan når modellen, vilket lägger till ett extra säkerhetslager.

Dessutom finns det FunktionerDessa är inbäddade Python-skript som lägger till åtgärdsknappar eller förbehandlingssteg. Detta är utöver stöd för... Modellkontextprotokoll (MCP)Detta gör att modellen kan interagera med externa verktyg som GitHub, Slack eller SQL-databaser. I huvudsak omvandlar vi AI från en enkel chattapplikation till en... agent som kan operera i vår arbetsmiljö.

Koppla Flowise till Ollama
Relaterad artikel:
Hur man kopplar Flowise till Ollama: En komplett guide till att skapa lokala LLM:er

Hårdvara och prestandaöverväganden

En superdator är inte nödvändig, men en viss grad av konsekvens är det. Ett grafikkort med 16 GB VRAM Det är den perfekta platsen för att köra medelstora modeller (som de med 7B- eller 8B-parametrar) tillsammans med inbäddningssystemet utan märkbar fördröjning. På Mac är prestandan fantastisk tack vare enhetligt minne, vilket gör att större modeller kan köras. marginellt användbar för dokumentläsningsuppgifter.

Exklusivt innehåll - Klicka här  Windows 95-tricket med snabb omstart som dolde komplex ingenjörskonst

När det gäller förvaring är det viktigt att använda ihållande volymer i Docker. Om vi ​​inte gör detta kommer varje programuppdatering att radera vår kunskapsbas och konversationshistorik. För fleranvändardistributioner i ett företag, ändra den interna databasen från SQLite till PostgreSQL Det kommer att drastiskt förbättra svarshastigheten och samtidigheten.

Säkerhet och driftsättning i verkliga miljöer

När vi driftsätter detta för ett team kommer säkerheten först. Vi bör aldrig exponera port 3000 direkt mot internet. Det klokaste tillvägagångssättet är att använda en omvänd proxy som Caddy eller Nginx för att hantera SSL-certifikat (HTTPS) och säkra den inkommande anslutningen. När administratörskontona har skapats är det absolut nödvändigt inaktivera offentlig loggning av användare i de allmänna inställningarna för att förhindra att alla som hittar URL:en skapar ett konto.

Hur man avgör om en app använder lokal AI eller skickar allt till molnet
Relaterad artikel:
Hur man avgör om en app använder lokal AI eller skickar allt till molnet

För de som behöver total isolering, möjligheten att offline-drift Det är kronjuvelen. Genom att inte vara beroende av något externt API försvinner risken för dataläckor. Vi kan ha en assistent som känner till alla rollback-processer i ett serverkluster eller detaljerna i ett juridiskt kontrakt utan att en enda byte blir stulen. lämna det lokala nätverket av företaget.

Denna arkitektur, baserad på Open WebUI och Ollama, förändrar hur vi interagerar med privat information, vilket gör att AI kan fungera som en ultraeffektiv bibliotekarie som hittar nålen i en höstack med tusentals PDF-filer. Från enkel distribution med Docker till kraften i lokala inbäddningar och utökningsmöjligheterna för pipelines, har vi ett professionellt verktyg som garanterar fullständig integritet och responsivitet baserat på verkliga data, eliminerar de typiska hallucinationerna hos generiska modeller och ger en säker och skalbar arbetsmiljö för alla tekniska team.

Gemma 4 AI
Relaterad artikel:
Gemma 4 AI: Googles nya öppna modell som driver lokal AI på mobiler och datorer