RAG: sådan får I AI til at svare ud fra jeres egne data

Kort svar: RAG (retrieval-augmented generation) er en teknik, hvor en AI-model først søger i jeres egne dokumenter og data og derefter skriver svaret ud fra det, den fandt. På den måde kan en virksomhed få ChatGPT-lignende svar om sine egne produkter, priser og procedurer, med henvisning til kilden, uden at træne en ny model. Kvaliteten afhænger mere af jeres data og adgangsstyring end af valget af AI-model.
Hvad er RAG?
RAG er en metode, der giver en sprogmodel adgang til viden uden for dens træningsdata, lige før den svarer. Begrebet blev introduceret i en forskningsartikel fra 2020 af Patrick Lewis og kolleger, der kombinerede en sprogmodel med søgning i en stor tekstsamling. Modellerne gav mere specifikke og faktuelle svar end modeller, der kun byggede på det, de havde lært under træningen (Lewis m.fl., 2020).
Problemet, RAG løser, kender alle, der har brugt ChatGPT: modellen ved ikke noget om jeres virksomhed, og den kan finde på svar, der lyder rigtige, men er forkerte. AWS beskriver RAG som en måde at få modellen til at slå op i en autoritativ vidensbase uden for træningsdata, før den svarer, så svarene kan bygge på aktuelle kilder og vise henvisninger, uden at modellen skal trænes om (AWS).
Når virksomheder taler om "ChatGPT til virksomheder" eller "AI på egne data", er det i praksis oftest RAG, de mener.
Sådan virker RAG trin for trin
RAG fungerer i tre trin: indholdet gøres søgbart, de relevante dele hentes, og modellen svarer ud fra dem (AWS).
- Indeksering. Dokumenter, hjemmesider, manualer og databaser deles op i mindre tekststykker. Hvert stykke omsættes til en talrække, en såkaldt embedding, der beskriver betydningen, og gemmes i en vektordatabase.
- Søgning. Når en medarbejder eller kunde stiller et spørgsmål, omsættes det også til en embedding, og systemet finder de tekststykker, der ligner mest i betydning. Mange løsninger kombinerer det med almindelig søgning på ord.
- Svar. De fundne tekststykker sendes sammen med spørgsmålet til sprogmodellen, som formulerer svaret og kan henvise til, hvilke dokumenter det bygger på.
Når et dokument ændres, opdateres indekset, ikke modellen. Det er derfor, RAG egner sig til viden, der ændrer sig, som prislister, produktdata og interne procedurer. OpenAIs filsøgning kombinerer fx semantisk søgning og søgning på nøgleord og angiver, hvilken fil et svar kommer fra (OpenAI).
RAG, finjustering eller almindelig ChatGPT?
RAG er det rigtige valg, når AI skal svare korrekt ud fra jeres egen, skiftende viden. Finjustering er bedre til at lære en model en bestemt stil eller et fast format, og almindelig ChatGPT er nok, når opgaven ikke kræver virksomhedens data.
| Almindelig ChatGPT | RAG | Finjustering | |
|---|---|---|---|
| Kender jeres data | Nej, kun det I indsætter | Ja, henter det ved hvert spørgsmål | Delvist, det der var med i træningen |
| Opdatering | Ikke relevant | Opdatér dokumenterne | Kræver ny træning |
| Kildehenvisninger | Nej | Ja | Nej |
| Adgangsstyring | Ikke relevant | Kan følge brugerens rettigheder | Svær, alt er i modellen |
| Bedst til | Generelle opgaver og tekster | Spørgsmål om jeres viden | Fast stil, format eller fagsprog |
Hvad kan en virksomhed bruge RAG til?
RAG giver mest værdi, hvor medarbejdere eller kunder ofte spørger om noget, der allerede står skrevet et sted. Typiske eksempler:
- Kundeservice. En chatbot på hjemmesiden, der svarer ud fra jeres FAQ, produktblade og leveringsbetingelser. Læs mere om AI-kundeservice.
- Intern vidensbase. Medarbejdere spørger om personalehåndbog, procedurer eller tidligere projekter i stedet for at lede i mapper.
- Salg og tilbud. Sælgere får svar om produkter, priser og tidligere tilbud, og første udkast til nye tilbud.
- Teknisk support. Serviceteknikere slår op i manualer og fejllogs på farten.
- Økonomi og drift. Spørgsmål til data fra regnskabs- eller ordresystemer, fx via en systemintegration.
Tre veje til AI på egne data
Der er tre hovedveje til AI på egne data: den indbyggede løsning i jeres kontorpakke, en færdig chattjeneste med koblinger, eller en RAG-løsning bygget til formålet.
1. Indbygget i Microsoft 365
Microsoft Copilot (tidligere Microsoft 365 Copilot) bruger et semantisk indeks over virksomhedens data i Microsoft 365. Indekset bygges automatisk, og Copilot viser kun indhold, som den enkelte bruger i forvejen har adgang til. Microsoft skriver, at prompts, svar og data fra indekset ikke bruges til at træne de underliggende sprogmodeller, og at indekset for kunder inden for EU Data Boundary gemmes i datacentre i EU eller EFTA (Microsoft Learn). Lever I i Microsoft 365, er det ofte det nemmeste sted at starte.
2. ChatGPT med koblinger
ChatGPTs virksomhedsabonnementer tilbyder koblinger til filtjenester som fx SharePoint og Google Drive, så ChatGPT kan søge i virksomhedens filer og henvise til dem. Hvilke koblinger der følger med, afhænger af abonnementet, så tjek det hos OpenAI. Det er hurtigt at komme i gang med, men I har mindre kontrol over, hvordan dokumenterne bliver opdelt og søgt i.
3. Egen RAG-løsning
Skal AI svare kunder på hjemmesiden, arbejde med data fra flere systemer eller følge særlige regler, bygges en RAG-løsning til formålet. De store platforme tilbyder byggeklodserne. OpenAI har en færdig filsøgning, hvor I uploader filer til en vektordatabase, og modellen selv søger i dem, når den svarer (OpenAI). AWS har tilsvarende tjenester (AWS). En RAG-løsning bliver ofte kombineret med automatisering i et værktøj som n8n, eller udbygget til en AI-agent, der også kan handle på svarene.
Data, adgang og GDPR
Det vigtigste ved AI på egne data er at styre, hvad AI må se, og hvem der må se svarene. Danskerne har taget generativ AI til sig: 68 % af befolkningen brugte generative AI-værktøjer i 2026 (Danmarks Statistik). Det øger risikoen for, at medarbejdere selv kopierer data ind i værktøjer, virksomheden ikke har godkendt. Datatilsynet har set flere brud på persondatasikkerheden, hvor medarbejdere har brugt persondata fra arbejdet i AI-værktøjer, og anbefaler klare retningslinjer og tekniske tiltag (Datatilsynet).
- Adgang: løsningen skal følge de rettigheder, der allerede gælder. En medarbejder, der ikke må se lønsedler, må heller ikke få dem i et AI-svar.
- Databehandleraftale: sørg for en databehandleraftale med leverandøren, og tjek hvor data gemmes og behandles.
- Konsekvensanalyse: Datatilsynet har udgivet en skabelon til konsekvensanalyse ved AI (Datatilsynet).
- Gennemsigtighed: efter AI-forordningen skal en chatbot gøre det tydeligt, at man taler med en AI (Europa-Kommissionen).
Typiske faldgruber
De fleste RAG-projekter, der skuffer, skyldes data og test, ikke modellen.
- Rodede data. Gamle versioner, dubletter og modstridende dokumenter giver modstridende svar. Ryd op, før I indekserer.
- For store eller for små tekststykker. Hvordan dokumenterne deles op, har stor betydning for, om de rigtige afsnit bliver fundet.
- Ingen test. Lav en liste med 30 til 50 rigtige spørgsmål og de korrekte svar, og test løsningen mod den, hver gang noget ændres.
- Ingen kilder i svaret. Vis altid, hvilket dokument svaret bygger på, så brugeren kan tjekke det.
- Ingen ejer af indholdet. Nogen skal have ansvaret for, at dokumenterne er opdaterede, ellers bliver svarene hurtigt forældede.
RAG er ét af flere projekter i en samlet AI strategi.
Ofte stillede spørgsmål
Hvad er RAG?
RAG står for retrieval-augmented generation. Det er en teknik, hvor en AI-model først søger i en vidensbase, fx virksomhedens egne dokumenter, og derefter skriver svaret ud fra det, den fandt. Det giver mere præcise svar med kildehenvisninger uden at træne en ny model.
Hvordan virker RAG?
RAG virker i tre trin. Dokumenterne deles op og gøres søgbare i en vektordatabase. Når nogen stiller et spørgsmål, hentes de mest relevante tekststykker. Til sidst formulerer sprogmodellen svaret ud fra de hentede tekststykker.
Hvad er forskellen på RAG og finjustering?
RAG henter viden fra jeres dokumenter, hver gang der stilles et spørgsmål, så I kan opdatere indholdet uden at træne modellen om. Finjustering ændrer selve modellen og egner sig bedre til at lære den en bestemt stil eller et fast format end til viden, der ændrer sig.
Kan ChatGPT svare ud fra vores egne data?
Ja. ChatGPTs virksomhedsabonnementer kan kobles til filtjenester som fx SharePoint og Google Drive (tjek, hvilke koblinger jeres abonnement giver), og via OpenAIs API kan man bygge en egen RAG-løsning med filsøgning. Microsoft Copilot søger tilsvarende i virksomhedens Microsoft 365-data.
Er RAG lovligt efter GDPR?
RAG kan bruges i overensstemmelse med GDPR, hvis løsningen kun viser data, brugeren har adgang til, hvis der er en databehandleraftale med leverandøren, og hvis der er klare regler for, hvilke persondata der indgår. Datatilsynet har en skabelon til konsekvensanalyse ved AI.
Hvad skal der til for at komme i gang med AI på egne data?
Vælg ét afgrænset område, fx kundeservice eller en intern håndbog, ryd op i dokumenterne, beslut hvem der må se hvad, og lav en liste med rigtige spørgsmål og svar at teste løsningen mod.
Kilder
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, Lewis m.fl., arXiv
- What is RAG (Retrieval-Augmented Generation)?, AWS
- File search, OpenAI
- Semantic indexing for Microsoft Copilot, Microsoft Learn
- Digitalisering, Danmarks Statistik
- Forhold dig til AI-værktøjer, Datatilsynet
- Kunstig intelligens, Datatilsynet
- AI Act, Europa-Kommissionen








