Mikä on RAG? Tekoäly, joka vastaa yrityksesi omilla tiedoilla

Lyhyesti: RAG (retrieval-augmented generation, suomeksi haulla täydennetty generointi) on tekniikka, jossa tekoäly hakee ensin tietoa yrityksesi omista dokumenteista ja tietolähteistä ja kirjoittaa vastauksensa vasta sen perusteella. Näin tekoäly osaa vastata kysymyksiin tuotteistasi, hinnoistasi tai prosesseistasi ja näyttää lähteen, eikä uutta kielimallia tarvitse kouluttaa. Lopputuloksen laatu riippuu enemmän aineistosi kunnosta ja käyttöoikeuksista kuin siitä, mikä tekoälymalli on käytössä.
Mikä on RAG?
RAG on menetelmä, jolla kielimalli saa juuri ennen vastaamista käyttöönsä tietoa, jota sen koulutusdatassa ei ole. Termi on peräisin Patrick Lewisin ja kumppaneiden vuonna 2020 julkaisemasta tutkimuksesta: kun kielimalli yhdistettiin hakuun laajasta tekstiaineistosta, vastaukset olivat tarkempia ja faktapohjaisempia kuin pelkän opitun tiedon varassa toimivalla mallilla (Lewis ym., 2020).
RAG ratkaisee ongelman, jonka jokainen ChatGPT:tä töissä kokeillut tuntee: malli ei tiedä yrityksestäsi mitään, ja se voi keksiä uskottavan mutta väärän vastauksen. AWS kuvaa RAG:n tavaksi ohjata malli tarkistamaan luotettava tietopohja ennen vastaamista, jotta vastaus perustuu ajantasaisiin lähteisiin ja lähteet voidaan näyttää, ilman mallin uudelleenkoulutusta (AWS).
Kun yrityksessä puhutaan omasta tekoälystä, sisäisestä ChatGPT:stä tai dokumentteihin vastaavasta avustajasta, taustalla on lähes aina RAG.
Miten RAG toimii vaihe vaiheelta
RAG toimii kolmessa vaiheessa: indeksointi, haku ja vastaus (AWS).
- Indeksointi. Dokumentit, ohjeet, verkkosivut ja tietokantojen sisältö pilkotaan lyhyempiin tekstikohtiin. Jokainen kohta muutetaan numerosarjaksi eli upotukseksi (embedding), joka kuvaa tekstin merkitystä, ja tallennetaan vektoritietokantaan.
- Haku. Kun työntekijä tai asiakas kysyy jotain, myös kysymys muutetaan upotukseksi, ja järjestelmä etsii merkitykseltään lähimmät tekstikohdat. Moni ratkaisu yhdistää tämän semanttisen haun tavalliseen avainsanahakuun.
- Vastaus. Löydetyt tekstikohdat lähetetään kielimallille kysymyksen kanssa. Malli kirjoittaa vastauksen ja voi kertoa, mihin dokumentteihin se perustuu.
Kun dokumentti muuttuu, päivitetään indeksi, ei mallia. Siksi RAG sopii tietoon, joka elää: hinnastoihin, tuotetietoihin ja sisäisiin ohjeisiin. Esimerkiksi OpenAI:n tiedostohaku hakee ladatuista tiedostoista sekä semanttisella että avainsanahaulla (OpenAI).
RAG, hienosäätö vai tavallinen ChatGPT?
RAG on oikea valinta, kun tekoälyn pitää vastata oikein muuttuvan, yrityksen oman tiedon perusteella. Hienosäätö (fine-tuning) sopii paremmin tietyn tyylin tai muodon opettamiseen. Tavallinen ChatGPT riittää, kun tehtävä ei vaadi yrityksen dataa.
| Tavallinen ChatGPT | RAG | Hienosäätö | |
|---|---|---|---|
| Tuntee yrityksesi tiedot | Ei, vain sen mitä liität keskusteluun | Kyllä, hakee ne jokaiseen kysymykseen | Osittain, sen mitä koulutusaineistossa oli |
| Päivittäminen | Ei koske | Päivitä dokumentit | Uusi koulutuskierros |
| Näyttää lähteet | Ei | Kyllä | Ei |
| Käyttöoikeudet | Ei koske | Voi noudattaa käyttäjän oikeuksia | Vaikeaa, kaikki on mallissa |
| Sopii parhaiten | Yleisiin tehtäviin ja teksteihin | Kysymyksiin omasta tiedosta | Vakiintuneeseen tyyliin, muotoon tai sanastoon |
RAG:n käyttökohteet yrityksessä
RAG tuo eniten hyötyä siellä, missä työntekijät tai asiakkaat kysyvät usein asioita, joihin vastaus on jo kirjoitettu jonnekin. Tyypillisiä kohteita:
- Asiakaspalvelu. Verkkosivujen chatbot, joka vastaa usein kysyttyjen kysymysten, tuotetietojen ja toimitusehtojen pohjalta.
- Sisäinen tietopankki. Henkilöstö kysyy perehdytysmateriaalista, toimintaohjeista tai aiemmista projekteista sen sijaan, että kaivaisi jaettuja kansioita.
- Myynti ja tarjoukset. Vastaukset tuotteista, ehdoista ja aiemmista tarjouksista sekä luonnokset uusiksi tarjouksiksi.
- Sopimukset ja dokumentit. Kysymykset sopimusarkistolle, esimerkiksi irtisanomisajoista tai hinnantarkistusehdoista.
- Liiketoimintadata. Kysymykset tilauksista, asiakkaista tai laskuista, kun tekoäly kytketään järjestelmiin järjestelmäintegraatiolla, esimerkiksi CRM:ään tai Procountoriin.
Tarve on todellinen. Tilastokeskuksen mukaan 38 % yrityksistä käytti tekoälyteknologioita vuonna 2025. Yleisimpiä olivat kirjoitettua tekstiä analysoivat teknologiat (29 %), ja kirjoitettua tai puhuttua kieltä tai ohjelmakoodia tuottavia teknologioita käytti 20 % yrityksistä (Tilastokeskus).
Kolme tapaa ottaa RAG käyttöön
Päävaihtoehtoja on kolme: toimisto-ohjelmistoon sisäänrakennettu ratkaisu, pilvipalveluiden valmiit rakennuspalikat tai räätälöity RAG, jonka rakentaa kumppani tai oma tiimi.
1. Sisäänrakennettuna Microsoft 365:ssä
Microsoft Copilot käyttää semanttista indeksiä organisaation Microsoft 365 -datasta. Microsoft ottaa indeksoinnin käyttöön automaattisesti, ja Copilot näyttää tuloksia vain sisällöstä, johon käyttäjällä on jo pääsy. Microsoftin mukaan kehotteita, vastauksia ja indeksin kautta käsiteltyä dataa ei käytetä pohjamallien kouluttamiseen, ja EU:n datarajan (EU Data Boundary) piirissä olevien asiakkaiden indeksi tallennetaan EU- tai EFTA-alueen konesaliin (Microsoft Learn). Jos yrityksesi työskentelee jo Microsoft 365:ssä, tämä on usein helpoin lähtökohta.
2. Pilvipalveluiden valmiit palikat
Kun haluat vastata asiakkaille verkkosivuilla tai yhdistää useita järjestelmiä, käytetään suurten palveluntarjoajien valmiita osia. OpenAI tarjoaa valmiin tiedostohaun: lataat tiedostot vektorivarastoon, ja malli hakee niistä itse ennen vastaamista (OpenAI). Selvitä, missä dataa käsitellään, ja tee henkilötietojen käsittelysopimus.
3. Räätälöity RAG ja tekoälyagentin rakentaminen
Räätälöity RAG on perusteltu, kun sanasto on erityistä tai data ei saa lähteä yrityksen omasta ympäristöstä. Se kytketään usein automaatiotyökaluun, kuten n8n:ään. Kun tekoälyn pitää myös toimia vastausten perusteella, esimerkiksi luoda tiketti tai päivittää asiakastieto, puhutaan jo tekoälyagentin rakentamisesta: n8n:n agenttisolmu yhdistää kielimallin ja työkalut, ja agentti valitsee itse, mitä työkalua käyttää (n8n Docs). Lue lisää palvelustamme tekoälyagentti yritykselle.
Kustannukset riippuvat enemmän aineiston määrästä ja kunnosta, integraatioista ja ylläpidosta kuin itse mallista. Yhteen käyttötapaukseen rajattu pilotti on yleensä huomattavasti kevyempi kuin koko yrityksen tietopankki.
RAG, tietosuoja ja EU:n tekoälysäädös
Tärkeintä on hallita, mitä tekoäly näkee ja kuka voi lukea sen vastaukset. Jos tietopohjassa on henkilötietoja, yrityksesi on niiden käsittelyssä rekisterinpitäjä, ja GDPR:n vaatimukset koskevat myös tekoälyn kautta tapahtuvaa käsittelyä. Suomessa valvova viranomainen on tietosuojavaltuutettu.
Euroopan tietosuojaneuvosto EDPB on koonnut tekoälyä ja henkilötietoja koskevat linjauksensa samalle sivulle, ja ne kannattaa käydä läpi ennen kuin tietopohjaan lisätään henkilötietoja (EDPB).
- Käyttöoikeudet: ratkaisun pitää noudattaa nykyisiä oikeuksia. Työntekijä, joka ei näe palkkatietoja, ei saa niitä myöskään tekoälyn vastauksesta.
- Käsittelysopimus: sopimus palveluntarjoajan kanssa, tiedossa oleva käsittelypaikka ja hallitut siirrot EU:n ulkopuolelle.
- Läpinäkyvyys: EU:n tekoälysäädöksen mukaan ihmisille on kerrottava, kun he ovat vuorovaikutuksessa koneen kanssa, esimerkiksi chatbotin. Säädöksen avoimuussäännöt tulevat voimaan elokuussa 2026 (Euroopan komissio).
- Ohjeistus: kirjaa, mihin tekoälyä saa käyttää ja millä aineistolla. Tilastokeskuksen mukaan vain 15 % yrityksistä oli dokumentoinut tekoälyn käyttöön liittyviä ohjeita tai toimintatapoja (Tilastokeskus).
Yleisimmät sudenkuopat
Useimmat pettymykseen päättyvät RAG-hankkeet kaatuvat aineistoon ja testaukseen, eivät malliin.
- Sotkuinen aineisto. Vanhat versiot, kaksoiskappaleet ja ristiriitaiset dokumentit tuottavat ristiriitaisia vastauksia. Siivoa ennen indeksointia.
- Liian pitkät tai lyhyet tekstikohdat. Se, miten dokumentit pilkotaan, ratkaisee pitkälti, löytyvätkö oikeat kohdat.
- Taulukot ja luvut. Hinnastot ja taulukot kannattaa testata erikseen, koska ne pilkkoutuvat helposti huonosti.
- Ei testijoukkoa. Kokoa 30–50 todellista kysymystä oikeine vastauksineen ja testaa ratkaisu aina muutosten jälkeen.
- Lähdettä ei näytetä. Näytä aina alkuperäinen dokumentti, jotta käyttäjä voi tarkistaa vastauksen.
- Kukaan ei omista sisältöä. Ilman nimettyä vastuuhenkilöä vastaukset vanhenevat nopeasti.
Sama periaate pätee myös toisinpäin: kun haluat, että ulkoiset tekoälypalvelut löytävät yrityksesi, lue miten tekoäly valitsee yritykset ja tutustu tekoälynäkyvyyteen.
Usein kysytyt kysymykset
Mikä on RAG?
RAG (retrieval-augmented generation) on tekniikka, jossa tekoäly hakee ensin tietoa tietopohjasta, esimerkiksi yrityksen dokumenteista, ja kirjoittaa vastauksen löytämänsä perusteella. Vastaukset ovat tarkempia ja lähteellisiä, eikä uutta mallia tarvitse kouluttaa.
Miten RAG toimii?
RAG toimii kolmessa vaiheessa. Dokumentit pilkotaan ja indeksoidaan vektoritietokantaan, jokaiseen kysymykseen haetaan osuvimmat tekstikohdat, ja kielimalli kirjoittaa niiden pohjalta vastauksen, jossa se voi mainita lähteet.
Mitä eroa on RAG:llä ja hienosäädöllä?
RAG hakee tiedon dokumenteistasi jokaisen kysymyksen kohdalla, joten riittää, että päivität dokumentit. Hienosäätö muuttaa itse mallia ja sopii paremmin tyylin tai muodon opettamiseen kuin muuttuvaan tietoon.
Voiko RAG-tekoälyä käyttää GDPR:n mukaisesti?
Voi, kun käyttö rajataan huolella. Jos tietopohjassa on henkilötietoja, yritys on rekisterinpitäjä. Tarvitaan nykyisiä oikeuksia noudattavat käyttöoikeudet, käsittelysopimus palveluntarjoajan kanssa ja kirjatut ohjeet tekoälyn käytöstä.
Mitä tekoälyagentin rakentaminen tarkoittaa RAG:n yhteydessä?
RAG vastaa kysymyksiin omasta aineistosta. Tekoälyagentti menee pidemmälle: se käyttää työkaluja, kuten CRM:ää tai tikettijärjestelmää, ja tekee toimenpiteitä vastausten perusteella. Agentin tietopohjana käytetään usein RAG:ia.
Miten RAG-hanke kannattaa aloittaa?
Valitse rajattu käyttötapaus, esimerkiksi asiakaspalvelu tai sisäinen ohjekirja, siivoa aineisto, päätä kuka saa nähdä mitä ja kokoa lista todellisista kysymyksistä ja oikeista vastauksista testausta varten ennen kuin avaat ratkaisun käyttäjille.
Lähteet
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, Lewis ym., arXiv
- What is RAG (Retrieval-Augmented Generation)?, AWS
- File search, OpenAI
- Semantic indexing for Microsoft Copilot, Microsoft Learn
- Tekoälyteknologioita käytti 38 % yrityksistä vuonna 2025, Tilastokeskus
- Tekoälysäädös, Euroopan komissio
- Tekoäly, Euroopan tietosuojaneuvosto (EDPB)
- AI Agent node, n8n Docs








