Tekoälyagenttien kyberturvallisuus ennen tuotantoa
Tekoälyagentti on tuotantokelpoinen vasta kun sen ulostulo kulkee koodissa olevan tarkistuksen läpi ennen tallennusta tai julkaisua. Prompt on ohje jota malli noudattaa todennäköisyydellä, ja portti on koodi joka tarkistaa lopputuloksen. Käymme läpi, mitä tekoälyagentin tietoturvassa pitää olla kunnossa ennen kuin päästät agentin asiakasrajapintaan, ja mitä kontrolleja kannattaa vaatia kumppanilta.
Miksi prompt ei ole tekoälyagentin tietoturvakontrolli?
Prompt on ohje eikä kontrolli, koska malli noudattaa sitä todennäköisyydellä ja se elää samassa tekstivirrassa kuin käyttäjän syöte.
Ohjeen voi kirjoittaa kuinka tiukaksi tahansa, mutta se vaikuttaa ennen kuin malli kirjoittaa vastauksen. Kontrolli syntyy vasta silloin kun valmis vastaus tarkistetaan koodilla. Työnjako mallin ja koodin välillä on tässä ratkaiseva. Malli lukee ja luokittelee, koodi mittaa ja päättää.
| Kysymys | Prompt | Portti |
|---|---|---|
| Mikä se on | Ohje mallille | Koodia putkessa |
| Milloin vaikuttaa | Ennen vastausta | Vastauksen jälkeen |
| Kuinka varma | Todennäköinen | Deterministinen |
| Mitä osumasta seuraa | Ei mitään | Ulostulo hylätään |
Mitä porttikerros tekee tekoälyagentin ulostulolle?
Porttikerros on koodissa oleva tarkistus, joka ajetaan agentin ulostulolle ennen kuin ulostulo tallennetaan kantaan tai julkaistaan.
Faktaportti on deterministinen faktatarkistus ennen tallennusta, eli se on koodia eikä toista kielimallia. Se tarkistaa, ettei agentin ulostulo väitä mitään mitä ei ole vahvistettujen faktojen joukossa. Osuma on blokki eikä varoitus, eikä hylättyä ulostuloa tallenneta. Hylätty versio kirjataan auditointilokiin, koska portti joka ei jätä jälkeä hylkäämästään on jälkikäteen todistamaton.
Faktaportti tarkistaa ainakin seuraavat väitetyypit.
- luvut yksiköineen, fysikaaliset yksiköt ja mitat
- sertifikaatit ja standardit
- lait ja direktiivit
- asemaväitteet, joilla yritys asettaa itsensä suhteessa muihin toimijoihin
Kattavuus ratkaisee enemmän kuin tarkkuus yhdessä väitetyypissä. Faktaportin on valvottava kaikkia väitetyyppejä eikä vain lukuja, koska värit, materiaalit, valmistajat, standardit, kyvykkyys- ja prosessiväitteet voi hallusinoida ilman yhtään numeroa.
Miten estät tekoälyagenttia vuotamasta tietoa?
Tekoälyagentti tarvitsee portit kahteen suuntaan, koska uhka tulee sekä sisään tulevasta syötteestä että ulos menevästä vastauksesta.
Sisääntuloportti torjuu syötteet jotka yrittävät kaapata ohjeistuksen. Ulostuloportti estää vastauksen jossa on toteutustason yksityiskohtia kuten tiedostopolkuja, taulunimiä tai avaimia. Kumpikin portti ajetaan putkessa eikä ohjeena mallille, koska portti joka voidaan kiertää putken ohi ei ole portti.
Mittaluokka kannattaa katsoa oikeasta ajosta. Yhden asiakkaan julkisessa chatissa faktaportti esti 43 vastausta kuukaudessa. Luku koskee yhtä agenttia ja yhtä kuukautta, joten älä yleistä sitä omaan käyttötapaukseesi ilman omaa mittausta.
Samasta chatista on toinenkin mittaus, ja se kertoo miksi estoja syntyi. Estoprosentti oli ennen korjausta 10 prosenttia tyypillisillä kysymyksillä, ja syy oli systemaattinen: malli kirjoitti vastaukseen superlatiivin jota lähteen sanamuodossa ei ollut, ja portti hylkäsi vastauksen. Kun ohje korjattiin käyttämään lähteen sanamuotoja, samasta viiden kysymyksen joukosta ei estynyt yhtään vastausta. Esto on siis myös työlista sisällön täydentämiseen, koska se kertoo täsmälleen mitä tietopohjasta puuttuu.
Mitä agentti tekee kun lähteet eriävät?
Agentti pysähtyy eikä anna ehdotusta, koska portit havaitsevat eivätkä valitse.
Tekoälyagentti ei valitse eriävien lähteiden välillä, koska ristiintarkistus ei ratkaise kumpi lähde on oikein vaan kertoo että ne eroavat. Tapaus siirtyy ihmiselle. Portti joka valitsee päätyy ennen pitkää hyväksymään väärän vastauksen, koska valinta etsii aktiivisesti sitä yhdistelmää joka läpäisee ehdon.
Sama sääntö koskee lähteen puuttumista. Ei lähdettä, ei kirjoiteta. Ohut lähde vaatii pakollisen ihmiskatselmuksen ennen julkaisua. Kielimalli saa vain muotoilla lähteessä jo olevaa faktaa, eikä se saa koskaan tuottaa uutta faktaa.
Emme lupaa tälle täydellistä turvallisuutta, ja syy kannattaa sanoa ääneen. Jos portti ei laukea silloin kun sen pitäisi, se on vakavampi vika kuin väärä luku. Väärä luku varoituksen kanssa on käsiteltävissä, väärä luku ilman varoitusta ei ole.
Mitkä kontrollit kestävät tuotannossa?
Kestävä kontrolli ylläpitää itsensä, koska sen rikkoutuessa tuotos näkyvästi huononee ja joku korjaa sen samana päivänä.
Ihmisvalvonta on pakollinen korkean riskin agenteilla, eikä sitä voi ohittaa ajoparametrilla. Ihminen tarkistaa ja hyväksyy sisällön, ja ilman ihmisen hyväksyntää mitään ei julkaista. Faktaportti ja laatuportti ovat eri portteja. Faktaportti ajetaan ensin, koska se on deterministinen, ja laadun arviointi vasta sen jälkeen.
Kun laajennat agentin toimintaa, muista että havaitseminen on halpaa ja käsittely on kallista. Uusi erikoistapaus lisätään ensin havaittavaksi ja vasta erikseen käsiteltäväksi. Agentti, portit, ajoloki ja toimintasäde eivät ole vaatimustenmukaisuuden lisäosia vaan toimintaedellytyksiä, jotka sattuvat täyttämään myös hallinnon vaatimuksia.
Kerromme myös sen, mikä meillä itsellämme petti ensimmäisenä. Se oli faktaportin kattavuus: portti valvoi noin 30 prosenttia väitetyypeistä. Se tunnisti luvut, mitat ja standardit, mutta laadulliset väitteet ilman lukua menivät läpi näkymättöminä, eli värit, materiaalit, valmistajat sekä kyvykkyys- ja prosessiväitteet. Samaan aikaan oli toinen aukko: osa sisällöstä oli kirjoitettu agenttiputken ulkopuolella, joten portti ei ajanut sille lainkaan. Huomasimme tämän vasta kun vertasimme julkaistua sisältöä lähteeseen jälkikäteen, emme kirjoitushetkellä. Siitä seurasi kolme muutosta: laajensimme portin kattavuuden laatuväitteisiin, lisäsimme sisääntuloportin joka kaataa ajon kun aiheelle ei ole yhtään faktalähdettä, ja teimme poikkeama-auditista vakiotarkistuksen, jossa julkaistua sisältöä verrataan lähteeseen jaksoittain eikä vain kirjoitushetkellä. Kysy itseltäsi sama kysymys omasta ympäristöstäsi, koska kattavuusaukko ei näy lokissa ennen kuin joku vertaa tekstiä lähteeseen.
Yhteenveto + CTA
Tekoälyagentin tietoturva ratkeaa koodissa eikä ohjeessa.
Porttikerros ajetaan ulostulolle ennen tallennusta, faktaportin osuma hylkää vastauksen, ja ihminen hyväksyy sisällön ennen julkaisua. Näin rakennamme agentit Frank Growth OS -alustalla. Samat portit ovat mukana myös GEO-sisällöissä, joissa agentti ajaa faktaportin ja laatuportin ennen kuin luonnos etenee, ja näkyvyyttä mitattaessa jokainen hakuintentti tarkistetaan sekä ChatGPT:stä että Google AI Overview -vastauksesta.
Konkreettinen esimerkki siitä miltä pysäytetty vastaus näyttää: sivustochatissa kielimalli tuotti vastaukseen linkin, jonka teksti lupasi eri palvelua kuin mihin osoite vei. Deterministinen tarkistus vertasi vastauksen osoitteita tietopohjaan, poisti lähteettömän linkin ja säilytti muun vastauksen. Faktaportti ei olisi huomannut sitä, koska se tarkistaa luvut ja väitteet mutta ei verkko-osoitteita, joten osoitteille tehtiin oma tarkistus koodiin. Väärään paikkaan vievä linkki on asiakkaalle pahempi kuin puuttuva linkki.
Jos harkitset agenttia asiakasrajapintaan, kerro meille mihin kohtaan putkea se tulisi, niin käymme portit läpi kohta kohdalta. Lisää aiheesta löydät blogistamme https://www.wearefrank.fi/blogi/ ja julkaistusta asiakastyöstämme, esimerkiksi case-sivulta https://www.wearefrank.fi/case/purait/.
Usein kysyttyä
Voiko tekoälyagentti vuotaa yrityksen sisäisiä tietoja?
Voi, jos ulostuloa ei tarkisteta koodilla. Ulostuloportti estää vastauksen jossa on toteutustason yksityiskohtia kuten tiedostopolkuja, taulunimiä tai avaimia. Sisääntuloportti puolestaan torjuu syötteet jotka yrittävät kaapata ohjeistuksen.
Riittääkö kun kirjoitamme promptiin ettei agentti saa keksiä mitään?
Ei riitä. Prompt on ohje jota malli noudattaa todennäköisyydellä, ja portti on koodi joka tarkistaa lopputuloksen. Kontrolli on vasta se tarkistus, joka ajetaan valmiille vastaukselle ennen tallennusta.
Mitä agentti tekee aiheella josta ei ole lähdettä?
Se ei kirjoita. Tekoälyagentti ei kirjoita aiheesta josta ei ole lähdedataa lainkaan, koska silloin sisältö keksitään eikä ulostulossa ole lukuja joihin väiteportti tarttuisi. Ohut lähde vaatii pakollisen ihmiskatselmuksen ennen julkaisua.
Voiko ihmisen hyväksynnän ohittaa kiireessä?
Ei voi. Ihmisvalvonta on pakollinen korkean riskin agenteilla, eikä sitä voi ohittaa ajoparametrilla. Ilman ihmisen hyväksyntää mitään ei julkaista.
Miten todistamme jälkikäteen että portti toimi?
Auditointilokista. Hylätty versio kirjataan auditointilokiin, koska portti joka ei jätä jälkeä hylkäämästään on jälkikäteen todistamaton. Sama loki kertoo myös sen, kuinka monta vastausta portti on estänyt.
Meta-kuvaus: Tekoälyagentin tietoturva ratkeaa koodissa eikä promptissa. Näin porttikerros estää tietovuodot ja hallusinaatiot ennen kuin agentti päästetään tuotantoon.
Haluatko tietää, miten yrityksesi näkyy tekoälyhauissa?
Tilaa ilmainen AI-näkyvyysraportti ja selvitä, löytävätkö ChatGPT, Copilot ja Google AI Overview yrityksesi.
Tilaa ilmainen raportti