AI-agendi täpsust ei saa hinnata viie ilusa demo ega ühe üldise protsendiga. Enne päris töö andmist tuleb luua kontrollvastustega testikomplekt, jagada vead mõju järgi klassidesse ja mõõta tulemust koos inimese kontrolliajaga.

Demo näitab võimalust. Test näitab, kas sellele saab töö anda.

Alusta ühest konkreetsest väljundist

„Kas agent saab päringust aru?” ei ole mõõdetav küsimus. „Kas agent täidab 14 kokkulepitud välja ja märgib puuduvad väärtused?” on.

Testi objekt võib olla näiteks:

  • pakkumise eeltöö tabel;
  • joonise kirjanurga väljad;
  • materjaliloendi mustand;
  • tarnijapäringu read;
  • kahe revisjoni erinevuste nimekiri;
  • kliendikirja klassifikatsioon ja järgmine tegevus.

Mida täpsem väljund, seda selgem on otsus, kas lahendus töötab.

Loo kuldstandard

Kuldstandard on testnäidete kogum, mille õiged vastused on spetsialist kinnitanud. Agent ei tohi neid vastuseid testi ajal näha.

Hea kuldstandard sisaldab nii tavalisi kui ebamugavaid juhtumeid:

  • puhtad ja halvasti vormistatud failid;
  • eri klientide dokumendipõhjad;
  • puuduva infoga päringud;
  • vastuolulised väärtused;
  • duplikaadid;
  • erandlikud tooted;
  • valed või aegunud revisjonid.

Kui testis on ainult ideaalne sisend, mõõdetakse demo ettevalmistamise oskust, mitte töökindlust.

Esimeseks sisuliseks testiks võib piisata 20–30 näitest. Tootmiskindluse hindamiseks tuleb testikomplekti hiljem laiendada ning lisada uued veajuhtumid. 14-päevase piloodi kaks või kolm näidisprojekti sobivad prototüübi ehitamiseks, kuid mitte veel usaldusväärse täpsuse tõestamiseks.

Kõik väljad ei ole võrdsed

Oletame, et agent täidab 100 väljast 95 õigesti. Täpsus on 95%. See number võib olla suurepärane või täiesti vastuvõetamatu.

Kui viis viga puudutavad kontaktisiku nime või sisemist märkust, võib mustand olla kasutatav. Kui need puudutavad kogust, materjali, hinda või tolerantsi, ei ole tulemus valmis.

Jaga väljad vähemalt kolme riskiklassi:

Kriitiline. Vale väärtus võib põhjustada rahalise kahju, praagi, lepingu rikkumise või ohutusriski.

Oluline. Viga tekitab lisatööd, viivituse või vale suhtluse, kuid on enne tagajärge lihtsalt parandatav.

Abistav. Viga vähendab mugavust, kuid ei muuda otsust.

Vastuvõtukriteerium võib olla näiteks selline: kriitilistes väljades ei jää ükski viga tuvastamata, olulistes väljades on täpsus vähemalt 95% ja kõik puuduva infoga juhtumid märgitakse nähtavalt. Riskipõhiseid kontrollpunkte käsitleb lähemalt artikkel sellest, mis saab siis, kui AI-agent eksib.

Mõõda ka puuduva info äratundmist

Generatiivse AI suur risk ei ole ainult vale väärtus. Veel ohtlikum on usutav vastus olukorras, kus sisend ei sisalda vastust.

Seetõttu peab test sisaldama tahtlikult puuduvaid välju. Mõõda eraldi:

  • mitu puuduvat väärtust agent õigesti märkas;
  • mitu olemasolevat väärtust ta ekslikult puuduvaks pidas;
  • mitu korda ta täitis puuduva välja oletusega.

Kriitilise välja täitmine oletusega peab olema tehnilise kontrolliga blokeeritud.

Täpsus ilma algallikata on kallis kontrollida

Iga olulise väärtuse juures peaks agent näitama, kust see tuli: fail, lehekülg, tabelirida või registrikirje. See ei tee väärtust automaatselt õigeks, kuid vähendab kontrolliaega.

Testi ajal mõõda kahte aega:

  1. kui kaua kulus inimesel töö tegemiseks ilma agendita;
  2. kui kaua kulus agendi tulemuse kontrollimiseks ja parandamiseks.

Kui agent koostab tabeli viie minutiga, kuid kontroll võtab sama kaua kui käsitöö, pole ärilist võitu tekkinud.

Kasuta veamaatriksit

Iga vea kohta salvesta vähemalt:

  • näite tunnus;
  • väli või tegevus;
  • oodatud tulemus;
  • agendi tulemus;
  • vea klass;
  • võimalik mõju;
  • algpõhjus;
  • parandus;
  • uue testi tulemus.

Algpõhjus võib olla halb fail, ebaselge reegel, vale registrivaste, mudeli eksimus, integratsiooniviga või kasutaja sisend. Kui kõik vead sildistatakse „AI hallutsinatsiooniks”, parandatakse sageli vale asja.

Testi parandusi regressiooniga

Kui üks viga parandatakse, tuleb kogu oluline testikomplekt uuesti läbi lasta. Seda nimetatakse regressioonitestiks.

Näiteks lisatakse reegel, et RAL-kood peab olema neljakohaline. See võib parandada ühe juhtumi, kuid tekitada probleemi teises dokumendis, kus kood on kirjutatud koos kirjeldusega. Ühe näite edukas parandamine ei tõesta süsteemi üldist paranemist.

Testikomplekt kasvab aja jooksul. Iga päris töös avastatud oluline viga lisatakse tulevaste versioonide kohustuslikku kontrolli.

Pane vastuvõtukriteerium paika enne tulemust

Kui kriteerium otsustatakse pärast demo nägemist, tekib kiusatus kohandada latt saadud tulemuse järgi.

Enne testi lepi kokku:

  • milliseid välju hinnatakse;
  • millised vead on kriitilised;
  • milline täpsus on nõutud;
  • kui pikk võib olla kontrolliaeg;
  • millal agent peab peatuma;
  • milline tulemus tähendab „edasi”, „paranda” või „lõpeta”.

NIST-i AI riskijuhtimise raamistik soovitab valida mõõdikud olulisemate riskide järgi ning testida süsteemi enne kasutuselevõttu ja regulaarselt töötamise ajal. See on parem põhimõte kui üks universaalne täpsusnumber. Sama küsimuse peaks läbi rääkima ka AI-partneri valimisel.

Täpsus muutub pärast kasutuselevõttu

Isegi kui test läheb hästi, võivad muutuda kliendi dokumendipõhi, ERP-i väljad, hinnastamisreeglid või kasutatav mudel. Seetõttu vajab agent pidevat valimit päris töö tulemustest.

Praktiline lahendus on näiteks:

  • kontrollida alguses kõiki tulemusi;
  • pärast stabiilset perioodi kontrollida automaatselt kriitilisi välju ja juhuvalimit tavaväljadest;
  • käivitada täielik regressioonitest iga olulise reegli-, integratsiooni- või mudelimuudatuse järel;
  • jälgida kontrolliaega, mitte ainult täpsust.

AI-agent ei saa valmis päeval, mil esimene versioon tööle hakkab. Ta saab usaldusväärseks siis, kui mõõtmine muutub töövoo osaks.

Korduma kippuvad küsimused

Milline AI täpsus on piisav?

See sõltub vea mõjust. Kriitilistes väljades ei tohi ükski viga jääda tuvastamata; abistavas tekstis võib madalam täpsus olla aktsepteeritav. Üks protsent ei sobi kõigile väljadele.

Kui palju testnäiteid on vaja?

Esimene 20–30 näitega test paljastab põhilised probleemid. Kindla ärilise otsuse jaoks peab komplekt esindama päris töö mitmekesisust ja kasvama uute eranditega.

Kas inimese kontroll tähendab, et täpsust ei pea mõõtma?

Peab küll. Vastasel juhul ei tea ettevõte, kui suur on kontrollikoormus, millised vead inimesele jäävad ja kas süsteem aja jooksul paraneb või halveneb.

Kas testimiseks võib kasutada kliendi faile?

Jah, kui ettevõttel on failide kasutamiseks õigus, keskkond on turvaline ja andmekäitlus selge. Võimalusel kasuta anonümiseeritud ajaloolisi näiteid.

Kui sul on agent või prototüüp, mis „tundub päris hea”, kuid puudub mõõdetud tõend, räägime 30 minutit. Paneme paika testikomplekti, veaklassid ja vastuvõtukriteeriumi.

Allikad