Hoe test je een AI-workflow? Van nulmeting tot go/no-go
Een demo bekijken is geen test. Leg vooraf een nulmeting, vaste voorbeelden, foutgrenzen en besliscriteria vast, en meet daarna de volledige workflow in plaats van alleen het AI-antwoord.
Een AI-workflow test je niet door alleen een goede demo te bekijken. Leg vooraf één hypothese, een handmatige nulmeting, een vaste set representatieve voorbeelden, de juiste uitkomsten, foutgrenzen en besliscriteria vast. Vergelijk daarna kwaliteit, menselijke reviewtijd, correctietijd, workflowfouten, risico en totale doorlooptijd met de huidige werkwijze. Zo eindigt de test met een onderbouwd besluit in plaats van een indruk.
Bewijslabel — Uitleg
Dit artikel beschrijft een methode en een besliskader, onderbouwd met bronnen en expliciete redenering. Er worden geen eigen testresultaten, nauwkeurigheidscijfers of besparingspercentages geclaimd.
Een werkende workflow is nog geen betere workflow
Het bouwen van een eerste automatisering wordt steeds toegankelijker. Zo kan de nieuwe n8n Assistant vanuit gewone taal een workflow plannen, opbouwen, uitvoeren en helpen herstellen. n8n waarschuwt zelf ook dat zo’n eerste workflow niet automatisch productieklaar is en dat beoordeling nodig blijft (n8n).
Een workflow kan technisch volledig doorlopen en toch onbruikbaar zijn. De controle kost misschien bijna evenveel tijd als het handwerk, een belangrijke uitzondering wordt gemist of een retry voert dezelfde actie twee keer uit.
De relevante vraag is daarom niet alleen:
Werkt de automatisering?
De betere vraag is:
Werkt deze afgebakende workflow aantoonbaar beter dan de huidige werkwijze, binnen de grenzen die vooraf zijn afgesproken?
Daarvoor gebruikt PuraFact een vaste testmethode.
1. Begin met één toetsbare hypothese
Een afdeling, compleet systeemlandschap of volledige klantenservice is te groot voor een eerste test. Kies één scenario met een herkenbare invoer, een beperkte verwerking en een controleerbare uitvoer.
Bij een gedeelde inbox kan de hypothese bijvoorbeeld zijn:
Een begrensde AI-workflow kan twintig synthetische aanvragen indelen en expliciet aanwezige gegevens omzetten naar een intern conceptrecord, terwijl een medewerker iedere uitkomst controleert.
Leg direct vast wat buiten de test valt. Denk aan echte klantdata, live CRM-koppelingen, automatische klantmails en zelfstandige beslissingen. Daarmee voorkom je dat een kleine haalbaarheidstest onderweg wordt behandeld alsof het al een productieproject is.
Twijfel je nog over de gekozen workflow? Bekijk dan eerst welke kenmerken een bedrijfsproces geschikt maken voor AI.
2. Meet de handmatige werkwijze
Zonder nulmeting kun je wel beoordelen of de nieuwe workflow iets doet, maar niet of het proces verbetert.
Meet bij dezelfde soort gevallen minimaal:
- de actieve verwerkingstijd per geval;
- de totale doorlooptijd tot een bruikbare uitkomst;
- het aantal handmatige handelingen;
- het aantal correcties of herstarts;
- veelvoorkomende fouten en uitzonderingen;
- het volume per week of maand.
Maak onderscheid tussen actieve mensminuten en wachttijd. Een medewerker kan drie minuten aan een aanvraag werken terwijl de totale doorlooptijd twee uur bedraagt. Beide cijfers zeggen iets anders.
Meet de nieuwe werkwijze later op dezelfde manier. Tel dus niet alleen de verwerking door AI, maar ook het openen, controleren, corrigeren en herstellen door een medewerker. Een demo zonder vergelijkingspunt bewijst nog geen tijdwinst.
3. Stel de testset vooraf samen
PuraFact gebruikt binnen de Eén-Workflow Sprint twintig vaste, synthetische voorbeelden. Die set bevat niet alleen nette standaardgevallen. Hij moet ook lijken op de variatie die medewerkers werkelijk tegenkomen.
Bij een inboxworkflow kun je denken aan:
- duidelijke aanvragen;
- ontbrekende gegevens;
- twee verzoeken in één bericht;
- onduidelijke formuleringen of spelfouten;
- een doorgestuurd bericht met oude tekst;
- tegenstrijdige informatie;
- een verwijzing naar een ontbrekende bijlage;
- een klacht, spoedclaim of bericht buiten scope.
Maak eerst een dekkingslijst: welke gewone gevallen, grensgevallen en uitzonderingen moeten in de test zitten? Voeg niet pas na het zien van de resultaten lastige voorbeelden toe om de uitkomst te repareren.
Twintig voorbeelden leveren geen statistisch bewijs van productiekwaliteit. Ze vormen een kleine, vaste beslisset waarmee je een hypothese controleerbaar kunt vergelijken. De conclusie geldt alleen voor deze set, deze instellingen en dit testmoment.
4. Leg per voorbeeld de juiste uitkomst vast
Voordat de workflow draait, bepaalt een proceseigenaar wat per testgeval correct of acceptabel is. Dat is de referentie waarmee de uitkomst wordt vergeleken.
Voor een conceptrecord kan vooraf worden vastgelegd:
- welke categorie juist is;
- welke velden verplicht zijn;
- welke informatie letterlijk uit de invoer mag worden overgenomen;
- wat leeg moet blijven als informatie ontbreekt;
- wanneer twijfel zichtbaar moet worden gemaakt;
- wanneer de workflow moet stoppen en een medewerker nodig is.
Niet iedere taak heeft één exact juist antwoord. Leg bij een concepttekst daarom een bandbreedte vast, zoals: inhoudelijk correct, geen verzonnen feiten, verplichte informatie aanwezig en een passende toon.
Het NIST AI Risk Management Framework benadrukt het documenteren van testsets, criteria en uitkomsten. Google beschrijft eveneens taakgerichte datasets en referentie-uitkomsten (Google Cloud).
5. Geef fouten een gewicht
Een percentage alleen kan misleiden. Negentien keurige uitkomsten en één verkeerd bedrag kunnen operationeel slechter zijn dan zestien direct bruikbare uitkomsten met vier kleine tekstcorrecties.
Daarom deelt de PuraFact-methode fouten vooraf in drie categorieën in:
| Foutzwaarte | Betekenis | Voorbeeld bij een inboxworkflow |
|---|---|---|
| Kritiek | Kan leiden tot een verkeerde externe actie, beslissing of onacceptabele verwerking | Verkeerde klant, prijs of bestemming; een verzoek buiten scope wordt toch vrijgegeven |
| Groot | De uitkomst is niet bruikbaar zonder substantiële correctie | Verkeerde categorie of meerdere verplichte velden ontbreken |
| Klein | De kern klopt en een korte correctie verandert de betekenis niet | Opmaakfout of niet-kritische formulering |
Leg ook de stopregel vast. Als een vooraf als kritiek aangemerkte fout optreedt, kan de test niet alsnog groen worden doordat de overige gevallen goed gingen. Eerst moet de oorzaak worden aangepakt en opnieuw worden getest. Waarom een hoog succespercentage op zichzelf weinig zegt, staat in een AI-workflow kan 95% goed gaan en toch onbruikbaar zijn.
6. Meet de volledige workflow
Beoordeel niet alleen het antwoord van het AI-model. Test de keten van invoer tot goedgekeurde uitvoer.
De PuraFact Testkaart houdt minimaal bij:
| Meetveld | Wat wordt vastgelegd? |
|---|---|
| Kwaliteit | Direct bruikbare gevallen en afwijkingen per vooraf bepaald criterium |
| Foutzwaarte | Aantallen kritieke, grote en kleine fouten |
| Menselijke review | Tijd om een uitkomst te controleren en goed te keuren |
| Correctiewerk | Tijd om fouten te herstellen of een geval opnieuw te verwerken |
| Workflowgedrag | Mislukte, incomplete, vastgelopen of dubbele uitvoeringen |
| Procesimpact | Actieve mensminuten en totale doorlooptijd tegenover de nulmeting |
| Risico en controle | Zichtbaarheid van twijfel, stopmomenten en verantwoordelijkheid |
| Economische logica | Verwacht voordeel bij het werkelijke volume, inclusief terugkerende kosten |
Er komt geen optelbare totaalscore. Een kritisch rood veld mag niet verdwijnen in een gunstig gemiddelde.
7. Test ook wat er gebeurt als het misgaat
Een workflow is niet betrouwbaar omdat hij twintig ideale keren achter elkaar werkt. Je moet ook weten wat uitvoering 21 doet wanneer een onderdeel niet reageert.
Onderzoek of simuleer daarom vragen als:
- Wat gebeurt er bij ontbrekende of onleesbare invoer?
- Wordt een timeout zichtbaar gemeld?
- Kan een mislukte stap veilig opnieuw worden uitgevoerd?
- Kan een retry dezelfde aanvraag of actie dubbel verwerken?
- Blijft een onvolledige uitkomst geblokkeerd?
- Wat gebeurt er wanneer menselijke goedkeuring uitblijft?
- Wie kan de uitvoering stoppen, herstellen en controleren?
Niet iedere storing kan zonder live koppelingen worden nagebootst. Wat niet is getest, blijft als open punt op de Testkaart staan. Lees ook hoe PuraFact een eerste test veilig houdt.
8. Beoordeel de economische logica zonder grote beloftes
Een technisch bruikbare workflow hoeft economisch nog niet logisch te zijn. Vergelijk daarom de handmatige actieve tijd met alle menselijke tijd in de nieuwe werkwijze:
verschil in mensminuten per geval = handmatige actieve tijd – (reviewtijd + correctietijd + gemiddeld herstelwerk)
Vermenigvuldig dat verschil met het werkelijke volume. Neem daarna ook toolkosten, onderhoud, monitoring, beheer en incidentele fouten mee. Bij een taak die vier keer per maand voorkomt kan een technisch mooie oplossing alsnog duurder zijn dan handwerk.
Deze berekening is een eerste economische beoordeling, geen besparingsgarantie. Een kleine synthetische test laat nog niet zien hoe kosten en prestaties zich maandenlang in productie ontwikkelen.
9. Neem het besluit dat vooraf is afgesproken
De test eindigt niet met “dit ziet er veelbelovend uit”. De bevindingen worden per veld op de PuraFact Testkaart gezet en leiden tot één van vier uitspraken:
Doorgaan
De afgebakende test geeft voldoende bewijs om een aparte productieanalyse te rechtvaardigen. Dit betekent nog niet dat de demonstratie direct live mag.
Doorgaan met voorwaarden
Vervolg is alleen logisch als benoemde aanpassingen, extra controles of aanvullende tests eerst worden uitgevoerd.
Eerst het proces verbeteren
De techniek is niet de eerste blokkade. De invoer, verantwoordelijkheden, werkwijze of gewenste uitkomst moet eerst duidelijker worden.
No-go
De workflow is binnen de geteste scope technisch te wankel, te risicovol of economisch onvoldoende interessant. Stoppen is dan geen mislukking, maar de uitkomst waarvoor de test is uitgevoerd.
NIST koppelt risicotolerantie eveneens aan vooraf bepaalde criteria voor goedkeuring, voorwaardelijke goedkeuring en afwijzing. Voor PuraFact is dat principe bewust klein gemaakt: één workflow, vaste voorbeelden, menselijke beoordeling en een navolgbaar besluit.
Wat deze test niet bewijst
Ook een zorgvuldig uitgevoerde eerste test bewijst niet dat:
- alle toekomstige gevallen goed zullen gaan;
- de workflow veilig en betrouwbaar in productie draait;
- live integraties zonder storingen werken;
- wetgeving, privacy en security volledig zijn afgedekt;
- prestaties gelijk blijven wanneer invoer, modellen of systemen veranderen;
- de verwachte besparing gegarandeerd wordt behaald.
Daarom scheidt PuraFact test, demonstratie en productie bewust van elkaar. De uitkomst van de test is een betere beslissing over de volgende stap.
Is jouw workflow geschikt voor zo’n test?
Een goede eerste workflow komt regelmatig voor, heeft een duidelijke invoer en uitvoer, bevat controleerbare resultaten en laat ruimte voor menselijke goedkeuring. Met zeven korte vragen krijg je een eerste indicatie: testen, eerst verder in kaart brengen of nu beter niet automatiseren. Doe de Workflow Check.
Bronnen
Verder
Over de auteur
Bjorn Scheepens — Softwaredeveloper en oprichter van PuraFact. Onderzoekt of één terugkerende MKB-workflow zich veilig laat automatiseren, met synthetische testdata, menselijke beoordeling en een vooraf vastgelegd go/no-go-oordeel. Schrijft op deze site over procesgeschiktheid, meten en de grenzen van AI-automatisering. Over de auteur en de werkwijze.
Welke handmatige workflow kost jouw team iedere week opvallend veel tijd?
Geen verkooppitch: eerst het probleem goed begrijpen.
Bespreek je workflow