SluitenMenu

Oplevering

Wat klaar voor productie echt betekent bij een AI-agent

Wanneer is een AI-agent echt klaar voor productie?

Een agent draait in productie wanneer hij blijft werken op een dag dat niemand kijkt, en wanneer je achteraf kunt bewijzen wat hij heeft gedaan. Een demo laat het gladde pad zien, en dat is ongeveer een derde van het werk. De rest is toegang die beperkt is tot wat hij echt nodig heeft, de gevallen waar niemand aan dacht, een verslag dat je kunt teruglezen, bewaking die stilte opmerkt, en een met naam genoemd persoon die eigenaar is van de uitkomst nadat iedereen naar huis is.

De demo is ongeveer een derde ervan

Dit is het duurste misverstand in het vak, en het is niemands schuld: de demo werkt echt. Iemand laat een agent een afspraak inplannen, en hij plant de afspraak in. De conclusie dat het ding bijna af is, is een redelijke conclusie om te trekken en ze is er ongeveer een factor drie naast.

Wat de demo wegliet, is wat er gebeurt als de agenda-koppeling er niet op tijd is, als twee mensen binnen een seconde van elkaar dezelfde plek vragen, als de invoer in een vorm binnenkomt waar niemand op had gerekend, of als het model ergens zelfverzekerd fout over is en niets verderop dat opvangt. Niets daarvan is exotisch. Het gebeurt allemaal in de eerste twee weken, en het afhandelen ervan is het grootste deel van de bouw.

Dus teams stemmen budget en planning af op de demo, ontdekken in maand twee de andere tweederde, en het project krijgt de naam te zijn vastgelopen terwijl het in feite normaal verliep. Als iemand mij vertelt dat zijn laatste AI-project nergens toe leidde, is dit ongeveer de helft van de keren wat er gebeurde.

Zes dingen die er moeten zijn

Dit is de lijst die ik afloop voordat ik iets productie noem, en hij is kort genoeg om een leverancier eraan te houden.

  • Een eigen identiteit, met toegang tot precies de systemen die zijn klus raakt en niets ruimers, in plaats van een geleende inlog van een collega.
  • Een geschreven lijst van wat hij doet, inclusief wat hij niet doet. Alles wat hij niet herkent gaat standaard naar een mens.
  • Een spoor dat een collega volgende week kan lezen zonder jou te bellen.
  • Een overdrachtsroute met een benoemde voorwaarde en een met naam genoemd persoon erachter.
  • Bewaking die afgaat op stilte, niet alleen op fouten.
  • Een overdracht, zodat het team het draait nadat degene die het bouwde is vertrokken.

Een eigen inlog, niet die van iemand anders

De snelste manier om een agent aan de praat te krijgen is hem de inloggegevens van een bestaande gebruiker geven, en het is de beslissing die achteraf het moeilijkst te ontwarren is. Er gaan twee dingen mis. Het spoor zegt nu dat een mens iets deed wat een machine deed, wat elk volgend onderzoek moeilijker maakt dan nodig. En de agent erft alles wat die gebruiker kan bereiken, wat steevast veel meer is dan zijn klus vraagt.

Een eigen identiteit, met rechten die tot de taak beperkt zijn, kost aan het begin een middag en bespaart je het gesprek waarin iemand aan een toezichthouder of een verzekeraar moet uitleggen waarom het systeem toegang had tot dossiers waar het niets te zoeken had.

Een spoor dat iemand ook echt gaat lezen

De meeste systemen loggen iets. Minder loggen het ding dat je nodig hebt, en dat is een verhaal en nooit een foutmelding: wat er binnenkwam, wat de agent besloot, welke tools hij aanriep en wat die teruggaven, wat hij deed, en waarom hij stopte als hij stopte.

De toets is of een collega die er nooit bij was er zes weken later een kan openen en kan reconstrueren wat er gebeurde zonder iemand iets te vragen. Is het antwoord nee, dan heb je foutuitvoer, en het verschil blijkt op de eerste dag dat iemand betwist wat het systeem heeft gedaan.

Bewaking die stilte opmerkt

Waarschuwen bij fouten is de makkelijke helft en die hebben teams bijna altijd. Het falen dat meer kost, is het stille geval waarin de agent helemaal niets meer doet en er geen fout wordt gemeld, omdat er niets is misgegaan. Een webhook kwam niet meer binnen. Een wachtrij liep leeg en vulde zich nooit meer. Een toegangssleutel verliep en de aanroep geeft nu een leeg resultaat terug in plaats van een weigering.

De waarschuwing die dit opvangt is saai en iedereen slaat hem over: verwacht volume over een venster. Doet een lijn die normaal dertig klussen per dag afhandelt er tegen lunchtijd nul, dan is er iets mis, ook al is er niets misgegaan. Die ene controle vindt meer echte storingen dan elk dashboard dat ik ooit heb gebouwd.

De overdracht is de enige toets die telt

Een agent die alleen zijn bouwer kan bedienen zit in een relatie, en dat is een andere regeling dan productie. De overdracht is een eigenschap van het ontwerp en nooit documentatie die er aan het eind bij wordt geschroefd, en je ziet binnen een week na de start welke kant een project op gaat.

Wat er over moet, is weinig. Iemand binnen het bedrijf moet weten hoe het spoor gelezen wordt, hoe je verandert wat hij afhandelt, wat hem doet stoppen om een mens te halen, wie er aan de andere kant daarvan zit, en hoe je het ding uitzet. Is er voor uitzetten degene nodig die het bouwde, dan was het nooit productie.

Wat Nederland en de EU hieraan toevoegen

Aan de lijst hierboven verandert niets, maar twee punten worden scherper. Het spoor houdt op goede praktijk te zijn en wordt het ding waar je op leunt wanneer iemand een recht uitoefent onder de AVG, of wanneer de Autoriteit Persoonsgegevens een vraag stelt. Een agent die niet kan zeggen wat hij met iemands gegevens heeft gedaan, is een risico met een productiviteitsspeldje op.

Het tweede is waar de verwerking gebeurt. Stuurt jouw agent data naar een model dat buiten de Europese Economische Ruimte draait, dan is dat een beslissing met waarborgen eraan vast, zoals een adequaatheidsbesluit of standaardcontractbepalingen, en iemand hoort die met opzet genomen te hebben in plaats van hem uit een tutorial te hebben geërfd.

Verder geldt: waar de vraag over de wet gaat en niet over het systeem, gaat hij naar een jurist. Ik lever systemen die vastleggen wat ze doen, die overdragen aan een mens wanneer dat hoort, en die stoppen waar een mens nog beslist, en ik zeg je gewoon waar de grens ligt.

Veelgestelde vragen

Vragen die mensen hierover stellen

Hoe weet ik of een agent klaar is voor productie of gewoon een goede demo is?

Vraag om een spoor van een run die misging. Een productiesysteem levert er een en iemand kan je erdoorheen praten. Een demo levert een excuus en de belofte dat het meestal werkt, en dat is een heel andere bewering.

Hebben we een testomgeving nodig voor een agent?

Je hebt een plek nodig waar hij kan handelen zonder gevolgen, en voor agents betekent dat meestal afgeschermde accounts op de echte systemen in plaats van een volledige parallelle omgeving. De gevallen die het oefenen waard zijn, zijn juist die waarvan je verwacht dat ze misgaan, want een slagingspercentage op makkelijke invoer zegt vrijwel niets.

Wie hoort eigenaar te zijn van een agent na de lancering?

Iemand in het bedrijf die al eigenaar is van de uitkomst waar hij op ingrijpt. Niet degene die hem bouwde, en niet standaard de IT-afdeling. Die persoon leest de overdrachten, merkt wanneer hij begint te stoppen op werk dat hij eerst afmaakte, en beslist wanneer de klus verandert.

Hoe lang duurt het voordat een agent herzien moet worden?

Eerder dan mensen verwachten, en meestal doordat het bedrijf veranderde terwijl de agent stilstond. Een nieuw product, een hernoemd veld, een proces dat iemand heeft bijgesteld. Bouw op de aanname dat de lijst opnieuw wordt bekeken, en dan is dat een uur werk in plaats van een herbouw.

Wat kost dit buiten de bouw?

Gebruik van model en infrastructuur, doorgaans de kleinere en beter voorspelbare post, plus de eigenaarstijd hierboven. De kostenpost die mensen verrast is de tweede koppeling, wanneer de agent die prachtig werkt tegen het ene systeem een tweede moet leren.

Werk je aan een van deze?

Een gesprek van dertig minuten, daarna een voorstel op papier met vaste scope, of een eerlijk nee.

Plan een gesprek