QA The Other WayKwaliteitsborging voor het tijdperk van door AI geschreven tests. QA The Other Way.
Strategie

Wat QA met AI-agenten bespaart en wat het kost

Trek review en herstel af van de bespaarde schrijftijd. Neem voor een geldbedrag ook de kosten van de tool, uitvoering en testomgeving mee.

10 minuten leestijdQA The Other Way
Een stopwatch die de kosten van revisie en reparatie illustreert.
Door AI gegenereerde redactionele illustratie.
Illustratieve video bij dit artikel. Engelse tekst op het scherm; selecteer ondertitels voor deze taal.

Vertaalde editie. Technische identificatiegegevens blijven in hun oorspronkelijke vorm.

Bij elke pitch voor AI-testen worden de uren vermeld die u bespaart. Bijna geen daarvan specificeert de uren die u zult besteden. In dit artikel wordt de rekensom langzaam uitgevoerd, waarbij aannames naast elk getal worden afgedrukt, want het enige wat erger is dan geen automatisering is automatisering waarvan je de kosten nooit hebt gemeten.

Voor een team dat al over QA-ingenieurs beschikt

De repetitieve helft van het werk is regressie: het schrijven van dezelfde stromen voor login-afrekeninstellingen en deze vervolgens onderhouden elke keer dat de gebruikersinterface beweegt. Agenten vallen precies die helft aan. Ze verkennen de app, stellen de stromen op en herschrijven ze als er iets verandert. Wanneer de concepten nuttig zijn, kunnen QA-ingenieurs minder tijd besteden aan het typen van repetitieve stromen en meer tijd besteden aan beoordeling, risicoanalyse en verkennende tests. Dat is een mogelijke capaciteitswinst om te meten, niet een beloofde verandering in elk team.

Voer het grootboek per sprint uit. Neem de uren die uw team voorheen besteedde aan het schrijven en repareren van regressietests, noem het A. Neem de uren die ze nu besteden aan het beoordelen van door agenten geschreven tests, noem het R, en de uren die ze besteden aan het repareren van de concepten die verkeerd terugkwamen, noem het F. De netto gewonnen capaciteit is A minus R min F. De automatisering wint als A groter is dan de som van de andere twee. Twee factoren zijn de moeite waard om in uw pilot te controleren: of het beoordelingsoppervlak de intentie duidelijk maakt en of de concepten uitgebreid moeten worden gerepareerd. Een leesbare stappentijdlijn kan uw team helpen; meet de beoordelingstijd in plaats van aan te nemen dat deze beter is dan een codeverschil.

Let op wat niet in de formule voorkwam: personeelsbezetting. De realistische uitkomst voor een QA-team is niet minder mensen. Het zijn dezelfde mensen die een groter deel van het product bestrijken en hun oordeel baseren op risico- en randzaken in plaats van op de vierde herschrijving van de kassastroom dit kwartaal.

Voor een bedrijf zonder QA-ingenieurs

De vergelijking hier is niet het inhuren van agenten versus QA. Het zijn door agenten geschreven tests die door een ontwikkelaar zijn beoordeeld versus de huidige status, wat meestal geen tests en hoop is. Dat verandert de vraag volledig. De concepten van de agent concurreren niet met de tests van een professional; ze concurreren met niets, en niets is duur op een manier die nooit binnen een budget valt: de kapotte login die een klant eerder ontdekt dan jij, de release die je hebt uitgesteld omdat niemand het vertrouwde.

Ook de kostenkant is eerlijk. Een oprichter of ontwikkelaar besteedt nu R uur per cyclus aan het beoordelen van tests in plaats van ze te schrijven. Die tijd is reëel. Het is misschien kleiner dan helemaal opnieuw schrijven, maar dat is een pilotresultaat om te meten. Bekendheid met pull-request review helpt, hoewel het testen van oracle review een aparte vaardigheid is. Break-even hangt af van de beoordelings- en reparatietijd, de gereedschaps- en uitvoeringskosten en de verwachte kosten van ontsnapte defecten. Het ontdekken van één bug betekent niet automatisch dat de investering zijn vruchten heeft afgeworpen.

Het kortingspercentage op elke AI-claim

Drie faalwijzen vreten de besparingen op, en elk daarvan leidt tot iets testbaars. Verkeerde orakels: tests die beweren op de melding in plaats van op de uitkomst, bedekt met Een groen vinkje is geen bewijs. Brittle locators: concepten die de DOM fotograferen in plaats van besturingselementen te benoemen, gedekt door Uw locator is een contract. Onveilige verkenning: een agent die vijandige pagina's leest zonder hek, bedekt met Een agent met een browser heeft een hek nodig. Een leverancier die u niet kan vertellen hoe het beoordelingsoppervlak, de kwaliteit van de selector en de rungrenzen werken, vraagt ​​u om de besparingen op vertrouwen te nemen.

Het werkblad

Noteer van de afgelopen vier weken: de uren die u hebt besteed aan het schrijven van regressietests, de uren aan het repareren ervan, regressies die naar gebruikers zijn ontsnapt en wat één ontsnapte bug u in reële termen heeft gekost. Vervolgens laat u een agent twee weken lang een kritieke stroom uitvoeren en registreert u de controle- en reparatie-uren. Houd rekening met toolkosten, computer- en omgevingsinstellingen bij het omzetten van uren in een geldschatting; de capaciteitsformule alleen is geen geldbesparingsformule. De tools die deze lus goedkoop maken, zijn expliciet over de vorm: AnyTest neemt een URL, de agenten onderzoeken en stellen de end-to-end tests op, en een mens beoordeelt elke stap voordat de suite wordt behouden. Als de R plus F van je piloot duidelijk lager is dan je oude A, heb je je antwoord in je eigen cijfers, de enige die het vertrouwen waard zijn.

Niemand anders' benchmark zal deze beslissing voor u nemen. De rekenkundige wil.

Veelgestelde vragen

Vervangt QA met AI-agenten QA-ingenieurs?

Niet op zichzelf. Het kan helpen bij herhaaldelijk schrijven en onderhoud, terwijl QA-ingenieurs nog steeds de bedoelingen, risico's en randgevallen beoordelen. AnyTest stelt in zijn eigen FAQ dat het QA aanvult in plaats van het oordeel vervangt.

Hoe meet ik of door AI geschreven tests mijn team tijd besparen?

Houd de auteursuren van tevoren bij en bekijk vervolgens de uren plus reparatie-uren erna. De nettowinst is het schrijven minus de beoordeling minus de reparatie. Meet het minimaal twee weken aan uw eigen stromen; leveranciersbenchmarks vormen geen bewijs voor uw product.

Is QA met AI-agenten de moeite waard voor een bedrijf zonder QA-team?

De vergelijking is dat je helemaal geen tests hebt. Een agent stelt de dekking op en een ontwikkelaar beoordeelt deze volgens hun planning. Of het loont, hangt af van de beoordelings-, reparatie-, gereedschaps- en uitvoeringskosten in vergelijking met de waarde van eerdere detectie van defecten. Meet die in een begrensde pilot.

Bronnen