AI agent monitoring: wat zijn Insights en wat heb je eraan?
Foto: Tima Miroshnichenko via Pexels
Met AI agent monitoring via Insights in Microsoft Foundry analyseer je productie-traces van AI-agents. Het systeem groepeert terugkerend probleemgedrag in overzichtelijke bevindingen. Elke Insight bevat een uitleg, gekoppelde voorbeeldtraces en een voorstel voor verbetering. Zo hoef je niet duizenden losse logs te doorzoeken om een patroon te herkennen.
Wat is het probleem met duizenden agent-traces?
Stel je bouwt een AI-agent die klantmails beantwoordt. Je meet al responstijd en foutpercentage. Maar wat als de agent systematisch bij een bepaald type vraag in een loop belandt? Dat zie je niet in je dashboard, want je hebt die loop nooit als fout gedefinieerd.
Observability (zichtbaarheid op wat er gebeurt) en evaluaties (testen op criteria die je al kent) lossen dit niet op. Ze meten wat je al weet. Het ontdekkingsprobleem is anders: je wilt patronen zien die je nog niet zocht.
Dit is het vertrekpunt van Insights in Microsoft Foundry. De tool analyseert je productie-traces en groepeert terugkerend gedrag automatisch in reviewbare bevindingen. Of dat in de praktijk werkt, lees je in de volgende secties.
Voor wie meer wil weten over hoe AI-agents in elkaar zitten: AI agent tools bouwen zonder vijftien versies bij te houden legt de basis goed uit.
Wat bevat een Insight precies? Nu in public preview
Het verschil met een gewone foutmelding is het bewijs. Een Insight laat je niet alleen weten dát er iets mis is, maar ook welke traces het laten zien en hoe vaak het voorkomt. Dat maakt het reviewbaar in plaats van vaag.
Let op de beperkingen. Concrete code- of promptwijzigingen als voorstel zijn alleen beschikbaar voor ondersteunde agent-types en configuraties. Voor andere agents krijg je algemene onderzoeksrichtingen, geen kant-en-klaar antwoord. Dat is eerlijk, want een automatisch systeem dat je code herschrijft zonder context is gevaarlijker dan nuttig.
Het systeem scheidt ernst van impact. Een klein probleem kan prima gecalibreerd zijn op 'laag' zonder dat het daarmee niet de moeite waard is om te bekijken. Dat zijn twee aparte dimensies, en vermenging ervan leidt tot slechte prioritering.
Hoe goed werkt het? De benchmarkcijfers op een rij 57,5% recall op gemengde data
De twee meetwaarden zijn trace recall (welk percentage van de bekende fouten pikt het systeem op?) en trace precision (van alles wat als fout wordt aangemerkt, hoeveel is ook echt een fout?). Op de AgentRx Tau-bench dataset, de enige dataset met een echte mix van goede en slechte traces, was de gemiddelde precision 37,8% en de recall 57,5%. Dat betekent: van elke drie traces die een Insight aanwijst als problematisch, is er gemiddeld iets meer dan één ook echt gelabeld als mislukking.
Is dat goed of slecht? Dat hangt af van je alternatief. Heb je nu helemaal geen geautomatiseerde detectie, dan is 57,5% recall een flinke verbetering. Doorzoek je handmatig elke trace, dan kan een precision van 37,8% frustrerend zijn: je kijkt naar veel ruis.
De scores op de LLM-judge evaluatie (hoe goed zijn de bevindingen zelf?) variëren van 2,84 tot 3,88 op een schaal van 1 tot 5. Dat is solide maar niet uitmuntend. Tau2-bench scoort het laagst met 2,84, wat aangeeft dat sommige Insights te generiek zijn voor bepaalde agent-typen.
Meer over hoe je AI-implementaties eerlijk evalueert lees je in AI implementatie kosten: waar het geld écht heen gaat.
Wat betekent dit als je zelf AI-agents bouwt of inkoopt?
Het eerlijke advies: ga er niet van uit dat een Insight een kant-en-klare oplossing geeft. Het is een startpunt voor onderzoek, geen eindoordeel. De tool zegt zelf ook: valideer voorgestelde wijzigingen via je normale evaluatie- en deploymentproces. Dat is precies de juiste insteek.
Koop je AI-agents in via een bureau of platform? Vraag dan naar monitoring en observability. Niet alleen dashboards voor de metrics die je al kent, maar ook mechanismen om onverwacht gedrag te ontdekken. Zegt een leverancier alleen 'we monitoren op uptime en responstijd', dan zie je terugkerende fouten in agent-gedrag pas als een klant erover klaagt.
Bouw je agents op Microsoft Azure? Insights in Foundry is nu in public preview, dus gratis te proberen. Koppel je Application Insights-resource aan je Foundry-project en het systeem analyseert bestaande traces. Je hoeft niets opnieuw te bouwen.
Wie bredere keuzes maakt over AI-modellen en migraties: LLM model migratie: zo doe je het zonder gedoe is de moeite waard om naast dit onderwerp te lezen.
Conclusie
AI agent monitoring gaat verder dan dashboards: je moet ook ontdekken wat je nog niet wist te meten.
Insights koppelen terugkerend faalgedrag aan concrete traces, maar validatie blijft mensenwerk.
De techniek werkt op benchmarks met tot 99,7% recall, maar productieresultaten hangen af van je eigen data.
Veelgestelde vragen
-
Observability laat je zien wat er is gebeurd: logs, foutmeldingen, responstijden. Dat zijn metrics die je zelf hebt ingesteld. Insights gaan een stap verder: ze analyseren patronen die je niet vooraf hebt gedefinieerd. Denk aan een agent die bij een specifiek type invoer systematisch in een loop belandt, terwijl je dat nooit als foutcriterium hebt opgegeven. Microsoft Azure AI Foundry documentatie beschrijft hoe de koppeling met Application Insights werkt.
-
Dat hangt sterk af van je data. Op datasets met alleen mislukte traces haalt het systeem tot 99,7% recall. Op een gemengde dataset met goede en slechte traces zakt dat naar gemiddeld 57,5% recall en 37,8% precision. De LLM-judge scoort de kwaliteit van bevindingen tussen 2,84 en 3,88 op een schaal van 1 tot 5. Bruikbaar als startpunt voor onderzoek, niet als definitief oordeel. Valideer altijd zelf via je eigen evaluatieproces. Meer over eerlijk evalueren lees je in ons artikel over AI implementatiekosten.
-
Pas echt nuttig als je agent al in productie draait met honderden of duizenden dagelijkse uitvoeringen. Bij laag volume zie je patronen zelf nog wel. Bij hoog volume is handmatig reviewen onmogelijk en wil je geautomatiseerde patroondetectie. Insights in Foundry is momenteel beschikbaar als public preview via Microsoft Azure AI Foundry, zonder extra kosten bovenop je bestaande Azure-gebruik.
-
Soms, maar niet altijd. Concrete code- of promptwijzigingen als voorstel zijn alleen beschikbaar voor ondersteunde agent-types en configuraties. Voor andere agents krijg je een algemene onderzoeksrichting. Dat is bewust zo gehouden: een systeem dat automatisch je productiecode aanpast zonder context is riskant. Beschouw elke Insight als een startpunt voor eigen onderzoek, niet als kant-en-klare oplossing.
-
Je koppelt je Application Insights-resource (de Azure-dienst die logs en telemetrie verzamelt) aan je Foundry-project. Het systeem analyseert daarna automatisch de bestaande traces die al worden opgeslagen. Je hoeft geen nieuwe logging-code te schrijven als je Application Insights al gebruikt. Meer technische details staan in de officiële Microsoft Learn documentatie voor AI Foundry.
-
Op de AgentRx Tau-bench dataset, de enige testset met een echte mix van goede en slechte traces, haalt Insights gemiddeld 57,5% recall en 37,8% precision. De LLM-judge kwaliteitsscore loopt van 2,84 (Tau2-bench) tot 3,88 op een schaal van 1 tot 5. Op datasets met uitsluitend mislukte traces loopt de recall op tot 99,7%. Zie de originele Microsoft blogpost voor de volledige cijfers per dataset.