<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Artikelen over AI kwaliteit | Nixo News</title>
	<atom:link href="https://nixonews.nl/tag/ai-kwaliteit/feed/" rel="self" type="application/rss+xml" />
	<link>https://nixonews.nl</link>
	<description>Het laatste nieuws over AI, Webdesign en Development</description>
	<lastBuildDate>Sat, 03 Oct 2026 22:03:44 +0000</lastBuildDate>
	<language>nl-NL</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI agent monitoring: wat zijn Insights en wat heb je eraan?</title>
		<link>https://nixonews.nl/ai-agent-monitoring-insights-foundry/</link>
					<comments>https://nixonews.nl/ai-agent-monitoring-insights-foundry/#respond</comments>
		
		<dc:creator><![CDATA[Sepp Stokbroekx]]></dc:creator>
		<pubDate>Sat, 03 Oct 2026 22:03:39 +0000</pubDate>
				<category><![CDATA[AI Implementatie]]></category>
		<category><![CDATA[Artificial Intelligence]]></category>
		<category><![CDATA[agent observability]]></category>
		<category><![CDATA[AI agent monitoring]]></category>
		<category><![CDATA[AI implementatie]]></category>
		<category><![CDATA[AI kwaliteit]]></category>
		<category><![CDATA[Microsoft Foundry]]></category>
		<category><![CDATA[productie-agents]]></category>
		<category><![CDATA[trace analyse]]></category>
		<guid isPermaLink="false">https://nixonews.nl/ai-agent-monitoring-insights-foundry/</guid>

					<description><![CDATA[AI-agents draaien duizenden acties per dag. Hoe weet je wat er misgaat? Microsoft Foundry introduceert Insights: automatisch gevonden patronen in agent-gedrag, met bewijs en een voorstel voor actie.]]></description>
										<content:encoded><![CDATA[<p><strong>Kort antwoord:</strong> Met AI agent monitoring via Insights in Microsoft Foundry analyseer je productie-traces van AI-agents. Het systeem groepeert terugkerend probleemgedrag in overzichtelijke bevindingen. Elke Insight bevat een uitleg, gekoppelde voorbeeldtraces en een voorstel voor verbetering. Zo hoef je niet duizenden losse logs te doorzoeken om een patroon te herkennen.</p>
<h2>Wat is het probleem met duizenden agent-traces?</h2>
<p>Een AI-agent die een dag draait, genereert makkelijk duizenden logs. Elk log bevat modelaanroepen, toolaanroepen, foutmeldingen en reactietijden. Je kunt dashboards instellen voor dingen die je al weet te meten, maar het echte probleem is wat je nog niet weet. Welke fout herhaalt zich elke dag, maar is nooit gedefinieerd als metric? Dat is precies het gat dat automatische Insight-analyse probeert te vullen.</p>
<p>Stel je bouwt een AI-agent die klantmails beantwoordt. Je meet al responstijd en foutpercentage. Maar wat als de agent systematisch bij een bepaald type vraag in een loop belandt? Dat zie je niet in je dashboard, want je hebt die loop nooit als fout gedefinieerd.</p>
<p>Observability (zichtbaarheid op wat er gebeurt) en evaluaties (testen op criteria die je al kent) lossen dit niet op. Ze meten wat je al weet. Het ontdekkingsprobleem is anders: je wilt patronen zien die je nog niet zocht.</p>
<p>Dit is het vertrekpunt van Insights in Microsoft Foundry. De tool analyseert je productie-traces en groepeert terugkerend gedrag automatisch in reviewbare bevindingen. Of dat in de praktijk werkt, lees je in de volgende secties.</p>
<p>Voor wie meer wil weten over hoe AI-agents in elkaar zitten: <a href="/ai-agent-tool-manifest-unified-schema/">AI agent tools bouwen zonder vijftien versies bij te houden</a> legt de basis goed uit.</p>
<h2>Wat bevat een Insight precies?</h2>
<p>Een Insight is geen alert en geen foutmelding. Het is een samengestelde bevinding over terugkerend gedrag. Je krijgt een titel en uitleg, gekoppelde traces als bewijs, ernst en categorie voor prioritering, en een voorstel voor vervolgactie. Concreet: niet &#8216;er is een fout&#8217;, maar &#8216;deze agent herhaalt bij 80 inputs een extractiestap zonder voortgangscheck, hier zijn drie voorbeeldtraces, overweeg een terminatieconditie toe te voegen&#8217;.</p>
<p>Het verschil met een gewone foutmelding is het bewijs. Een Insight laat je niet alleen weten dát er iets mis is, maar ook welke traces het laten zien en hoe vaak het voorkomt. Dat maakt het reviewbaar in plaats van vaag.</p>
<p>Let op de beperkingen. Concrete code- of promptwijzigingen als voorstel zijn alleen beschikbaar voor ondersteunde agent-types en configuraties. Voor andere agents krijg je algemene onderzoeksrichtingen, geen kant-en-klaar antwoord. Dat is eerlijk, want een automatisch systeem dat je code herschrijft zonder context is gevaarlijker dan nuttig.</p>
<p>Het systeem scheidt ernst van impact. Een klein probleem kan prima gecalibreerd zijn op &#8216;laag&#8217; zonder dat het daarmee niet de moeite waard is om te bekijken. Dat zijn twee aparte dimensies, en vermenging ervan leidt tot slechte prioritering.</p>
<h2>Hoe goed werkt het? De benchmarkcijfers op een rij</h2>
<p>Microsoft heeft de kwaliteit van Insights getest op zes publieke datasets met gelabelde agent-traces. De resultaten lopen sterk uiteen per dataset. Op datasets met alleen mislukte traces haalt het systeem tot 99,7% recall. Op een gemengde dataset met goede en slechte traces zakt die recall naar gemiddeld 57,5%. Dat laatste getal is het meest eerlijke, want echte productieomgevingen zijn altijd gemengd.</p>
<p>De twee meetwaarden zijn trace recall (welk percentage van de bekende fouten pikt het systeem op?) en trace precision (van alles wat als fout wordt aangemerkt, hoeveel is ook echt een fout?). Op de AgentRx Tau-bench dataset, de enige dataset met een echte mix van goede en slechte traces, was de gemiddelde precision 37,8% en de recall 57,5%. Dat betekent: van elke drie traces die een Insight aanwijst als problematisch, is er gemiddeld iets meer dan één ook echt gelabeld als mislukking.</p>
<p>Is dat goed of slecht? Dat hangt af van je alternatief. Heb je nu helemaal geen geautomatiseerde detectie, dan is 57,5% recall een flinke verbetering. Doorzoek je handmatig elke trace, dan kan een precision van 37,8% frustrerend zijn: je kijkt naar veel ruis.</p>
<p>De scores op de LLM-judge evaluatie (hoe goed zijn de bevindingen zelf?) variëren van 2,84 tot 3,88 op een schaal van 1 tot 5. Dat is solide maar niet uitmuntend. Tau2-bench scoort het laagst met 2,84, wat aangeeft dat sommige Insights te generiek zijn voor bepaalde agent-typen.</p>
<p>Meer over hoe je AI-implementaties eerlijk evalueert lees je in <a href="/ai-implementatie-kosten-meer-dan-techniek/">AI implementatie kosten: waar het geld écht heen gaat</a>.</p>
<h2>Wat betekent dit als je zelf AI-agents bouwt of inkoopt?</h2>
<p>Dit type tooling is pas echt waardevol als je agent al in productie draait met enig volume. Voor een agent die tien keer per dag wordt aangeroepen, heb je geen automatische patroondetectie nodig. Ga je richting honderden of duizenden dagelijkse uitvoeringen, dan is handmatig reviewen onmogelijk. Dan wil je weten welke patronen terugkomen, zonder ze allemaal vooraf te definiëren.</p>
<p>Het eerlijke advies: ga er niet van uit dat een Insight een kant-en-klare oplossing geeft. Het is een startpunt voor onderzoek, geen eindoordeel. De tool zegt zelf ook: valideer voorgestelde wijzigingen via je normale evaluatie- en deploymentproces. Dat is precies de juiste insteek.</p>
<p>Koop je AI-agents in via een bureau of platform? Vraag dan naar monitoring en observability. Niet alleen dashboards voor de metrics die je al kent, maar ook mechanismen om onverwacht gedrag te ontdekken. Zegt een leverancier alleen &#8216;we monitoren op uptime en responstijd&#8217;, dan zie je terugkerende fouten in agent-gedrag pas als een klant erover klaagt.</p>
<p>Bouw je agents op Microsoft Azure? Insights in Foundry is nu in public preview, dus gratis te proberen. Koppel je Application Insights-resource aan je Foundry-project en het systeem analyseert bestaande traces. Je hoeft niets opnieuw te bouwen.</p>
<p>Wie bredere keuzes maakt over AI-modellen en migraties: <a href="/llm-model-migratie-ai-applicaties/">LLM model migratie: zo doe je het zonder gedoe</a> is de moeite waard om naast dit onderwerp te lezen.</p>
<div class="nn-related-posts">
<h3>Dit vind je misschien ook interessant</h3>
<ul>
<li><a href="https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/">AI videobeschrijvingen kwaliteit meten: hoe goed is goed genoeg?</a></li>
<li><a href="https://nixonews.nl/llm-model-migratie-ai-applicaties/">LLM model migratie: zo doe je het zonder gedoe</a></li>
<li><a href="https://nixonews.nl/anthropic-model-2-intern-gebruik-mythos/">Claude AI vs ChatGPT: Anthropic&amp;#8217;s sterkste model is niet voor jou</a></li>
</ul>
</div>
]]></content:encoded>
					
					<wfw:commentRss>https://nixonews.nl/ai-agent-monitoring-insights-foundry/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>AI videobeschrijvingen kwaliteit meten: hoe goed is goed genoeg?</title>
		<link>https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/</link>
					<comments>https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/#respond</comments>
		
		<dc:creator><![CDATA[Sepp Stokbroekx]]></dc:creator>
		<pubDate>Fri, 11 Sep 2026 16:33:41 +0000</pubDate>
				<category><![CDATA[AI Content Tools]]></category>
		<category><![CDATA[Artificial Intelligence]]></category>
		<category><![CDATA[AI content tools]]></category>
		<category><![CDATA[AI evaluatie]]></category>
		<category><![CDATA[AI kwaliteit]]></category>
		<category><![CDATA[AI onderzoek]]></category>
		<category><![CDATA[AI videobeschrijvingen]]></category>
		<category><![CDATA[benchmark]]></category>
		<category><![CDATA[multimodale AI]]></category>
		<category><![CDATA[videocaptioning]]></category>
		<guid isPermaLink="false">https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/</guid>

					<description><![CDATA[AI-modellen genereren videobeschrijvingen, maar hoe meet je of die kloppen? De standaardmethode deugt niet. CapQuiz bewijst dat met een slimmere aanpak.]]></description>
										<content:encoded><![CDATA[<p><strong>Kort antwoord:</strong> De meeste benchmarks voor AI videobeschrijvingen kwaliteit vergelijken gegenereerde tekst met een referentietekst. Dat werkt niet: twee correcte beschrijvingen van dezelfde video kunnen totaal anders klinken. CapQuiz lost dit op door beschrijvingen te toetsen aan meerkeuzevragen over de video zelf. Factualiteit en dekking meet je apart. Dat geeft een eerlijker beeld van wat een AI-model echt ziet en begrijpt.</p>
<h2>Waarom de huidige manier van meten niet klopt?</h2>
<p>Stel je voor: je laat een AI een video beschrijven en vergelijkt die tekst met een handmatig geschreven referentie. Als de woorden niet overeenkomen, scoort de AI slecht. Maar wat als de AI-beschrijving gewoon een andere invalshoek kiest, en toch correct is? Dat is precies het probleem met gangbare meetmethoden voor videobeschrijvingen. Ze straffen afwijking af, ook als die afwijking inhoudelijk juist is. Het gevolg: ontwikkelaars optimaliseren modellen voor woordovereenkomst in plaats van voor feitelijke nauwkeurigheid.</p>
<p>Het probleem heet het &#8216;one-to-many&#8217; probleem. Eén video kan op tien manieren correct beschreven worden. De ene beschrijving focust op de mensen in beeld, de andere op de omgeving, de derde op de actie. Alle drie kunnen kloppen. Maar als je ze vergelijkt met één referentietekst, lijken er maar twee goed te zijn.</p>
<p>Dit klinkt als een academisch probleem, maar het heeft praktische gevolgen. Als jij AI-tools gebruikt om video&#8217;s te beschrijven, ondertitels te genereren of metadata aan te maken voor je website, dan trainen en beoordelen ontwikkelaars die tools op dit soort gebrekkige metrics. Ze mikken dus op iets wat niet overeenkomt met wat jij eigenlijk wilt: een beschrijving die klopt met wat er echt te zien is.</p>
<p>Ik gebruik zelf AI-tools voor contentproductie, en dit is een punt waar ik sceptisch over ben. Een hoge score op een benchmark zegt weinig als die benchmark het verkeerde meet. Het is vergelijkbaar met een leerling die goed is in overschrijven maar niet in begrijpen. <a href="/ai-begrippen-uitgelegd-glossary-ux-design/">In het AI-begrippen overzicht</a> leg ik uit hoe dit soort evaluatieproblemen vaker opduiken bij taalmodellen.</p>
<h2>Wat doet CapQuiz anders dan bestaande benchmarks?</h2>
<p>CapQuiz beoordeelt een videobeschrijving niet door hem te vergelijken met een referentietekst, maar door te kijken of de beschrijving bruikbaar is om vragen over de video te beantwoorden. Die vragen zijn meerkeuze, door mensen geverifieerd, en verdeeld over tien vraagtypen in 24 videocategorieën. Een beschrijving is goed als je er de juiste antwoorden mee kunt vinden. Niet als hij toevallig op dezelfde woorden lijkt als een andere beschrijving.</p>
<p>Het idee is eenvoudig: als een beschrijving goed is, moet je er informatie uit kunnen halen die overeenkomt met wat er echt in de video gebeurt. CapQuiz stelt dus vragen die je alleen kunt beantwoorden als de beschrijving feitelijk klopt én voldoende detail bevat.</p>
<p>Daarvoor introduceert het onderzoek twee nieuwe maatstaven. CapP meet factualiteit: klopt wat er staat? CapR meet dekking: hoe volledig is de beschrijving? Samen geven ze de CapF1-score, een gecombineerde maatstaf die beter correleert met menselijke oordelen dan bestaande methoden.</p>
<p>Wat me aanspreekt: de vragen zijn door mensen geverifieerd. Dat is een stuk geloofwaardiger dan automatisch gegenereerde testsets, waarbij je het risico hebt dat de testset dezelfde fouten maakt als het model. Toch wil ik hier één voorbehoud maken: dit systeem is zelf ook afhankelijk van een AI-model dat de vragen beantwoordt op basis van de beschrijving. Dat model kan fouten maken. De benchmark is beter dan zijn voorgangers, maar niet perfect.</p>
<p>Voor wie meer wil weten over hoe AI-modellen onderling vergeleken worden: <a href="/llm-model-migratie-ai-applicaties/">dit artikel over LLM model migratie</a> laat zien hoe afhankelijk je van dit soort kwaliteitsverschillen bent als je overstapt van het ene naar het andere model.</p>
<h2>Wat betekent dit als je AI inzet voor videocontentproductie?</h2>
<p>Als ondernemer gebruik je AI misschien om ondertitels te maken, video&#8217;s samen te vatten of metadata te genereren voor je website. De kwaliteit van die output hangt af van hoe goed het onderliggende model video&#8217;s begrijpt. Onderzoek als CapQuiz laat zien dat de huidige manier van meten die kwaliteit onderschat of overschat. Dat heeft directe gevolgen voor welke tool je kiest en hoe je de output controleert.</p>
<p>Stel je vertrouwt op een AI-tool om productvideos op je webshop automatisch van beschrijvingen te voorzien. Die tool scoort goed op de benchmarks die het bedrijf op de marketingpagina noemt. Maar als die benchmarks het verkeerde meten, zegt die score weinig over of de beschrijvingen daadwerkelijk kloppen met wat er in de video te zien is.</p>
<p>Mijn advies is simpel: vertrouw niet blind op benchmark-claims van AI-tools. Kijk liever naar concrete voorbeelden. Laat de tool een video beschrijven die jij goed kent en controleer of de beschrijving klopt. Dat duurt vijf minuten en leert je meer dan een whitepaper vol grafieken.</p>
<p>Dit soort onderzoek is nuttig als context, maar het lost jouw probleem niet direct op. Het laat wel zien dat de industrie zelf worstelt met het definiëren van &#8216;goed&#8217;. Dat betekent dat jij als gebruiker kritisch moet blijven, ook als een tool indrukwekkend klinkt. <a href="/ai-implementatie-kosten-meer-dan-techniek/">De echte kosten van AI-implementatie</a> zitten vaak in precies dit soort kwaliteitscontrole die je niet had verwacht.</p>
<p>Overigens: als je AI-tools inzet voor webdesign of contentproductie, is het de moeite waard om te kijken <a href="/figma-weave-workflows-visual-content/">hoe Figma Weave herbruikbare AI-workflows opzet</a>. Daarmee leg je tenminste vast wat je verwacht, ook al kun je de output nog niet automatisch meten.</p>
<div class="nn-related-posts">
<h3>Dit vind je misschien ook interessant</h3>
<ul>
<li><a href="https://nixonews.nl/llm-model-migratie-ai-applicaties/">LLM model migratie: zo doe je het zonder gedoe</a></li>
<li><a href="https://nixonews.nl/anthropic-model-2-intern-gebruik-mythos/">Claude AI vs ChatGPT: Anthropic&amp;#8217;s sterkste model is niet voor jou</a></li>
<li><a href="https://nixonews.nl/google-ads-ai-updates-ask-advisor-analytics/">Google Ads AI-updates: wat verandert er echt voor jou?</a></li>
</ul>
</div>
]]></content:encoded>
					
					<wfw:commentRss>https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
