<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Artikelen over Microsoft Foundry | Nixo News</title>
	<atom:link href="https://nixonews.nl/tag/microsoft-foundry/feed/" rel="self" type="application/rss+xml" />
	<link>https://nixonews.nl</link>
	<description>Het laatste nieuws over AI, Webdesign en Development</description>
	<lastBuildDate>Sat, 03 Oct 2026 22:03:44 +0000</lastBuildDate>
	<language>nl-NL</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI agent monitoring: wat zijn Insights en wat heb je eraan?</title>
		<link>https://nixonews.nl/ai-agent-monitoring-insights-foundry/</link>
					<comments>https://nixonews.nl/ai-agent-monitoring-insights-foundry/#respond</comments>
		
		<dc:creator><![CDATA[Sepp Stokbroekx]]></dc:creator>
		<pubDate>Sat, 03 Oct 2026 22:03:39 +0000</pubDate>
				<category><![CDATA[AI Implementatie]]></category>
		<category><![CDATA[Artificial Intelligence]]></category>
		<category><![CDATA[agent observability]]></category>
		<category><![CDATA[AI agent monitoring]]></category>
		<category><![CDATA[AI implementatie]]></category>
		<category><![CDATA[AI kwaliteit]]></category>
		<category><![CDATA[Microsoft Foundry]]></category>
		<category><![CDATA[productie-agents]]></category>
		<category><![CDATA[trace analyse]]></category>
		<guid isPermaLink="false">https://nixonews.nl/ai-agent-monitoring-insights-foundry/</guid>

					<description><![CDATA[AI-agents draaien duizenden acties per dag. Hoe weet je wat er misgaat? Microsoft Foundry introduceert Insights: automatisch gevonden patronen in agent-gedrag, met bewijs en een voorstel voor actie.]]></description>
										<content:encoded><![CDATA[<p><strong>Kort antwoord:</strong> Met AI agent monitoring via Insights in Microsoft Foundry analyseer je productie-traces van AI-agents. Het systeem groepeert terugkerend probleemgedrag in overzichtelijke bevindingen. Elke Insight bevat een uitleg, gekoppelde voorbeeldtraces en een voorstel voor verbetering. Zo hoef je niet duizenden losse logs te doorzoeken om een patroon te herkennen.</p>
<h2>Wat is het probleem met duizenden agent-traces?</h2>
<p>Een AI-agent die een dag draait, genereert makkelijk duizenden logs. Elk log bevat modelaanroepen, toolaanroepen, foutmeldingen en reactietijden. Je kunt dashboards instellen voor dingen die je al weet te meten, maar het echte probleem is wat je nog niet weet. Welke fout herhaalt zich elke dag, maar is nooit gedefinieerd als metric? Dat is precies het gat dat automatische Insight-analyse probeert te vullen.</p>
<p>Stel je bouwt een AI-agent die klantmails beantwoordt. Je meet al responstijd en foutpercentage. Maar wat als de agent systematisch bij een bepaald type vraag in een loop belandt? Dat zie je niet in je dashboard, want je hebt die loop nooit als fout gedefinieerd.</p>
<p>Observability (zichtbaarheid op wat er gebeurt) en evaluaties (testen op criteria die je al kent) lossen dit niet op. Ze meten wat je al weet. Het ontdekkingsprobleem is anders: je wilt patronen zien die je nog niet zocht.</p>
<p>Dit is het vertrekpunt van Insights in Microsoft Foundry. De tool analyseert je productie-traces en groepeert terugkerend gedrag automatisch in reviewbare bevindingen. Of dat in de praktijk werkt, lees je in de volgende secties.</p>
<p>Voor wie meer wil weten over hoe AI-agents in elkaar zitten: <a href="/ai-agent-tool-manifest-unified-schema/">AI agent tools bouwen zonder vijftien versies bij te houden</a> legt de basis goed uit.</p>
<h2>Wat bevat een Insight precies?</h2>
<p>Een Insight is geen alert en geen foutmelding. Het is een samengestelde bevinding over terugkerend gedrag. Je krijgt een titel en uitleg, gekoppelde traces als bewijs, ernst en categorie voor prioritering, en een voorstel voor vervolgactie. Concreet: niet &#8216;er is een fout&#8217;, maar &#8216;deze agent herhaalt bij 80 inputs een extractiestap zonder voortgangscheck, hier zijn drie voorbeeldtraces, overweeg een terminatieconditie toe te voegen&#8217;.</p>
<p>Het verschil met een gewone foutmelding is het bewijs. Een Insight laat je niet alleen weten dát er iets mis is, maar ook welke traces het laten zien en hoe vaak het voorkomt. Dat maakt het reviewbaar in plaats van vaag.</p>
<p>Let op de beperkingen. Concrete code- of promptwijzigingen als voorstel zijn alleen beschikbaar voor ondersteunde agent-types en configuraties. Voor andere agents krijg je algemene onderzoeksrichtingen, geen kant-en-klaar antwoord. Dat is eerlijk, want een automatisch systeem dat je code herschrijft zonder context is gevaarlijker dan nuttig.</p>
<p>Het systeem scheidt ernst van impact. Een klein probleem kan prima gecalibreerd zijn op &#8216;laag&#8217; zonder dat het daarmee niet de moeite waard is om te bekijken. Dat zijn twee aparte dimensies, en vermenging ervan leidt tot slechte prioritering.</p>
<h2>Hoe goed werkt het? De benchmarkcijfers op een rij</h2>
<p>Microsoft heeft de kwaliteit van Insights getest op zes publieke datasets met gelabelde agent-traces. De resultaten lopen sterk uiteen per dataset. Op datasets met alleen mislukte traces haalt het systeem tot 99,7% recall. Op een gemengde dataset met goede en slechte traces zakt die recall naar gemiddeld 57,5%. Dat laatste getal is het meest eerlijke, want echte productieomgevingen zijn altijd gemengd.</p>
<p>De twee meetwaarden zijn trace recall (welk percentage van de bekende fouten pikt het systeem op?) en trace precision (van alles wat als fout wordt aangemerkt, hoeveel is ook echt een fout?). Op de AgentRx Tau-bench dataset, de enige dataset met een echte mix van goede en slechte traces, was de gemiddelde precision 37,8% en de recall 57,5%. Dat betekent: van elke drie traces die een Insight aanwijst als problematisch, is er gemiddeld iets meer dan één ook echt gelabeld als mislukking.</p>
<p>Is dat goed of slecht? Dat hangt af van je alternatief. Heb je nu helemaal geen geautomatiseerde detectie, dan is 57,5% recall een flinke verbetering. Doorzoek je handmatig elke trace, dan kan een precision van 37,8% frustrerend zijn: je kijkt naar veel ruis.</p>
<p>De scores op de LLM-judge evaluatie (hoe goed zijn de bevindingen zelf?) variëren van 2,84 tot 3,88 op een schaal van 1 tot 5. Dat is solide maar niet uitmuntend. Tau2-bench scoort het laagst met 2,84, wat aangeeft dat sommige Insights te generiek zijn voor bepaalde agent-typen.</p>
<p>Meer over hoe je AI-implementaties eerlijk evalueert lees je in <a href="/ai-implementatie-kosten-meer-dan-techniek/">AI implementatie kosten: waar het geld écht heen gaat</a>.</p>
<h2>Wat betekent dit als je zelf AI-agents bouwt of inkoopt?</h2>
<p>Dit type tooling is pas echt waardevol als je agent al in productie draait met enig volume. Voor een agent die tien keer per dag wordt aangeroepen, heb je geen automatische patroondetectie nodig. Ga je richting honderden of duizenden dagelijkse uitvoeringen, dan is handmatig reviewen onmogelijk. Dan wil je weten welke patronen terugkomen, zonder ze allemaal vooraf te definiëren.</p>
<p>Het eerlijke advies: ga er niet van uit dat een Insight een kant-en-klare oplossing geeft. Het is een startpunt voor onderzoek, geen eindoordeel. De tool zegt zelf ook: valideer voorgestelde wijzigingen via je normale evaluatie- en deploymentproces. Dat is precies de juiste insteek.</p>
<p>Koop je AI-agents in via een bureau of platform? Vraag dan naar monitoring en observability. Niet alleen dashboards voor de metrics die je al kent, maar ook mechanismen om onverwacht gedrag te ontdekken. Zegt een leverancier alleen &#8216;we monitoren op uptime en responstijd&#8217;, dan zie je terugkerende fouten in agent-gedrag pas als een klant erover klaagt.</p>
<p>Bouw je agents op Microsoft Azure? Insights in Foundry is nu in public preview, dus gratis te proberen. Koppel je Application Insights-resource aan je Foundry-project en het systeem analyseert bestaande traces. Je hoeft niets opnieuw te bouwen.</p>
<p>Wie bredere keuzes maakt over AI-modellen en migraties: <a href="/llm-model-migratie-ai-applicaties/">LLM model migratie: zo doe je het zonder gedoe</a> is de moeite waard om naast dit onderwerp te lezen.</p>
<div class="nn-related-posts">
<h3>Dit vind je misschien ook interessant</h3>
<ul>
<li><a href="https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/">AI videobeschrijvingen kwaliteit meten: hoe goed is goed genoeg?</a></li>
<li><a href="https://nixonews.nl/llm-model-migratie-ai-applicaties/">LLM model migratie: zo doe je het zonder gedoe</a></li>
<li><a href="https://nixonews.nl/anthropic-model-2-intern-gebruik-mythos/">Claude AI vs ChatGPT: Anthropic&amp;#8217;s sterkste model is niet voor jou</a></li>
</ul>
</div>
]]></content:encoded>
					
					<wfw:commentRss>https://nixonews.nl/ai-agent-monitoring-insights-foundry/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>LLM model migratie: zo doe je het zonder gedoe</title>
		<link>https://nixonews.nl/llm-model-migratie-ai-applicaties/</link>
					<comments>https://nixonews.nl/llm-model-migratie-ai-applicaties/#respond</comments>
		
		<dc:creator><![CDATA[Sepp Stokbroekx]]></dc:creator>
		<pubDate>Tue, 01 Sep 2026 06:02:52 +0000</pubDate>
				<category><![CDATA[AI Implementatie]]></category>
		<category><![CDATA[Artificial Intelligence]]></category>
		<category><![CDATA[AI evaluatie]]></category>
		<category><![CDATA[AI implementatie]]></category>
		<category><![CDATA[Azure OpenAI]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[GPT-5.1]]></category>
		<category><![CDATA[LLM migratie]]></category>
		<category><![CDATA[Microsoft Foundry]]></category>
		<category><![CDATA[model deployment]]></category>
		<category><![CDATA[model pensionering]]></category>
		<category><![CDATA[prompt engineering]]></category>
		<guid isPermaLink="false">https://nixonews.nl/llm-model-migratie-ai-applicaties/</guid>

					<description><![CDATA[Je AI-app werkt prima, maar het model eronder wordt binnenkort afgezet. Eén regel code aanpassen klinkt simpel. Het is het niet. Dit is hoe je een model migratie goed aanpakt.]]></description>
										<content:encoded><![CDATA[<p><strong>Kort antwoord:</strong> Een LLM model migratie is meer dan een naam veranderen in je code. Het model achter je AI-app kan stil veranderen in toon, JSON-output en tool-aanroepen zonder dat je dashboards iets signaleren. Microsoft Foundry hanteert een 6-fasen proces: Discover, Assess, Adapt, Validate, Roll out en Retire. GPT-4o (2024-05-13) gaat per 1 oktober 2026 offline; de opvolger is GPT-5.1.</p>
<h2>Waarom één regel code veranderen zo gevaarlijk is?</h2>
<p>Het aanpassen van een model naam in je code lijkt triviaal. Maar een nieuw model kan volledig andere JSON teruggeven, langere samenvattingen produceren, of tool-aanroepen in een andere volgorde afvuren. Je foutmeldingenlog blijft leeg. Je gebruikers krijgen rare antwoorden. Dat is het echte risico van een model migratie zonder plan.</p>
<p>Stel je bouwt een bestelassistent voor een webshop. Die roept een AI-model aan, dat JSON teruggeeft met velden als <code>product_id</code>, <code>quantity</code> en <code>shipping_option</code>. Je vervangt het model, de API reageert nog steeds, je dashboard zegt groen. Maar het nieuwe model geeft <code>productId</code> terug in camelCase. Je parser crasht niet. Hij leest gewoon een leeg veld en slaat een bestelling op zonder product-ID.</p>
<p>Dit is precies het probleem dat Microsoft Foundry beschrijft: model failures zijn vaak stil voor de systemen die het model aanroepen, maar luid voor de eindgebruiker. Dat maakt het zo lastig. Er is geen alarm. Alleen een groeiende supportwachtrij.</p>
<p>Eerlijk gezegd is dit het type fout dat ik zelf ook niet direct zou zien aankomen. Je denkt: ik verander een string, wat kan er misgaan? Veel, blijkt. Elk model heeft zijn eigen &#8216;karakter&#8217; in hoe het formaten, hoe uitgebreid het antwoordt en hoe het tools aanroept. Dat karakter verandert bij elke generatiewissel. Een goed <a href="/ai-begrippen-uitgelegd-glossary-ux-design/">begrip van hoe LLMs werken</a> helpt je hier sneller doorheen.</p>
<h2>GPT-4o stopt op 1 oktober 2026: wat doe jij nu?</h2>
<p>Microsoft maakt het concreet: GPT-4o (versie 2024-05-13) wordt op 1 oktober 2026 afgezet. De opvolger is GPT-5.1. Pay-as-you-go deployments worden automatisch omgezet, maar provisioned deployments (PTU) doe jij zelf. En automatisch omzetten betekent niet dat je app zich hetzelfde gedraagt.</p>
<p>Er zijn drie soorten deployments op Microsoft Foundry, en ze worden elk anders behandeld bij een pensionering:</p>
<ul>
<li><strong>Standard / Global Standard / Data Zone Standard</strong> (pay-as-you-go): worden automatisch geüpgraded. Je bepaalt de timing via de instelling <code>versionUpgradeOption</code>. Kies je <code>NoAutoUpgrade</code>, dan stopt de deployment gewoon op de pensioneringsdatum.</li>
<li><strong>Provisioned (PTU)</strong>: worden <em>niet</em> automatisch gemigreerd. Jij regelt dit zelf, in-place (20-30 minuten zonder downtime) of naast elkaar (side-by-side).</li>
<li><strong>Batch deployments</strong>: altijd side-by-side aanpak. Nieuw model deployen, jobs opnieuw indienen, oud model weggooien.</li>
</ul>
<p>Microsoft maakt een vervangend model beschikbaar in Global Standard ongeveer 90 dagen voor pensionering, in provisioned regio&#8217;s 30 dagen van tevoren en in standaard regio&#8217;s 2 weken ervoor. Je hebt dus tijd, maar die raakt op als je wacht.</p>
<p>Mijn standpunt: begin nu met de validatie op GPT-5.1, ook als je deployment automatisch wordt omgezet. Automatisch verkeer omzetten bewijst niet dat je app zich hetzelfde gedraagt. Dat bewijs lever jij zelf.</p>
<h2>De 6 fasen van een veilige model migratie</h2>
<p>Microsoft Foundry beschrijft zes fasen: Discover, Assess, Adapt, Validate, Roll out en Retire. Elke fase heeft een duidelijk eindpunt. Geen fase overslaan, ook niet als het model &#8216;lijkt te werken&#8217;. De Adapt-fase is voor de meeste productie-apps de zwaarste en meest tijdrovende.</p>
<p>Hier zijn de zes fasen kort uitgelegd, met wat ik er zelf bij denk:</p>
<ol>
<li><strong>Discover</strong>: je hoort dat een model met pensioen gaat, of je wilt proactief upgraden. Einddoel: weet je wat er verandert en wanneer?</li>
<li><strong>Assess</strong>: kies een kandidaat-model en check of het beschikbaar is in jouw regio, SKU en quota. Let op: prijsstructuren veranderen per generatie. Redeneer-tokens, gecachte input en structured-output overhead kunnen je kosten met factor 2 of meer verschuiven.</li>
<li><strong>Adapt</strong>: speel je huidige workload af op het nieuwe model zonder aanpassingen. Kijk waar het gedrag afwijkt: verbositeit, JSON-structuur, tool-aanroepen. Pas daarna je prompts, parameters en output-schema&#8217;s aan.</li>
<li><strong>Validate</strong>: run een evaluatiesuite met concrete kwaliteitscriteria. Azure AI Evaluation SDK heeft meer dan 30 evaluatoren, inclusief LLM-as-judge (dat is een AI die de output van een andere AI beoordeelt).</li>
<li><strong>Roll out</strong>: stuur eerst een klein percentage verkeer naar het nieuwe model (canary deployment). Meet live kwaliteit naast latency en foutpercentages. Houd rollback mogelijk.</li>
<li><strong>Retire</strong>: gooi het oude deployment weg, archiveer je evaluatie-artifacts en noteer wat je hebt geleerd.</li>
</ol>
<p>Fase 0 staat er eigenlijk voor: bouw een testdataset van echte productie-input vóór je begint. Zonder die dataset heb je niets om tegen te valideren. En die dataset moet je nu al loggen, want productie-logs zijn niet retroactief beschikbaar.</p>
<h2>Welke tools helpen je door elke fase heen?</h2>
<p>Microsoft Foundry heeft voor elke fase specifieke tooling: van model-pensioneringschema&#8217;s en leaderboards in Assess, tot de Prompt Optimizer in Adapt en de Azure AI Evaluation SDK in Validate. De tooling is goed, maar er zijn ook gaten waar je zelf iets moet bouwen.</p>
<p>Wat goed werkt in de Foundry toolchain:</p>
<ul>
<li><strong>Discover</strong>: het model-pensioneringschema en de Models API geven je programmatische toegang tot pensioneringsdatums en vervangers. Ideaal voor een interne notificatielaag.</li>
<li><strong>Assess</strong>: model leaderboards vergelijken kwaliteit, veiligheid, kosten, doorvoer en latency. Je kunt tot drie modellen naast elkaar vergelijken.</li>
<li><strong>Adapt</strong>: de Prompt Optimizer in de Foundry Agent playground helpt je prompts aanpassen. Een simulator genereert synthetische testdata als je geen productie-data hebt.</li>
<li><strong>Validate</strong>: Azure AI Evaluation SDK met 30+ evaluatoren. Inclusief LLM-as-judge voor kwalitatieve beoordeling.</li>
<li><strong>Roll out</strong>: automatische upgrade-opties, continuous evaluation en Azure Monitor alerts.</li>
<li><strong>Retire</strong>: de Models API geeft een 410 Gone terug als een model echt offline is. Je observability dashboard toont het deployment-aantal.</li>
</ul>
<p>Waar het soms misgaat: teams ontdekken een pensionering via e-mail of een productie-fout, in plaats van via een gestructureerd systeem. En soms blijkt een gekozen model niet beschikbaar in de vereiste regio, iets wat je pas ontdekt als de planning al klaar is. Dat is vervelend. Mijn advies: valideer beschikbaarheid in jouw specifieke regio als eerste stap in de Assess-fase, niet als laatste.</p>
<p>Als je meer wilt weten over wat AI-implementatie in de praktijk kost, ook buiten de licentiekosten, bekijk dan <a href="/ai-implementatie-kosten-meer-dan-techniek/">wat AI implementatie echt kost aan tijd en aanpassing</a>.</p>
<h2>Wat moet jij nu concreet doen als je een AI-app draait?</h2>
<p>Check welk model je deployment gebruikt en wanneer dat model met pensioen gaat. Zet logging aan als je dat nog niet hebt. Start alvast met het bouwen van een testdataset op basis van echte productie-input. Wacht niet op een pensioneringsbericht.</p>
<p>Drie concrete stappen die je deze week kunt zetten:</p>
<ol>
<li><strong>Check je deployment type.</strong> Gebruik je Standard of Provisioned? Bij Provisioned doe jij de migratie zelf. Dat wil je weten voordat de deadline nadert.</li>
<li><strong>Zet content capture aan.</strong> Log je prompts, responses, latency en token-aantallen nu. Dit is opt-in en nooit retroactief. Zonder logs heb je geen testdataset voor Validate.</li>
<li><strong>Plan een side-by-side test.</strong> Draai je huidige workload op GPT-5.1 naast je huidige model. Kijk waar de output afwijkt. Dat hoeft niet perfect te zijn, maar je wilt weten waar de risico&#8217;s zitten voordat je live gaat.</li>
</ol>
<p>Overigens: je hoeft niet te wachten op een pensioneringsbericht om te beginnen. Als een nieuw model betere kwaliteit of lagere kosten biedt, is dat reden genoeg om het proces te starten. Een geplande migratie is altijd minder stressvol dan een gedwongen upgrade op een datum die je niet hebt gekozen.</p>
<p>Voor bredere context over hoe AI-tools en -modellen zich in 2026 ontwikkelen, is het ook de moeite waard om te volgen <a href="/google-ads-ai-updates-ask-advisor-analytics/">hoe grote platforms als Google hun AI-functies uitrollen</a> en wat dat voor afhankelijkheden in je toolstack betekent.</p>
<div class="nn-related-posts">
<h3>Dit vind je misschien ook interessant</h3>
<ul>
<li><a href="https://nixonews.nl/anthropic-model-2-intern-gebruik-mythos/">Claude AI vs ChatGPT: Anthropic&amp;#8217;s sterkste model is niet voor jou</a></li>
<li><a href="https://nixonews.nl/google-ads-ai-updates-ask-advisor-analytics/">Google Ads AI-updates: wat verandert er echt voor jou?</a></li>
<li><a href="https://nixonews.nl/claude-hackte-bedrijven-cybersecurity-tests/">Claude AI beveiliging: zo hackte het drie bedrijven tijdens tests</a></li>
</ul>
</div>
]]></content:encoded>
					
					<wfw:commentRss>https://nixonews.nl/llm-model-migratie-ai-applicaties/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
