<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Artikelen over AI evaluatie | Nixo News</title>
	<atom:link href="https://nixonews.nl/tag/ai-evaluatie/feed/" rel="self" type="application/rss+xml" />
	<link>https://nixonews.nl</link>
	<description>Het laatste nieuws over AI, Webdesign en Development</description>
	<lastBuildDate>Fri, 11 Sep 2026 16:33:45 +0000</lastBuildDate>
	<language>nl-NL</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI videobeschrijvingen kwaliteit meten: hoe goed is goed genoeg?</title>
		<link>https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/</link>
					<comments>https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/#respond</comments>
		
		<dc:creator><![CDATA[Sepp Stokbroekx]]></dc:creator>
		<pubDate>Fri, 11 Sep 2026 16:33:41 +0000</pubDate>
				<category><![CDATA[AI Content Tools]]></category>
		<category><![CDATA[Artificial Intelligence]]></category>
		<category><![CDATA[AI content tools]]></category>
		<category><![CDATA[AI evaluatie]]></category>
		<category><![CDATA[AI kwaliteit]]></category>
		<category><![CDATA[AI onderzoek]]></category>
		<category><![CDATA[AI videobeschrijvingen]]></category>
		<category><![CDATA[benchmark]]></category>
		<category><![CDATA[multimodale AI]]></category>
		<category><![CDATA[videocaptioning]]></category>
		<guid isPermaLink="false">https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/</guid>

					<description><![CDATA[AI-modellen genereren videobeschrijvingen, maar hoe meet je of die kloppen? De standaardmethode deugt niet. CapQuiz bewijst dat met een slimmere aanpak.]]></description>
										<content:encoded><![CDATA[<p><strong>Kort antwoord:</strong> De meeste benchmarks voor AI videobeschrijvingen kwaliteit vergelijken gegenereerde tekst met een referentietekst. Dat werkt niet: twee correcte beschrijvingen van dezelfde video kunnen totaal anders klinken. CapQuiz lost dit op door beschrijvingen te toetsen aan meerkeuzevragen over de video zelf. Factualiteit en dekking meet je apart. Dat geeft een eerlijker beeld van wat een AI-model echt ziet en begrijpt.</p>
<h2>Waarom de huidige manier van meten niet klopt?</h2>
<p>Stel je voor: je laat een AI een video beschrijven en vergelijkt die tekst met een handmatig geschreven referentie. Als de woorden niet overeenkomen, scoort de AI slecht. Maar wat als de AI-beschrijving gewoon een andere invalshoek kiest, en toch correct is? Dat is precies het probleem met gangbare meetmethoden voor videobeschrijvingen. Ze straffen afwijking af, ook als die afwijking inhoudelijk juist is. Het gevolg: ontwikkelaars optimaliseren modellen voor woordovereenkomst in plaats van voor feitelijke nauwkeurigheid.</p>
<p>Het probleem heet het &#8216;one-to-many&#8217; probleem. Eén video kan op tien manieren correct beschreven worden. De ene beschrijving focust op de mensen in beeld, de andere op de omgeving, de derde op de actie. Alle drie kunnen kloppen. Maar als je ze vergelijkt met één referentietekst, lijken er maar twee goed te zijn.</p>
<p>Dit klinkt als een academisch probleem, maar het heeft praktische gevolgen. Als jij AI-tools gebruikt om video&#8217;s te beschrijven, ondertitels te genereren of metadata aan te maken voor je website, dan trainen en beoordelen ontwikkelaars die tools op dit soort gebrekkige metrics. Ze mikken dus op iets wat niet overeenkomt met wat jij eigenlijk wilt: een beschrijving die klopt met wat er echt te zien is.</p>
<p>Ik gebruik zelf AI-tools voor contentproductie, en dit is een punt waar ik sceptisch over ben. Een hoge score op een benchmark zegt weinig als die benchmark het verkeerde meet. Het is vergelijkbaar met een leerling die goed is in overschrijven maar niet in begrijpen. <a href="/ai-begrippen-uitgelegd-glossary-ux-design/">In het AI-begrippen overzicht</a> leg ik uit hoe dit soort evaluatieproblemen vaker opduiken bij taalmodellen.</p>
<h2>Wat doet CapQuiz anders dan bestaande benchmarks?</h2>
<p>CapQuiz beoordeelt een videobeschrijving niet door hem te vergelijken met een referentietekst, maar door te kijken of de beschrijving bruikbaar is om vragen over de video te beantwoorden. Die vragen zijn meerkeuze, door mensen geverifieerd, en verdeeld over tien vraagtypen in 24 videocategorieën. Een beschrijving is goed als je er de juiste antwoorden mee kunt vinden. Niet als hij toevallig op dezelfde woorden lijkt als een andere beschrijving.</p>
<p>Het idee is eenvoudig: als een beschrijving goed is, moet je er informatie uit kunnen halen die overeenkomt met wat er echt in de video gebeurt. CapQuiz stelt dus vragen die je alleen kunt beantwoorden als de beschrijving feitelijk klopt én voldoende detail bevat.</p>
<p>Daarvoor introduceert het onderzoek twee nieuwe maatstaven. CapP meet factualiteit: klopt wat er staat? CapR meet dekking: hoe volledig is de beschrijving? Samen geven ze de CapF1-score, een gecombineerde maatstaf die beter correleert met menselijke oordelen dan bestaande methoden.</p>
<p>Wat me aanspreekt: de vragen zijn door mensen geverifieerd. Dat is een stuk geloofwaardiger dan automatisch gegenereerde testsets, waarbij je het risico hebt dat de testset dezelfde fouten maakt als het model. Toch wil ik hier één voorbehoud maken: dit systeem is zelf ook afhankelijk van een AI-model dat de vragen beantwoordt op basis van de beschrijving. Dat model kan fouten maken. De benchmark is beter dan zijn voorgangers, maar niet perfect.</p>
<p>Voor wie meer wil weten over hoe AI-modellen onderling vergeleken worden: <a href="/llm-model-migratie-ai-applicaties/">dit artikel over LLM model migratie</a> laat zien hoe afhankelijk je van dit soort kwaliteitsverschillen bent als je overstapt van het ene naar het andere model.</p>
<h2>Wat betekent dit als je AI inzet voor videocontentproductie?</h2>
<p>Als ondernemer gebruik je AI misschien om ondertitels te maken, video&#8217;s samen te vatten of metadata te genereren voor je website. De kwaliteit van die output hangt af van hoe goed het onderliggende model video&#8217;s begrijpt. Onderzoek als CapQuiz laat zien dat de huidige manier van meten die kwaliteit onderschat of overschat. Dat heeft directe gevolgen voor welke tool je kiest en hoe je de output controleert.</p>
<p>Stel je vertrouwt op een AI-tool om productvideos op je webshop automatisch van beschrijvingen te voorzien. Die tool scoort goed op de benchmarks die het bedrijf op de marketingpagina noemt. Maar als die benchmarks het verkeerde meten, zegt die score weinig over of de beschrijvingen daadwerkelijk kloppen met wat er in de video te zien is.</p>
<p>Mijn advies is simpel: vertrouw niet blind op benchmark-claims van AI-tools. Kijk liever naar concrete voorbeelden. Laat de tool een video beschrijven die jij goed kent en controleer of de beschrijving klopt. Dat duurt vijf minuten en leert je meer dan een whitepaper vol grafieken.</p>
<p>Dit soort onderzoek is nuttig als context, maar het lost jouw probleem niet direct op. Het laat wel zien dat de industrie zelf worstelt met het definiëren van &#8216;goed&#8217;. Dat betekent dat jij als gebruiker kritisch moet blijven, ook als een tool indrukwekkend klinkt. <a href="/ai-implementatie-kosten-meer-dan-techniek/">De echte kosten van AI-implementatie</a> zitten vaak in precies dit soort kwaliteitscontrole die je niet had verwacht.</p>
<p>Overigens: als je AI-tools inzet voor webdesign of contentproductie, is het de moeite waard om te kijken <a href="/figma-weave-workflows-visual-content/">hoe Figma Weave herbruikbare AI-workflows opzet</a>. Daarmee leg je tenminste vast wat je verwacht, ook al kun je de output nog niet automatisch meten.</p>
<div class="nn-related-posts">
<h3>Dit vind je misschien ook interessant</h3>
<ul>
<li><a href="https://nixonews.nl/llm-model-migratie-ai-applicaties/">LLM model migratie: zo doe je het zonder gedoe</a></li>
<li><a href="https://nixonews.nl/anthropic-model-2-intern-gebruik-mythos/">Claude AI vs ChatGPT: Anthropic&amp;#8217;s sterkste model is niet voor jou</a></li>
<li><a href="https://nixonews.nl/google-ads-ai-updates-ask-advisor-analytics/">Google Ads AI-updates: wat verandert er echt voor jou?</a></li>
</ul>
</div>
]]></content:encoded>
					
					<wfw:commentRss>https://nixonews.nl/ai-videobeschrijvingen-kwaliteit-meten-capquiz/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>LLM model migratie: zo doe je het zonder gedoe</title>
		<link>https://nixonews.nl/llm-model-migratie-ai-applicaties/</link>
					<comments>https://nixonews.nl/llm-model-migratie-ai-applicaties/#respond</comments>
		
		<dc:creator><![CDATA[Sepp Stokbroekx]]></dc:creator>
		<pubDate>Tue, 01 Sep 2026 06:02:52 +0000</pubDate>
				<category><![CDATA[AI Implementatie]]></category>
		<category><![CDATA[Artificial Intelligence]]></category>
		<category><![CDATA[AI evaluatie]]></category>
		<category><![CDATA[AI implementatie]]></category>
		<category><![CDATA[Azure OpenAI]]></category>
		<category><![CDATA[GPT-4o]]></category>
		<category><![CDATA[GPT-5.1]]></category>
		<category><![CDATA[LLM migratie]]></category>
		<category><![CDATA[Microsoft Foundry]]></category>
		<category><![CDATA[model deployment]]></category>
		<category><![CDATA[model pensionering]]></category>
		<category><![CDATA[prompt engineering]]></category>
		<guid isPermaLink="false">https://nixonews.nl/llm-model-migratie-ai-applicaties/</guid>

					<description><![CDATA[Je AI-app werkt prima, maar het model eronder wordt binnenkort afgezet. Eén regel code aanpassen klinkt simpel. Het is het niet. Dit is hoe je een model migratie goed aanpakt.]]></description>
										<content:encoded><![CDATA[<p><strong>Kort antwoord:</strong> Een LLM model migratie is meer dan een naam veranderen in je code. Het model achter je AI-app kan stil veranderen in toon, JSON-output en tool-aanroepen zonder dat je dashboards iets signaleren. Microsoft Foundry hanteert een 6-fasen proces: Discover, Assess, Adapt, Validate, Roll out en Retire. GPT-4o (2024-05-13) gaat per 1 oktober 2026 offline; de opvolger is GPT-5.1.</p>
<h2>Waarom één regel code veranderen zo gevaarlijk is?</h2>
<p>Het aanpassen van een model naam in je code lijkt triviaal. Maar een nieuw model kan volledig andere JSON teruggeven, langere samenvattingen produceren, of tool-aanroepen in een andere volgorde afvuren. Je foutmeldingenlog blijft leeg. Je gebruikers krijgen rare antwoorden. Dat is het echte risico van een model migratie zonder plan.</p>
<p>Stel je bouwt een bestelassistent voor een webshop. Die roept een AI-model aan, dat JSON teruggeeft met velden als <code>product_id</code>, <code>quantity</code> en <code>shipping_option</code>. Je vervangt het model, de API reageert nog steeds, je dashboard zegt groen. Maar het nieuwe model geeft <code>productId</code> terug in camelCase. Je parser crasht niet. Hij leest gewoon een leeg veld en slaat een bestelling op zonder product-ID.</p>
<p>Dit is precies het probleem dat Microsoft Foundry beschrijft: model failures zijn vaak stil voor de systemen die het model aanroepen, maar luid voor de eindgebruiker. Dat maakt het zo lastig. Er is geen alarm. Alleen een groeiende supportwachtrij.</p>
<p>Eerlijk gezegd is dit het type fout dat ik zelf ook niet direct zou zien aankomen. Je denkt: ik verander een string, wat kan er misgaan? Veel, blijkt. Elk model heeft zijn eigen &#8216;karakter&#8217; in hoe het formaten, hoe uitgebreid het antwoordt en hoe het tools aanroept. Dat karakter verandert bij elke generatiewissel. Een goed <a href="/ai-begrippen-uitgelegd-glossary-ux-design/">begrip van hoe LLMs werken</a> helpt je hier sneller doorheen.</p>
<h2>GPT-4o stopt op 1 oktober 2026: wat doe jij nu?</h2>
<p>Microsoft maakt het concreet: GPT-4o (versie 2024-05-13) wordt op 1 oktober 2026 afgezet. De opvolger is GPT-5.1. Pay-as-you-go deployments worden automatisch omgezet, maar provisioned deployments (PTU) doe jij zelf. En automatisch omzetten betekent niet dat je app zich hetzelfde gedraagt.</p>
<p>Er zijn drie soorten deployments op Microsoft Foundry, en ze worden elk anders behandeld bij een pensionering:</p>
<ul>
<li><strong>Standard / Global Standard / Data Zone Standard</strong> (pay-as-you-go): worden automatisch geüpgraded. Je bepaalt de timing via de instelling <code>versionUpgradeOption</code>. Kies je <code>NoAutoUpgrade</code>, dan stopt de deployment gewoon op de pensioneringsdatum.</li>
<li><strong>Provisioned (PTU)</strong>: worden <em>niet</em> automatisch gemigreerd. Jij regelt dit zelf, in-place (20-30 minuten zonder downtime) of naast elkaar (side-by-side).</li>
<li><strong>Batch deployments</strong>: altijd side-by-side aanpak. Nieuw model deployen, jobs opnieuw indienen, oud model weggooien.</li>
</ul>
<p>Microsoft maakt een vervangend model beschikbaar in Global Standard ongeveer 90 dagen voor pensionering, in provisioned regio&#8217;s 30 dagen van tevoren en in standaard regio&#8217;s 2 weken ervoor. Je hebt dus tijd, maar die raakt op als je wacht.</p>
<p>Mijn standpunt: begin nu met de validatie op GPT-5.1, ook als je deployment automatisch wordt omgezet. Automatisch verkeer omzetten bewijst niet dat je app zich hetzelfde gedraagt. Dat bewijs lever jij zelf.</p>
<h2>De 6 fasen van een veilige model migratie</h2>
<p>Microsoft Foundry beschrijft zes fasen: Discover, Assess, Adapt, Validate, Roll out en Retire. Elke fase heeft een duidelijk eindpunt. Geen fase overslaan, ook niet als het model &#8216;lijkt te werken&#8217;. De Adapt-fase is voor de meeste productie-apps de zwaarste en meest tijdrovende.</p>
<p>Hier zijn de zes fasen kort uitgelegd, met wat ik er zelf bij denk:</p>
<ol>
<li><strong>Discover</strong>: je hoort dat een model met pensioen gaat, of je wilt proactief upgraden. Einddoel: weet je wat er verandert en wanneer?</li>
<li><strong>Assess</strong>: kies een kandidaat-model en check of het beschikbaar is in jouw regio, SKU en quota. Let op: prijsstructuren veranderen per generatie. Redeneer-tokens, gecachte input en structured-output overhead kunnen je kosten met factor 2 of meer verschuiven.</li>
<li><strong>Adapt</strong>: speel je huidige workload af op het nieuwe model zonder aanpassingen. Kijk waar het gedrag afwijkt: verbositeit, JSON-structuur, tool-aanroepen. Pas daarna je prompts, parameters en output-schema&#8217;s aan.</li>
<li><strong>Validate</strong>: run een evaluatiesuite met concrete kwaliteitscriteria. Azure AI Evaluation SDK heeft meer dan 30 evaluatoren, inclusief LLM-as-judge (dat is een AI die de output van een andere AI beoordeelt).</li>
<li><strong>Roll out</strong>: stuur eerst een klein percentage verkeer naar het nieuwe model (canary deployment). Meet live kwaliteit naast latency en foutpercentages. Houd rollback mogelijk.</li>
<li><strong>Retire</strong>: gooi het oude deployment weg, archiveer je evaluatie-artifacts en noteer wat je hebt geleerd.</li>
</ol>
<p>Fase 0 staat er eigenlijk voor: bouw een testdataset van echte productie-input vóór je begint. Zonder die dataset heb je niets om tegen te valideren. En die dataset moet je nu al loggen, want productie-logs zijn niet retroactief beschikbaar.</p>
<h2>Welke tools helpen je door elke fase heen?</h2>
<p>Microsoft Foundry heeft voor elke fase specifieke tooling: van model-pensioneringschema&#8217;s en leaderboards in Assess, tot de Prompt Optimizer in Adapt en de Azure AI Evaluation SDK in Validate. De tooling is goed, maar er zijn ook gaten waar je zelf iets moet bouwen.</p>
<p>Wat goed werkt in de Foundry toolchain:</p>
<ul>
<li><strong>Discover</strong>: het model-pensioneringschema en de Models API geven je programmatische toegang tot pensioneringsdatums en vervangers. Ideaal voor een interne notificatielaag.</li>
<li><strong>Assess</strong>: model leaderboards vergelijken kwaliteit, veiligheid, kosten, doorvoer en latency. Je kunt tot drie modellen naast elkaar vergelijken.</li>
<li><strong>Adapt</strong>: de Prompt Optimizer in de Foundry Agent playground helpt je prompts aanpassen. Een simulator genereert synthetische testdata als je geen productie-data hebt.</li>
<li><strong>Validate</strong>: Azure AI Evaluation SDK met 30+ evaluatoren. Inclusief LLM-as-judge voor kwalitatieve beoordeling.</li>
<li><strong>Roll out</strong>: automatische upgrade-opties, continuous evaluation en Azure Monitor alerts.</li>
<li><strong>Retire</strong>: de Models API geeft een 410 Gone terug als een model echt offline is. Je observability dashboard toont het deployment-aantal.</li>
</ul>
<p>Waar het soms misgaat: teams ontdekken een pensionering via e-mail of een productie-fout, in plaats van via een gestructureerd systeem. En soms blijkt een gekozen model niet beschikbaar in de vereiste regio, iets wat je pas ontdekt als de planning al klaar is. Dat is vervelend. Mijn advies: valideer beschikbaarheid in jouw specifieke regio als eerste stap in de Assess-fase, niet als laatste.</p>
<p>Als je meer wilt weten over wat AI-implementatie in de praktijk kost, ook buiten de licentiekosten, bekijk dan <a href="/ai-implementatie-kosten-meer-dan-techniek/">wat AI implementatie echt kost aan tijd en aanpassing</a>.</p>
<h2>Wat moet jij nu concreet doen als je een AI-app draait?</h2>
<p>Check welk model je deployment gebruikt en wanneer dat model met pensioen gaat. Zet logging aan als je dat nog niet hebt. Start alvast met het bouwen van een testdataset op basis van echte productie-input. Wacht niet op een pensioneringsbericht.</p>
<p>Drie concrete stappen die je deze week kunt zetten:</p>
<ol>
<li><strong>Check je deployment type.</strong> Gebruik je Standard of Provisioned? Bij Provisioned doe jij de migratie zelf. Dat wil je weten voordat de deadline nadert.</li>
<li><strong>Zet content capture aan.</strong> Log je prompts, responses, latency en token-aantallen nu. Dit is opt-in en nooit retroactief. Zonder logs heb je geen testdataset voor Validate.</li>
<li><strong>Plan een side-by-side test.</strong> Draai je huidige workload op GPT-5.1 naast je huidige model. Kijk waar de output afwijkt. Dat hoeft niet perfect te zijn, maar je wilt weten waar de risico&#8217;s zitten voordat je live gaat.</li>
</ol>
<p>Overigens: je hoeft niet te wachten op een pensioneringsbericht om te beginnen. Als een nieuw model betere kwaliteit of lagere kosten biedt, is dat reden genoeg om het proces te starten. Een geplande migratie is altijd minder stressvol dan een gedwongen upgrade op een datum die je niet hebt gekozen.</p>
<p>Voor bredere context over hoe AI-tools en -modellen zich in 2026 ontwikkelen, is het ook de moeite waard om te volgen <a href="/google-ads-ai-updates-ask-advisor-analytics/">hoe grote platforms als Google hun AI-functies uitrollen</a> en wat dat voor afhankelijkheden in je toolstack betekent.</p>
<div class="nn-related-posts">
<h3>Dit vind je misschien ook interessant</h3>
<ul>
<li><a href="https://nixonews.nl/anthropic-model-2-intern-gebruik-mythos/">Claude AI vs ChatGPT: Anthropic&amp;#8217;s sterkste model is niet voor jou</a></li>
<li><a href="https://nixonews.nl/google-ads-ai-updates-ask-advisor-analytics/">Google Ads AI-updates: wat verandert er echt voor jou?</a></li>
<li><a href="https://nixonews.nl/claude-hackte-bedrijven-cybersecurity-tests/">Claude AI beveiliging: zo hackte het drie bedrijven tijdens tests</a></li>
</ul>
</div>
]]></content:encoded>
					
					<wfw:commentRss>https://nixonews.nl/llm-model-migratie-ai-applicaties/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
