AI Implementatie

Claude AI vs ChatGPT: Anthropic’s sterkste model is niet voor jou

Serverruimte van een AI-lab waar interne Claude AI-modellen draaien

Foto: panumas nikhomkhai via Pexels

Kort antwoord

Anthropic gebruikt intern een ongepubliceerd AI-model genaamd Model 2. In de claude ai vs chatgpt discussie is dit relevant: het beste model van een lab is zelden het model dat jij kunt gebruiken. Model 2 scoort 1,5 punten hoger dan het publiek beschikbare Claude Mythos 5 op Anthropics eigen capaciteitsindex. Het schrijft inmiddels het grootste deel van Anthropics productiecode. Er zijn geen plannen voor publieke release.

Wat is Model 2 en hoe sterk is het precies? 1,5 punt hoger op interne index

Anthropic heeft intern een model in gebruik dat ze Model 2 noemen, ingedeeld in de Mythos-klasse. Op hun interne capaciteitsindex, de AECI, scoort het 1,5 punten hoger dan Claude Mythos 5, het sterkste model dat nu publiek beschikbaar is. Dat klinkt indrukwekkend, maar de sprong is kleiner dan de stap van Mythos Preview naar Mythos 5. Model 2 is op sommige vlakken zelfs zwakker dan Mythos 5. Geen grote generatiesprong dus, eerder een incrementele verbetering.

De AECI is een verzameling interne benchmarks waarmee Anthropic bijhoudt hoe capabel hun modellen zijn. Benchmarks zijn altijd een momentopname: ze meten wat je ervoor kiest te meten. Dat Anthropic zelf zegt dat Model 2 slechts 1,5 punt hoger scoort, is waarschijnlijk eerlijk, maar het is ook hun eigen meetlat.

Wat meer zegt: Anthropic omschrijft het verschil als 'iets sterker overall, maar zwakker op sommige gebieden'. Dat is geen doorbraak. Het is een fijnafstelling. Ze trekken geen grote conclusies over wat dit model anders maakt. Opvallend voor een bedrijf dat normaal graag over haar modellen communiceert.

Voor de context: als je nu al werkt met Claude Code en de bijbehorende gebruikslimieten, dan is dit het soort model dat intern de basis vormt voor verdere ontwikkeling. Jij ziet het niet, maar het beïnvloedt wel hoe het systeem zich verder ontwikkelt.

Schrijft AI nu de code van een AI-bedrijf zelf? AI schrijft productie-code

Ja, en dat is misschien wel het meest concrete gegeven uit dit verhaal. Anthropic meldt dat Claude inmiddels het grootste deel van de code schrijft die in hun eigen productiesystemen draait. Model 2 zit daar middenin, deels via agents die continu doorwerken. Het model is intern gereviewed, maar minder grondig getest dan Mythos 5 publiek is getest. Anthropic ziet geen nieuwe of zorgwekkendere vormen van misalignment.

Misalignment is een term uit AI-veiligheidsonderzoek. Het betekent dat een model doelen nastreeft die niet overeenkomen met wat mensen bedoelen of willen. Anthropic zegt dat de risico's hierop 'laag' zijn voor Model 2, en dat ze bij de interne review niks nieuws of verontrustends hebben gevonden.

Dit is een vrij openhartige mededeling. De meeste AI-labs vertellen je niet welk model ze intern gebruiken, laat staan dat ze zeggen dat het hun eigen productiecode schrijft. Dat Anthropic dit publiceert in een risicoreport, is een teken dat ze hun veiligheidscommunicatie serieus nemen.

Of dat genoeg is? Dat is een andere vraag. Lees ook hoe Anthropic zijn veiligheidsnormen aanscherpt. Dit past in dat patroon: transparantie over wat er intern gebeurt, ook als het ongemakkelijk is.

Wat betekent dit als je nu Claude gebruikt voor je werk?

Eerlijk gezegd: weinig direct. Je hebt geen toegang tot Model 2, en er zijn geen plannen om dat te veranderen. Wat je meeneemt: het beste model van een AI-lab is zelden het model dat jij kunt gebruiken. Dat geldt voor Anthropic, maar ook voor andere labs. De publieke modellen zijn krachtig genoeg voor het meeste werk. Maar denk je dat je het absolute topmodel gebruikt? Dat klopt waarschijnlijk niet.

De kloof tussen intern gebruik en publieke toegang is structureel. Dat is niet per se erg. Labs testen nieuwe modellen eerst intern voor ze ze breed uitrollen. Dat is verantwoord. Maar het betekent ook dat als jij nu Claude Mythos 5 gebruikt, je werkt met een model dat intern al ingehaald is.

Voor de meeste taken maakt dat niks uit. Gebruik je Claude om tekst te schrijven, code te reviewen of vragen te beantwoorden? Dan is Mythos 5 meer dan krachtig genoeg. De 1,5 punten extra die Model 2 scoort op een interne index, vertalen zich niet automatisch naar merkbaar betere output op alledaagse taken.

Waar het relevant wordt: als je AI inzet voor complexe, meerstaps-taken zoals AI-agents die als ontwikkelteam werken. Dan kunnen kleine capaciteitsverschillen op de marge groot worden. Maar dat is voor de meeste Nederlandse ondernemers nog toekomstmuziek.

De echte les hier is een andere: vergelijk AI-modellen niet op basis van wat labs intern gebruiken, maar op basis van wat jij ermee doet in de praktijk. De eerlijke vergelijking tussen ChatGPT Pro en Claude is relevanter dan het bestaan van een model dat je toch niet kunt aanraken.

Conclusie

Anthropic gebruikt intern een krachtiger model dan het publiek aanbiedt, wat bij AI-labs normaler is dan het lijkt.

Model 2 scoort 1,5 punten hoger dan Mythos 5 op Anthropics interne benchmark, maar toont geen grote capaciteitssprong.

Dat AI-labs hun eigen tools anders inzetten dan klanten dat kunnen, is een reëel verschil om rekening mee te houden.

Veelgestelde vragen

Anthropic heeft geen plannen aangekondigd om Model 2 publiek beschikbaar te maken. Het model wordt intern gebruikt voor coding, data-generatie en onderzoek. Of het ooit uitkomt, is onbekend. Volg Anthropics officiële nieuwspagina voor updates over nieuwe modelreleases.

Ja, Claude Mythos 5 is op dit moment het krachtigste model dat Anthropic publiek aanbiedt. Model 2 scoort intern 1,5 punten hoger op Anthropics eigen capaciteitsindex, maar is niet beschikbaar voor externe gebruikers. Voor de meeste zakelijke toepassingen is Mythos 5 meer dan toereikend. Wil je weten hoe Claude zich verhoudt tot alternatieven? Lees dan onze vergelijking van ChatGPT Pro en Claude.

Misalignment betekent dat een AI-model doelen nastreeft die niet overeenkomen met wat mensen bedoelen of willen. Anthropic beoordeelt het risico op misalignment bij Model 2 als 'laag' na een interne review. De veiligheidsonderzoeken van Anthropic zijn publiek toegankelijk als je meer wilt weten over hoe ze dit meten.