AI & modellen26 aug 2026, 20:43 · Aangepast 21:07

Top-code voor een tiende van de prijs: wat GLM-5.3 écht laat zien (en wat niet)

De Chinese AI-aanbieder Z.ai bracht in augustus twee modellen uit die op papier de beste open-source codeer- en cybermodellen zijn: GLM-5.3 (14 augustus) en het tien keer goedkopere GLM-5.3-Flash, wekenlang anoniem bekend als 'ox-alpha'. Belangrijkste voorbehoud: vrijwel alle cijfers komen van Z.ai zelf.

Het is journalistiek curios: een model-release zonder speculatie rondom geheime architectuur of reuzengrote parametercounts. GLM-5.3 gebruikt volgens Z.ai dezelfde basis als zijn voorganger (743 miljard parameters, waarvan ~40 miljard actief per token) en alle winst komt uit post-training.

Z.ai's prestatievergelijking van GLM-5.3 tegenover conc
Z.ai's prestatievergelijking van GLM-5.3 tegenover concurrenten op codeer-, cyber- en agentic-benchmarks. Bron: z.ai/blog/glm-5.3

Twee modellen, twee verhalen

Op publieke benchmarks claimt Z.ai open-source state-of-the-art, maar alleen op toetsen die het bedrijf zelf afneemt. Terminal-Bench 3.0 springt van 4,6 naar 28,3; Agents' Last Exam (CLI) van 23,8 naar 28,5; DeepSWE v1.1 van 46,2 naar 66,9; AutomationBench van 26,2 naar 48,2.

GLM-5.3-Flash is een ander verhaal. Het model draaide ongeveer een week anoniem als 'ox-alpha' op OpenCode en OpenRouter en was volgens OfficeChai het meest besproken model van die week, voordat Z.ai de naam bevestigde. Anders dan GLM-5.3 is dit een nieuw getraind basis-model: 320 miljard parameters totaal, slechts 18 miljard actief, met hybride attention en een pre-training-corpus van 30 biljoen tokens. De prijs ligt rond een tiende van het grote broertje.

De benchmarkgrafiek die OfficeChai publiceerde bij de o
De benchmarkgrafiek die OfficeChai publiceerde bij de onthulling van GLM-5.3-Flash ('ox-alpha'). Bron: OfficeChai, 26 aug 2026
Token-efficiëntie op Z.ai Code Bench: hogere taak-afron
Token-efficiëntie op Z.ai Code Bench: hogere taak-afronding bij kleinere token-budgetten op elk effort-niveau. Bron: z.ai/blog/glm-5.3

Wat de benchmarks écht betekenen

Terminal-Bench 3.0 vraagt of een model een kapotte computeromgeving zelfstandig kan repareren — pas geslaagd als alle tests weer groen zijn. Versie 3.0 is véél zwaarder dan zijn voorganger, dáárom liggen álle scores laag, ook die van de duurste concurrenten (Fable 5: 33,7; GPT-5.6 Sol: 34,6). De sprong van 4,6 naar 28,3 is relatief enorm, absoluut nog geen koppositie.

DeepSWE v1.1 meet of een model wekenlang aan één project kan werken zonder de draad te verliezen — denk aan 'voeg een betaalmethode toe in deze bestaande webshop', inclusief database, backend én honderden tests die blijven slagen. Dit komt dagelijks programmeerwerk het dichtst bij; daar steeg GLM-5.3 van 46,2 naar 66,9.

Z.ai Code Bench is het examen van de school zelf: meet taak-afronding én token-verbruik, en tokens zijn geld. Volgens Z.ai haalt GLM-5.3 op max-effort 34,5 procent bij ~75K output-tokens per klus; op high-effort passeert het Claude Opus 4.8 (31,4 vs 29,5 procent) met nog geen helft aan tokens. Twee loodgieters, dezelfde klus — één rekent minder uur.

GDPval-AA v2 is wél onafhankelijk (Artificial Analysis): kenniswerk over 44 beroepen, beoordeeld met Elo zoals bij schaken. GLM-5.3: 1769, ruim omhoog vanaf 1508. En op KingBench 3, de vaste takenlijst van één onderzoeker, is GLM-5.3 met 91,25 procent het beste model ooit op die test — boven Claude Fable 5.

Cyber-capability: CyberGym 84,5% (SOTA), ExploitBench 5
Cyber-capability: CyberGym 84,5% (SOTA), ExploitBench 54,4 en ExploitGym 105/130 taken. Bron: z.ai/blog/glm-5.3
STELLING VAN DE DAG · HALFWEG HET ARTIKEL, EVEN PAUZE

Automatisering door AI gaat in tien jaar meer banen weggeven dan het oplevert — en dat is goed voor de economie.

Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.

Eens
Oneens
1.203 stemmen · blijft anoniem✓ Stem bezorgd bij de redactie!

Het cyberhoofdstuk

De grootste verrassing zit in beveiliging. Op CyberGym (defensief: vind de kwetsbaarheid in broncode en bewijs ze door ze te laten crashen) haalt GLM-5.3 84,5 procent — nipt boven Mythos 5 en GPT-5.6 Sol, al zijn die marges kleiner dan de ruis. Op de offensieve tegenhangers verdubbelt de score wél (24,4 naar 54,4 op ExploitBench), maar blijft het ver achter de gesloten top (Fable 5: 78). Z.ai zegt dat cybercapaciteit 'sneller groeide dan verwacht' en meldt 2.436 gevonden kwetsbaarheden in 269 open-sourceprojecten, waarvan 53 nu openbaar.

Wat weten we zéker?

Reuters meldde dat de benchmarkresultaten niet onafhankelijk zijn geverifieerd. De open gewichten (MIT-licentie) komen pas eind augustus uit, dus reproduceren kon niemand buiten Z.ai. Vaststaat: de onafhankelijke GDPval-score, de KingBench-run en het feit dat dezelfde basis ineens recordresultaten haalt. Voor iedereen die dagelijks met coding-agents werkt is Flash het interessantste verhaal: topconcurrentie, tiende van de prijs.

«Dit artikel is geschreven met behulp van AI en vóór publicatie feitelijk gecontroleerd door de menselijke redactie.»

Geschreven door AI · gecontroleerd door mensen

WhatsApp X / Twitter

Gerelateerd

Benchmarks uitgelegd: 5 toetsen die tellenUitleg · 6 min
Ox Alpha ontrafeld: weekje lang anoniem top-modelAI & modellen
Open gewichten: waarom twee weken wachten?Verdieping