NET BINNEN
Z.ai lanceert GLM-5.3 en Flash — open gewichten binnen twee wekenCloudflare bouwt eigen inferentie-chipsEU stemt dinsdag over AI Act-zorguitzonderingNVIDIA onthult nieuwe architectuur eerder dan gepland Z.ai lanceert GLM-5.3 en Flash — open gewichten binnen twee wekenCloudflare bouwt eigen inferentie-chipsEU stemt dinsdag over AI Act-zorguitzonderingNVIDIA onthult nieuwe architectuur eerder dan gepland
AI & modellen12 min. geleden

Top-code voor een tiende van de prijs: wat GLM-5.3 écht laat zien (en wat niet)

Het Chinese lab zet dezelfde basis om in record-scores met pure post-training. Onafhankelijke checks blijven dun: waarom u dat voorzichtig moet lezen.

Geschreven door AI · gecontroleerd door mensen

Bron: z.ai/blog/glm-5.3 · gelezen door de redactie

Laatste nieuws

Tijdlijn — nieuwste eerst, zoals NOS en Tweakers.

AI & modellen12 min. geleden

Top-code voor een tiende van de prijs: wat GLM-5.3 écht laat zien (en wat niet)

De Chinese AI-aanbieder Z.ai bracht in augustus twee modellen uit die op papier de beste open-source codeer- en cybermodellen zijn: GLM-5.3 (14 augustus) en het tien keer goedkopere GLM-5.3-Flash, wekenlang anoniem bekend als 'ox-alpha'. Belangrijkste voorbehoud: vrijwel alle cijfers komen van Z.ai zelf.

Twee modellen, twee verhalen

GLM-5.3 gebruikt volgens Z.ai dezelfde 743B Mixture-of-Experts-basis als GLM-5.2 (zo'n 40 miljard actieve parameters per token). Alle winst komt uit post-training: IndexShare, SAO en slime, opgeschaald met meer omgevingen, meer taken en meer computekracht. Op Z.ai's eigen besloten Code Bench scoort het model volgens het bedrijf 50 procent beter dan zijn voorganger. Ontbreekt in het plaatje: een groter model.

Op publieke benchmarks claimt Z.ai 'open-source state-of-the-art', maar alleen op toetsen die het bedrijf zelf afneemt. Terminal-Bench 3.0 springt van 4,6 naar 28,3; Agents' Last Exam (CLI) van 23,8 naar 28,5; DeepSWE v1.1 van 46,2 naar 66,9; AutomationBench van 26,2 naar 48,2.

Z.ai's prestatievergelijking van GLM-5.3 tegenover conc
Z.ai's prestatievergelijking van GLM-5.3 tegenover concurrenten op codeer-, cyber- en agentic-benchmarks. Bron: z.ai/blog/glm-5.3

GLM-5.3-Flash is een ander verhaal. Het model draaide ongeveer een week anoniem als 'ox-alpha' op OpenCode en OpenRouter en was volgens OfficeChai het meest besproken model van die week, voordat Z.ai de naam bevestigde. Anders dan GLM-5.3 is dit een nieuw getraind basis-model: 320 miljard parameters totaal, slechts 18 miljard actief, met hybride attention en een pre-training-corpus van 30 biljoen tokens. Het eerste GLM-model dat native beeld ziet — en kan checken wat het zelf bouwt. De prijs ligt rond een tiende van het grote broertje.

De benchmarkgrafiek die OfficeChai publiceerde bij de o
De benchmarkgrafiek die OfficeChai publiceerde bij de onthulling van GLM-5.3-Flash ('ox-alpha'). Bron: OfficeChai, 26 aug 2026
Token-efficiëntie op Z.ai Code Bench: hogere taak-afron
Token-efficiëntie op Z.ai Code Bench: hogere taak-afronding bij kleinere token-budgetten op elk effort-niveau. Bron: z.ai/blog/glm-5.3

Wat de benchmarks écht betekenen

Terminal-Bench 3.0 vraagt of een model een kapotte computeromgeving zelfstandig kan repareren — pas geslaagd als alle tests weer groen zijn. Versie 3.0 is véél zwaarder dan zijn voorganger, dáárom liggen álle scores laag, ook die van de duurste concurrenten (Fable 5: 33,7; GPT-5.6 Sol: 34,6). De sprong van 4,6 naar 28,3 is relatief enorm, absoluut nog geen koppositie.

DeepSWE v1.1 meet of een model wekenlang aan één project kan werken zonder de draad te verliezen — denk aan 'voeg een betaalmethode toe in deze bestaande webshop', inclusief database, backend én honderden tests die blijven slagen. Dit komt dagelijks programmeerwerk het dichtst bij; daar steeg GLM-5.3 van 46,2 naar 66,9.

Z.ai Code Bench is het examen van de school zelf: meet taak-afronding én token-verbruik, en tokens zijn geld. Volgens Z.ai haalt GLM-5.3 op max-effort 34,5 procent bij ~75K output-tokens per klus; op high-effort passeert het Claude Opus 4.8 (31,4 vs 29,5 procent) met nog geen helft aan tokens. Twee loodgieters, dezelfde klus — één rekent minder uur. Eigen examen blijft eigen examen.

GDPval-AA v2 is wél onafhankelijk (Artificial Analysis): kenniswerk over 44 beroepen, beoordeeld met Elo zoals bij schaken. GLM-5.3: 1769, ruim omhoog vanaf 1508. En op KingBench 3, de vaste takenlijst van één onderzoeker, is GLM-5.3 met 91,25 procent het beste model ooit op die test — boven Claude Fable 5.

Cyber-capability: CyberGym 84,5% (SOTA), ExploitBench 5
Cyber-capability: CyberGym 84,5% (SOTA), ExploitBench 54,4 en ExploitGym 105/130 taken. Bron: z.ai/blog/glm-5.3
STELLING VAN DE DAG · HALFWEG HET ARTIKEL, EVEN PAUZE

Automatisering door AI gaat in tien jaar meer banen weggeven dan het oplevert — en dat is goed voor de economie.

Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.

Eens
Oneens
1.203 stemmen · blijft anoniem✓ Stem bezorgd bij de redactie!

Het cyberhoofdstuk

De grootste verrassing zit in beveiliging. Op CyberGym (defensief: vind de kwetsbaarheid in broncode en bewijs ze door ze te laten crashen) haalt GLM-5.3 84,5 procent — nipt boven Mythos 5 en GPT-5.6 Sol, al zijn die marges kleiner dan de ruis. Op de offensieve tegenhangers verdubbelt de score wél (24,4 naar 54,4 op ExploitBench), maar blijft het ver achter de gesloten top (Fable 5: 78). Z.ai zegt dat cybercapaciteit 'sneller groeide dan verwacht' en meldt 2.436 gevonden kwetsbaarheden in 269 open-sourceprojecten, waarvan 53 nu openbaar.

Wat weten we zéker?

Reuters meldde dat de benchmarkresultaten niet onafhankelijk zijn geverifieerd. De open gewichten (MIT-licentie) komen pas eind augustus uit, dus reproduceren kon niemand buiten Z.ai. Vaststaat: de onafhankelijke GDPval-score, de KingBench-run en het feit dat dezelfde basis als GLM-5.2 ineens wél recordresultaten haalt. Voor iedereen die dagelijks met coding-agents werkt is Flash het interessantste verhaal: topconcurrentie, tiende van de prijs, en hij verslindt je tokens niet terwijl je gewoon refactort.

«Dit artikel is geschreven met behulp van AI en vóór publicatie feitelijk gecontroleerd door de menselijke redactie.»

Gerelateerd

Benchmarks uitgelegd: 5 toetsen die tellenUitleg · 6 min
Ox Alpha ontrafeld: weekje lang anoniem top-modelAI & modellen
Open gewichten: waarom twee weken wachten?Verdieping
🎨 Huisstijl & beweging (klap uit/in)
Krantenpapier#F7F5F0 — licht thema
Inkt#12141A — tekst
Toekomst-blauw#4F46E5 — merk
Cyaan-glow#06B6D4 — accent
Koerier-oranje#F97316 — breaking/CTA
Urgent-rood#DC2626 — NET BINNEN
Nacht-navy#0C0F17 — donker thema

Animatie-waaier: lopende NET BINNEN-ticker · shimmer over beelden bij hover · scroll-reveal per blok · stempel die op je scherm 'Insneert' bij openen · duim-flip + confetti + ping-ring + groeiende stafranden bij stemmen · liftende kaarten · gloeiende hover-randen.