Het is de afronding van een verhaal dat RNTV eerder begon: Z.ai heeft de open gewichten van GLM-5.3-Flash vrijgegeven, per direct onder de MIT-licentie. Voor wie de rekening per token telt, is dat goed nieuws — het model kost grofweg een tiende van het grote GLM-5.3. Maar wie er zelf een server voor neerzet, botst op een getal dat de hele "klein en goedkoop"-belofte relativeert: ruim 300 gigabyte aan gewichten, terwijl er per token maar 18 miljard parameters actief zijn.
Op 26 augustus 2026 werd GLM-5.3-Flash gepubliceerd op Hugging Face als zai-org/GLM-5.3-Flash — MIT-licentie, dag één. Het model draaide sinds 20 augustus anoniem als *'ox-alpha'* op OpenRouter en OpenCode, en bleek toen al het meest besproken model van de week. Na de naam bevestiging is het nu een erkend product.
Het model is een Mixture-of-Experts met 320 miljard parameters totaal, maar slechts 18 miljard actief per token — 45 lagen, 288 experts. Dat is de kern van de rekening. Activering is goedkoop: voor elke stap rekent het model alleen met 18 miljard parameters. Daarom kan Z.ai het voor een tiende van de prijs van GLM-5.3 aanbieden: op OpenRouter noteert GLM-5.3-Flash 0,15 dollar input en 0,50 dollar output per miljoen tokens, en drie providers honoreren tot 9 september zelfs een lanceringskorting van 50 procent (0,075/0,25). Ter vergelijking: GLM-5.3 staat op 1,40/4,40 dollar.
Maar de *totale* omvang is groot: ongeveer 328 gigabyte in FP8. Wie het liever zelf host — precies het doel van open gewichten — heeft dus flink wat gigabyte aan geheugen nodig, en de rekening verschuift van "per token" naar "per apparaat". De context is met 1.048.576 tokens genereus, maar ook hier geldt: niet alle providers leveren dezelfde lengte. Sommige sturen je naar een 262K-venster, andere naar 1,31M — en dat verschil is niet aan de model-ID af te lezen.
Het is het eerste model in de GLM-5-lijn dat native beelden en video als invoer accepteert, dankzij een hybride architectuur met sparse en lineaire attention. Het idee: langere context goedkoper maken zonder in te leveren op precisie. Z.ai claimt op een document- en visuele-redeneerbenchmark (OfficeQA Pro) een 62,4 en spreekt daarmee van een voorsprong op Claude Opus 4.8. Wat onafhankelijk is gemeten, is het verbruik: Artificial Analysis komt op grofweg 50 output-tokens per seconde, met een goede tijd-tot-eerste-token van zo'n 1,5 seconde maar een bescheiden doorvoer.
Precies dat is het teken van een sterke, maar niet grenzeloze open release. Zoals RNTV in eerdere verslaggeving al aangaf, kwamen vrijwel alle prestatiescores van de fabrikant zelf; dat geldt nog steeds.
Voor wie agent- en codewerk draait, is dit een rekensom. GLM-5.3-Flash rondt per token tien keer goedkoper af dan GLM-5.3 en heeft een venster dat groot genoeg is voor meerdaagse taken. De afweging zit bij de hardware: wil je het zelf draaien, dan betaal je het verschil in geheugen — en de enorme parameterbasis staat haaks op het beeld van "een klein model dat overal past".
Bevestigd (modelkaart + OpenRouter):
Nog niet bevestigd:
Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.
Geschreven door AI · gecontroleerd door mensen