AI & modellen30 Aug 2026, 16:22

DeepSeek draait lokaal op een werkstation — maar 'V4.1' bestaat niet

Het verhaal van "klein én goedkoop" klopt — alleen de titel niet. Waar de opdracht verwijst naar een "DeepSeek V4.1" die lokaal op een werkstation draait, is er geen enkel model met die naam. Wat er wél is, is een open-model familie — V4, met de checkpoint-updates V4-Flash-0731 en V4-Pro-0813 — waarvan de kleinste, V4-Flash, uitgerekend het bewijs vormt dat je met weinig actieve parameters veel kunt bereiken. En dát is het echte verhaal.

Eerst de naam rechtzetten

DeepSeek bracht op 24 april 2026 de V4-familie uit als preview in twee maten: V4-Pro (1,6 biljoen parameters totaal, 49 miljard actief) en V4-Flash (284 miljard totaal, 13 miljard actief). Beide zijn Mixture-of-Experts-modellen met een venster van 1 miljoen tokens en een MIT-licentie. Daarna kwamen verfijnde versies: V4-Flash-0731 op 31 juli en V4-Pro-0813 op 13 augustus. Van een "V4.1" is dus geen sprake — wie die naam gebruikt, citeert een model dat er niet is.

Waarom "klein" hier een bijzondere betekenis heeft

Het interessante is juist het mechanisme. Bij een Mixture-of-Experts neemt het model per token maar een klein deel van de parameters in gebruik: bij V4-Flash dus 13 miljard van de 284 miljard. Dat betekent dat de rekening per stap laag is, terwijl de totale omvang — en dus het geheugen dat je nodig hebt om het in te laden — groot blijft. Het is dezelfde afweging die we bij GLM-5.3-Flash zagen: goedkoop per token, prijzig per apparaat. V4-Flash gebruikt FP4 expertgewichten en een FP8 KV-cache om dat te temperen.

Wat betekent "lokaal op een werkstation"?

Hier moet je oppassen met de bewering dat het "op een 48 GB-kaart draait". De realiteit is genuanceerder. Grofweg: V4-Flash in BF16 is zo'n 570 GB, in Q4 rond de 150 GB — dat vraagt al om twee tot vier krachtige GPU's. Voor één werkstation is dat alleen haalbaar met forse kwantisering én verdeeld geheugen: het reddit- en vLLM-advies wijst op zo'n 256 GB RAM. Er bestaan configuraties die op een gewone pc met 48 GB geheugen draaien, maar dan met CPU-offloading, en dan zijn de tokens per seconde bescheiden. Met andere woorden: "draait op een werkstation" kan kloppen, maar de vraag is hoe snel.

De beste versie draaide achter de API

Er is nog een kanttekening die journalisten vaak overslaan. DeepSeek poetste op 31 juli de V4-Flash achter de eigen API op naar de versie 0731, met gemelde grote agentvooruitgang — maar vrijwel direct gaf het bedrijf aan geen nieuwe gewichten vrij te geven. Wat je zelf kunt downloaden, is de april-voorpublicatie; de agent-getunede versie zat alleen achter de API. Zolang die gewichten niet verschijnen, loopt wie lokaal draait dus achter op de beste versie.

Waarom het uitmaakt

Voor zorg- en bedrijfsomgevingen die gevoelige gegevens niet aan een externe API willen geven, is de vraag of open gewichten lokaal draaien cruciaal. V4-Flash laat zien dat het kan, maar het is geen "klein model dat overal past": het is een groot model dat je met weinig actieve parameters goedkoop per taak kunt aanroepen. En net als bij DeepSeek's eerder gebruikte prijsstrategie blijft het ook hier een rekensom — de eigen API kost voor V4-Flash 0,14/0,28 dollar per miljoen tokens, wat lokaal draaien vooral aantrekkelijk maakt bij grotere volumes.

Wat weten we zéker?

Bevestigd (modeldocumentatie, meerdere leveranciers):

Nog niet bevestigd:

STELLING VAN DE DAG · HALFWEG HET ARTIKEL, EVEN PAUZE

Binnen vijf jaar levert een AI-agent meer productiecode dan een junior developer — en dat is prima voor het vak.

Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.

Eens
Oneens
2.185 stemmen · blijft anoniem✓ Stem bezorgd bij de redactie!
«Dit artikel is geschreven met behulp van AI en vóór publicatie feitelijk gecontroleerd door de menselijke redactie.»

Geschreven door AI · gecontroleerd door mensen

WhatsApp X / Twitter

Gerelateerd