Van 1,5 TB naar 214 GB: de echte AI-knik zit in de bits

De Koerier in je inbox — één e-mail per week met de verhalen die telden. Geen spam, geen verkoop van data (zie privacyverklaring).

Tencent comprimeerde zijn open-source taalmodel Hy4-preview van 1,5 terabyte naar 214 gigabyte — 770 miljard parameters, een context van 1 miljoen tokens. De kunst zit niet in nieuwe chips, maar in de kwantisatiemethode Sherry, die bepaalt waar de bits terechtkomen.

Een model van 770 miljard

Hy4-preview verscheen op 28 augustus 2026 onder Apache 2.0, met gewichten op Hugging Face; Tencent kondigde het zelf aan. Het is een mixture-of-experts-model: 770 miljard parameters, waarvan er per token 49 miljard actief zijn. De architectuur leunt op ideeën uit de DeepSeek- en GLM-lijn, onder meer gated sparse attention met een cache op de indexen. De context is vier keer zo groot en het model 2,6 keer zwaarder dan Hy3, dat 53 dagen eerder verscheen. In de API betaal je $0,834 per miljoen invoertokens en $2,501 per miljoen uitvoertokens — goedkoper dan GLM-5.3, duurder dan DeepSeek V4 Pro.

Zeven keer kleiner: Sherry

Kwantisatie slaat gewichten op in minder bits. Op 29 augustus meldde Tencent dat Hy4-preview van 1,5 terabyte naar ongeveer 214 gigabyte is gecomprimeerd — ruim zeven keer kleiner. Het principe: elke weight wordt ternair — min één, nul of plus één, waarbij nul "sla me over" betekent. Routing-experts bevatten meer dan zestig procent van alle parameters; daar moeten de bits zitten. Een simpel 2-bits schema verspilt ruim een kwart aan ongebruikte codes, en een strakker 1,67-bits schema past niet op de SIMD-eenheden van echte chips.

Infographic Sherry-kwantisatie
Sherry-kwantisatie in drie stappen: ternair, 3:4-sparsity, slimme bitverdeling. Bron: @TencentAI_News, 29 augustus 2026.

Sherry's truc: verdeel de gewichten in groepjes van vier en dwing precies één nul per groepje af. Dat geeft exact tweeëndertig patronen — vijf bits per groepje, oftewel 1,25 bits per weight — zonder verspilling én passend op de hardware. De Sherry-paper is geaccepteerd voor ACL 2026. Voor Hy4 is de implementatie in de GGUF-repo beschikbaar als STQ1_0.

In de praktijk: wat weten we al?

Tencent claimt de open-source top, maar dat geldt niet overal. Op Terminal Bench 2.1 scoort Hy4 85,4 tegen 88,3 voor Claude Opus 5; op programmeren gaat het met 17,5 achteruit tegen 39,5, en op enkele redeneertaken blijft het achter bij gesloten modellen. Onafhankelijke analyse trekt de winst in twijfel: de marge op GLM-5.3 en Kimi K3 is 0,05 tot 4 punten — binnen de ruis. Het model zou zijn eigen werk overmatig controleren en op zo'n 36 tokens per seconde komen; "preview" betekent ook dat deze checkpoint nog wordt vervangen. Hy4 is wel de derde grote Chinese open-weight release in zo'n zes weken, na Qwen 3.8 van Alibaba. De tabel toont voor coderen en zoeken leverancierscijfers; of die een soepel werkproces opleveren, moet nog blijken.

Hy4 preview benchmarkgrafieken
Hy4 preview tegen de concurrentie op twaalf agent-benchmarks; Hy4 wint niet overal. Bron: Tencent Hunyuan (Hugging Face), 28 augustus 2026.

Kanttekeningen: dit draait niet zomaar

De GGUF-builds lopen uiteen van 435 tot 214 gigabyte. Maar "geen van beide bestanden draait op standaard llama.cpp": de Hy4-architectuur zit nog niet in de upstream-code, dus je moet twee patches zelf meecompileren; chat vereist een extra vlag en het bestand moet op lokale schijf staan. Ook het "stitchen" van GPU's over machines is geen nieuw uitvindsel: llama.cpp heeft daarvoor al een RPC-backend die één model pipeline-parallel over machines verdeelt. Nieuw is dat de drempel laag genoeg is dat oude werkplek-GPU's samen realistisch worden. Maar RPC kent een throughput-belasting, geen continuous batching en is standaard onbeveiligd — alleen voor een privénetwerk. En 214 gigabyte blijft veel: volledig in VRAM betekent nog altijd een klein datacenternetwerkje.

Benchmarktabel agentic coding en search
De officiële benchmarktabel voor agentic coding en search — cijfers van Tencent zelf. Bron: Tencent Hunyuan (Hugging Face), 28 augustus 2026.

Waarom het uitmaakt

Open modellen worden niet alleen slimmer, maar ook draaibaar. De knik zit steeds vaker in kwantisatie — waar zitten de bits? — in plaats van alleen in de chips. Sherry laat zien dat "1,25 bits per weight" geen laboratoriumtruc meer is, maar een gedownload artifact: alleen al op de GGUF-repo stond de teller vorige maand op ruim 93.000 downloads. Voor bedrijven met oude werkplek-GPU's betekent dat samenstellen in plaats van cloud-huren, al is thuis nog een netwerkje nodig. Het roept een vraag op die rijp is voor een publiekspanel: als de bits maar slim genoeg zitten, win je dan meer dan met een nieuwe GPU?

Wat weten we zéker?

STELLING VAN DE DAG · HALFWEG HET ARTIKEL, EVEN PAUZE

Binnen vijf jaar levert een AI-agent meer productiecode dan een junior developer — en dat is prima voor het vak.

Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.

Eens
Oneens
2.185 stemmen · blijft anoniem✓ Stem bezorgd bij de redactie!
«Dit artikel is geschreven met behulp van AI en vóór publicatie feitelijk gecontroleerd door de menselijke redactie.»

Geschreven door AI · gecontroleerd door mensen

Externe bronnen — in volgorde van vermelding; primair boven secundair (zie ons bronbeleid).
Reageren? Wij geloven in kritische, eerlijke en objectieve nieuwsvoering — vanuit verschillende perspectieven. Dus: heb je een aanvulling, tegenargument of correctie? Mail redactie@toekomstkoerier.com. De beste reacties publiceren we onder dit artikel — met je naam of anoniem, zoals jij dat wilt.
Correcties & updates
  • 05-09-2026 — Tijdstempel gecorrigeerd. Geregistreerd als '24:48' (bestaat niet); gecorrigeerd naar 2 september 2026, 00:48.
  • Zie je een fout? Mail redactie@toekomstkoerier.com — we fixen 'm zichtbaar (alle correcties).
WhatsApp X / Twitter

Gerelateerd