Tencent comprimeerde zijn open-source taalmodel Hy4-preview van 1,5 terabyte naar 214 gigabyte — 770 miljard parameters, een context van 1 miljoen tokens. De kunst zit niet in nieuwe chips, maar in de kwantisatiemethode Sherry, die bepaalt waar de bits terechtkomen.
Hy4-preview verscheen op 28 augustus 2026 onder Apache 2.0, met gewichten op Hugging Face; Tencent kondigde het zelf aan. Het is een mixture-of-experts-model: 770 miljard parameters, waarvan er per token 49 miljard actief zijn. De architectuur leunt op ideeën uit de DeepSeek- en GLM-lijn, onder meer gated sparse attention met een cache op de indexen. De context is vier keer zo groot en het model 2,6 keer zwaarder dan Hy3, dat 53 dagen eerder verscheen. In de API betaal je $0,834 per miljoen invoertokens en $2,501 per miljoen uitvoertokens — goedkoper dan GLM-5.3, duurder dan DeepSeek V4 Pro.
Kwantisatie slaat gewichten op in minder bits. Op 29 augustus meldde Tencent dat Hy4-preview van 1,5 terabyte naar ongeveer 214 gigabyte is gecomprimeerd — ruim zeven keer kleiner. Het principe: elke weight wordt ternair — min één, nul of plus één, waarbij nul "sla me over" betekent. Routing-experts bevatten meer dan zestig procent van alle parameters; daar moeten de bits zitten. Een simpel 2-bits schema verspilt ruim een kwart aan ongebruikte codes, en een strakker 1,67-bits schema past niet op de SIMD-eenheden van echte chips.

Sherry's truc: verdeel de gewichten in groepjes van vier en dwing precies één nul per groepje af. Dat geeft exact tweeëndertig patronen — vijf bits per groepje, oftewel 1,25 bits per weight — zonder verspilling én passend op de hardware. De Sherry-paper is geaccepteerd voor ACL 2026. Voor Hy4 is de implementatie in de GGUF-repo beschikbaar als STQ1_0.
Tencent claimt de open-source top, maar dat geldt niet overal. Op Terminal Bench 2.1 scoort Hy4 85,4 tegen 88,3 voor Claude Opus 5; op programmeren gaat het met 17,5 achteruit tegen 39,5, en op enkele redeneertaken blijft het achter bij gesloten modellen. Onafhankelijke analyse trekt de winst in twijfel: de marge op GLM-5.3 en Kimi K3 is 0,05 tot 4 punten — binnen de ruis. Het model zou zijn eigen werk overmatig controleren en op zo'n 36 tokens per seconde komen; "preview" betekent ook dat deze checkpoint nog wordt vervangen. Hy4 is wel de derde grote Chinese open-weight release in zo'n zes weken, na Qwen 3.8 van Alibaba. De tabel toont voor coderen en zoeken leverancierscijfers; of die een soepel werkproces opleveren, moet nog blijken.

De GGUF-builds lopen uiteen van 435 tot 214 gigabyte. Maar "geen van beide bestanden draait op standaard llama.cpp": de Hy4-architectuur zit nog niet in de upstream-code, dus je moet twee patches zelf meecompileren; chat vereist een extra vlag en het bestand moet op lokale schijf staan. Ook het "stitchen" van GPU's over machines is geen nieuw uitvindsel: llama.cpp heeft daarvoor al een RPC-backend die één model pipeline-parallel over machines verdeelt. Nieuw is dat de drempel laag genoeg is dat oude werkplek-GPU's samen realistisch worden. Maar RPC kent een throughput-belasting, geen continuous batching en is standaard onbeveiligd — alleen voor een privénetwerk. En 214 gigabyte blijft veel: volledig in VRAM betekent nog altijd een klein datacenternetwerkje.

Open modellen worden niet alleen slimmer, maar ook draaibaar. De knik zit steeds vaker in kwantisatie — waar zitten de bits? — in plaats van alleen in de chips. Sherry laat zien dat "1,25 bits per weight" geen laboratoriumtruc meer is, maar een gedownload artifact: alleen al op de GGUF-repo stond de teller vorige maand op ruim 93.000 downloads. Voor bedrijven met oude werkplek-GPU's betekent dat samenstellen in plaats van cloud-huren, al is thuis nog een netwerkje nodig. Het roept een vraag op die rijp is voor een publiekspanel: als de bits maar slim genoeg zitten, win je dan meer dan met een nieuwe GPU?
Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.
Geschreven door AI · gecontroleerd door mensen