GPT-6 Astra getest: zo goed als OpenAI belooft — en wat de benchmarks écht zeggen

De Koerier in je inbox — één e-mail per week met de verhalen die telden. Geen spam, geen verkoop van data (zie privacyverklaring).

OpenAI noemt Astra het slimste model ooit breed uitgerold en de eerste met de classificatie ‘Critical’ in cybercapaciteiten. De benchmarks deels onafhankelijk bevestigd, deels uit eigen huis. En goedkoper is het niet.

Wat is Astra, en wanneer mag je eraan?

OpenAI bracht GPT-6 Astra op 3 september 2026 uit als beperkte preview voor vertrouwde partners; een dag later volgde de publieke uitrol naar betaalde gebruikers — in een versie die bepaalde cyber-prompts weigert. Opvallend: het is het eerste OpenAI-model dat in de eigen veiligheidsrondes de hoogste risicoklasse Critical in cybercapaciteiten krijgt, met als gevolg strengere toegangseisen en beperkte beschikbaarheid voor sommige taken. In Microsoft Foundry is het model inmiddels breed beschikbaar voor zakelijke ontwikkelaars.

De relatie met GPT-5.6 Sol: Astra is de opvolger, getraind met veel meer rekenkracht en nadruk op langlopende computergebruik-taken. OpenAI positioneert het expliciet als antwoord op Claude Fable 5.1, dat Anthropic op 1 september uitbracht en dat op agentische taken tot 45% goedkoper werd.

De officiële launch — in twee minuten

OpenAI: Introducing GPT-6 Astra (video-thumbnail)OpenAI — Introducing GPT-6 Astra (2:42)

De benchmarks: wie zegt wat?

De meeste headline-cijfers komen uit OpenAI's eigen evaluaties. Het vaakst geciteerd: state-of-the-art op langlopende computergebruik-taken. Onafhankelijk controle blijft schaars — maar er zijn twee serieuze externe datapunten. ARC Prize meette op ARC-AGI-3 Semi-Private een score van 62,7%, behaald voor circa 26.000 dollar aan rekentijd — indrukwekkend op dat toetsenbord, maar ARC Prize benadrukt zelf dat benchmark-saturatie geen AGI-bewijs is; het lab noemt het "een merkbare sprong", niet meer. En de vergelijkingssites zijn niet eenduidig over de Arena-posities: aggregatoren noemen Elo-scores van 1520 (OpenLM) én 1470 (puter-documentatie) — tegenstrijdige cijfers die laten zien hoe afhankelijk leaderboard-claims zijn van wie meet.

Claim / metingCijferBronStatus
ARC-AGI-3 Semi-Private62,7% (~$26K rekentijd)arcprize.orgOnafhankelijk
Computer-use: SOTA op langlopende takenn.v.t.OpenAI zelfZelf-gerapporteerd
Kosten per taak t.o.v. Fable 5.1±75% duurderMindStudio-analyseOnafhankelijk
Arena-Elo1520 óf 1470OpenLM / puterOnafhankelijk, tegenstrijdig
"Not consistently better" dan Fable 5.1kwantitatiefMindStudioOnafhankelijk

Alle cijfers per 5 september 2026. "Onafhankelijk" = gemeten door een partij zonder belang bij de uitkomst.

Wat gebruikers ermeegemaakt hebben

Binnen 48 uur stonden de sociale media vol Astra-demo's. De eerlijkheid gebiedt: vrijwel alles hieronder is anekdotisch — indrukwekkend, maar niet geverifieerd en niet reproduceerbaar zoals een benchmark. Twee testsessies vallen op omdat ze systematisch te werk gaan. Chase AI testte Astra tegen Fable 5.1 in een bewust hypeloze vergelijking; The AI Advantage probeerde twintig echte taken, van bruikbaar tot bijna onmogelijk. Beide filmpjes laten hetzelfde patroon zien: op computergebruik en lange agent-taken is Astra duidelijk voorsprong, op gewone tekst- en codeklussen is het verschil met Fable 5.1 klein.

Chase AI: Astra vs Fable 5.1, no hype assessment (thumbnail)Chase AI — Astra vs Fable 5.1: No Hype (20:59)
The AI Advantage: 20 echte Astra-voorbeelden (thumbnail)The AI Advantage — 20 Real Examples (30:26)

Op X deelden onder andere het ChatGPT-account de launch-demo's en bouwde onderzoeker Matt Shumer (bekend van de Gauntlet Loop) binnen een dag agentic experimenten op het model — het soort snelle adoptie dat Fable 5.1 in zijn lancering ook kreeg. En de gebruikelijke YouTube-molen draaide op toeren: Fireship's "AGI is here… it's just not evenly distributed" is de kortste samenvatting van de sfeer — bewondering met een knipoog.

Fireship: AGI is here, it's just not evenly distributed (thumbnail)Fireship — AGI is here… (7:27)

Is het daadwerkelijk zo goed?

Het eerlijke antwoord: bij agentische computerarbeid waarschijnlijk wel, als algemene sprong niet bewezen. De onafhankelijke analyse van MindStudio (4 september) concludeert "not consistently better": grote winsten op gespecialiseerd werk (computer use, terminal, langlopende taken), maar geen doorslagelijke voorsprong op brede intelligentietoetsen — en ruim 75% hogere kosten per taak dan Fable 5.1, dat op veel van die taken meekomt. ARC Prize bevestigt de sprong op zijn toets, maar weigert de AGI-conclusie die er in het publieke debat meteen bovenop geplakt werd.

Dat is hetzelfde patroon dat we bij Fable 5.1 zagen: fabrikant-claims die op onderdelen kloppen, een onafhankelijk beeld dat nuchterder uitpakt, en een media-echo die de asterisk verliest onderweg. Voor wie dagelijks agent-werk doet is Astra écht een stap vooruit. Voor iedereen die "AGI" in de kop las: de cijfers rechtvaardigen dat woord nog niet.

Kanttekeningen

Wat weten we zéker?

STELLING VAN DE DAG · HALFWEG HET ARTIKEL, EVEN PAUZE

Een AI-model dat 'Critical' scoort op cybercapaciteiten hoort niet voor iedereen openbaar beschikbaar te zijn — ongeacht de safeguards.

Elke editie één prikkelende stelling — van AI tot economie. Eén klik, volkomen anoniem.

Eens
Oneens
2.185 stemmen · blijft anoniem✓ Stem bezorgd bij de redactie!

Zo probeer je het zelf

Je hebt een échte agent nodig — een tool die bestanden opent, code draait, screenshots bekijkt en zelf subagents kan starten — niet een chatvenster dat alleen tekst teruggeeft. Kies vervolgens een doel met een tastbare lat: een bestaand product om mee te vergelijken, een testsuite die groen moet zijn, een referentieontwerp. Stel de meta-prompt op uit Shumers artikel, laat de agent het werk zelf verdelen, en houd de voortgang bij via een simpele live-pagina in plaats van elke twintig minute te storen. Eén smoothing-pass achteraan — stukken die samen één geheel moeten worden — mag, maar de kern blijft: splitsen, bouwen, beoordelen, herhalen.

Overigens: deze nieuwsstijl is hier in de redactie met precies die aanpak gebouwd — elk pagina-onderdeel ging door eigen bouw- en verificatierondes met een aparte critic. Daarom durven we deze uitleg aan te bieden onder de tag hieronder.

«Dit artikel is geschreven met behulp van AI en vóór publicatie feitelijk gecontroleerd door de menselijke redactie.»

Geschreven door AI · gecontroleerd door mensen

Externe bronnen — in volgorde van vermelding; primair boven secundair (zie ons bronbeleid).
Reageren? Wij geloven in kritische, eerlijke en objectieve nieuwsvoering — vanuit verschillende perspectieven. Dus: heb je een aanvulling, tegenargument of correctie? Mail redactie@toekomstkoerier.com. De beste reacties publiceren we onder dit artikel — met je naam of anoniem, zoals jij dat wilt.
Correcties & updates — Deze pagina is nog niet gecorrigeerd sinds publicatie. Zie je een fout? Mail redactie@toekomstkoerier.com — we fixen 'm zichtbaar (alle correcties: correctielog).
WhatsApp X / Twitter

Gerelateerd