OpenAI maakt zich op voor de lancering van Astra, een nieuw AI-model dat volgens het bedrijf een ongekend niveau van zelfstandige cybercapaciteiten bereikt. Astra is het eerste OpenAI-model dat binnen het eigen Preparedness Framework als ‘Critical’ wordt geclassificeerd. Die kracht heeft gevolgen: de ontwikkeling werd tijdelijk vertraagd, extra beveiligingslagen werden ingevoerd en de meest geavanceerde cyberfuncties zullen niet voor iedereen beschikbaar zijn.
Voor de voorbereidingen van de inhoud en creatie van de visuals wordt (uiteraard) gebruikgemaakt van generatieve AI.
Cybersecurity categorie ‘Critical’
OpenAI heeft een opvallende grens bereikt in de ontwikkeling van zijn volgende generatie AI-modellen. Het nog niet publiek beschikbare Astra kan volgens interne evaluaties zelfstandig onbekende beveiligingslekken ontdekken en methodes ontwikkelen om die kwetsbaarheden uit te buiten. Daardoor plaatst OpenAI het model voor het eerst in de categorie Critical voor cybersecurity binnen zijn Preparedness Framework.
Die kwalificatie betekent niet dat Astra standaard onbeperkt cyberaanvallen kan uitvoeren. OpenAI spreekt specifiek over de capaciteiten van het model wanneer het over de juiste hulpmiddelen en toegang beschikt. Volgens het bedrijf kan het dan kwetsbaarheden in sterk beveiligde systemen ontdekken en exploitketens ontwikkelen zonder dat een mens iedere stap hoeft aan te sturen.
Astra vindt zelfstandig onbekende kwetsbaarheden
De sprong ten opzichte van GPT-5.6 Sol lijkt aanzienlijk. OpenAI testte Astra onder meer met ExploitBench, een benchmark waarbij modellen exploits moeten ontwikkelen voor bekende kwetsbaarheden. Astra behaalde daar volgens het bedrijf een score van 100 procent.
Omdat bestaande benchmarks mogelijk onderdeel kunnen zijn geweest van trainingsdata, ontwikkelde OpenAI daarnaast een interne test met twintig recent ontdekte ernstige kwetsbaarheden in de V8-engine. Astra bleek daarin niet alleen efficiënter dan GPT-5.6 Sol, maar ontdekte tijdens de evaluaties ook twee tot dan toe onbekende zero-daykwetsbaarheden. OpenAI werkt momenteel aan de verantwoordelijke bekendmaking daarvan aan de betrokken ontwikkelaars.
Tijdens afzonderlijke tests wist Astra bovendien onbekende kwetsbaarheden in een beveiligde browser en een besturingssysteem te combineren tot werkende aanvalsketens. Die resultaten waren voor OpenAI voldoende om de strengste cyberclassificatie uit zijn risicomodel te activeren.
Lancering werd bewust afgeremd
De extra mogelijkheden hebben ook de ontwikkeling van Astra beïnvloed. Na een eerder beveiligingsincident waarbij experimentele OpenAI-systemen betrokken waren, pauzeerde het bedrijf bepaalde trainingen gedurende twee weken om zijn infrastructuur beter te isoleren en bewaken. Astra zelf was volgens OpenAI niet betrokken bij dat incident.
Ook daarna bleven grotere trainingsruns langer on hold. Pas op 28 augustus 2026 werd een grote reinforcement-learningtraining opnieuw gestart nadat strengere veiligheidsvoorwaarden waren ingevoerd.
Voor Astra combineert OpenAI meerdere verdedigingslagen. Het model is sterker getraind om schadelijke cyberverzoeken te weigeren, terwijl aanvullende classifiers en monitoringssystemen verdachte acties moeten herkennen. In interne jailbreaktests weigerde Astra 91,5 procent van verboden cyberverzoeken, tegenover 59 procent voor GPT-5.6 Sol.
Krachtigste cyberfuncties krijgen beperkte toegang
OpenAI is van plan Astra binnenkort beschikbaar te maken, maar niet alle gebruikers zullen dezelfde mogelijkheden krijgen. De krachtigste cybersecurityfuncties gaan aanvankelijk naar een kleine groep testers. Daarna moet het Daybreak Blue-programma gecontroleerde toegang bieden aan beveiligingsprofessionals die de technologie voor defensieve toepassingen inzetten.
Die extra controles kunnen ook merkbaar worden voor gewone gebruikers. Wanneer monitoringssystemen een actie als mogelijk ongeautoriseerd beschouwen, kan een taak in ChatGPT of Codex worden onderbroken en om menselijke bevestiging vragen. Bij gebruik via andere omgevingen, zoals de API, kan een taak volledig worden stopgezet.
Astra markeert daarmee een belangrijke verschuiving. De discussie rond krachtige AI gaat niet langer alleen over betere antwoorden, programmeren of redeneren. Naarmate modellen zelfstandig kwetsbaarheden kunnen ontdekken en complexe digitale acties uitvoeren, wordt de vraag hoe die capaciteit gecontroleerd wordt minstens zo belangrijk als de prestaties zelf.

