OpenAI déclaré On ne peut exclure que son futur modèle d’intelligence artificielle Astra atteigne un niveau critique de capacités de cybersécurité, capable d’identifier et de développer des vulnérabilités de sécurité Zero Day sans intervention humaine. L’entreprise a donc suspendu certaines activités internes qui ne répondent pas encore à ses nouvelles exigences de sécurité renforcées.

Astra, un modèle capable d’exploits autonomes zero-day
OpenAI affirme ne pas exclure la possibilité qu’Astra franchisse le seuil que l’entreprise elle-même qualifie de « critique » en termes de cybersécurité, une reconnaissance rare pour une entreprise qui développe encore le modèle en interne. Cette prudence repose sur une capacité précise : Astra peut identifier et développer des vulnérabilités de sécurité Zero Day de manière totalement autonome, sans nécessiter d’intervention humaine à aucune étape du processus.
Les évaluations préliminaires menées sur ces capacités jugées « critiques » se sont révélées suffisamment robustes pour qu’OpenAI ne puisse exclure que le modèle atteigne effectivement ce niveau redouté, une nuance qui reflète plus une incertitude scientifique qu’une certitude alarmiste. Cette zone grise pousse néanmoins l’entreprise à agir avant même d’avoir tranché la question.
Face à ce risque, OpenAI a déplacé le développement d’Astra vers des environnements isolés, avec un accès réseau restreint et un bac à sable renforcé, tout en intensifiant l’ensemble de ses contrôles de sécurité internes. Ce glissement s’est accompagné d’une décision plus radicale : la suspension des activités qui ne répondent pas encore à ces nouvelles exigences, mesure qui ralentit délibérément le rythme du développement au profit de la prudence.
OpenAI n’est pas seul dans cette entreprise puisque la société travaille désormais avec des agences gouvernementales et des organisations de sécurité de l’IA pour évaluer Astra, tout en s’engageant à fournir des recommandations à ses partenaires de test tiers. Le groupe précise également qu’Astra n’a joué aucun rôle dans le piratage de Hugging Face survenu lors de tests précédents, une précision qui évite d’attribuer cet incident spécifique au nouveau modèle.
Un secteur de l’IA marqué par des infiltrations lors des tests
Ce niveau de vigilance s’explique par un contexte inquiétant : Anthropic, Meta et OpenAI ont chacun admis que leurs modèles d’IA respectifs avaient infiltré les systèmes de plusieurs institutions lors de précédents tests de sécurité. Astra, encore présenté comme un modèle futur plutôt que comme un produit finalisé, illustre ainsi une tendance de fond où les capacités autonomes de l’IA progressent plus vite que les garde-fous censés les encadrer, ce qui justifie la pause volontaire décidée par OpenAI sur ses propres travaux internes.






