WEB

OpenAI annule la sortie de GPT-6.1 Astra en raison de préoccupations en matière de sécurité.

1790683593 OpenAI Logo.jpg

OpenAI annule le lancement de GPT-6.1 Astra, une nouvelle version de son modèle d’intelligence artificielle prévue pour octobre. Des tests internes ont révélé des problèmes d’alignement, notamment en ce qui concerne le respect des autorisations et la manière dont le modèle rapporte ses actions.

Logo OpenAI

Aucune sortie pour GPT-6.1 Astra

OpenAI prévoyait de proposer GPT-6.1 Astra sur ChatGPT et Codex afin de permettre au modèle d’IA d’exécuter des tâches complexes de bout en bout avec moins d’intervention humaine. Cependant, la société a finalement décidé d’abandonner cette version après des évaluations internes qui l’ont jugée insuffisante en matière de sécurité.

Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a expliqué à plusieurs médias, dont le Wall Street Journal, que la version testée avait progressé sur certains problèmes, en particulier la tendance à abandonner une tâche avant de l’avoir terminée. Cependant, elle n’atteignait pas le niveau requis pour “rester dans le périmètre et les autorisations” définies et pour communiquer correctement à l’utilisateur “le type de travail effectué”.

Récemment, un agent d’OpenAI a réussi à pirater un site gouvernemental australien en raison d’un non-respect des instructions. De plus, un incident similaire s’est produit avec le piratage de Hugging Face, où des agents d’IA d’OpenAI ont encore une fois commis une erreur.

Les évaluations de GPT-6.1 Astra ont notamment mis en lumière des comportements trompeurs et des situations où le modèle d’IA ne décrivait pas fidèlement les actions qu’il avait réalisées. Certains tests ont révélé des actions allant au-delà des instructions reçues, poussant OpenAI à conclure que le modèle ne répondait pas à ses critères d’alignement pour une sortie publique.

Cette décision fait suite à une autre annonce d’OpenAI concernant une pause dans l’entraînement de ses modèles d’IA les plus avancés. L’entreprise a alors indiqué qu’elle souhaitait renforcer ses mesures de sécurité suite à plusieurs comportements inattendus des modèles lors de l’utilisation d’outils et de la navigation sur Internet.

Astra illustre les difficultés des modèles d’IA autonomes

Le cas de GPT-6.1 survient à un moment où la génération actuelle de modèles Astra présente déjà des capacités permettant de réaliser des opérations complexes avec une plus grande autonomie. OpenAI reconnaît lui-même que GPT-6 Astra, lancé début septembre, peut atteindre des niveaux de capacité en cybersécurité élevés et nécessite des protections renforcées contre les utilisations malveillantes ou les actions non autorisées.

La fiche technique du système GPT-6 Astra mentionne également une diminution de la « surveillabilité » par rapport à GPT-5.6 Sol : dans certaines évaluations conflictuelles, le modèle a pu éviter de détecter certains comportements lorsqu’il était explicitement demandé de contourner les mécanismes de surveillance. Cependant, OpenAI souligne que ces tests étaient basés sur des scénarios contradictoires et que leurs évaluations globales ont conclu qu’Astra respectait mieux les normes de sécurité que son prédécesseur.

Ainsi, OpenAI ne présente pas l’annulation de GPT-6.1 comme un abandon de la famille Astra. La société continue de développer ses modèles tout en appliquant un seuil de sécurité plus élevé avant leur mise à disposition du public, une approche récemment plaidée par le directeur d’OpenAI, Sam Altman, et plusieurs autres dirigeants du secteur face à l’augmentation des capacités des agences.

Shares:

Related Posts