Altman a déclaré qu'il s'attend toujours à ce que de nouveaux modèles, probablement le retardé Astra, soient livrés bientôt. La pause de l'entraînement affecte les sorties plus lointaines.
OpenAI dans sa publication a réitéré ses plans visant à se concentrer sur la surveillance, l'alignement des modèles et les mesures de sécurité pour empêcher ses modèles de devenir incontrôlables comme ils l'ont fait le mois dernier. Suite à l'incident HuggingFace, OpenAI a "interrompu l'inférence des modèles de pointe dans les clusters de recherche pour les exécutions qui pourraient exécuter du code ou utiliser des outils pouvant accéder à Internet."
L'entreprise a déclaré qu'elle autorisait l'exécution de certaines charges de travail, mais qu'elle en avait suspendu d'autres jusqu'à ce qu'elles puissent être déplacées sous un régime de sécurité plus strict comprenant le sandboxing, l'isolation du réseau et des tests de sécurité continus.
"Notre plus grande exécution de RL (apprentissage par renforcement) de pointe prévue reste en attente pendant que nous menons des entraînements et des évaluations à plus petite échelle pour évaluer le comportement des modèles, valider nos sauvegardes et établir davantage de preuves d'alignement avant de poursuivre", a écrit l'entreprise.
L'apprentissage par renforcement fait référence au processus d'essais et d'erreurs par lequel les agents d'IA "apprennent" leur environnement en étant récompensés pour les résultats souhaités.
OpenAI a également déclaré qu'elle élargissait sa surveillance du processus de chaîne de pensée, la technique qui voit les modèles "pensants" décomposer les tâches en étapes distinctes et produire une sortie textuelle intermédiaire pour chaque étape.
L'approche antérieure de l'entreprise se concentrait sur les charges de travail à haut risque, spécifiquement les déploiements internes de modèles de pointe et les exécutions d'entraînement RL de pointe.
En revanche, indique OpenAI, sa nouvelle configuration de surveillance couvre tous les entraînements RL et les évaluations impliquant des outils pour les modèles d'un niveau de capacité de GPT-5.6 Sol ou supérieur. Et avec la détermination qu'Astra possède des capacités cybernétiques critiques, OpenAI a ajouté une exigence de surveillance supplémentaire qui couvre toute l'inférence avec Astra, pas seulement l'entraînement et les tests RL.
"Ces sauvegardes nécessitent un calcul significatif", a déclaré OpenAI. "Nos estimations actuelles placent les frais généraux de surveillance à environ 20 % du calcul d'inférence surveillé, bien que le coût varie considérablement selon les charges de travail d'entraînement et d'évaluation."
OpenAI prévoit de partager plus de détails sur la mise en œuvre de son schéma de surveillance dans une future publication. Dans une recherche publiée l'année dernière, l'entreprise a déclaré que la surveillance de la chaîne de pensée est un moyen efficace de détecter les mauvais comportements des modèles, mais a averti que l'optimisation directe des modèles pour suivre strictement les instructions "n'élimine pas tous les mauvais comportements et peut amener un modèle à cacher son intention."
Si vous choisissez de croire l'assurance de l'entreprise qu'elle ne répercutera pas le coût de la police de la pensée des modèles sur les clients, il s'ensuit que les pertes d'OpenAI augmenteront. Il est difficile d'imaginer que cela serait une position durable si OpenAI entre en bourse.
Mais étant donné les $600+ milliards d'engagements dans l'infrastructure d'IA signalés par l'entreprise et son attente de rester non rentable jusqu'en 2030 au moins, qu'est-ce qu'un peu plus de dépenses pour le bien d'une sécurité incertaine ? ®