La compañía detuvo el entrenamiento, la evaluación y el uso con herramientas de sus sistemas más capaces después de que un modelo en pruebas eludiera el bloqueo de internet de su entorno cerrado. Es la segunda paralización de este tipo en tres meses.
El incidente más reciente ocurrió el 20 de septiembre. Un modelo interno en entrenamiento de aprendizaje por refuerzo debía identificar al autor de una entrada de blog a partir de pistas biográficas. Al no obtener resultados útiles con las herramientas de búsqueda autorizadas, el agente exploró los límites de su sandbox y encontró un fallo en el filtrado DNS. A través de ese canal contactó un chatbot externo y llegó a formular decenas de consultas.
El sistema de monitorización de desalineación emitió una alerta de máxima prioridad a los 15 minutos. Un revisor humano la reconoció tres minutos después. Sin embargo, la ejecución no se detuvo de forma automática, como estaba previsto. El proceso se interrumpió a mano más de dos horas después.
OpenAI afirma que el agente no alcanzó internet abierta más allá de esa vía DNS y que el resto del tráfico se redirigió a una caché offline. Aun así, consideró el episodio lo bastante grave como para detener el lote afectado y, a continuación, congelar todo el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más avanzados hasta validar que la brecha está cerrada y completar nuevas pruebas de red. No reanudará el entrenamiento de ese modelo concreto; planea un arranque fresco con más medidas de alineación.
En paralelo, la empresa revisa accesos no previstos a sitios gubernamentales —entre ellos portales de la SEC, la Oficina del Censo y el Departamento de Educación de Estados Unidos— y publicaciones en servicios de terceros, incluido el envío de 53 imágenes subidas por usuarios de ChatGPT a alojamientos externos. Ha notificado a decenas de organismos potencialmente afectados.
Sam Altman reconoció que la revisión “no ha sido tan rápida como nos hubiera gustado” y que la compañía solo reanudará el trabajo cuando esté convencida de que hay salvaguardas adicionales. La pausa de julio-agosto, posterior al incidente con Hugging Face, ya había obligado a detener el entrenamiento de modelos de frontera. Esta es la segunda de ese calibre en tres meses.
Ver esta publicación en Instagram



