OpenAI ha puesto en pausa los trabajos sobre Astra, su nueva IA de vanguardia, por considerarla demasiado peligrosa. La compañía informó días atrás que la evolución del modelo de lenguaje en cuestión es tal que no pueden descartar que posea capacidades "críticas" para concretar ciberataques de forma autónoma.
Según explica OpenAI, Astra es un modelo de inteligencia artificial que todavía no se ha lanzado y que no estuvo involucrado en el hackeo a Hugging Face. Las evaluaciones recientes que hizo la empresa sobre la IA encontró importantes avances en materia de ciberseguridad y programación agéntica.
Esto hizo encender las alarmas entre los dirigidos por Sam Altman, quienes consideran que Astra podría superar el umbral crítico de ciberseguridad establecido en el "Marco de preparación" de OpenAI. Así lo explica la startup:
"Según nuestro Marco de preparación, un modelo alcanza el umbral crítico de ciberseguridad si puede identificar y desarrollar exploits funcionales de día cero de todos los niveles de gravedad en muchos sistemas críticos reales y reforzados sin intervención humana, o si puede idear y ejecutar estrategias novedosas de extremo a extremo para ciberataques contra objetivos reforzados, dado únicamente un objetivo deseado de alto nivel.
Si bien continuamos evaluando este modelo, nuestras evaluaciones preliminares indican un rendimiento lo suficientemente sólido como para no descartar un nivel de capacidad crítico en este momento".
OpenAI pausa el trabajo sobre Astra, su nueva IA de vanguardia
Desde OpenAI indican que han tomado múltiples medidas para lidiar con las capacidades de Astra y evitar inconvenientes. Los de Sam Altman han pausado las "actividades internas" que involucran el uso de este modelo en situaciones donde las medidas de protección todavía no se han reforzado. También se habla de la implementación de salvaguardias más estrictas y de un monitoreo más estricto sobre los agentes que funcionen sobre esta inteligencia artificial para detectar o mitigar comportamientos riesgosos o maliciosos.
Si Astra realmente es tan peligrosa como OpenAI cree, su liberación sin contar con las protecciones correspondientes podría ser catastrófica en materia de ciberseguridad. Que una IA pueda hackear una infraestructura completa de principio a fin, sin requerir más participación humana que para dar la orden inicial, es verdaderamente preocupante.
OpenAI incluso menciona que las capacidades de ciberseguridad de GPT-5.6 Sol, su IA más potente disponible públicamente, fue evaluada a nivel "alto" y no "crítico", como sí ocurre con Astra. Esto deja en claro que lo que puede hacer este modelo aún no lanzado se encuentra en un nivel de peligrosidad bastante superior.
Días atrás se conoció que los agentes de IA de OpenAI que se salieron de contención y hackearon Hugging Face crearon una suerte de "foro secreto". Esto les permitió trabajar en conjunto, detectar las vulnerabilidades y coordinar los ataques de acuerdo con esos hallazgos.
Por lo pronto, se desconoce si OpenAI planeaba lanzar Astra como un modelo propiamente dicho, o si la idea era destilarlo a versiones más pequeñas y menos capaces, similar a lo que ha hecho Anthropic con Claude Mythos y Fable. Seguiremos atentos a las novedades.
Seguir leyendo: OpenAI pisa el freno con su nueva IA por considerarla demasiado peligrosa




