viernes, 4 de septiembre de 2026 MediosSobre🌓
🇦🇷 AR ▾
ÚLTIMA HORA
Marín: «Está la posibilidad de que Argentina llegue a producir 2 millones de barriles por día» Caída masiva de las IA: ChatGPT, Claude y Grok con fallas Víctor Algra, veterinario: “A diferencia de los perros, los gatos pueden sentir dolor sin que nos demos cuenta” Siddhartha llega al Palacio de los Deportes con “Radio Nostalgia” y anuncia show en el Estadio GNP para 2027 Capturan en Jalisco a 3 estadounidenses buscados por el FBI por criptofraude y lavado de dinero Tren Maya opera sin fallas: Sheinbaum deslinda a empresas encargadas de mantenimiento sobre accidentes y acusa ‘errores humanos’ EN VIVO | Clima CDMX y resto de México hoy 3 de septiembre: ciclón Marie y dos ondas tropicales causarán fuertes lluvias Contrabando en Argentina: aseguran que uno de cada tres celulares que se conecta a la red ingresó de forma ilegal Adrian Mannarino, crítico con las condiciones del US Open: “Se está convirtiendo en un zoológico” Violenta noche en Costa Rica: enfrentamiento armado contra la policía deja un fallecido y 8 capturados Marín: «Está la posibilidad de que Argentina llegue a producir 2 millones de barriles por día» Caída masiva de las IA: ChatGPT, Claude y Grok con fallas Víctor Algra, veterinario: “A diferencia de los perros, los gatos pueden sentir dolor sin que nos demos cuenta” Siddhartha llega al Palacio de los Deportes con “Radio Nostalgia” y anuncia show en el Estadio GNP para 2027 Capturan en Jalisco a 3 estadounidenses buscados por el FBI por criptofraude y lavado de dinero Tren Maya opera sin fallas: Sheinbaum deslinda a empresas encargadas de mantenimiento sobre accidentes y acusa ‘errores humanos’ EN VIVO | Clima CDMX y resto de México hoy 3 de septiembre: ciclón Marie y dos ondas tropicales causarán fuertes lluvias Contrabando en Argentina: aseguran que uno de cada tres celulares que se conecta a la red ingresó de forma ilegal Adrian Mannarino, crítico con las condiciones del US Open: “Se está convirtiendo en un zoológico” Violenta noche en Costa Rica: enfrentamiento armado contra la policía deja un fallecido y 8 capturados
Últimas

OpenAI refuerza la seguridad de sus modelos de IA sofisticados para evitar que ataquen más sistemas por su cuenta

Infobae ·

OpenAI ha reforzado sus modelos de seguridad con nuevas salvaguardas que se adaptan a sus capacidades para garantizar que hacen lo que se espera de ellos y evitar nuevos 'hackeos' autónomos como el de Hugging Face.

El incidente de seguridad causado por dos modelos de OpenAI en julio, que de manera autónoma salieron de un entorno de pruebas aislado y con acceso restringido a internet y 'hackearon' la plataforma de Hugging Face para encontrar información que les ayudara a resolver una de las pruebas planteadas durante una evaluación, ha motivado una revisión de las medidas de seguridad de los sistemas de inteligencia artificial sofisticados.

En concreto, la firma tecnológica asegura que han revisado e implementado nuevas medidas de supervisión, alineación y contención en todas las etapas del proceso de entrenamiento, incidiendo en el entrenamiento de aprendizaje por refuerzo por contener "las cargas de trabajo de mayor riesgo", como explica en un comunicado.

Las nuevas medidas se centran, por un lado, en la monitorización que, bajo el nuevo enfoque, se convierte en una configuración multietapa, en la que se incluyen todas las ejecuciones de inferencia y el entrenamiento que utilizaban herramientas, que anteriormente quedaba fuera de esta revisión.

El objetivo es detectar "accesos no autorizados, robo de datos, comportamiento destructivo e intentos de eludir las medidas de seguridad" y, caso de identificar alguna de estas acciones, se emitirá una alerta en los 30 minutos posteriores para notificar a los equipos de seguridad, protección e investigación.

También se han extendido las técnicas de alineación a más etapas del proceso de entrenamiento, para reforzar el proceso que hace que los sistemas de IA "se comporten según lo previsto y respondan a la supervisión humana", para reducir las posibilidades de que, de manera autónoma, puedan realizar acciones no autorizadas o causar daño.

Estos trabajos incluyen la mejora de los modelos de recompensa y el entrenamiento de los modelos para que sean más honestos y reduzcan los comportamientos que explotan las debilidades en las recompensas, los evaluadores, las herramientas o la supervisión.

Alcanzan también los comportamientos que podrían causar daño cuando los modelos interactúan con sistemas o recursos externos.

Los cambios también implican nuevas salvaguardas en las cargas de trabajo de investigación que pueden requerir la ejecución de código o el uso de herramientas con acceso a internet.

Por ejemplo, se exige un mayor aislamiento, se han implementado nuevos controles para aislar de internet "las cargas de trabajo de alto riesgo y no confiables" y se ha reconfigurado la seguridad del entorno de pruebas para "eliminar servicios compartidos potencialmente vulnerables y reducir privilegios".

Leer la noticia completa en Infobae ›

5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae.

Más de Infobae

Ver todo ›

Más en Últimas

Ver todo ›