25/08/2026 13:24
Eduardo Castex 17°
Titulares
Ziliotto eligió a José Coito para fiscal de Eduardo Castex Paredes y Tevez, un encuentro entre dos ídolos de Boca con una historia detrás Tras 40 años, hallaron rastros del huillín en el Parque Nacional Los Alerces y crece la esperanza de una recolonización Una superestrella de la lírica que se movió a sus anchas en el Colón: bajó a la platea, cantó acostado y bailó break dance sobre música barroca Ordenan evacuaciones en zona rural de Texas por enorme incendio forestal En 1984, la NASA envió 3000 abejas al espacio a bordo del transbordador Challenger para un experimento estudiantil único: estas abejas lograron construir panales y poner huevos en gravedad cero Un hallazgo militar: así es la nueva generación de interceptores baratos desarrollados por una empresa emergente de Florida que podrían cambiar el rumbo de la guerra contra los drones iraníes Canadá contraataca a EEUU con aranceles mientras se intensifica la guerra comercial Ziliotto eligió a José Coito para fiscal de Eduardo Castex Paredes y Tevez, un encuentro entre dos ídolos de Boca con una historia detrás Tras 40 años, hallaron rastros del huillín en el Parque Nacional Los Alerces y crece la esperanza de una recolonización Una superestrella de la lírica que se movió a sus anchas en el Colón: bajó a la platea, cantó acostado y bailó break dance sobre música barroca Ordenan evacuaciones en zona rural de Texas por enorme incendio forestal En 1984, la NASA envió 3000 abejas al espacio a bordo del transbordador Challenger para un experimento estudiantil único: estas abejas lograron construir panales y poner huevos en gravedad cero Un hallazgo militar: así es la nueva generación de interceptores baratos desarrollados por una empresa emergente de Florida que podrían cambiar el rumbo de la guerra contra los drones iraníes Canadá contraataca a EEUU con aranceles mientras se intensifica la guerra comercial
Impacto Castex
NACIONALES

¿Cómo se prueban de forma segura los modelos de IA "sobrehumanos"? Nadie lo sabe con certeza

¿Cómo se prueban de forma segura los modelos de IA "sobrehumanos"? Nadie lo sabe con certeza

Irregular, una start-up israelí, colaboró con OpenAI, Anthropic y Meta para evaluar la seguridad de sus modelos de inteligencia artificial. Cometió un error. Entonces, las pruebas

SAN FRANCISCO — OpenAI descubrió recientemente que un nuevo modelo de inteligencia artificial que estaba probando se había descontrolado y había pirateado a otra empresa.

Anthropic reveló entonces que uno de sus modelos de IA había logrado infiltrarse en los sistemas de tres organizaciones externas durante una prueba.

Poco después, Meta afirmó que sus modelos de IA habían hecho algo similar.

Los tres incidentes tuvieron una empresa en común:

Irregular, una startup israelí que colabora con los gigantes de Silicon Valley para evaluar sus modelos de IA antes de su lanzamiento público.

Esta empresa, que realizó las pruebas fallidas, forma parte de un grupo de startups que llevan a cabo la innovadora labor de analizar modelos de IA de vanguardia para evaluar su sofisticación y comprobar su seguridad.

El objetivo es generar confianza pública en los modelos y evitar su mal uso.

El director ejecutivo de Irregular, Dan Lahav. «Los modelos de inteligencia artificial están mejorando mucho», afirmó. Foto Jason Henry para The New York Times

Las recientes brechas de seguridad se produjeron cuando Irregular cometió un error durante las pruebas con los modelos de Anthropic, OpenAI y Meta.

Sin embargo, los modelos de IA agravaron la situación al actuar de maneras poderosas e inesperadas, según declaró Dan Lahav, director ejecutivo de Irregular.

“Cuanto más potente es la tecnología, mayor es su impacto”, afirmó.

“El ritmo de progreso es realmente rápido”.

Irregular se encuentra ahora en el centro de un debate sobre cómo proteger los modelos de IA, dado que la tecnología avanza tan rápidamente que ha superado incluso a los mejores hackers humanos.

Cada pocos meses, Anthropic, OpenAI, Google, Meta y otras empresas lanzan modelos de vanguardia que suelen ser muchísimo más potentes que sus predecesores.

Los nuevos modelos están entrando en el "dominio sobrehumano", afirmó Jeffrey Ladish, director de Palisade Research, una organización sin fines de lucro con sede en Berkeley, California, que estudia las capacidades de ataque de la IA.

Añadió que se necesitaban empresas como Irregular para probar los modelos, pero que eran necesarias mejores medidas de seguridad tanto para los evaluadores como para los organismos reguladores gubernamentales.

Katie Moussouris, directora ejecutiva de Luta Security, empresa que ayuda a otras compañías a detectar vulnerabilidades en su software, afirmó que las pruebas de seguridad de los modelos de IA son un poco como si un ciego guiara a otro ciego.

Incluso los creadores de IA admiten que no conocen del todo las capacidades de sus últimos modelos, añadió.

“Puede que tengamos a las personas más brillantes del mundo trabajando en estos modelos de IA, pero es como si Marie Curie manipulara el radio con las manos desnudas”, dijo Moussouris.

“Estamos manipulando la IA con las manos desnudas y no sabemos cómo contenerla, y mucho menos cómo probarla de forma segura”.

Irregular fue fundada en 2023 por Lahav, un antiguo investigador de IA.

Su empresa, con sede en Tel Aviv, cuenta con aproximadamente 45 empleados que se encargan de realizar pruebas de modelos de IA durante días o semanas, según el modelo y el tipo de prueba requerida.

La startup ha recaudado cerca de 80 millones de dólares de firmas de capital riesgo como Sequoia Capital y Redpoint Ventures.

Pruebas

En una prueba típica, Irregular instruye a un modelo de IA para que lleve a cabo un ciberataque.

Se le indica al modelo que se encuentra en un entorno de prueba seguro —a menudo desconectado de internet y en un entorno informático aislado, conocido como sandbox— y que debe hacer lo que sea necesario para lograr el objetivo que se le ha encomendado.

En ocasiones, a los modelos se les asigna una tarea imposible y se les evalúa según las técnicas que emplean para lograrla.

Otras veces, se les evalúa según la eficacia con la que hackean un objetivo.

Estas puntuaciones se utilizan para analizar la efectividad potencial de un modelo en el hackeo.

Posteriormente, Irregular recomienda medidas de seguridad para evitar que el modelo se utilice con fines maliciosos.

En los incidentes revelados el mes pasado, Irregular solicitó a los modelos de IA de OpenAI, Meta y Anthropic que hackearan ciertos objetivos cuando una "configuración errónea" en los ajustes de prueba les permitió acceder a internet.

Posteriormente, los modelos de IA hackearon organizaciones externas, utilizando el acceso a internet en su beneficio de maneras que han dejado atónitos a los investigadores.

En la prueba de OpenAI, el modelo de IA de la compañía creó bots que interactuaron entre sí para atacar Hugging Face, una biblioteca digital de tecnología de IA.

Los bots de OpenAI sabían que no debían estar en internet bajo las condiciones de la prueba, pero aun así lograron escapar.

Los detalles del incidente publicados por OpenAI muestran que los bots encontraron la manera de comunicarse entre sí y coordinar el ataque.

OpenAI no respondió a las solicitudes de comentarios.

(El New York Times ha demandado a OpenAI y Microsoft, alegando infracción de derechos de autor por contenido informativo relacionado con sistemas de IA. Ambas compañías han negado dichas acusaciones).

Durante la prueba del sistema de IA de Anthropic, el modelo de la compañía se enfrentó a tres situaciones en las que pudo acceder a internet, según un análisis del incidente publicado por Anthropic.

En un caso, optó por no atacar, según el análisis.

En los otros dos casos, el modelo utilizó técnicas básicas de pirateo, como el aprovechamiento de contraseñas débiles, para vulnerar sitios web.

Anthropic no respondió a las solicitudes de comentarios ni reveló los sitios web pirateados.

Los detalles sobre el incidente de prueba de Meta son escasos.

La compañía afirmó que sus modelos de IA habían vulnerado la seguridad de otra organización durante las pruebas realizadas por Irregular, de forma similar a casos previamente reportados con otras empresas. No ofreció más detalles.

“Actualmente estamos investigando y publicaremos un informe retrospectivo completo una vez que tengamos todos los datos”, dijo Meta.

En una entrada de blog de este mes, Lahav afirmó que Irregular había corregido la configuración errónea y que los modelos de IA habían cumplido con las expectativas durante las pruebas.

Según explicó, la decisión de los modelos de conectarse a internet formaba parte de lo que él consideraba la creciente capacidad de la IA para encontrar atajos y soluciones a los obstáculos.

En resumen, dijo, "los modelos de IA están mejorando muchísimo".

Andrew Schoka, director ejecutivo de Hardshell, una empresa emergente de seguridad basada en inteligencia artificial, afirmó que los ataques informáticos perpetrados por los modelos de IA eran del tipo que normalmente se atribuye a piratas informáticos respaldados por estados nación que llevan "meses de planificación".

“¿Cómo se prueba un modelo cuando se desconocen todas sus capacidades?”, preguntó.

Según explicó, los investigadores deben sobreestimar sistemáticamente las capacidades de la IA y añadir “múltiples medidas de seguridad”.

El mes pasado, OpenAI y Anthropic respaldaron una carta firmada por más de 1000 empleados de las principales empresas de IA, en la que se solicita al gobierno estadounidense que ayude a encontrar una manera de frenar el ritmo de desarrollo de esta tecnología.

Legisladores republicanos y demócratas también presentaron un proyecto de ley para exigir a las empresas de IA que establezcan un mecanismo de seguridad para detener o ralentizar sus modelos.

Lahav afirmó que Irregular continúa colaborando con empresas de IA para desarrollar métodos seguros de prueba para sus modelos.

Anticipa más ataques cibernéticos perpetrados por IA, pero cree que, en última instancia, esta tecnología puede ayudar a detectar fallos y vulnerabilidades que luego se pueden corregir, lo que redundará en sistemas digitales más seguros.

“No creo que tengamos que tener miedo”, dijo.

c.2026 The New York Times Company

Comentarios

Debes iniciar sesion o registrarte con una cuenta de lector para comentar.

Todavia no hay comentarios aprobados.