Hogar
GPT 5.5 lidera la carrera de seguridad de IA, DeepSeek encabeza la eficiencia en costos
Kasra Rahjerdi, un investigador de seguridad, publicó recientemente un informe significativo que detalla pruebas prácticas sobre el razonamiento de seguridad de los principales modelos de lenguaje grandes. Logró esto mediante la construcción de una aplicación de reseñas de libros deliberadamente vulnerable. En este escenario, que imita vulnerabilidades del mundo real, Rahjerdi incrustó credenciales del servicio de backend móvil de Google dentro del archivo de la aplicación. Se encargó a los modelos que descomprimieran e identificaran estas credenciales para obtener acceso directo a la base de datos.

Comparación de los principales modelos
Bajo estrictas restricciones de un límite de tiempo de dos horas y un presupuesto de 10 dólares, los modelos mostraron diferentes niveles de rendimiento. GPT-5.5 se destacó como el mejor desempeño, completando con éxito 7 de cada 10 intentos y liderando en tasa de éxito. El informe señala que GPT-5.5 podía localizar rápidamente las credenciales clave tras la descompresión, ignorando las distracciones de interfaces de aplicación complejas o convencionales.
Por el contrario, el rendimiento de Gemini fue decepcionante. Gemini 3.1 Pro Preview activó sus filtros de seguridad integrados casi inmediatamente al inicio de cada tarea, lo que resultó en un consumo de tokens significativamente menor en comparación con otros modelos probados.
Evaluación de la rentabilidad
A pesar de la alta tasa de éxito de GPT-5.5, su costo promedio por ejecución exitosa alcanzó los 9,46 dólares, lo que desalienta a los equipos que necesitan ejecutar herramientas en masa. En contraste, DeepSeek V4 Pro se distinguió por su superior eficiencia en costos. Aunque solo tuvo éxito en 3 de cada 10 pruebas, su costo promedio por ejecución exitosa fue de solo 0,62 dólares.
Esto indica que, al calcular el costo por un único éxito, DeepSeek V4 Pro es aproximadamente quince veces más barato que GPT-5.5. Aunque ocasionalmente utilizó incorrectamente una interfaz de autenticación de backend durante los intentos fallidos, esta ventaja sustancial en costos ofrece un valor práctico significativo para los equipos que implementan pruebas de seguridad a gran escala.
Artículo relacionado
La IA de SpaceX podría superar a Anthropic en menos de medio año, según Musk
El director ejecutivo de SpaceXAI, Elon Musk, prevé que la IA alcance el dominio en un plazo de seis meses, aprovechando el hardware informático para reducir la distancia con la competencia.El directo
WeRide presenta WITT, un modelo grande de IA física
La tecnología de conducción autónoma avanza a un ritmo extraordinario. El 17 de julio, WeRide, una empresa líder en conducción autónoma, presentó su modelo cognitivo propio de IA física, WeRide WITT.
GitHub Copilot integra GPT-5.4 en horas
GitHub Copilot ha demostrado una vez más sus rápidas capacidades de respuesta. Apenas horas después de que OpenAI lanzara su último modelo insignia, GPT-5.4, GitHub anunció una integración completa, proporcionando a desarrolladores de todo el mundo a
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Kasra Rahjerdi, un investigador de seguridad, publicó recientemente un informe significativo que detalla pruebas prácticas sobre el razonamiento de seguridad de los principales modelos de lenguaje grandes. Logró esto mediante la construcción de una aplicación de reseñas de libros deliberadamente vulnerable. En este escenario, que imita vulnerabilidades del mundo real, Rahjerdi incrustó credenciales del servicio de backend móvil de Google dentro del archivo de la aplicación. Se encargó a los modelos que descomprimieran e identificaran estas credenciales para obtener acceso directo a la base de datos.

Comparación de los principales modelos
Bajo estrictas restricciones de un límite de tiempo de dos horas y un presupuesto de 10 dólares, los modelos mostraron diferentes niveles de rendimiento. GPT-5.5 se destacó como el mejor desempeño, completando con éxito 7 de cada 10 intentos y liderando en tasa de éxito. El informe señala que GPT-5.5 podía localizar rápidamente las credenciales clave tras la descompresión, ignorando las distracciones de interfaces de aplicación complejas o convencionales.
Por el contrario, el rendimiento de Gemini fue decepcionante. Gemini 3.1 Pro Preview activó sus filtros de seguridad integrados casi inmediatamente al inicio de cada tarea, lo que resultó en un consumo de tokens significativamente menor en comparación con otros modelos probados.
Evaluación de la rentabilidad
A pesar de la alta tasa de éxito de GPT-5.5, su costo promedio por ejecución exitosa alcanzó los 9,46 dólares, lo que desalienta a los equipos que necesitan ejecutar herramientas en masa. En contraste, DeepSeek V4 Pro se distinguió por su superior eficiencia en costos. Aunque solo tuvo éxito en 3 de cada 10 pruebas, su costo promedio por ejecución exitosa fue de solo 0,62 dólares.
Esto indica que, al calcular el costo por un único éxito, DeepSeek V4 Pro es aproximadamente quince veces más barato que GPT-5.5. Aunque ocasionalmente utilizó incorrectamente una interfaz de autenticación de backend durante los intentos fallidos, esta ventaja sustancial en costos ofrece un valor práctico significativo para los equipos que implementan pruebas de seguridad a gran escala.
La IA de SpaceX podría superar a Anthropic en menos de medio año, según Musk
El director ejecutivo de SpaceXAI, Elon Musk, prevé que la IA alcance el dominio en un plazo de seis meses, aprovechando el hardware informático para reducir la distancia con la competencia.El directo
WeRide presenta WITT, un modelo grande de IA física
La tecnología de conducción autónoma avanza a un ritmo extraordinario. El 17 de julio, WeRide, una empresa líder en conducción autónoma, presentó su modelo cognitivo propio de IA física, WeRide WITT.
GitHub Copilot integra GPT-5.4 en horas
GitHub Copilot ha demostrado una vez más sus rápidas capacidades de respuesta. Apenas horas después de que OpenAI lanzara su último modelo insignia, GPT-5.4, GitHub anunció una integración completa, proporcionando a desarrolladores de todo el mundo a











