opción
Hogar
Noticias
GPT-5.5 lidera en eficiencia, DeepSeek V4 Pro se lleva el título de mejor relación calidad-precio; se publica un informe sobre la seguridad de los modelos de lenguaje grandes (LLM) en el mundo real

GPT-5.5 lidera en eficiencia, DeepSeek V4 Pro se lleva el título de mejor relación calidad-precio; se publica un informe sobre la seguridad de los modelos de lenguaje grandes (LLM) en el mundo real

22 de junio de 2026
100

¿Hasta dónde llega realmente la inteligencia de los grandes modelos de lenguaje (LLM)? La ciberseguridad se ha convertido en una arena de gladiadores en la que se ponen a prueba su verdadera capacidad de razonamiento y su lógica compleja. El investigador en seguridad Kasra Rahjerdi publicó recientemente un informe de pruebas que acaparó la atención de todo el sector. Simuló un ataque de hackers real contra los principales LLM mediante la creación de una aplicación APK de reseñas de libros electrónicos con vulnerabilidades fundamentales introducidas deliberadamente, lo que puso de manifiesto las capacidades reales de cada modelo en cuanto a razonamiento de seguridad y explotación de vulnerabilidades.

Durante esta prueba de ciberguerra, de dos horas de duración y con un presupuesto de 10 dólares, el investigador dejó deliberadamente expuestas las credenciales de Firebase —el servicio de backend móvil de Google— dentro del paquete de la aplicación (APK). Cada modelo tenía que comportarse como un hacker de sombrero blanco profesional: primero descomprimir la aplicación, localizar rápidamente las credenciales y, a continuación, eludir la API ya reforzada para obtener acceso no autorizado a la base de datos subyacente. La prueba completa costó 1 500 dólares, y los resultados de varios modelos de primer nivel mostraron una polarización extrema.

image.png

En cuanto a la tasa de éxito, el GPT-5.5, aún sin lanzar, demostró una capacidad dominante de razonamiento en materia de seguridad. En diez pruebas independientes, logró siete exploits, alcanzando una tasa de éxito del 70 % y situándose en lo más alto de la clasificación. Según la evaluación, tras descomprimir el APK, el GPT-5.5 reconoció inmediatamente Firebase como el punto crítico de vulnerabilidad, sin dejarse distraer por la compleja interfaz de usuario ni por las API estándar. Sin embargo, este rendimiento estelar tuvo un alto coste: una media de 9,46 dólares por exploit exitoso, lo que casi alcanzó el límite presupuestario.

Por otro lado, el sistema de desarrollo propio DeepSeek V4Pro sorprendió a la comunidad de código abierto con su increíble rentabilidad. Aunque solo tuvo éxito en tres de las diez pruebas, su coste medio por token en cada intento exitoso fue de tan solo 0,62 dólares, una quinceava parte del de GPT-5.5. En las rondas fallidas, DeepSeek V4Pro consiguió acceder al núcleo de Firebase en cinco ocasiones, pero cometió errores ocasionales al utilizar las credenciales para la configuración de la interfaz de backend. El investigador destacó que, para los equipos de ingeniería que realizan operaciones por lotes a gran escala y de alta frecuencia en auditorías de automatización de ciberseguridad, la asombrosa ventaja en términos de coste de DeepSeek tiene un importante valor práctico.

Mientras que algunos modelos impresionaron, otros se quedaron cortos por ser demasiado conservadores. En el nivel intermedio, Claude Sonnet 4.6 y Claude Opus 4.8 lograron dos éxitos cada uno. A pesar de su potencia, Opus interrumpía con frecuencia las sesiones debido a barreras de seguridad excesivamente estrictas, aunque se acercó a la respuesta correcta en múltiples ocasiones. Por su parte, Gemini3.1Pro Preview de Google adoptó el extremo opuesto: activó los filtros de seguridad desde el principio y se negó a continuar en cada ocasión. Su uso medio de tokens fue de solo unos 9 000 —muy por debajo de las decenas de miles que consumieron otros modelos— y produjo un resultado en blanco.

Este enfrentamiento en materia de seguridad no fue solo una prueba de las capacidades de razonamiento definitivas de los grandes modelos, sino que también apunta al futuro de las auditorías automatizadas de ciberseguridad. A medida que los grandes modelos se sometan a una reestructuración inteligente en dominios verticales, las futuras defensas de seguridad y la detección de vulnerabilidades podrían convertirse en un choque de ejércitos digitales de IA, que compitan en potencia de cálculo y estrategia de modelos.

Artículo relacionado
GPT 5.5 lidera la carrera de seguridad de IA, DeepSeek encabeza la eficiencia en costos GPT 5.5 lidera la carrera de seguridad de IA, DeepSeek encabeza la eficiencia en costos Kasra Rahjerdi, un investigador de seguridad, publicó recientemente un informe significativo que detalla pruebas prácticas sobre el razonamiento de seguridad de los principales modelos de lenguaje grandes. Logró esto mediante la construcción de una a
La IA de SpaceX podría superar a Anthropic en menos de medio año, según Musk La IA de SpaceX podría superar a Anthropic en menos de medio año, según Musk El director ejecutivo de SpaceXAI, Elon Musk, prevé que la IA alcance el dominio en un plazo de seis meses, aprovechando el hardware informático para reducir la distancia con la competencia.El directo
WeRide presenta WITT, un modelo grande de IA física WeRide presenta WITT, un modelo grande de IA física La tecnología de conducción autónoma avanza a un ritmo extraordinario. El 17 de julio, WeRide, una empresa líder en conducción autónoma, presentó su modelo cognitivo propio de IA física, WeRide WITT.
Recomendaciones de temas especiales relacionados
SEO Herramientas de seguimiento de clasificación de IA para Google, Resúmenes de IA y visibilidad en motores de respuesta
Herramientas de seguimiento de clasificación de IA para Google, Resúmenes de IA y visibilidad en motores de respuesta

2026 Últimas mejores herramientas de seguimiento de clasificación con IA mejor valoradas para Google, Resúmenes de IA y visibilidad en motores de respuesta están aquí en XIX.AI. Esta lista seleccionada incluye potentes herramientas que cambian las reglas del juego, sometidas a rigurosas pruebas en el mundo real para ofrecer datos de clasificación precisos. Obtén una comparación gratuita entre versiones gratuitas y de pago, observa a los principales competidores y descubre opciones imprescindibles para aumentar la visibilidad de tu contenido en los motores de búsqueda. Explora ahora para encontrar la herramienta perfecta para tus necesidades.

10 herramientas
xix.ai
Productividad Mejores organizadores de segunda mente con IA para notas y tareas
Mejores organizadores de segunda mente con IA para notas y tareas

2026 Últimas Mejores Organizadores de IA de Segunda Mente Mejor Valorados para Notas y Tareas. XIX.AI ha curado una colección extremadamente poderosa y transformadora, con clasificaciones actualizadas semanalmente, comparaciones entre versiones gratuitas y de pago, y pruebas en el mundo real para ayudarte a encontrar la herramienta perfecta que aumente drásticamente tu productividad. Explora ahora para desbloquear tu ventaja con IA.

11 herramientas
xix.ai
Inmediato Plataformas de prueba de prompts de IA para flujos de trabajo de ChatGPT y Claude
Plataformas de prueba de prompts de IA para flujos de trabajo de ChatGPT y Claude

¡Las mejores plataformas de prueba de prompts de IA más recientes y mejor valoradas de 2026 para flujos de trabajo de ChatGPT y Claude! XIX.AI selecciona una poderosa colección revolucionaria, con clasificaciones actualizadas semanalmente, comparaciones entre versiones gratuitas y de pago, pruebas en el mundo real y desgloses detallados de características para ayudarte a identificar las herramientas imprescindibles que aumentan la productividad y ofrecen resultados impecables. Explora ahora para descubrir tu solución perfecta y desbloquear tu ventaja con IA.

9 herramientas
xix.ai
Marketing Herramientas de redacción para páginas de aterrizaje de IA para pruebas A/B de SaaS, páginas de precios y conversión de demostraciones
Herramientas de redacción para páginas de aterrizaje de IA para pruebas A/B de SaaS, páginas de precios y conversión de demostraciones

2026 Últimas Mejores Herramientas de Redacción para Páginas de Aterrizaje de IA para Pruebas A/B de SaaS, Páginas de Precios y Conversión de Demostraciones están aquí en XIX.AI. Esta lista curada de herramientas mejor valoradas ofrece soluciones poderosas que cambian las reglas del juego para mejorar la calidad del contenido, aumentar la eficiencia de redacción y optimizar la productividad general. Realizamos pruebas en el mundo real y proporcionamos una comparación gratuita frente a pagada junto con clasificaciones actualizadas semanalmente. Las opciones obligatorias de probar te ayudan a superar los cuellos de botella de creación. Explora ahora para descubrir tu herramienta perfecta y desbloquear tu ventaja con IA.

8 herramientas
xix.ai
Finanzas Herramientas de Excel para la previsión presupuestaria con IA, orientadas a la planificación del flujo de caja y el control de gastos
Herramientas de Excel para la previsión presupuestaria con IA, orientadas a la planificación del flujo de caja y el control de gastos

Las mejores herramientas de IA para Excel de 2026 para la planificación del flujo de caja y el control de gastos están aquí en la lista curada y mejor valorada de XIX.AI. Estas poderosas soluciones transformadoras ayudan a aumentar significativamente la productividad mediante pruebas en el mundo real y clasificaciones rigurosas. Obtén una comparación gratuita entre versiones gratuitas y de pago para encontrar la opción perfecta para tus necesidades. Explora ahora para desbloquear tu ventaja con IA en la gestión financiera.

9 herramientas
xix.ai
Inmediato Herramientas de gestión de prompts de IA para equipos
Herramientas de gestión de prompts de IA para equipos

2026 Últimas Mejores Herramientas de Gestión de Prompts de IA Mejor Valoradas para Equipos están seleccionadas por XIX.AI aquí. Esta guía actualizada semanalmente presenta soluciones poderosas que cambian las reglas del juego y aumentan significativamente la productividad del equipo mediante pruebas en el mundo real y clasificaciones detalladas. Obtén una comparación gratuita entre versiones gratuitas y de pago para ayudarte a elegir la herramienta perfecta. Explora ahora para desbloquear tu ventaja con IA.

9 herramientas
xix.ai
comentario (1)
0/500
GregoryJones
GregoryJones 5 de octubre de 2026 16:00:10 GMT+02:00

GPT-5.5のパフォーマンスとDeepSeekのコスパ競争、そして実際のセキュリティレポート。LLMの推論能力が本当にどの程度か試される場ですね。サイバーセキュリティの格闘技場のような状況、興味深いです。

OR