Las empresas tecnológicas favorecen los modelos de IA rentables

El auge de la IA se ha basado en una premisa fundamental: los modelos más grandes son más capaces, y los modelos más capaces ganan. Ahora, la industria está a punto de descubrir qué sucede cuando esa premisa comienza a resquebrarse.
Los crecientes costos ya han obligado a los usuarios a reconsiderar la opción de modelos más pequeños y económicos. Este enfoque basado en el costo al seleccionar modelos es nuevo, y aún no está claro cómo afectará la industria, pero su impacto es probable que sea significativo.
Una predicción, expresada con mayor claridad por Brian Armstrong, cofundador de Coinbase, es que la gran mayoría de las tareas se trasladarán a modelos más económicos.
“La demanda de inteligencia es casi infinita, pero el 80% de las cargas de trabajo se ejecutarán en modelos que sean un 99% más económicos en los próximos 12 a 18 meses”, escribió Armstrong en X. “El 20% de las cargas de trabajo seguirá utilizando los modelos de última generación, donde es importante maximizar la inteligencia”.
Es difícil exagerar cuán significativo sería este cambio para la industria de la IA si la predicción de Armstrong se cumple.
Hasta ahora, la mayoría de las empresas de IA compitían en calidad, lo que significaba utilizar siempre los modelos más avanzados disponibles. Si esas mismas tareas pueden ser manejadas por modelos más económicos sin ninguna pérdida de calidad, eso indicaría un cambio drástico en la economía de la IA. Y lo más importante es que gran parte del ahorro provendría directamente de los ingresos de los grandes laboratorios, lo que representaría un golpe financiero para OpenAI y Anthropic justo cuando se encuentran en el proceso de realizar sus ofertas públicas.
Este podría ser un cambio revolucionario para la industria, y todo depende de una pregunta fundamental: ¿Están las empresas listas para pasar a utilizar modelos más pequeños?
Pruebas iniciales sugieren que, con la configuración adecuada, los modelos más económicos pueden funcionar sin ninguna pérdida de calidad. En una prueba reciente realizada por el herramienta de IA legal Harvey, la empresa logró reducir los costos de inferencia en tres veces sin disminuir la calidad. La prueba, llevada a cabo en colaboración con la plataforma de inferencia Fireworks AI, combinó a Claude Opus y GLM 5.1 de Fireworks, y utilizó Opus para las tareas más exigentes. El resultado fue una carga significativamente menor para los servidores y costos generales más bajos.
“La calidad es lo primero, y siempre lo será en el ámbito legal”, dijo Gabe Pereyra, cofundador de Harvey, a TechCrunch, refiriéndose a los servicios legales de IA de su startup. “Sin embargo, la definición de calidad está evolucionando: ya no se trata simplemente de utilizar el modelo más potente para todo, sino de elegir el modelo que proporcione la respuesta correcta de manera más eficiente”.
Esta tendencia a menudo se presenta como un enfrentamiento entre los grandes laboratorios y los modelos chinos u abiertos, pero eso pasa por alto la imagen más amplia. La verdadera división no está entre modelos propietarios y abiertos, sino entre modelos grandes y pequeños. Puedes ahorrar dinero cambiando de GPT-5.5 a DeepSeek’s V4Flash, pero también cambiar a GPT-5.4-mini y obtener resultados igualmente buenos.
Existe una intensa guerra de precios entre los servicios de inferencia internos de los grandes laboratorios y los modelos abiertos ofrecidos de manera independiente. En cuanto a la cuestión más general de si los modelos pequeños o grandes son los mejores, en realidad no importa cuál tipo de modelo pequeño gane.
Todo esto puede parecer obvio: por supuesto, no deberías utilizar más recursos computacionales de lo necesario, pero va en contra del enfoque basado en la escalabilidad que ha dominado la industria hasta ahora. Inspirados por esta lección amarga, los laboratorios se han centrado en entrenar modelos que requieran la mayor cantidad posible de recursos computacionales, llevando al límite de lo que pueden hacer los modelos de IA. Con los precios subvencionados en gran medida por los inversores, los clientes no tenían razón para elegir anything other than las opciones más avanzadas.
Ahora que los precios de los tokens están aumentando y las subvenciones disminuyendo, los usuarios enfrentan por primera vez presiones financieras. Todavía no sabemos si esta nueva presión financiera realmente llevará a los usuarios empresariales a utilizar modelos más pequeños. También podrían ahorrar dinero reduciendo el número de llamadas, utilizando ventanas de contexto más cortas o simplemente abandonando aquellas implementaciones que no tengan mucho potencial.
Pero si resulta que la mayoría de las implementaciones pueden funcionar igual de bien con modelos más pequeños, eso podría frenar seriamente la creciente demanda de servicios de inferencia y plantear nuevas preguntas sobre cómo justificar el costo de entrenar modelos de vanguardia.
Artículo relacionado
Anthropic lanza Opus 4.8, que incluye una nueva herramienta dinámica para el flujo de trabajo
Anthropic presentó el jueves Opus 4.8, la última versión de su modelo público estrella. Con un precio idéntico al de su predecesor, esta actualización ya está disponible en todas las plataformas.Con s
OpenAI lanza una versión más segura de ChatGPT para adolescentes, años después de que estos empezaran a utilizarla
Tras una serie de demandas relacionadas con la ausencia de protocolos de seguridad en los chatbots de IA —que contribuyeron a suicidios de adolescentes y otras crisis de salud mental—, OpenAI presentó
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes
Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El auge de la IA se ha basado en una premisa fundamental: los modelos más grandes son más capaces, y los modelos más capaces ganan. Ahora, la industria está a punto de descubrir qué sucede cuando esa premisa comienza a resquebrarse.
Los crecientes costos ya han obligado a los usuarios a reconsiderar la opción de modelos más pequeños y económicos. Este enfoque basado en el costo al seleccionar modelos es nuevo, y aún no está claro cómo afectará la industria, pero su impacto es probable que sea significativo.
Una predicción, expresada con mayor claridad por Brian Armstrong, cofundador de Coinbase, es que la gran mayoría de las tareas se trasladarán a modelos más económicos.
“La demanda de inteligencia es casi infinita, pero el 80% de las cargas de trabajo se ejecutarán en modelos que sean un 99% más económicos en los próximos 12 a 18 meses”, escribió Armstrong en X. “El 20% de las cargas de trabajo seguirá utilizando los modelos de última generación, donde es importante maximizar la inteligencia”.
Es difícil exagerar cuán significativo sería este cambio para la industria de la IA si la predicción de Armstrong se cumple.
Hasta ahora, la mayoría de las empresas de IA compitían en calidad, lo que significaba utilizar siempre los modelos más avanzados disponibles. Si esas mismas tareas pueden ser manejadas por modelos más económicos sin ninguna pérdida de calidad, eso indicaría un cambio drástico en la economía de la IA. Y lo más importante es que gran parte del ahorro provendría directamente de los ingresos de los grandes laboratorios, lo que representaría un golpe financiero para OpenAI y Anthropic justo cuando se encuentran en el proceso de realizar sus ofertas públicas.
Este podría ser un cambio revolucionario para la industria, y todo depende de una pregunta fundamental: ¿Están las empresas listas para pasar a utilizar modelos más pequeños?
Pruebas iniciales sugieren que, con la configuración adecuada, los modelos más económicos pueden funcionar sin ninguna pérdida de calidad. En una prueba reciente realizada por el herramienta de IA legal Harvey, la empresa logró reducir los costos de inferencia en tres veces sin disminuir la calidad. La prueba, llevada a cabo en colaboración con la plataforma de inferencia Fireworks AI, combinó a Claude Opus y GLM 5.1 de Fireworks, y utilizó Opus para las tareas más exigentes. El resultado fue una carga significativamente menor para los servidores y costos generales más bajos.
“La calidad es lo primero, y siempre lo será en el ámbito legal”, dijo Gabe Pereyra, cofundador de Harvey, a TechCrunch, refiriéndose a los servicios legales de IA de su startup. “Sin embargo, la definición de calidad está evolucionando: ya no se trata simplemente de utilizar el modelo más potente para todo, sino de elegir el modelo que proporcione la respuesta correcta de manera más eficiente”.
Esta tendencia a menudo se presenta como un enfrentamiento entre los grandes laboratorios y los modelos chinos u abiertos, pero eso pasa por alto la imagen más amplia. La verdadera división no está entre modelos propietarios y abiertos, sino entre modelos grandes y pequeños. Puedes ahorrar dinero cambiando de GPT-5.5 a DeepSeek’s V4Flash, pero también cambiar a GPT-5.4-mini y obtener resultados igualmente buenos.
Existe una intensa guerra de precios entre los servicios de inferencia internos de los grandes laboratorios y los modelos abiertos ofrecidos de manera independiente. En cuanto a la cuestión más general de si los modelos pequeños o grandes son los mejores, en realidad no importa cuál tipo de modelo pequeño gane.
Todo esto puede parecer obvio: por supuesto, no deberías utilizar más recursos computacionales de lo necesario, pero va en contra del enfoque basado en la escalabilidad que ha dominado la industria hasta ahora. Inspirados por esta lección amarga, los laboratorios se han centrado en entrenar modelos que requieran la mayor cantidad posible de recursos computacionales, llevando al límite de lo que pueden hacer los modelos de IA. Con los precios subvencionados en gran medida por los inversores, los clientes no tenían razón para elegir anything other than las opciones más avanzadas.
Ahora que los precios de los tokens están aumentando y las subvenciones disminuyendo, los usuarios enfrentan por primera vez presiones financieras. Todavía no sabemos si esta nueva presión financiera realmente llevará a los usuarios empresariales a utilizar modelos más pequeños. También podrían ahorrar dinero reduciendo el número de llamadas, utilizando ventanas de contexto más cortas o simplemente abandonando aquellas implementaciones que no tengan mucho potencial.
Pero si resulta que la mayoría de las implementaciones pueden funcionar igual de bien con modelos más pequeños, eso podría frenar seriamente la creciente demanda de servicios de inferencia y plantear nuevas preguntas sobre cómo justificar el costo de entrenar modelos de vanguardia.
Anthropic lanza Opus 4.8, que incluye una nueva herramienta dinámica para el flujo de trabajo
Anthropic presentó el jueves Opus 4.8, la última versión de su modelo público estrella. Con un precio idéntico al de su predecesor, esta actualización ya está disponible en todas las plataformas.Con s
OpenAI lanza una versión más segura de ChatGPT para adolescentes, años después de que estos empezaran a utilizarla
Tras una serie de demandas relacionadas con la ausencia de protocolos de seguridad en los chatbots de IA —que contribuyeron a suicidios de adolescentes y otras crisis de salud mental—, OpenAI presentó
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes
Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando





Hogar






