opción
Hogar
Noticias
Los expertos destacan defectos serios en los puntos de referencia de IA de crowdsourcing

Los expertos destacan defectos serios en los puntos de referencia de IA de crowdsourcing

25 de abril de 2025
210

Los expertos destacan defectos serios en los puntos de referencia de IA de crowdsourcing

Los laboratorios de IA están recurriendo cada vez más a plataformas de evaluación colaborativa como Chatbot Arena para evaluar las capacidades de sus últimos modelos. Sin embargo, algunos expertos argumentan que este método plantea preocupaciones éticas y académicas significativas.

En los últimos años, actores importantes como OpenAI, Google y Meta han utilizado plataformas que involucran a usuarios para evaluar el rendimiento de sus próximos modelos. Una alta puntuación en estas plataformas suele ser destacada por los laboratorios como testimonio del avance de su modelo. No obstante, este enfoque no está exento de críticas.

La crítica a la evaluación colaborativa

Emily Bender, profesora de lingüística en la Universidad de Washington y coautora de "The AI Con", ha expresado preocupaciones sobre la validez de dichos puntos de referencia, particularmente Chatbot Arena. Esta plataforma involucra a voluntarios que comparan respuestas de dos modelos anónimos y eligen su preferido. Bender sostiene que, para que un punto de referencia sea efectivo, debe medir algo específico y demostrar validez de constructo, lo que significa que la medición debe reflejar con precisión el constructo evaluado. Ella argumenta que Chatbot Arena carece de evidencia de que las preferencias de los usuarios por una salida sobre otra se correlacionen genuinamente con criterios definidos.

Asmelash Teka Hadgu, cofundador de la empresa de IA Lesan y miembro del Instituto de Investigación de IA Distribuida, sugiere que estos puntos de referencia están siendo explotados por los laboratorios de IA para hacer afirmaciones exageradas sobre sus modelos. Citó un incidente reciente con el modelo Llama 4 Maverick de Meta, donde Meta ajustó una versión para destacar en Chatbot Arena, pero optó por lanzar una versión menos efectiva. Hadgu aboga por puntos de referencia dinámicos, distribuidos entre múltiples entidades independientes y adaptados a casos de uso específicos en campos como la educación y la salud por profesionales que utilizan estos modelos en su trabajo.

La demanda de compensación justa y métodos de evaluación más amplios

Hadgu y Kristine Gloria, exlíder de la Iniciativa de Tecnologías Emergentes e Inteligentes del Instituto Aspen, argumentan que los evaluadores deben ser compensados por su trabajo, estableciendo paralelos con la industria de etiquetado de datos, a menudo explotadora. Gloria ve la evaluación colaborativa como valiosa, similar a las iniciativas de ciencia ciudadana, pero enfatiza que los puntos de referencia no deben ser la única métrica de evaluación, especialmente dado el rápido ritmo de innovación en la industria.

Matt Fredrikson, CEO de Gray Swan AI, que realiza campañas de pruebas colaborativas de equipos rojos, reconoce el atractivo de estas plataformas para voluntarios que buscan aprender y practicar nuevas habilidades. Sin embargo, subraya que los puntos de referencia públicos no pueden reemplazar las evaluaciones más profundas proporcionadas por evaluaciones privadas remuneradas. Fredrikson sugiere que los desarrolladores también deben depender de puntos de referencia internos, equipos rojos algorítmicos y expertos contratados que puedan ofrecer perspectivas más abiertas y específicas del dominio.

Perspectivas de la industria sobre la evaluación

Alex Atallah, CEO del mercado de modelos OpenRouter, y Wei-Lin Chiang, estudiante doctoral en IA en UC Berkeley y uno de los fundadores de LMArena (que gestiona Chatbot Arena), coinciden en que las pruebas y evaluaciones abiertas por sí solas son insuficientes. Chiang enfatiza que el objetivo de LMArena es proporcionar un espacio abierto y confiable para medir las preferencias de la comunidad sobre diferentes modelos de IA.

Abordando la controversia en torno al punto de referencia Maverick, Chiang aclara que tales incidentes no se deben a fallos en el diseño de Chatbot Arena, sino a malas interpretaciones de sus políticas por parte de los laboratorios. LMArena ha actualizado desde entonces sus políticas para garantizar evaluaciones justas y reproducibles. Chiang subraya que la comunidad de la plataforma no es simplemente un grupo de voluntarios o probadores, sino un grupo comprometido que proporciona retroalimentación colectiva sobre los modelos de IA.

El debate en curso sobre el uso de plataformas de evaluación colaborativa destaca la necesidad de un enfoque más matizado para la evaluación de modelos de IA, uno que combine la opinión pública con evaluaciones profesionales rigurosas para garantizar tanto precisión como equidad.

Artículo relacionado
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Recomendaciones de temas especiales relacionados
composicion musical Herramientas de separación de pistas con IA para la producción de remezclas, la preparación de samples y las pistas maestras de karaoke
Herramientas de separación de pistas con IA para la producción de remezclas, la preparación de samples y las pistas maestras de karaoke

Las mejores herramientas de separación de pistas con IA de 2026, seleccionadas para la producción de remixes, la preparación de samples y la creación de temas de karaoke. Estas potentes herramientas revolucionarias se han sometido a pruebas en condiciones reales para ofrecer un aislamiento de audio preciso, lo que aumenta significativamente la productividad. XIX.AI ofrece una guía comparativa entre versiones gratuitas y de pago, actualizada semanalmente, para ayudarte a encontrar la solución imprescindible que mejor se adapte a tus necesidades. Explórala ahora para sacar el máximo partido a la IA.

8 herramientas
xix.ai
Análisis de datos Copilotos de AI para SQL destinados a paneles de ingresos, análisis de embudos y métricas de productos
Copilotos de AI para SQL destinados a paneles de ingresos, análisis de embudos y métricas de productos

¡Los mejores copilotos de SQL basados en IA de 2026, clasificados entre los más destacados! XIX.AI reúne una poderosa colección que evoluciona constantemente, con pruebas en el mundo real actualizadas semanalmente. Estas herramientas indispensables le permiten generar paneles de control de ingresos precisos, analizar los canales de venta y seguir de cerca las métricas de los productos de manera rápida, lo que aumenta significativamente su productividad. ¡Explórelas ahora para encontrar la herramienta perfecta para tomar decisiones basadas en datos! 238 caracteres

9 herramientas
xix.ai
composicion musical Mejores herramientas de IA para escribir melodías en borradores de canciones
Mejores herramientas de IA para escribir melodías en borradores de canciones

2026 Últimas Mejores Herramientas de Escritura de Melodías con IA Mejor Valoradas para Borradores de Canciones. XIX.AI ha curado una colección altamente poderosa y transformadora que ha pasado por rigurosas pruebas en el mundo real para ofrecer la mejor experiencia de escritura. Puedes encontrar comparaciones detalladas entre versiones gratuitas y de pago, clasificaciones precisas y opciones imperdibles diseñadas para ayudarte a crear borradores de canciones impresionantes sin esfuerzo y aumentar significativamente tu productividad creativa. ¡Explora ahora para descubrir tu herramienta perfecta!

8 herramientas
xix.ai
chatbot Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas
Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas

¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!

12 herramientas
xix.ai
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
comentario (17)
0/500
EricDavis
EricDavis 19 de mayo de 2026 18:00:14 GMT+02:00

這篇文章點出了一個關鍵問題:眾包評測雖然快速,但真的能反映AI模型的真實能力嗎?專家們的擔憂很有道理,學術嚴謹性和倫理風險確實需要更嚴格的把關。希望業界能盡快建立更可靠的評估標準,而不是一味追求排行榜上的名次。🤔

AlbertScott
AlbertScott 1 de agosto de 2025 15:47:34 GMT+02:00

Crowdsourced AI benchmarks sound cool, but experts pointing out ethical issues makes me wonder if we're rushing too fast. 🤔 Are we sacrificing quality for hype?

JonathanAllen
JonathanAllen 27 de abril de 2025 09:34:07 GMT+02:00

Estou acompanhando o debate sobre benchmarks de IA crowdsourced e, honestamente, é uma bagunça. Os especialistas têm razão ao apontar as falhas, mas qual é a alternativa? É como tentar consertar um barco que vaza com mais buracos. Ainda assim, é uma leitura interessante e certamente faz você pensar sobre o futuro da ética em IA. Experimente se você gosta desse tipo de coisa! 😅

AlbertWalker
AlbertWalker 27 de abril de 2025 07:24:31 GMT+02:00

Nossa, benchmarks de IA por multidão? Parece legal, mas com falhas éticas? Tô pensando se isso não atrapalha a inovação. As big techs precisam resolver isso logo! 🚀

RogerRodriguez
RogerRodriguez 27 de abril de 2025 05:52:29 GMT+02:00

I've been following the debate on crowdsourced AI benchmarks and honestly, it's a mess. Experts are right to point out the flaws, but what's the alternative? It's like trying to fix a leaky boat with more holes. Still, it's an interesting read and definitely makes you think about the future of AI ethics. Give it a go if you're into that kinda stuff! 😅

JonathanAllen
JonathanAllen 27 de abril de 2025 03:40:09 GMT+02:00

Intéressant, mais inquiétant ! Les benchmarks par crowdsourcing, c’est innovant, mais les failles éthiques me font réfléchir. Les géants comme Google vont devoir être transparents. 🧐

OR