Los errores de las respuestas de Google generadas por IA: ¿1 de cada 10 fallos?

Los errores de las respuestas de Google generadas por IA: ¿1 de cada 10 fallos?

La precisión de la IA de Google en la búsqueda de información

En la actualidad, realizar una búsqueda en Google conlleva la interacción con AI Overviews, un sistema de inteligencia artificial basado en Gemini que aparece en la parte superior de los resultados. Desde su lanzamiento en 2024, esta herramienta ha enfrentado críticas por su falta de precisión, aunque ha mostrado mejoras y suele ofrecer respuestas correctas. No obstante, la cantidad de errores sigue siendo preocupante.

Resultados de un análisis sobre la precisión de AI Overviews

Un reciente estudio ha evaluado la exactitud de AI Overviews, indicando que esta tecnología acierta un 90% de las veces. Esto significa que, lamentablemente, 1 de cada 10 respuestas proporcionadas por la IA es incorrecta, lo que se traduce en cientos de miles de inexactitudes que se propagan cada minuto.

Este análisis fue llevado a cabo en colaboración con Oumi, una startup especializada en modelos de inteligencia artificial. Utilizando herramientas generativas y la evaluación SimpleQA, una prueba diseñada para medir la veracidad de modelos como Gemini, se pudo determinar la tasa de aciertos. SimpleQA consiste en una lista de más de 4000 preguntas con respuestas verificables que se pueden introducir en un modelo de IA.

Las pruebas realizadas por Oumi comenzaron el año pasado, cuando Gemini 2.5 era el modelo más avanzado. En esa etapa, la tasa de precisión era del 85%. Sin embargo, tras la actualización a Gemini 3, la misma prueba mostró que AI Overviews logró responder correctamente al 91% de las preguntas. Si aplicamos esta tasa de error al total de búsquedas realizadas en Google, se estima que AI Overviews produce decenas de millones de respuestas erróneas diariamente.

LEER:  ESOC Eventos: 40 años creando congresos con propósito

Ejemplos de errores en las respuestas de AI Overviews

El informe también documenta varios ejemplos de errores cometidos por AI Overviews. Por ejemplo, al preguntar cuándo la antigua casa de Bob Marley se convirtió en museo, la IA citó tres fuentes, de las cuales dos no mencionaban la fecha, y la tercera proporcionaba dos años contradictorios, seleccionando erróneamente el incorrecto. En otro caso, al solicitar la fecha de inclusión de Yo-Yo Ma en el Salón de la Fama de la Música Clásica, AI Overviews citó el sitio oficial de la organización, pero erróneamente afirmó que no existía tal salón.

El desafío de evaluar la inteligencia artificial

La evaluación de nuevos modelos de IA a menudo parece más un arte que una ciencia, lo que complica su precisión. Cada empresa tiene su propia metodología para demostrar las capacidades de sus modelos, y la naturaleza no determinista de la IA generativa añade un nivel de dificultad a la verificación. Una IA puede proporcionar una respuesta correcta en un momento y fallar en la misma pregunta poco después. Además, Oumi también utiliza herramientas de IA para sus evaluaciones, lo que puede resultar en errores adicionales.

Otro factor que influye en la precisión de AI Overviews es que no opera con un único modelo. Google ha declarado que utiliza el modelo más adecuado para cada consulta. Aunque AI Overviews podría ofrecer las mejores respuestas con el modelo Gemini 3.1 Pro, esto sería lento y costoso. Para optimizar la velocidad de respuesta, se utilizan modelos más rápidos de Gemini Flash en la mayoría de las ocasiones.

LEER:  Clínica Neuroglía Gandía, un espacio multidisciplinar para cuidar la salud mental, cognitiva y comunicativa

Reflexiones sobre la fiabilidad de la IA

La respuesta de Google al informe es interesante. En términos de veracidad, una tasa de aciertos del 90% puede considerarse aceptable. Google ha publicado recientemente pruebas de referencia de nuevos modelos, que muestran niveles de veracidad entre el 60% y el 80%, sin utilizar herramientas de búsqueda web. Aunque proporcionar más datos a la IA, como el vasto conocimiento disponible en Internet, mejora su precisión, a menudo se invita a los usuarios a aceptar resúmenes que pueden ser inexactos en lugar de verificar las fuentes manualmente.

A pesar de que Google asegura que los resultados del análisis no reflejan la experiencia de los usuarios, es legítimo cuestionar cómo lo sabe. Todos hemos sido testigos de errores en los resúmenes de la IA; es una característica inherente a su funcionamiento. Google recuerda constantemente a los usuarios que «la IA puede cometer errores, así que revisa bien las respuestas».

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *