Schuyler Stacy2026-02-12

Google FACTS: Por qué la precisión de la IA alcanza un techo del 70 %

El nuevo benchmark FACTS de Google revela que los principales modelos de IA, como Gemini 3 Pro y GPT-5, no superan una precisión del 70 %. Descubre las implicaciones para la búsqueda y la visión multimodal, y cómo cerrar la brecha de la verdad en la inteligencia generativa.

Google FACTS: Por qué la precisión de la IA alcanza un techo del 70 %

Google sacudió recientemente el mundo tecnológico al publicar el benchmark Google FACTS, un estudio exhaustivo que revela que incluso los modelos de IA más avanzados del mundo tienen dificultades para mantener la integridad factual. A pesar de contar con conjuntos de datos enormes, ningún modelo líder ha superado un umbral de precisión del 70 %. Esta «brecha de la verdad» expone vulnerabilidades críticas en la forma en que los modelos de lenguaje de gran escala (LLM) procesan el conocimiento interno y los datos visuales. Para desarrolladores y empresas, el informe Google FACTS sirve como una importante comprobación de la realidad y demuestra que el camino hacia una inteligencia generativa fiable y crítica para las misiones requiere algo más que datos adicionales: exige un cambio fundamental en la verificación.

Tabla de contenido

La comprobación de realidad del 70 %: qué nos enseña Google FACTS

Hoy existe una creciente sensación de inquietud entre los líderes tecnológicos. Hemos visto cómo la IA generativa escribe código y redacta ensayos a una velocidad inquietante, pero sigue pendiente una pregunta fundamental: ¿podemos confiar en sus resultados? El benchmark Google FACTS proporcionó recientemente una respuesta aleccionadora. En una prueba rigurosa de fiabilidad factual, los sistemas más avanzados del planeta —incluidos los propios modelos insignia de Google— chocaron con un muro estadístico en el 70 %.

Para ponerlo en contexto, una puntuación de Google FACTS inferior al 70 % significa que tu asistente de IA es prácticamente un riesgo en entornos profesionales. Si un investigador humano se equivocara tres de cada diez veces, sería despedido. Sin embargo, este es el estado actual de la tecnología. Los datos de Google FACTS sugieren que, aunque la IA se vuelve más creativa, su capacidad para actuar como fuente definitiva de verdad se está estancando. Este techo no es simplemente un error menor; es una característica de las arquitecturas probabilísticas actuales, que priorizan la fluidez por encima de la exactitud factual.

Comprender los resultados de Google FACTS requiere mirar más allá del entusiasmo del marketing. Actualmente operamos en una era de fiabilidad «suficiente». Tanto si utilizas un modelo para investigación, análisis de datos o atención al cliente, el marco Google FACTS demuestra que las alucinaciones no son simples fallos ocasionales: están profundamente integradas en la forma en que estos sistemas «predicen» la información en lugar de verificarla.

AI models hitting the Google FACTS 70 percent accuracy ceiling

Los cuatro pilares de la metodología Google FACTS

Google no se limitó a formular preguntas sencillas de cultura general. Para crear el benchmark Google FACTS, los investigadores establecieron cuatro pilares de evaluación distintos. El primero es el conocimiento paramétrico, que evalúa lo que el modelo sabe internamente sin acceso a internet. Las puntuaciones de Google FACTS fueron sorprendentemente bajas en este apartado, lo que demuestra que los pesos internos suelen volverse «imprecisos» con el tiempo y provocan afirmaciones seguras, pero incorrectas.

El segundo pilar de Google FACTS es la precisión aumentada mediante búsquedas. Muchos creían que dar acceso a Google Search a una IA resolvería el problema de la verdad. Sin embargo, el informe Google FACTS muestra que los modelos suelen tener dificultades para sintetizar informes web contradictorios. Pueden encontrar la información correcta, pero no verificarla, y en ocasiones citan sátiras o datos obsoletos como hechos principales. La búsqueda es una herramienta, pero según Google FACTS, no es una cura para las alucinaciones.

El tercer y cuarto pilar se centran en el análisis multimodal y la fundamentación. Aquí es donde el benchmark Google FACTS se vuelve realmente desalentador. La capacidad de leer correctamente gráficos, diagramas e imágenes es un requisito fundamental para los futuros agentes de IA. Sin embargo, las pruebas de Google FACTS revelan que la interpretación visual es el eslabón más débil de la cadena. La fidelidad a un documento proporcionado —mantenerse dentro de los límites de un texto específico— también sigue siendo un obstáculo importante para todos los LLM principales evaluados.

La tabla de resultados de Google FACTS: un análisis competitivo

Al observar las clasificaciones específicas de Google FACTS, Gemini 3 Pro encabeza la lista con una puntuación compuesta del 68,8 %. Aunque técnicamente lo convierte en el líder del mercado, sigue por debajo del umbral del 70 % que el estudio Google FACTS define como el «techo de precisión». GPT-5 y Claude 4.5 le siguen de cerca, pero la estrecha concentración de estas puntuaciones de Google FACTS sugiere que todos los desarrolladores están alcanzando simultáneamente los mismos límites arquitectónicos.

El benchmark Google FACTS destaca que duplicar el tamaño de un modelo no produce un aumento lineal de la precisión. Estamos observando rendimientos decrecientes. Para superar el muro del 70 % de Google FACTS, el sector quizá deba abandonar los modelos Transformer puros en favor de la lógica simbólica. Los datos de Google FACTS nos indican esencialmente que forzar la inteligencia con más datos ya no basta para garantizar la verdad.

Para las empresas, estas cifras de Google FACTS son una advertencia. No puedes implementar un sistema para diagnósticos médicos o cumplimiento legal si falla sistemáticamente los estándares de fiabilidad de Google FACTS. La brecha entre una precisión del 70 % y del 99 % es donde reside ahora el trabajo más difícil del desarrollo de la IA. El informe Google FACTS no es solo una clasificación; es una hoja de ruta para la próxima década de investigación.

La crisis multimodal revelada por Google FACTS

Quizá el descubrimiento más alarmante del informe Google FACTS sea el fracaso de los modelos de visión y lenguaje. Aunque vemos demostraciones de IA describiendo fotografías con facilidad, el benchmark multimodal de Google FACTS mostró una precisión máxima de solo el 46,9 %. Esto significa que, si pides a una IA que extraiga datos de un gráfico financiero, es más probable que te proporcione una cifra incorrecta que una correcta, según los criterios de Google FACTS.

Este «astigmatismo visual» identificado por Google FACTS tiene enormes implicaciones. Si un modelo no puede interpretar con precisión una hoja de cálculo estática o una exploración médica, no puede funcionar como un agente autónomo fiable. Los hallazgos de Google FACTS sugieren que estos modelos «alucinan» detalles visuales para adaptarlos a una narrativa. Si el modelo espera que una línea de tendencia suba, informará de que sube, aunque la imagen muestre un descenso. Esta desalineación semántica es uno de los principales focos de la ingeniería posterior a Google FACTS.

Multimodal AI data hallucination and visualization errors

Para solucionar esto, los investigadores mencionados en el estudio Google FACTS están estudiando el razonamiento de «cadena de visión». Esto requiere que el modelo describa cada píxel antes de interpretar su significado. Hasta que se cierre esta brecha, el benchmark Google FACTS seguirá recordándonos que los ojos humanos deben continuar siendo el árbitro final de la verdad. Actualmente vivimos en una era en la que la IA puede ver, pero aún no puede percibir la realidad con precisión.

La paradoja de la búsqueda en el marco Google FACTS

Se suponía que la generación aumentada mediante recuperación (RAG) sería la solución definitiva para los errores de la IA. Sin embargo, los resultados de Google FACTS muestran una «paradoja de la búsqueda». Aunque añadir capacidades de búsqueda mejoró las puntuaciones, no llevó a los modelos a la zona de «alta fiabilidad». Los datos de Google FACTS indican que los modelos suelen sufrir contaminación de fuentes. Encuentran tres errores generados por IA en internet y los tratan como un consenso, creando un ciclo de desinformación.

Además, el informe Google FACTS identifica el «fallo de síntesis». Esto ocurre cuando un modelo recupera el hecho correcto, pero luego lo distorsiona durante la fase de redacción. Es una desconexión cognitiva entre el motor de búsqueda y el generador lingüístico. El benchmark Google FACTS demuestra que conectar simplemente una API de búsqueda no basta para alcanzar una precisión del 100 %. Se necesita una verificación en varios pasos para superar los fallos señalados en el informe Google FACTS.

Para los desarrolladores, la conclusión de Google FACTS es que el cerebro del «razonamiento» suele imponerse al cerebro de la «búsqueda». Si la probabilidad interna del modelo indica una cosa, puede ignorar el resultado de búsqueda que indica otra. Esta lucha por el control dentro de la arquitectura de la IA es una razón clave por la que las puntuaciones de Google FACTS permanecen obstinadamente por debajo del 70 % en la mayoría de las categorías.

Cómo afrontar la era del 70 % con GPT Proto

Si vamos a quedarnos con el techo del 70 % de Google FACTS en un futuro próximo, ¿cómo debemos proceder? La respuesta está en la verificación multimodelo. Puesto que el informe Google FACTS demuestra que los distintos modelos tienen fortalezas diferentes, un desarrollador inteligente utilizará un modelo de Google para las búsquedas y quizá un modelo de OpenAI para la lógica. Esta «comprobación cruzada» es la única forma de mitigar los riesgos identificados por Google FACTS.

Aquí es donde GPT Proto se vuelve esencial. En un mundo posterior a Google FACTS, depender de una sola API es peligroso. GPT Proto te permite acceder a los principales modelos —Gemini, GPT y Claude— mediante una única interfaz. Si el benchmark Google FACTS muestra que Gemini lidera este mes, puedes cambiar al instante. Esta flexibilidad garantiza que no quedes atado a un modelo que haya alcanzado su techo de precisión de Google FACTS.

Además, implementar las capas de verificación sugeridas por el estudio Google FACTS puede resultar costoso. Ejecutar tres modelos para comprobar un solo hecho triplica los costes. GPT Proto resuelve este problema al ofrecer estos modelos de primer nivel con hasta un 60 % menos de coste. Puedes crear los flujos de trabajo «human-in-the-loop» o multimodelo recomendados por los investigadores de Google FACTS sin salirte del presupuesto. La precisión no debería ser un lujo, ni siquiera en la era de Google FACTS.

El coste económico de la brecha de precisión de Google FACTS

El benchmark Google FACTS trata tanto de economía como de tecnología. Cada vez que una IA se equivoca, le cuesta dinero a una empresa. Ya sea una alucinación en el servicio de atención al cliente o un error de programación, la tasa de fallos del 30 % de Google FACTS es un impuesto oculto de la revolución de la IA. Actualmente, las empresas se ven obligadas a contratar personas para comprobarlo todo, lo que reduce el retorno de inversión de la automatización.

Al utilizar GPT Proto para gestionar tu stack de IA, puedes mitigar estos riesgos relacionados con Google FACTS. Puedes elegir un modelo rentable para los borradores y otro de alto rendimiento y alta puntuación en Google FACTS para la verificación final. Este enfoque escalonado es la única forma lógica de gestionar el estado actual de la inteligencia generativa. El informe Google FACTS demuestra que la «IA oráculo» aún no existe, por lo que debemos crear sistemas que asuman que la IA puede equivocarse.

El benchmark Google FACTS ha cambiado la conversación de «¿con qué rapidez puede funcionar?» a «¿con qué frecuencia acierta?». Como desarrolladores, debemos optimizar para lo segundo. Utilizar una plataforma unificada como GPT Proto te proporciona la agilidad necesaria para adaptarte mientras los nuevos modelos intentan superar la barrera del 70 % de Google FACTS. Mantener la flexibilidad es la única forma de conservar una ventaja competitiva mientras el sector trabaja para alcanzar el objetivo de una verdad del 100 %.

«El techo de Google FACTS no es solo un número; es una capa límite. Para superarlo, necesitamos sistemas que comprendan tanto el “porqué” como el “qué”.» — Científico sénior de investigación en Google

Tendencias futuras: más allá de la referencia de Google FACTS

¿Adónde vamos después de Google FACTS? Los investigadores no se rinden. Consideran el límite del 70 % una herramienta de diagnóstico. El siguiente paso es la IA neuro-simbólica. Este enfoque combina el reconocimiento intuitivo de patrones de los LLM con la lógica estricta de la programación tradicional. Podría ser la clave para romper por fin el techo de precisión de Google FACTS y avanzar hacia un mundo en el que se pueda confiar implícitamente en la IA.

Por ahora, el benchmark Google FACTS sigue siendo el estándar de oro para medir la verdad. Nos recuerda que el criterio humano continúa siendo el activo más valioso del stack tecnológico. Utilizamos las máquinas para encontrar las piezas, pero somos nosotros quienes ensamblamos la verdad. La era de Google FACTS es una época de cautela, pero también de enormes oportunidades para quienes saben verificar y validar.

Al integrar estas herramientas, mantén los hallazgos de Google FACTS en el centro de tu estrategia. Utiliza modelos diversos, implementa una fundamentación rigurosa y aprovecha plataformas como GPT Proto para mantener tus operaciones eficientes y precisas. El informe Google FACTS es un regalo: nos indica exactamente dónde estamos para que podamos decidir adónde ir después. El camino hacia una precisión del 100 % comienza por reconocer que solo estamos en el 70 %.

Resumen: conclusiones clave de Google FACTS

El benchmark Google FACTS ha redefinido fundamentalmente nuestras expectativas sobre los LLM en 2025. Ahora sabemos que el conocimiento interno es falible, que la búsqueda no es una solución perfecta y que la interpretación visual presenta graves carencias. Sin embargo, al reconocer los resultados de Google FACTS, podemos crear aplicaciones de IA mejores, más seguras y eficaces. El muro del 70 % es un desafío, pero ahora el sector cuenta con las herramientas necesarias para afrontarlo.

No permitas que la brecha de precisión de Google FACTS frene tu innovación. En su lugar, deja que refine tu enfoque. Utiliza las mejores herramientas, verifica tus datos de forma cruzada y confía en GPT Proto para proporcionar el acceso multimodelo necesario para desenvolverte en este complejo panorama. El futuro de la IA sigue siendo prometedor, pero gracias a Google FACTS, ahora sabemos exactamente cuánta luz nos queda por aportar.


Artículo original de GPT Proto

«Nos centramos en debatir problemas reales con emprendedores tecnológicos, ayudando a algunos a entrar primero en la era de la GenAI.»

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
Claude
20% OFF
Google
40% OFF
Google
40% OFF
MoonshotAI
10% OFF