Google AI se está inventando tus URLs: el extraño caso de los 404 que nunca existieron

Hace unas semanas, revisando una de las crawls automatizadas que hacemos en RafaSEO para un cliente, nos encontramos con algo bastante raro. El número de URLs 404 detectadas alrededor de una sección concreta del site había empezado a crecer de forma muy rápida. 

Primero eran unas pocas. Después decenas. Luego más de cien. Y en cuestión de semanas estábamos cerca de 400 URLs inexistentes. 

Hasta aquí, nada especialmente revolucionario. Cualquier persona que trabaje en tech SEO sabe que Google puede descubrir URLs rotas de mil maneras: antiguos internal links, XML sitemaps desactualizados, parámetros, backlinks externos, errores de CMS, relative URLs mal construidas… 

El problema era que aquí nada de eso existía. 

Las URLs no aparecían en nuestros crawls históricos. No estaban en el XML sitemap. No había internal links apuntando hacia ellas. Nunca habían respondido con un 200. Y todas devolvían correctamente un hard 404.

Tabla de contenidos

Entonces, ¿de dónde demonios estaba sacando Google esas 404?

Primera hipótesis: backlinks automatizados

Nuestra primera sospecha fue bastante lógica. Al analizar el backlink profile del dominio encontramos cientos de enlaces procedentes de sites bastante aleatorios y, en algunos casos con patrones que recordaban claramente a link farms.

Así que la teoría inicial era sencilla: algún proceso automatizado externo estaba generando backlinks hacia URLs mal construidas.

Y tenía sentido. Las URLs falsas no eran completamente aleatorias. Eran versiones muy cercanas de URLs reales. Por ejemplo, imaginemos que existe:

  • /sample/article/how-to-cool-down-your-phone 

Google estaba reportando variaciones como: 

  • /sample/article/how-to-cool-down-phone 
  • /sample/article/how-to-cool-your-phone 
  • /sample/article/how-to-cool-your-phone-down-in-2026 
  • /sample/article/how-to-cool-your-phone-down-in-the-sun 
AI alucina URLs (404s)

En otros casos desaparecían preposiciones, cambiaban palabras, se añadían términos del H1 o directamente aparecían sustituciones bastante surrealistas. 

Todo parecía encajar con un sistema automatizado generando URLs a partir de titles, topics o keywords. Así que hicimos lo lógico: buscar esos backlinks. SEMrush. Ahrefs. Crawls. Pero nada… 

De casi 400 malformed URLs, no encontramos ni un backlink externo apuntando directamente a ellas. 

Y entonces apareció la verdadera sorpresa.

Las URLs estaban en el propio informe de Generative AI de Google

Al analizar el nuevo informe de Generative AI Performance de Google Search Console y exportar las URLs que habían generado impresiones en AI Overview y AI Mode, aparecieron exactamente aquellas URLs que estábamos investigando. 

Y aquí cambia completamente la historia. 

Google explica que este informe incluye las impresiones generadas por AI Overviews y AI Mode, y define la dimensión Pages como la URL final enlazada por una generative AI feature. Es decir, no estamos hablando simplemente de URLs que Googlebot ha encontrado durante un rastreo: hablamos de URLs que Google ha mostrado como enlaces dentro de sus propias experiencias de Generative AI. 

De repente, aquello que inicialmente parecía un problema de backlinks externos empezó a parecer algo mucho más interesante: Google AI estaba mostrando URLs que nunca habían existido. 

¡Y algunos usuarios incluso habían hecho click en ellas! Y en los reportes de Adobe Analytics efectivamente veíamos las entradas a esas URLs inventadas por la IA y procedentes de Google.com (AI Mode y Ai Overview) 

Google también confirma que cuando un usuario hace click en un enlace externo dentro de un AI Overview, ese click se contabiliza en Search Console. 

Es decir: Google genera una respuesta → muestra una URL inexistente → el usuario hace click → llega al 404. 

No es precisamente el user journey que uno esperaría de una compañía cuya misión durante décadas ha sido organizar la información del mundo.

Y no era un caso aislado 

Lo siguiente que hicimos fue comprobar otros dominios. Y, efectivamente, también encontramos hallucinated URLs. La diferencia estaba en la magnitud.

En uno de los dominios analizados, aproximadamente el 60% de las URLs distintas que habían generado al menos una impresión dentro del informe de Generative AI eran inexistentes. En otro dominio comparable, la cifra estaba alrededor del 20%. 

Eso plantea una pregunta mucho más interesante que simplemente “¿Google AI alucina URLs?”. A estas alturas sabemos que los LLMs pueden inventarse enlaces. La pregunta es la siguiente:

¿Por qué algunos sites parecen sufrirlo muchísimo más que otros?

Nuestra hipótesis: Google cree haber entendido demasiado bien tu web. Aquí entramos en terreno de hipótesis, pero los patrones son difíciles de ignorar. 

En el site más afectado, prácticamente todas las URLs inexistentes aparecían dentro de un mismo directorio de contenido, construido con una arquitectura extremadamente consistente:

  • Mismo path.
  • Mismo tipo de página. 
  • Templates muy similares y siguiendo patrones recurrentes. 
  • URLs siguiendo estructuras relativamente predecibles. 

Y aquí aparece algo particularmente curioso. En muchos casos, la URL que Google AI mostraba no era simplemente una alteración aleatoria de la URL real. Era una versión construida a partir del H1 o del título del artículo. 

Por ejemplo, conceptualmente: 

  • URL real: /how-to-cool-down-your-phone 
  • H1: How to Cool Your Phone Down in 2026 
  • URL mostrada por la IA: /how-to-cool-your-phone-down-in-2026 

 

La IA parece saber qué contenido quiere citar. Parece saber cuál es el artículo. Pero, en lugar de verificar cuál es su URL real, parece reconstruir una URL que considera suficientemente probable. ¡Y falla! 

El problema de la “sobreconfianza algorítmica” 

Quizá una buena forma de describirlo sea sobreconfianza algorítmica. 

Cuando una arquitectura es extremadamente repetitiva y predecible, el sistema puede creer que ya entiende el patrón. 

Algo parecido a: “Ya sé cómo funciona este site: Los artículos están en /sample/post/, tengo el title y sé cómo suelen ser sus slugs. La URL debería ser esta.” 

Excepto que “debería ser” y “es” no son lo mismo.

Y aquí aparece una paradoja interesante para GEO (Generative Engine Optimization). Durante años hemos intentado hacer nuestros sites cada vez más fáciles de interpretar para Google: arquitecturas limpias, patrones consistentes, templates estructurados, headings claros, entidades repetibles… Todo correcto. Pero, ¿qué pasa cuando hacemos una estructura tan predecible que una Generative AI deja de verificar y empieza a completar el patrón? 

Una web menos predecible puede obligar al sistema a retrieve la URL real. Una extremadamente predecible podría incentivar el atajo… inferir en lugar de recuperar. 

No podemos demostrar todavía que este sea exactamente el mecanismo interno de Google AI, pero la diferencia entre dominios y, sobre todo, la relación entre H1 → hallucinated slug hace que sea una línea de investigación bastante difícil de ignorar. 

Google ya sabía que esto iba a pasar…

Lo curioso es que Google lleva tiempo reconociendo que las hallucinated URLs son un problema de los sistemas de IA.

En marzo de 2025, John Mueller hablaba precisamente del aumento de estos enlaces inventados y decía: 

“My tea leaves say that for the next 6-12 months we’ll see a slight uptick of these hallucinated links being clicked.”  

También sugería recopilar más datos antes de reaccionar excesivamente y recomendaba tener buenas 404 pages para esos usuarios.

El consejo no era malo. Lo irónico es que ahora es la propia Generative AI de Google la que aparece en nuestros datos mostrando algunas de esas URLs inexistentes. Quizá esas “tea leaves” necesitaban un pequeño disclaimer. 

… Y Google quiere responder antes de comprobar 

Y para nosotros esta es probablemente la parte más interesante de todo el caso. 

Durante muchos años, Search funcionaba fundamentalmente alrededor de un proceso bastante lógico: 

crawl → understand → index → retrieve → show

Generative Search introduce otra capa donde Google no sólo recupera documentos: también construye una respuesta. Y construir implica inferir. El problema aparece cuando la inferencia se extiende a algo que no debería necesitar imaginación: una URL. 

  • Una URL no es una respuesta creativa. 
  • No necesita ser plausible. 
  • No necesita “sonar correcta”. 
  • Una URL existe o no existe. 

 

Google incluso define oficialmente el campo Pages de este nuevo informe como la «final URL linked by a generative AI feature». 

Así que si esa “final URL” devuelve 404 porque nunca ha existido, desde el punto de vista del publisher da bastante igual lo inteligente que haya sido el resto de la respuesta: Google ha enviado al usuario a una página inventada que no existe (404). 

¿Qué hacemos entonces con estas hallucinated URLs? 

Por ahora, nuestra respuesta es bastante pragmática.

No recomendamos crear cientos de redirects simplemente porque una IA haya decidido inventarse cientos de URLs. 

Pero sí tiene sentido monitorizarlas. Si una hallucinated URL tiene una correspondencia inequívoca con una página real y empieza a acumular impressions o, especialmente, clicks, un 301 hacia el artículo correcto puede recuperar usuarios que de otra forma terminarían en un 404. 

También merece la pena tener una 404 page realmente útil, algo que precisamente Mueller ya recomendaba. 

Pero el verdadero aprendizaje para nosotros no está en las redirecciones, sino en entender por qué unas arquitecturas parecen provocar muchas más hallucinated URLs que otras. 

El siguiente problema de GEO quizá no sea aparecer en la IA, sino controlar cómo te interpreta. Mucho del discurso actual sobre GEO gira alrededor de: 

  • “¿Cómo consigo que ChatGPT me mencione?” 
  • “¿Cómo consigo aparecer en AI Overviews?” 
  • “¿Cómo aumento mis citations?” 

 

Todo eso importa, pero empiezan a aparecer problemas bastante más interesantes. Porque conseguir que una IA entienda tu contenido no significa necesariamente que entienda correctamente cómo acceder a él. 

Nuestro caso sugiere que una IA puede identificar perfectamente el artículo que quiere utilizar, comprender su temática e incluso reproducir parte de su title… ¡y después inventarse el enlace!.

Y quizá aquí tengamos otra señal de hacia dónde se dirige Tech SEO/GEO. Ya no basta con preguntarnos: ¿puede Google rastrear esta URL? Ahora también tenemos que preguntarnos: ¿puede Google AI resistirse a inventarse otra? 

En RafaSEO vamos a seguir comparando el comportamiento entre diferentes sites, especialmente la relación entre arquitectura, URL patterns, H1s y la frecuencia de hallucinated URLs. 

Porque si el gap que estamos viendo entre dominios se mantiene, puede que detrás de estas 404s haya algo bastante más interesante que un simple bug. Puede que estemos viendo una consecuencia inesperada de una Search que intenta ir cada vez más rápido: cuando Google cree que ya conoce la respuesta, a veces deja de comprobarla.

Usamos cookies para asegurar que te damos la mejor experiencia en nuestra web. Si continúas usando este sitio o aceptas, asumiremos que estás de acuerdo con ello. Encontrarás más información en nuestra política de cookies.

Contáctame y planifiquemos tu estrategia digital!

Puedes contactarme por teléfono, WhatsApp, enviándome un correo electrónico, o esperar a que me ponga en contacto contigo rellenando este formulario.

Los datos serán tratados por el responsable de la web con la finalidad de establecer contacto, enviar información y promociones y con la legitimación por parte del cliente. Ver política de privacidad.