GEO multimodal: 6 pasos para que la IA cite tus imágenes y vídeos
Solo 3 de cada 6 rastreadores de IA leen el alt de las imágenes y ninguno ve el vídeo de la página. Seis pasos para llevarlos al texto que sí leen.
En este texto
Los motores de IA no miran tus imágenes y no ven el vídeo de la página. Leen el texto que los rodea. Si ese texto es pobre, el recurso queda invisible por muy bueno que sea. Seis cambios lo arreglan. Cuestan unas dos horas por página y funcionan igual con una infografía, con una captura de producto y con una demo de doce minutos.
El GEO multimodal consiste en hacer que los recursos que no son texto resulten legibles para los motores generativos. Casi todo el trabajo, sin embargo, es textual: nombres de archivo, atributos alt, pies de foto, transcripciones y datos estructurados. Ninguno de los seis pasos de abajo exige grabar nada nuevo.
Qué hacen de verdad los motores con una imagen
Writesonic probó unos 60 elementos de página en seis rastreadores de IA: solo Claude, Gemini y Copilot leen el atributo alt. ChatGPT descarga el HTML en bruto, lo convierte a Markdown y por el camino pierde el alt. Los seis se reparten en tres niveles: renderizado completo de navegador (Copilot), navegadores headless con JavaScript (DeepSeek, Grok) y analizadores de solo HTML (ChatGPT, Claude, Gemini). La consecuencia práctica es seca. Lo que la página inyecta con JavaScript no existe para la mitad de ellos.
En el lado de Google el argumento es el volumen. En octubre de 2024 Google cifró Lens en casi 20.000 millones de búsquedas visuales al mes, una de cada cuatro con intención comercial. AI Mode ya acepta una foto subida por el usuario y responde con una versión propia de Gemini, así que una búsqueda puede empezar como imagen y acabar en un enlace a tu página.
Con el vídeo el mecanismo es el mismo, un piso más arriba. Los motores leen título, descripción, subtítulos, transcripción y marcado VideoObject. El estudio de Otterly de 2026 sobre citas de YouTube sitúa la plataforma en el 22,7% de las citas sociales de Perplexity y en el 9,5% de las de ChatGPT; un informe aparte de 5WPR la deja en el 23,3% de las citas de las AI Overviews de Google. Los dos estudios miden cosas distintas, así que conviene leerlos como dirección y no como cifra única. La dirección se entiende: el vídeo trae citas, y el motor llega hasta él pasando por el texto.
Antes de empezar
- Imágenes servidas con etiquetas
<img>en el HTML renderizado en servidor. Nada de fondos CSS ni de inyección en cliente. - Acceso de escritura al JSON-LD de la página.
- Una transcripción por cada vídeo que importe. La automática sirve como base, luego se corrige a mano en nombres propios y términos técnicos.
Paso 1: escribe el alt como una frase, no como una lista de palabras clave
La guía de Google sobre imágenes pide dos cosas: alt descriptivo y nombre de archivo descriptivo. El ejemplo es suyo: mi-gatito-negro.jpg gana a IMG00023.JPG. Para el alt basta una frase que diga qué hay en el encuadre y por qué ese encuadre está ahí.
Compara las dos versiones. «auditoría design system dashboard token drift 2026» es una lista de palabras clave, y tres de cada seis rastreadores no la van a leer igualmente. «Un panel de auditoría que muestra 31 valores de color que se salieron del design system» es una frase que un modelo puede coger y citar. Misma longitud, distinto trabajo.
Paso 2: lleva al texto cada afirmación que hace la imagen
Es el paso que mueve los números. Si un gráfico enseña una caída del 40%, ese 40% tiene que estar escrito en el párrafo de al lado. Si una captura muestra tres estados de un formulario, los tres estados se nombran en prosa. La guía de Google pide colocar las imágenes cerca del texto pertinente por el mismo motivo.
La imagen ilustra una afirmación que ya está escrita en otro sitio. Las infografías son el peor caso: sostienen un razonamiento entero en píxeles y al motor no le dejan nada. Por eso una infografía que circula mucho en redes apenas genera superficie de cita.
Paso 3: sirve las imágenes en HTML, con nombres de archivo legibles
Etiqueta <img> con src y alt dentro del marcado que devuelve el servidor. Nada de fondos CSS para imágenes que llevan significado: Google dice explícitamente que las imágenes por CSS no entran en Google Imágenes. Y renombra el archivo antes de subirlo: panel-token-drift.png, no export_final_2.png. Minúsculas, guiones, de tres a seis palabras.
Paso 4: publica la transcripción en la página, no solo en el reproductor
Los subtítulos dentro del reproductor de YouTube no están en tu página. Un rastreador de solo HTML ve un embed vacío y sigue adelante. Pega la transcripción corregida en el cuerpo del artículo, bajo un título propio, partida en párrafos cortos y con el nombre de quien habla cuando hay más de una voz.
Una charla de diez minutos se convierte en unas 1.500 palabras de texto indexable que dicen exactamente lo que dice el vídeo. Es además la mejora de accesibilidad más barata de la lista, y después del Acta Europea de Accesibilidad ya vale por sí sola.
Paso 5: añade el marcado VideoObject con las propiedades que pide Google
La documentación de Google sobre datos estructurados de vídeo exige name, thumbnailUrl y uploadDate, y recomienda con fuerza description, duration en formato ISO 8601 (PT4M35S), contentUrl y embedUrl.
contentUrl es la que casi todos se saltan. Sin un archivo de vídeo descargable o un embed reconocido, Google puede indexar la página y no indexar nunca el vídeo que hay dentro. Ya que estás, añade la propiedad transcript: cuesta un campo y le entrega al motor todo el texto en forma legible por máquina.
Paso 6: pon capítulos al vídeo, y escríbelos como frases
Google admite los key moments de dos formas. El marcado Clip, donde nombras tú cada momento, o SeekToAction, donde declaras cómo funciona el parámetro de tiempo en la URL y dejas que Google los elija. Cuando el vídeo tiene una estructura que ya conoces, nómbralos tú.
Y escribe títulos de capítulo que aguanten fuera de contexto. «Por qué el pooler pierde conexiones a 400 clientes» se cita solo. «Parte 2» no. La regla es la misma que rige los H2 de un artículo: un título que el motor pueda citar sin el párrafo de debajo.
Cómo compruebas que ha funcionado
- Lee el HTML en bruto. Lanza
curl -s https://ejemplo.com/paginay busca las etiquetas<img>y el texto de la transcripción. Si ahí no están, tampoco los ve un rastreador de solo HTML. - Valida el marcado. Pasa la URL por la prueba de resultados enriquecidos de Google y luego vigila el informe de indexación de vídeos en Search Console.
- Pregúntaselo a los motores. Hazle a ChatGPT, Claude y Perplexity la pregunta que responde la página y mira si la página sale. Repite a los 30 días, porque los conjuntos de fuentes se mueven.
Dónde se rompe casi siempre
- La infografía sostiene el razonamiento. Escribe el razonamiento en prosa y deja que el gráfico lo resuma.
- Los subtítulos automáticos destrozan el vocabulario técnico. La transcripción automática va bien con el habla corriente y falla con nombres de producto, nombres de librerías y siglas. Léela una vez y corrige a mano.
- El lazy loading cambia el
srcen tiempo de ejecución. Deja unsrcreal en el marcado del servidor y que el cargador lo mejore después. - El vídeo vive solo en YouTube. Entonces la cita se la lleva YouTube. Incrústalo en una página tuya, con la transcripción al lado, y los dos pasan a ser citables.
- El alt repite el pie de foto palabra por palabra. Dos cadenas idénticas le dan al motor un dato en lugar de dos. Que el pie lleve la idea y el alt la descripción.
Para seguir
El principio del texto que hay debajo de los seis pasos es el mismo que rige el contenido escrito: cómo escribir los primeros 200 tokens para que los motores de IA citen el artículo. En el lado del esquema, cómo añadir JSON-LD a un artículo de blog explica dónde van los bloques y cómo se validan. Y si todavía estás decidiendo para qué motor trabajar, AI Overviews y AI Mode citan fuentes distintas, y eso cambia las prioridades.
Preguntas frecuentes
¿Vale la pena escribir el alt si ChatGPT lo ignora?+
Sí. Tres de los seis rastreadores probados sí lo leen, lo lee Google Imágenes y lo leen los lectores de pantalla. Cuesta una frase por imagen. El error es tratar el alt como el único sitio donde vive una afirmación: si el rastreador que te importa es justo el que se lo salta, esa afirmación tiene que estar también en el cuerpo del texto.
¿Sirve el alt generado por IA?+
Sirve como primera pasada y falla en lo que importa. Un modelo de visión describe el encuadre con bastante precisión, pero no sabe por qué esa imagen está en esa página, que es justo la mitad de la frase que hace citable el alt. Genera la descripción y añade el motivo con tus palabras. En una página con 40 capturas sigue siendo mucho tiempo ahorrado.
El vídeo está en YouTube. ¿Sigue mereciendo la pena el marcado VideoObject?+
Sí, si el vídeo está incrustado en una página tuya y quieres que se cite esa y no la URL de YouTube. YouTube ya se lleva citas por su cuenta: dos estudios de 2026 lo sitúan entre el 22% y el 23% de las citas en Perplexity y en las AI Overviews. El marcado más una transcripción en página son la forma de que la página que incrusta el vídeo entre también en el reparto.
¿Una transcripción larga diluye la página?+
El problema no es la longitud, es la colocación. Pon la transcripción bajo un título propio, al final del cuerpo del artículo, para que los primeros 200 tokens sigan llevando la respuesta que busca el motor. Lo que hay que evitar es pegar la misma transcripción en varias páginas: la duplicación entre URLs sí es un riesgo, un bloque largo de habla única en una sola URL no.
Studio
Empieza un proyecto.
Escribimos sobre lo que construimos. Cuéntanos qué quieres construir tú.