Un cliente me preguntó hace poco: "¿En qué posición estamos en ChatGPT?" Le tuve que explicar que esa pregunta, tal como está formulada, no tiene una respuesta limpia. No porque la herramienta que usamos esté mal, sino porque el sistema que estamos midiendo cambia de respuesta entre una consulta y la siguiente, incluso si nadie tocó una sola línea de contenido.
Esa es la trampa en la que está cayendo buena parte del marketing B2B en 2026: tratar el prompt tracking como si fuera un rank tracker de Google con otro nombre. No lo es. Y entender por qué importa mucho si tu presupuesto de contenido depende de esos números.
¿Qué es el prompt tracking y por qué se volvió urgente?
El prompt tracking es la práctica de correr un set fijo de preguntas ("prompts") contra modelos como ChatGPT, Gemini, Claude o Perplexity, de forma repetida, para ver si tu marca aparece mencionada o citada en las respuestas. Es la evolución directa del rastreo de posiciones en Google, adaptado a un entorno donde ya no hay una página de resultados sino una respuesta redactada.
La urgencia es real. El tráfico de búsqueda impulsado por IA creció 527% año contra año entre 2024 y 2025[8], y motores como ChatGPT, Perplexity, Google AI Overviews, Gemini y Copilot ya generan más del 40% de las interacciones de descubrimiento de producto para compradores B2B, según datos de Gartner citados en análisis recientes del sector[5].
Si tu comprador ideal (el Carlos gerente comercial que decide entre tres proveedores industriales) le está preguntando a ChatGPT "cuáles son los mejores proveedores de [tu categoría]" antes de escribirte, necesitas saber si apareces en esa respuesta. El problema es que la forma en que hoy se mide eso tiene huecos que casi nadie explica con honestidad.
¿Por qué el prompt tracking no da el número exacto que promete?
Aquí está lo que la mayoría de los vendors de herramientas de "AI visibility" no dice en su página de precios: los sistemas de IA generativa no tienen un índice único y estable que se pueda consultar, como sí lo tiene Google con su SERP.
Un artículo reciente de Search Engine Land lo resume bien: la IA generativa puede cambiar el formato de la respuesta, las fuentes citadas, la redacción e incluso las marcas recomendadas de una corrida a la siguiente. ChatGPT, Gemini, Claude, Perplexity, Copilot, Google AI Overviews y AI Mode tienen interfaces, comportamientos de recuperación de información, restricciones de acceso y formatos de respuesta distintos entre sí[1]. Algunos permiten pruebas vía API; otros no exponen la misma experiencia que ve el usuario final en el producto.
Eso significa que las herramientas de prompt tracking tienen que simular sesiones, estandarizar salidas desordenadas y comparar resultados entre plataformas que nunca fueron diseñadas para medirse de la misma manera. El resultado: los datos que obtienes son direccionales, no definitivos[1].
La inestabilidad es el verdadero problema
Con el rank tracking tradicional, si tu marca baja de la posición 5 a la 8, es frustrante pero sigue siendo medible y reproducible. Con una respuesta de IA, tu marca puede aparecer citada en una corrida, desaparecer en la siguiente, y volver a aparecer minutos después con fuentes distintas.
Una investigación de SparkToro de enero de 2026, mencionada en la guía de Search Engine Land, encontró que las pruebas repetidas en las principales plataformas de IA produjeron listas de recomendación altamente inconsistentes, lo que confirma que las fotografías puntuales de visibilidad en IA pueden ser ruidosas y fáciles de sobreinterpretar[1].
"Esta no es una falla de las herramientas de prompt tracking. Es un reflejo de cómo funcionan realmente los motores de respuesta de IA."
La tabla siguiente resume la diferencia de fondo entre lo que medías antes y lo que mides ahora:
| Dimensión | Rank tracking tradicional (Google) | Prompt tracking (LLMs) |
|---|---|---|
| Superficie de medición | SERP relativamente estable | Respuesta generativa variable |
| Reproducibilidad | Alta, misma consulta = resultados similares | Baja, misma consulta puede variar entre sesiones |
| Índice único | Sí, hay una página de resultados | No, cada plataforma tiene su propio comportamiento |
| Naturaleza del dato | Posición exacta | Muestra direccional |
| Qué mide realmente | Ranking | Probabilidad de mención en una muestra |
¿Cómo construir un sistema de medición más completo que solo el prompt tracking?
La respuesta corta: dejar de pedirle a una sola herramienta que responda todas las preguntas sobre visibilidad en IA. La respuesta larga tiene cuatro capas que se complementan.
1. Analítica de tráfico real (GA4). El prompt tracking no te muestra cada prompt que existe, pero tu analítica sí te muestra algo más importante: si esa visibilidad en IA se traduce en sesiones, engagement y conversiones reales. Agrupar el tráfico de referencia de ChatGPT, Perplexity, Copilot y otros motores de IA en una agrupación de canal dedicada permite comparar ese tráfico contra otros canales con métricas como tasa de conversión y conversiones asistidas.
2. Google Search Console para patrones tipo prompt. GSC no etiqueta una consulta como proveniente de una IA Overview, pero filtrar por consultas largas (seis, ocho o diez palabras o más) ayuda a aislar comportamiento de búsqueda conversacional que se parece más a un prompt que a un término de cabecera clásico[1].
3. Bing Webmaster Tools para datos de grounding. En febrero de 2026, Microsoft introdujo el reporte "AI Performance" en Bing Webmaster Tools en vista previa pública, que muestra cuándo tu sitio es citado en respuestas de IA compatibles, qué páginas fueron citadas y qué consultas de grounding dispararon esas citaciones[1]. Es de los pocos datos nativos de plataforma que existen hoy en esta categoría.
4. Logs de servidor. Revisar qué bots de IA (GPTBot, ClaudeBot, PerplexityBot, entre otros) están rastreando tu contenido no prueba que te estén citando, pero sí responde preguntas operativas: ¿tus páginas clave están siendo rastreadas? ¿hay secciones del sitio ignoradas por completo?
5. Herramientas comerciales de AI visibility. Si prefieres no armar el set de prompts a mano, los líderes tradicionales de SEO ya empaquetaron esto como producto. Semrush ofrece un "AI Visibility Toolkit" que rastrea ChatGPT, Google AI, Gemini y Perplexity, con 25 prompts de seguimiento y auditoría de hasta 100 páginas, desde 99 USD al mes por dominio. Ahrefs tiene "Brand Radar", enfocado en comparar el desempeño de tu marca contra competidores en las principales plataformas de IA, con planes desde 199 USD al mes por plataforma individual. SimilarWeb también ofrece monitoreo de visibilidad en IA, pero su precio y alcance solo se conocen agendando una demo con su equipo comercial. Ninguna resuelve la inestabilidad de fondo que ya mencionamos, pero ahorran el trabajo operativo de correr y clasificar el set de prompts a mano.
Si quieres profundizar en cómo optimizar contenido específicamente para que los modelos generativos lo entiendan y lo citen (lo que en la disciplina se conoce como GEO), publiqué un artículo sobre esto → GEO: Generative Engine Optimization para B2B.
¿Qué hacer con el prompt tracking mientras la categoría madura?
No lo ignores, pero úsalo con la intención correcta. Estas son las prácticas que marcan la diferencia entre un dashboard bonito y datos que realmente sirven para tomar decisiones:
- Prueba en múltiples plataformas. Un set de prompts que se ve fuerte en ChatGPT puede verse débil en Perplexity. Hay apenas 11% de solapamiento de dominios citados entre ChatGPT y Perplexity, así que la visibilidad en una no se traduce automáticamente en la otra[4].
- Usa acceso por API cuando esté disponible. Te permite registrar el prompt exacto, el timestamp, la versión del modelo y la salida estructurada, lo que hace tu dataset comparable en el tiempo[1].
- Registra los cambios de versión del modelo. Si tu visibilidad cambia, no asumas que fue tu contenido. Puede ser una actualización del modelo. Sin ese registro, un cambio de plataforma puede parecer una victoria o una pérdida de contenido cuando en realidad no es ninguna de las dos[1].
- Prueba con y sin señales de RAG (retrieval augmented generation). Muchos LLMs ahora usan búsqueda web para fundamentar sus respuestas. Si tu marca aparece solo en entornos con recuperación activa, el contenido fresco y las citaciones de fuentes importan más. Si aparece incluso sin recuperación, pesa más la familiaridad de marca ya aprendida por el modelo[1].
- Analiza el sentimiento, no solo la aparición. Aparecer en una respuesta no es lo mismo que aparecer bien recomendado. Hay que revisar si el contexto es favorable, neutral o si tu marca aparece asociada a quejas o comparaciones desfavorables.
- Construye un set fijo de 20 a 30 prompts que un comprador real de tu categoría escribiría, con preguntas de categoría, comparación y problema-solución. Corre el mismo set el mismo día cada semana y documenta si tu marca fue mencionada, si se citó una URL, qué competidores aparecieron y en qué tono[4].
¿Qué es el AI Share of Voice y por qué importa más que la simple aparición?
Aparecer una vez en una respuesta no dice mucho. Lo que sí dice algo es cuánto apareces frente a tus competidores dentro del mismo conjunto de prompts. Ese es el AI Share of Voice: el porcentaje de menciones que se lleva tu marca cuando la IA responde preguntas de tu sector, comparado con lo que se llevan tus competidores.
El cálculo es directo: número de consultas donde aparece tu marca dividido entre el total de consultas del set, multiplicado por cien, ejecutado de forma independiente en cada motor de IA porque los resultados varían significativamente entre plataformas.
Vale la pena mencionar un dato que cambia la conversación sobre qué construir primero: un estudio reciente encontró que las menciones de marca se correlacionan tres veces más fuerte con la visibilidad en IA que los backlinks tradicionales (puntaje de correlación de 0.664 frente a 0.218)[7]. En otras palabras, la vieja receta de construir enlaces pesa menos en este entorno que construir presencia de marca real en fuentes que los modelos ya consultan.
También ayuda tener contexto de qué tan concentrado está este juego: Semrush escaló su índice de visibilidad en IA de un análisis inicial de 2,500 prompts a 126 millones de prompts de búsqueda en IA en Estados Unidos entre enero y abril de 2026, y encontró que solo 36 marcas (el "Universal 36") mantuvieron visibilidad en todas las plataformas durante todo el período[9]. La consistencia, no la aparición ocasional, es lo que separa a las marcas que realmente ganan terreno.
Si te interesa entender cómo preparar tu catálogo y tus datos de producto para que los sistemas de IA (incluidos los agentes de compra) puedan citarte con precisión, tengo un artículo relacionado → Cómo preparar tu catálogo B2B para agentes de compra con IA.
¿Qué significa esto en la práctica para un equipo de marketing B2B en Colombia?
Deja de perseguir "el número exacto" de posición en IA. No existe todavía, y cualquier herramienta que te lo venda como algo definitivo te está vendiendo una ilusión de precisión que la propia categoría aún no puede sostener[1].
En cambio, haz las preguntas que sí puedes responder con evidencia:
- ¿Estamos apareciendo con más frecuencia con el paso del tiempo?
- ¿Qué temas parecen disparar menciones o citaciones de nuestra marca?
- ¿Qué competidores aparecen en el mismo set de prompts que nosotros?
- ¿Qué páginas reciben visitas reales después de aparecer en una respuesta de IA?
Ese cambio de enfoque (de "posición exacta" a "patrón direccional combinado con tráfico real") es exactamente lo que separa a un equipo que reporta ruido de uno que toma decisiones de contenido y de PR con evidencia sólida.
Conclusiones Clave
- El prompt tracking mide visibilidad direccional, no una posición exacta y reproducible como el rank tracking tradicional de Google.
- Las respuestas de los LLMs son inestables: la misma marca puede aparecer, desaparecer y reaparecer con fuentes distintas en corridas separadas por minutos.
- Bing Webmaster Tools ya ofrece datos nativos de citaciones en IA desde febrero de 2026, algo poco común todavía en esta categoría.
- El AI Share of Voice (aparición relativa frente a competidores) es más útil que medir tu marca de forma aislada.
- Las menciones de marca se correlacionan mucho más fuerte con visibilidad en IA que los backlinks tradicionales.
- Combinar prompt tracking con GA4, Search Console y logs de servidor da una imagen mucho más completa que cualquier herramienta por sí sola.
- Un set fijo y disciplinado de 20 a 30 prompts, corrido semanalmente, suele rendir mejor que perseguir miles de variaciones sin un plan claro de acción.
Si tu equipo comercial necesita empezar a construir presencia de marca donde los modelos de IA ya están buscando información (no solo posicionarse en Google), ese trabajo empieza con una estrategia de generación de demanda pensada para este entorno. Conoce el servicio de Generación de Demanda B2B con IA y conversemos sobre cómo aplicarlo a tu categoría.
Sobre el Autor
Juan Pablo Franco es consultor en marketing digital B2B, eCommerce y automatización con agentes de IA. Dirige Elefante, agencia de marketing digital, y publica sobre comercio agéntico, IA aplicada a negocios B2B y estrategia digital en su blog franco.com.co/blog. Trabaja con empresas industriales y distribuidores en Colombia y Latinoamérica.
Referencias
[1] Search Engine Land, "LLM prompt tracking: How to monitor generative AI prompts more accurately, and with more context" - https://searchengineland.com/guide/ai-prompt-tracking-how-to-monitor-llm-queries-better
[2] SparkToro, "New Research: AIs are highly inconsistent when recommending brands or products" - https://sparktoro.com/blog/new-research-ais-are-highly-inconsistent-when-recommending-brands-or-products-marketers-should-take-care-when-tracking-ai-visibility/
[3] Bing Webmaster Blog, "Introducing AI Performance in Bing Webmaster Tools Public Preview" - https://blogs.bing.com/webmaster/February-2026/Introducing-AI-Performance-in-Bing-Webmaster-Tools-Public-Preview
[4] GrowByData, "How to Track Brand Mentions in ChatGPT (2026 Playbook)" - https://growbydata.com/how-to-track-brand-mentions-in-chatgpt/
[5] Omnia, "AI Search Monitoring Tools 2026" - https://www.useomnia.com/blog/ai-search-monitoring-tools
[6] Siftly, "10 Best AI Brand Monitoring Tools (2026, Compared)" - https://siftly.ai/blog/best-ai-brand-monitoring-tools-2026
[7] Get Ryze, "Prompt-Test Your Brand in ChatGPT to Measure Visibility" - https://www.get-ryze.ai/blog/prompt-testing-your-brand-in-chatgpt-to-measure-visibility
[8] LLM Pulse, "Prompt Tracking: how to track and key metrics" - https://llmpulse.ai/blog/glossary/prompt-tracking/
[9] Semrush, "Semrush Releases Expanded 2026 AI Visibility Index, Analyzing 126 Million AI Search Prompts" - https://www.semrush.com/news/463141-semrush-releases-expanded-2026-ai-visibility-index-analyzing-126-million-ai-search-prompts/