Marketing y Demanda

Los agentes de IA de compras todavía no están listos para comprar por ti, según un estudio de Wharton

Investigadores de Wharton probaron seis modelos como asistentes de compra. Una sola reseña externa movió la elección de producto hasta 99 puntos porcentuales, y hasta el orden en que se presentaron las mismas fuentes cambió el resultado.

6 min de lecturaFuente: The Decoder
Ilustración de un agente de inteligencia artificial eligiendo un reloj deportivo en una tienda en línea, en referencia al estudio de Wharton sobre comercio agéntico
Imagen: The Decoder

La noticia en 30 segundos

Investigadores de la Escuela Wharton de la Universidad de Pensilvania probaron seis modelos de lenguaje actuando como asistentes de compra y encontraron que sus recomendaciones son muy inestables. Al mostrarles una sola reseña externa antes de la página de producto, la probabilidad de elegir ese producto subió hasta 90 puntos porcentuales en Claude Opus 4.8 y 99 puntos en Gemini 3.5 Flash. Cambiar solo el orden de las mismas fuentes también alteró el resultado, y frases breves de memoria del usuario empujaron a varios modelos hacia productos más caros pese a existir una opción objetivamente superior.

Un equipo de la Escuela Wharton de la Universidad de Pensilvania publicó un estudio que pone en duda una de las promesas centrales del comercio agéntico: que un agente de inteligencia artificial pueda comprar en nombre de una persona de forma consistente y racional. El resultado es que, con cambios mínimos en el contexto, la decisión de compra se mueve de forma dramática.

El equipo probó seis modelos actuales, entre variantes mini y de frontera, pidiéndole a cada uno que actuara como asistente personal de compras y eligiera un reloj deportivo desde una grilla fija de productos. Usaron el simulador ACES, que le muestra al agente una captura de pantalla de la página de producto. El agente analiza la imagen, opcionalmente incorpora fuentes de recomendación, y luego elige.

¿Cuánto influye una sola reseña externa en la decisión del agente?

Incluso sin fuentes externas, los modelos ya mostraban preferencias base distintas entre sí. Pero al agregar una sola fuente antes de la página de producto, las recomendaciones se movieron de manera brusca.

Los investigadores probaron tres fuentes: un hilo de Reddit que recomendaba el Garmin Forerunner 55, una reseña de Wirecutter sobre el Fitbit Inspire 3 y un artículo de Strategist sobre el WHOOP 5.0. Wirecutter resultó ser la de mayor peso. La probabilidad de elegir el Fitbit Inspire 3 subió 90 puntos porcentuales en Claude Opus 4.8 respecto de la condición de control, y 99 puntos porcentuales en Gemini 3.5 Flash.

En un segundo experimento, los agentes vieron combinaciones de dos y tres fuentes. Sumar fuentes no equilibró la decisión: Wirecutter tendió a dominar en la mayoría de los modelos cada vez que estaba en la mezcla, y más fuentes generaron más variabilidad, no menos.

¿El orden de la información cambia el resultado?

Sí, y este es probablemente el hallazgo más incómodo. En un tercer experimento los agentes recibieron las tres fuentes en distinto orden. Un proceso de decisión estable debería entregar el mismo resultado con contenido idéntico. No fue así.

Gemini 3.1 Flash Lite fue el más sensible: su probabilidad de elegir el Fitbit Inspire 3 osciló entre 2 y 56 puntos porcentuales sobre el control según el orden de las fuentes. Claude Haiku 4.5 se mantuvo estable, entre 41 y 42 puntos. Los investigadores concluyen que el orden de presentación es en sí mismo un factor que determina la selección de producto.

También importó la forma de entrega. GPT-5.5 eligió el Fitbit Inspire 3 en 53 puntos porcentuales más de los casos cuando las fuentes llegaron agrupadas, pero solo 6 puntos más cuando llegaron de forma secuencial.

¿La memoria del usuario puede anular la mejor oferta?

En un cuarto experimento el equipo modificó la grilla de productos para que uno fuera superior en todas las dimensiones medibles: un reloj inteligente con Alexa a 29,99 dólares, con calificación de 5,0 sobre 5,0 y 430 reseñas. Todos los demás costaban al menos 359 dólares y tenían menos reseñas.

Luego agregaron declaraciones breves de memoria del usuario, del tipo «me encanta hacer senderismo». En varios modelos, esas frases desplazaron la selección hacia productos más caros pese a existir una opción objetivamente superior. La tasa de selección del Garmin Vivoactive 5 subió 75 puntos porcentuales en Claude Opus 4.8, 37 puntos en GPT-5.5 y 36 puntos en Gemini 3.1 Flash Lite.

Gemini 3.5 Flash fue el más resistente: eligió el producto objetivamente mejor entre 86% y 92% de las corridas, sin importar las declaraciones de memoria.

¿Qué significa esto para quien vende?

Para el comprador, la conclusión es que delegar una compra a un agente no garantiza una decisión consistente ni óptima. Dos personas con la misma consulta, o la misma persona en días distintos, pueden recibir recomendaciones diferentes sin una razón visible.

Para quien vende, los propios investigadores advierten que optimizar para agentes de compra será más difícil que el SEO tradicional. El vendedor no sabe qué modelo está comprando, qué leyó antes, ni cómo su configuración técnica procesa la información. Y en el sentido inverso, el estudio confirma que una reseña de un medio con autoridad puede reescribir por completo la decisión del agente.

Para el mercado de Chile y Latinoamérica hay un matiz adicional que el estudio no cubre pero que se deduce del mecanismo. Las fuentes con mayor influencia en el experimento son medios estadounidenses de reseñas de producto. En categorías B2B y en mercados donde ese tipo de medios de autoridad casi no existe en español, la capa de fuentes que un agente consulta es más delgada y más volátil, lo que amplifica el efecto de cualquier contenido que sí esté disponible y bien estructurado.

Análisis de Revenue Hub

La lectura fácil de este estudio es que el comercio agéntico todavía no está maduro. La lectura útil para un líder comercial es distinta: si una sola fuente externa puede mover una decisión de compra 99 puntos porcentuales, entonces la pelea competitiva ya no es solo por aparecer en la página de resultados, es por ser la fuente que el agente lee antes de decidir.

Eso desplaza el trabajo de marketing hacia un terreno concreto. Publicar contenido comparativo, con datos verificables y estructurado para ser extraído, deja de ser un ejercicio de posicionamiento de marca y pasa a ser infraestructura de conversión. En categorías B2B en Chile y Latinoamérica, donde el volumen de contenido de autoridad en español es bajo, la barrera de entrada para convertirse en esa fuente es, hoy, comparativamente baja. Esa ventana no va a durar.

La advertencia de los investigadores sobre la dificultad de optimizar para agentes también merece matiz. Es cierto que no se puede controlar qué modelo consulta al comprador ni en qué orden procesa la información, y por eso no existe una táctica única y determinista como en el SEO clásico. Pero sí se puede controlar la existencia, la calidad y la citabilidad del contenido propio. La conclusión práctica es diversificar: no apostar a una sola pieza ni a un solo motor, y medir la presencia de la marca en respuestas generadas por IA como se mide el ranking orgánico. Seguimos este tema en la sección de Marketing y demanda y en nuestro blog.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a The Decoder.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Qué probó el estudio de Wharton sobre agentes de IA de compras?

Probó seis modelos de lenguaje actuando como asistentes personales de compra, pidiéndoles elegir un reloj deportivo desde una grilla fija de productos, usando el simulador ACES de comercio electrónico agéntico. El objetivo era medir qué tan consistentes son las recomendaciones cuando cambia el contexto de búsqueda.

¿Cuánto puede cambiar una sola fuente externa la recomendación de un agente?

Hasta 99 puntos porcentuales. Al mostrar una reseña de Wirecutter sobre el Fitbit Inspire 3, la probabilidad de elegir ese producto subió 90 puntos porcentuales en Claude Opus 4.8 y 99 puntos en Gemini 3.5 Flash respecto de la condición de control.

¿Agregar más fuentes hace que la recomendación sea más equilibrada?

No. Con combinaciones de dos y tres fuentes, Wirecutter siguió dominando en la mayoría de los modelos cada vez que formaba parte de la mezcla, y el estudio encontró que más fuentes generaron más variabilidad en el resultado, no menos.

¿El orden de las fuentes afecta la decisión de compra del agente?

Sí. Con las mismas tres fuentes presentadas en distinto orden, Gemini 3.1 Flash Lite osciló entre 2 y 56 puntos porcentuales sobre el control, mientras Claude Haiku 4.5 se mantuvo estable entre 41 y 42 puntos. Los autores concluyen que el orden de presentación es por sí mismo un factor de selección.

¿Los agentes de IA eligen siempre el producto objetivamente mejor?

No. En un experimento donde un reloj de 29,99 dólares con calificación 5,0 y 430 reseñas era superior en todas las dimensiones medibles, frases breves de memoria del usuario desplazaron la elección hacia productos más caros: 75 puntos porcentuales más para el Garmin Vivoactive 5 en Claude Opus 4.8, 37 en GPT-5.5 y 36 en Gemini 3.1 Flash Lite.

¿Qué modelo se comportó de forma más estable en el estudio?

Gemini 3.5 Flash fue el más resistente a las declaraciones de memoria del usuario: eligió el producto objetivamente mejor entre 86% y 92% de las corridas. Claude Haiku 4.5 fue el más estable frente a los cambios en el orden de las fuentes.

¿Es más difícil optimizar para agentes de IA que hacer SEO tradicional?

Según los investigadores, sí. El vendedor no sabe qué modelo está realizando la compra, qué contenido leyó antes, ni cómo su configuración técnica procesa la información, lo que hace imposible una táctica determinista como en el SEO clásico. Lo que sí se puede controlar es la existencia, calidad y citabilidad del contenido propio.

¿Qué implica esto para empresas B2B en Chile y Latinoamérica?

Las fuentes con mayor peso en el experimento son medios estadounidenses de reseñas. En mercados donde ese tipo de contenido de autoridad casi no existe en español, la capa de fuentes que consulta un agente es más delgada, por lo que el contenido bien estructurado y verificable tiene hoy una influencia proporcionalmente mayor y una barrera de entrada más baja.

Comparte este análisis con tu equipo

Continúa explorando

Ver toda la categoría