Inteligencia artificial y ecommerce

Agentes de voz para atención al cliente y comercio electrónico

Cómo los modelos de voz en tiempo real abren nuevas experiencias de soporte y compra, y qué necesita una implantación empresarial fiable.

Micrófono rodeado de ondas que representan una conversación en tiempo real
Un agente de voz útil debe comprender, consultar sistemas y confirmar las acciones sensibles.

En pocas palabras

Ideas principales

  • Amazon presentó Nova Sonic el 8 de abril de 2025 para conversaciones de voz bidireccionales en tiempo real.
  • La voz puede reducir fricción en soporte, seguimiento, disponibilidad y compra asistida.
  • La experiencia depende de latencia, interrupciones, contexto, integración y escalado humano.
  • La automatización debe diseñarse alrededor de tareas y resultados, no de una demostración tecnológica.

El 8 de abril de 2025 AWS presentó Amazon Nova Sonic, un modelo capaz de comprender y generar voz dentro de una misma arquitectura y de mantener conversaciones bidireccionales en tiempo real. El anuncio ilustró un cambio más amplio: la interfaz con la inteligencia artificial ya no tenía por qué comenzar en un campo de texto.

Para atención al cliente y comercio electrónico, la voz puede convertir tareas complejas en una conversación natural. Sin embargo, hablar de forma convincente no basta. El valor aparece cuando el agente comprende la intención, consulta información autorizada, ejecuta procesos seguros y sabe cuándo transferir la conversación.

Casos de uso con valor inmediato

En soporte, un agente puede identificar el pedido, explicar su estado, resolver preguntas frecuentes, recopilar información de una incidencia o preparar la transferencia a una persona. En ecommerce puede orientar una selección, comprobar compatibilidad, consultar disponibilidad, explicar entrega y devoluciones o acompañar una compra asistida.

También existen escenarios internos: personal de almacén que consulta instrucciones sin dejar una tarea, equipos comerciales que actualizan el CRM mediante voz o responsables que solicitan un resumen de operaciones.

La prioridad debe ser una necesidad concreta y medible. Intentar resolver cualquier conversación desde el primer día multiplica riesgo, coste y frustración.

Una conversación no es una secuencia de audios

Las arquitecturas tradicionales convertían voz a texto, enviaban el texto a un modelo y sintetizaban después la respuesta. Un modelo integrado de voz a voz puede conservar más información sobre ritmo, tono e interrupciones y reducir latencia. AWS presentó Nova Sonic precisamente con comprensión y generación unificadas, una API de streaming bidireccional, llamada a funciones y conexión con conocimiento empresarial.

Aun así, la calidad depende del sistema completo:

  • Reconocimiento correcto de nombres, referencias y direcciones.
  • Respuesta rápida y posibilidad de interrumpir con naturalidad.
  • Memoria de lo dicho durante la interacción.
  • Acceso controlado a catálogo, pedidos, CRM o base de conocimiento.
  • Confirmación explícita antes de pagar, cancelar o modificar datos.
  • Transferencia a una persona conservando contexto y resumen.

Diseñar para el error

En una interfaz visual, el usuario puede releer. En voz, una respuesta incorrecta desaparece mientras se pronuncia. Por eso conviene resumir datos sensibles, pedir confirmación y ofrecer alternativas. Si el sistema no entiende una referencia, debe reconocer la incertidumbre en lugar de inventar.

La privacidad también exige decisiones claras: qué se graba, durante cuánto tiempo, para qué se utiliza y quién puede acceder. Las credenciales nunca deberían solicitarse de manera improvisada. Autenticación, consentimiento y minimización de datos forman parte de la experiencia.

Del piloto a la operación

Un buen piloto acota canal, idioma, horario y tareas. Empieza con consultas de bajo riesgo y utiliza datos reales anonimizados o entornos de prueba. Antes de ampliar se evalúan conversaciones completas, no solo frases individuales.

Las métricas útiles incluyen resolución en primer contacto, tiempo hasta la solución, transferencias, abandonos, repeticiones, errores de identificación, satisfacción y coste por interacción. En ecommerce deben añadirse conversión asistida, valor del pedido y devoluciones relacionadas con recomendaciones.

También es importante revisar muestras cualitativas. Un promedio de latencia puede ser aceptable mientras determinados silencios rompen la conversación; una tasa alta de resolución puede ocultar respuestas poco claras.

Voz conectada con la estrategia omnicanal

El agente no debe convertirse en un canal aislado. Una conversación puede comenzar en la web, continuar por voz y terminar con un enlace o resumen enviado al usuario. El historial relevante debe llegar al equipo humano sin obligar al cliente a repetirlo todo.

En Sitelicon tratamos los agentes de voz como una combinación de experiencia, integración y operación. Diseñamos el caso de uso, conectamos las fuentes necesarias, establecemos límites y medimos el resultado. La voz abre una interfaz poderosa; la confianza depende de lo que sucede detrás de ella.

Nota editorial: artículo publicado originalmente en abril de 2025 y revisado el 11 de septiembre de 2026 para preservar la continuidad del archivo editorial.

Responsabilidad editorial

¿Quién responde de este contenido?

Equipo Sitelicon
Contenido creado y mantenido por el equipo multidisciplinar de Sitelicon.

Publicación
Última revisión
Trazabilidad
2 fuentes referenciadas

Fuentes y actualización

Información contrastada y fechada.

Última actualización registrada el . Las funciones y condiciones de las plataformas digitales pueden cambiar con el tiempo.

Contacta con Sitelicon

¿Hablamos de tu estrategia digital?

Cuéntanos qué quieres conseguir, qué canales utilizas y qué contexto debemos conocer. Te responderemos con una primera orientación concreta.

Enviar consulta

Empecemos por el contexto.

Pedimos únicamente la información necesaria para entender la consulta y asignarla correctamente.

Cargando formulario seguro…