Asistente de Ventas con IA y RAG
Un asistente de RAG y analítica en producción para concesionarios de automóviles

El Desafío
Una gran plataforma de marketing de inventario automotriz quería ofrecer a miles de concesionarios un único asistente conversacional: uno capaz de responder preguntas en lenguaje natural sobre su inventario en vivo, explicar de forma consistente conceptos de precios y riesgo, evaluar y reescribir los anuncios de vehículos y mejorar las fotos de los anuncios, sin exponer nunca los datos de un concesionario a otro ni inventar cifras.
La Solución
Construimos un asistente con streaming sobre un framework de pipelines propio y totalmente tipado, en lugar de una biblioteca de agentes lista para usar, de modo que cada paso es testeable, trazable y evaluable de forma independiente. Una capa de recuperación fundamenta las respuestas en una base de conocimiento curada usando embeddings de Amazon Titan en Postgres/pgvector, filtrados por tipo de documento, etiquetas y perfil de usuario. Un enrutador de intención dirige cada pregunta a la herramienta correcta: preguntas y respuestas fundamentadas en la recuperación, conversión de lenguaje natural a SQL sobre BigQuery (con validación acotada a cada concesionario y límites de costo para que ningún concesionario pueda leer los datos de otro), análisis en vivo de páginas de vehículos mediante un crawler headless resiliente, o un servicio de imágenes en GPU que segmenta fotos con Segment Anything, elimina fondos y añade insignias de características usando un modelo de visión. Las respuestas sin fundamento devuelven una alternativa segura en lugar de una suposición, y cada paso no determinista es calificado por un LLM juez en Langfuse, además de una suite offline de calidad de recuperación.
Resultados
- Llevado a producción en Kubernetes sobre flotas de CPU y GPU con entrega vía GitOps
- Aislamiento multi-tenant estricto: la validación de SQL acotada por concesionario bloquea el acceso a datos entre concesionarios
- RAG fundamentado con una alternativa anti-alucinación en lugar de respuestas inventadas
- Evaluación continua: LLM como juez en Langfuse más una suite offline de recuperación con DeepEval