Assistente de Vendas com IA e RAG
Um assistente de RAG e analytics em produção para concessionárias automotivas

O Desafio
Uma grande plataforma de marketing e gestão de estoque automotivo queria dar a milhares de concessionárias um único assistente conversacional: um que respondesse perguntas em linguagem natural sobre o estoque ao vivo, explicasse conceitos de precificação e risco de forma consistente, avaliasse e reescrevesse anúncios de veículos e melhorasse as fotos dos anúncios, sem nunca expor os dados de uma concessionária a outra nem inventar números.
A Solução
Construímos um assistente com streaming sobre um framework de pipeline próprio e totalmente tipado, em vez de uma biblioteca de agentes pronta, de modo que cada etapa é testável, rastreada e avaliada de forma independente. Uma camada de retrieval fundamenta as respostas em uma base de conhecimento curada, usando embeddings Amazon Titan em Postgres/pgvector, filtrada por tipo de documento, tags e persona do usuário. Um roteador de intenção direciona cada pergunta para a ferramenta certa: perguntas e respostas fundamentadas em retrieval, conversão de linguagem natural para SQL sobre BigQuery (com validação restrita a cada concessionária e limites de custo, para que nenhuma concessionária leia os dados de outra), análise ao vivo de páginas de veículos por meio de um crawler headless resiliente, ou um serviço de imagem em GPU que segmenta as fotos com Segment Anything, remove fundos e adiciona selos de características usando um modelo de visão. Respostas sem fundamentação retornam um fallback seguro em vez de um palpite, e cada etapa não determinística é avaliada por um LLM judge no Langfuse, além de uma suíte offline de qualidade de retrieval.
Resultados
- Colocado em produção no Kubernetes, em frotas de CPU e GPU, com entrega via GitOps
- Isolamento multi-tenant rígido: a validação de SQL restrita a cada concessionária bloqueia o acesso a dados de outras
- RAG fundamentado, com fallback anti-alucinação em vez de respostas inventadas
- Avaliação contínua: LLM-as-judge no Langfuse mais uma suíte de retrieval offline com DeepEval