Voltar aos Estudos de CasoSaúde

    Assistente de Voice AI para Pacientes do Medicare

    Um companheiro voice-first para pacientes idosos em tablets de cabeceira

    Assistente de Voice AI para Pacientes do Medicare

    O Desafio

    Uma startup de saúde precisava de um companheiro voice-first que pacientes idosos realmente conseguissem usar em um tablet de cabeceira, sem menus, digitação ou jargão. Ele precisava soar acolhedor e paciente, responder rápido o suficiente para sustentar uma conversa natural, ajudar com rotinas diárias como medicamentos e lembretes, e ser operável e observável em uma frota de dispositivos em campo.

    A Solução

    Construímos o assistente sobre o framework LiveKit Agents como um pipeline de voz em tempo real: speech-to-text em streaming da AssemblyAI, um modelo de raciocínio OpenAI GPT-4.1 e voz da Cartesia, com detecção de atividade de voz Silero VAD e um detector de turno baseado em transformer, ajustado para uma fala mais lenta e suave. Um protocolo de comandos com autoridade no backend mantém a voz em sincronia com uma interface de toque em fonte grande, de modo que o paciente pode falar ou tocar e os dois caminhos se comportam de forma idêntica. O assistente cuida de check-ins de medicação, lembretes falados, previsão do tempo, notícias, quiz e jogos de palavras, e busca na web sensível à localização, e lembra fatos duradouros (família, saúde, preferências) por meio de uma camada de memória de longo prazo. Trabalhamos a latência deliberadamente (prewarming de workers, carregamento de memória paralelizado e escritas fora do caminho crítico) e instrumentamos tudo com tracing no Langfuse, monitoramento no Sentry e uma suíte de avaliação com LLM judge que pontua empatia e clareza, não apenas chamadas de ferramentas. Uma camada de autenticação de dispositivo, telemetria de rede por dispositivo e administração remota o tornam operável em escala de frota.

    Resultados

    • Roda em produção em tablets no modo quiosque, com observabilidade ponta a ponta em cada chamada
    • Interface multimodal de fato, por voz e toque, projetada para acessibilidade de idosos
    • Seis habilidades de voz (medicação, lembretes, previsão do tempo, notícias, quiz, jogos de palavras) mais busca na web
    • Ganhos de responsividade medidos a partir de trabalho direcionado em latência (por exemplo, intervalo entre turnos de jogo cerca de 58% menor)
    • 96 testes unitários de backend mais uma suíte de avaliação conversacional com 32 cenários, pontuando empatia e clareza

    Tecnologias Utilizadas

    LiveKitAssemblyAIOpenAI GPT-4.1CartesiaSilero VADLangfuse

    Verified by Clutch

    This case study has been independently verified by Clutch.

    View Report

    Pronto para transformar seu negócio?

    Fale Conosco