Descrição
Resumo:
Assumir a responsabilidade pela arquitetura técnica e entrega de um copiloto por voz em tempo real para cuidados veterinários, garantindo alto desempenho, melhoria contínua e transferência de conhecimento.
Pontos de destaque:
1. Liderar a arquitetura técnica e a implementação prática do fluxo de IA por voz
2. Impulsionar a otimização da latência e reforçar os sistemas para escala de produção
3. Absorver uma transferência abrangente do arquiteto atual
**Sobre o projeto** ***(descrição, duração, fase)***
----------------------------------------------------------
O cliente é a maior rede norte-americana de cuidados paliativos veterinários e cuidados de fim de vida realizados no domicílio. Um importante patrocinador norte-americano de private equity impulsiona o programa de IA e planeja mais projetos em seu portfólio.
Desenvolvemos um copiloto por voz em tempo real para seus Coordenadores de Cuidados Veterinários (VCCs). O copiloto escuta chamadas ao vivo com famílias de animais de estimação. Ele extrai campos de agendamento e clínicos enquanto a chamada está em andamento. Preenche o sistema de agendamento do cliente por meio de uma extensão do Chrome. Um segundo fluxo de trabalho, o **Copiloto de Visita Veterinária**, envia a cada veterinário um briefing pré-visita por IA por e-mail (Amazon SES).
A seguir vem a **fase de produção**.
**Fase:** SOW de produção em alinhamento executivo; início previsto para setembro de 2026.
**Duração:** vários meses, com forte probabilidade de prorrogação. Carga mínima de 0,5 FTE; aumento progressivo até 1,0 FTE à medida que a produção escala.
**Motivo da vaga:** o arquiteto atual transfere-se para outra construção estratégica. Ele permanecerá com **0,15–0,2 FTE para supervisão e transferência de conhecimento** durante a fase de ramp-up, de modo que o novo arquiteto receba uma transferência estruturada.
**Objetivo**
-------------
* Assumir a responsabilidade pela arquitetura técnica e entrega do copiloto por voz, desde a prova de conceito validada até a produção
* Alcançar os critérios avaliados por este cliente: latência, precisão, concorrência e custo
* Manter as expectativas alinhadas: o acabamento de produção está agora dentro do escopo; proteger a equipe contra expansões silenciosas do escopo
* Transferir continuamente conhecimento à equipe do cliente e aos engenheiros do Neurons Lab
**Áreas de Responsabilidade**
---------------------------
### **Arquitetura técnica \& implementação prática**
* Assumir a responsabilidade pelo fluxo completo: conversão de fala em texto em streaming, extração de campos por LLM, entrega via extensão do Chrome e infraestrutura AWS
* Impulsionar o trabalho de latência: reduzir o percentil P95 de \~6 s para \~2 s; eliminar casos especiais de pós-processamento (atraso ocasional de \~1 minuto em um tipo de campo)
* Executar testes A/B com modelos (par atual: Claude Haiku vs GPT Luna) com avaliação por conjunto dourado quanto à precisão de nomes fonéticos e endereços de e-mail
* Assumir a responsabilidade pela avaliação e pelo custo: rastreamentos Langfuse, painéis de precisão, custo real por chamada a partir de chamadas ao vivo e um plano de otimização
* Reforçar para produção: 5–10\+ chamadas simultâneas, isolamento rigoroso de dados entre usuários, monitoramento, alertas e rollback seguro
* Entregar epics integralmente (exemplo: o serviço de briefing por e-mail via SES); manter sempre um fallback demonstrável para que uma sessão ao vivo nunca falhe
### **Trabalhando com partes interessadas do cliente**
* Liderar discussões técnicas com um cliente meticuloso; os VCCs testam casos extremos e esperam qualidade de produção
* Apresentar comportamentos concretos do sistema, com números — esta conta valoriza evidências, não slides
* Manter a linha do escopo: vincular cada item de feedback ao SOW; direcionar itens de roadmap (loop de aprendizado, memória persistente) para fases futuras
* Manter discussões internas internas; todos os materiais voltados ao cliente passam pela revisão ADM antes do envio
### **Equipe \& conhecimento**
* Liderar o Engenheiro de IA e o grupo: definir tarefas, revisar resultados e remover bloqueios rapidamente
* Absorver a transferência do arquiteto que está saindo (janela de supervisão de 0,15–0,2 FTE) e tornar-se independente rapidamente
* Realizar sessões de transferência de conhecimento; o projeto não deve ter nenhum ponto único de falha
* Apoiar a SOW de produção com estimativas e opções de arquitetura quando solicitado pela equipe da conta
**Habilidades**
----------
* Fluxos de voz em tempo real: STT em streaming, tratamento de turnos, inferência de LLM de baixa latência — prática direta
* Engenharia de LLM: engenharia de prompts, extração estruturada, salvaguardas, avaliação A/B de modelos
* Observabilidade e avaliações: Langfuse ou similar; conjuntos de dados dourados; painéis de latência, precisão e custo
* AWS: Bedrock, padrões serverless, SES; economia de tokens e engenharia de custo por chamada
* Pragmatismo full-stack: Python sólido; conhecimento suficiente de TypeScript / extensão do Chrome para assumir a integração
* Inglês falado e escrito claro para executivos norte-americanos exigentes
**Conhecimento**
-------------
* Padrões e métricas de centros de contato / assistência a agentes (tempo de atendimento, custo por chamada, concorrência)
* Operações de LLM em produção: testes de carga, isolamento de dados, tratamento de incidentes
* Desejável: domínios sensíveis à empatia (saúde, veterinária, seguros) e implantações patrocinadas por private equity
**Experiência**
--------------
Características principais (avaliadas nas quatro):
* **IA por voz em produção — obrigatório.** Lançou pelo menos um produto de voz ou fala em tempo real para usuários reais (assistência a agentes, bot de voz, copiloto de transcrição ao vivo). Os candidatos apresentarão artefatos reais na entrevista.
* **6\+ anos de experiência prática em engenharia de IA/ML**, com forte prática recente em produção de LLM
* **Histórico comprovado em latência e confiabilidade.** Capaz de demonstrar reduções medidas no percentil P95 e correções de concorrência em um sistema ao vivo
* **Senioridade em consultoria / interação com clientes.** Calmo e preciso sob escrutínio detalhado de UAT; gerencia bem as expectativas
Desejável:
* Entrega por extensão do Chrome; pilhas de telefonia / streaming (Amazon Connect, Twilio, LiveKit)
* Langfuse em produção
* Experiência com clientes norte-americanos com sobreposição de fuso horário leste