Descrição
Resumo:
Junte-se à equipe de um cliente como especialista sênior em AI DevOps / LLMOps para projetar e implementar pipelines de CI/CD, gerenciar infraestrutura de IA e garantir experimentação segura.
Pontos de destaque:
1. Projetar e implementar pipelines robustos de CI/CD personalizados para IA.
2. Provisionar e gerenciar ambientes de computação de alto desempenho.
3. Arquitetar estratégias de Entrega Progressiva para IA.
Na TechBiz Global, prestamos serviços de recrutamento a nossos principais clientes do portfólio. Atualmente, buscamos um especialista **Senior AI DevOps / LLMOps** para integrar uma das equipes de nossos **clientes**. Se você procura uma oportunidade empolgante para crescer em um ambiente inovador, essa pode ser a combinação perfeita para você.
**Principais Responsabilidades**
* Automação de Build\-to\-Production
* Projetar e implementar pipelines robustos de CI/CD personalizados para IA, abrangendo pesos de modelos,
versionamento de conjuntos de dados e código de aplicação.
* Desenvolver fluxos de trabalho especializados para PromptOps, assegurando que os prompts do sistema sejam
controlados por versionamento, testados quanto a regressões e implantados com o mesmo rigor do código tradicional.
* Automatizar a implantação de fluxos de trabalho agênticos, gerenciando as complexidades das interações de IA com estado e transferências entre múltiplos agentes.
2\. Infraestrutura como Código para IA (IaC)
* Provisionar e gerenciar ambientes de computação de alto desempenho (clusters GPU, pods TPU) usando Terraform, Pulumi ou Ansible.
* Definir e impor Política\-como\-Código para endpoints de IA, garantindo conformidade com requisitos de segurança,
limites de uso de custos e residência de dados.
* Manter um ambiente consistente em infraestruturas híbridas, assegurando paridade perfeita entre desenvolvimento local e produção em nuvem.
3\. Experimentação Segura \& Lançamentos Controlados
* Arquitetar estratégias de Entrega Progressiva para IA, incluindo lançamentos canário, implantações Blue\-Green
e sombreamento (em que novos modelos são executados em paralelo com a produção para comparar saídas).
* Criar portões de “Avaliação\-no\-Loop” dentro do pipeline para testar automaticamente viés,
hallucinações e degradação de desempenho antes de um lançamento.
* Implementar estruturas de teste A/B especificamente projetadas para saídas de LLMs e comportamento agêntico.
4\. Monitoramento \& Observabilidade
\- Estabelecer observabilidade profunda em Endpoints de Inferência, rastreando métricas como tokens\-por\-
segundo, latência e deriva na acurácia do modelo.
* Integrar loops de feedback que capturem “casos extremos” da produção para realimentar os pipelines de treinamento e ajuste fino.
**Habilidades Técnicas Obrigatórias:**
* Orquestração: Habilidades avançadas em Kubernetes (K8s), especificamente com KubeFlow, Ray ou
NVIDIA Triton.
* CI/CD \& IaC: Experiência especializada em GitHub Actions/GitLab CI, bem como em Terraform ou Pulumi.
* Ferramentas de IA: Experiência com Weights \& Biases, MLflow, LangSmith ou Arize
Phoenix.
* Hardware: Conhecimento de virtualização de GPU, drivers CUDA e gerenciamento de hardware local.
* Segurança: Familiaridade com Open Policy Agent (OPA) e gerenciamento de segredos (Vault).
**Experiência:**
* 10\+ anos em DevOps, SRE ou Engenharia de Nuvem.
* 2\+ anos de experiência prática em MLOps ou LLMOps, especificamente migrando LLMs
do notebook para produção.
* Experiência comprovada no gerenciamento de ambientes de nuvem híbrida (ex.: AWS/Azure \+ Data Center Privado).