Descrição
Resumo:
Procuramos um Engenheiro de Dados para construir, manter e otimizar a infraestrutura e os pipelines de dados, garantindo acesso confiável aos dados para analistas e usuários.
Pontos principais:
1. Construir e manter infraestrutura de dados e pipelines do Airflow
2. Colaborar com analistas de dados para fornecer dados acessíveis
3. Focar na melhoria da arquitetura de dados e dos processos DevOps
**Descrição da vaga**
Estamos à procura de um Engenheiro de Dados responsável por construir e manter a infraestrutura que suporta a arquitetura de dados da organização.
A função envolve criar e gerenciar pipelines de dados usando o Airflow para extração, processamento e carregamento de dados, assegurando sua manutenção, monitoramento e estabilidade.
O engenheiro trabalhará em estreita colaboração com analistas de dados e usuários finais para fornecer dados acessíveis e confiáveis
**Principais tarefas e responsabilidades:**
* Responsável pela manutenção da infraestrutura que suporta a arquitetura de dados atual
* Responsável pela criação de pipelines de dados no Airflow para extração, processamento e carregamento de dados
* Responsável pela manutenção, monitoramento e estabilidade dos pipelines de dados
* Responsável por fornecer acesso aos dados para analistas de dados e usuários finais
* Responsável pela infraestrutura DevOps
* Responsável pela implantação de DAGs do Airflow no ambiente de produção utilizando ferramentas DevOps
* Responsável pela otimização de códigos e consultas
* Responsável pela revisão de códigos
* Responsável pela melhoria da arquitetura de dados e dos processos DevOps atuais
* Responsável por entregar dados de forma útil e atraente aos usuários
* Responsável por realizar e documentar análises, revisões e estudos sobre temas regulatórios específicos
* Responsável por compreender as necessidades de mudança e requisitos de negócio, avaliando seu impacto e custo
**Perfil****Competências técnicas:**
* Python avançado (obrigatório)
* Experiência na criação de APIs em Python — pelo menos Flask (obrigatório)
* Experiência em documentação e testes em Python (obrigatório)
* Habilidades avançadas em SQL e gerenciamento de bancos de dados relacionais (Oracle é obrigatório; SQL Server é desejável; PostgreSQL é desejável)
* Experiência com Data Warehouses
* Ecossistema Hadoop — HDFS + Yarn (obrigatório)
* Arquitetura do ambiente Spark (obrigatório)
* PySpark avançado (obrigatório)
* Experiência na criação e manutenção de ambientes distribuídos usando Hadoop e Spark
* Data Lakes — experiência em organizar e manter data lakes (obrigatório) — S3 é preferencial
* Experiência com formato de arquivo Parquet é obrigatória; Avro é um diferencial
* Apache Airflow — experiência tanto no desenvolvimento de pipelines quanto na implantação do Airflow em ambiente distribuído (obrigatório)
* Containerização — Docker é obrigatório
* Kubernetes (obrigatório)
* Apache Kafka (obrigatório)
* Experiência na automação de implantação de aplicações usando ferramentas DevOps — Jenkins é obrigatório; Ansible é um diferencial
* Metodologias ágeis (pelo menos SCRUM)
**Competências linguísticas:**
* Fluência em inglês (obrigatório)
**Sobre a Inetum**
A Inetum é uma líder europeia em serviços digitais. A equipe da Inetum, composta por 28.000 consultores e especialistas, esforça-se diariamente para gerar um impacto digital nas empresas, entidades do setor público e na sociedade. As soluções da Inetum visam contribuir para o desempenho e inovação de seus clientes, bem como para o bem comum. Presente em 19 países com uma densa rede de escritórios, a Inetum é parceira de grandes editoras de software para enfrentar os desafios da transformação digital com proximidade e flexibilidade. Impulsionada por sua ambição de crescimento e escala, a Inetum registrou vendas de 2\.5 bilhões de euros em 2023\.
**País**
Portugal
**Localização**
Lisboa
**Tipo de contrato**
Contrato sem termo