Habilidade de engenharia de dados de classe mundial para construir pipelines de dados escaláveis, sistemas ETL/ELT e infraestrutura de dados. Expertise em Python, SQL, Spark, Airflow, dbt, Kafka e modern data stack. Inclui data modeling, orquestração de pipelines, qualidade de dados e DataOps. Use ao projetar arquiteturas de dados, construir pipelines de dados, otimizar workflows de dados ou implementar governança de dados.
Scanned 9/8/2026
Install to Claude Code
npx -y skills add artubss/SKILLS-CLAUDE-CODE --skill senior-data-engineer --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Senior Data Engineer?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/artubss-senior-data-engineer)More formats (shields.io, HTML) on the badges page.
---
name: senior-data-engineer
description: Habilidade de engenharia de dados de classe mundial para construir pipelines de dados escaláveis, sistemas ETL/ELT e infraestrutura de dados. Expertise em Python, SQL, Spark, Airflow, dbt, Kafka e modern data stack. Inclui data modeling, orquestração de pipelines, qualidade de dados e DataOps. Use ao projetar arquiteturas de dados, construir pipelines de dados, otimizar workflows de dados ou implementar governança de dados.
---
# Senior Data Engineer
Habilidade de engenheiro de dados sênior de classe mundial para sistemas production-grade de AI/ML/Data.
## Quick Start
### Principais Capacidades
```bash
# Core Tool 1
python scripts/pipeline_orchestrator.py --input data/ --output results/
# Core Tool 2
python scripts/data_quality_validator.py --target project/ --analyze
# Core Tool 3
python scripts/etl_performance_optimizer.py --config config.yaml --deploy
```
## Expertise Principal
Esta habilidade cobre capacidades de classe mundial em:
- Padrões e arquiteturas de produção avançados
- Design e implementação de sistemas escaláveis
- Otimização de performance em escala
- Melhores práticas de MLOps e DataOps
- Processamento e inferência em tempo real
- Frameworks de computação distribuída
- Deploy e monitoramento de modelos
- Segurança e conformidade
- Otimização de custos
- Liderança de equipes e mentoria
## Tech Stack
**Linguagens:** Python, SQL, R, Scala, Go
**ML Frameworks:** PyTorch, TensorFlow, Scikit-learn, XGBoost
**Data Tools:** Spark, Airflow, dbt, Kafka, Databricks
**LLM Frameworks:** LangChain, LlamaIndex, DSPy
**Deployment:** Docker, Kubernetes, AWS/GCP/Azure
**Monitoring:** MLflow, Weights & Biases, Prometheus
**Databases:** PostgreSQL, BigQuery, Snowflake, Pinecone
## Documentação de Referência
### 1. Data Pipeline Architecture
Guia abrangente disponível em `references/data_pipeline_architecture.md` cobrindo:
- Padrões e melhores práticas avançados
- Estratégias de implementação em produção
- Técnicas de otimização de performance
- Considerações de escalabilidade
- Segurança e conformidade
- Estudos de caso do mundo real
### 2. Data Modeling Patterns
Documentação completa de workflow em `references/data_modeling_patterns.md` incluindo:
- Processos passo a passo
- Padrões de design de arquitetura
- Guias de integração de ferramentas
- Estratégias de ajuste de performance
- Procedimentos de troubleshooting
### 3. Dataops Best Practices
Guia de referência técnica em `references/dataops_best_practices.md` com:
- Princípios de design de sistemas
- Exemplos de implementação
- Melhores práticas de configuração
- Estratégias de deployment
- Monitoramento e observabilidade
## Padrões de Produção
### Padrão 1: Processamento de Dados Escalável
Processamento de dados em escala empresarial com computação distribuída:
- Arquitetura de scaling horizontal
- Design tolerante a falhas
- Processamento em tempo real e batch
- Validação de qualidade de dados
- Monitoramento de performance
### Padrão 2: Deploy de Modelo ML
Sistema ML em produção com alta disponibilidade:
- Model serving com baixa latência
- Infraestrutura de A/B testing
- Integração com feature store
- Monitoramento de modelos e detecção de drift
- Pipelines de retrainamento automatizado
### Padrão 3: Inferência em Tempo Real
Sistema de inferência com alto throughput:
- Estratégias de batching e caching
- Load balancing
- Auto-scaling
- Otimização de latência
- Otimização de custos
## Melhores Práticas
### Desenvolvimento
- Desenvolvimento orientado por testes
- Code reviews e pair programming
- Documentação como código
- Versionamento de tudo
- Integração contínua
### Produção
- Monitore tudo que é crítico
- Automatize deployments
- Feature flags para releases
- Canary deployments
- Logging abrangente
### Liderança de Equipe
- Mentoria de engenheiros juniores
- Condução de decisões técnicas
- Estabelecimento de padrões de código
- Fostering de cultura de aprendizado
- Colaboração cross-funcional
## Alvos de Performance
**Latência:**
- P50: < 50ms
- P95: < 100ms
- P99: < 200ms
**Throughput:**
- Requisições/segundo: > 1000
- Usuários simultâneos: > 10.000
**Disponibilidade:**
- Uptime: 99,9%
- Taxa de erro: < 0,1%
## Segurança & Conformidade
- Autenticação & autorização
- Criptografia de dados (em repouso e em trânsito)
- Tratamento de PII e anonimização
- Conformidade GDPR/CCPA
- Auditorias de segurança regulares
- Gestão de vulnerabilidades
## Comandos Comuns
```bash
# Development
python -m pytest tests/ -v --cov
python -m black src/
python -m pylint src/
# Training
python scripts/train.py --config prod.yaml
python scripts/evaluate.py --model best.pth
# Deployment
docker build -t service:v1 .
kubectl apply -f k8s/
helm upgrade service ./charts/
# Monitoring
kubectl logs -f deployment/service
python scripts/health_check.py
```
## Recursos
- Advanced Patterns: `references/data_pipeline_architecture.md`
- Implementation Guide: `references/data_modeling_patterns.md`
- Technical Reference: `references/dataops_best_practices.md`
- Automation Scripts: `scripts/` directory
## Responsabilidades em Nível Sênior
Como um profissional de classe mundial sênior:
1. **Liderança Técnica**
- Conduza decisões arquiteturais
- Faça mentoria de membros da equipe
- Estabeleça melhores práticas
- Garanta qualidade de código
2. **Pensamento Estratégico**
- Alinhe com objetivos de negócio
- Avalie trade-offs
- Planeje para escala
- Gerencie débito técnico
3. **Colaboração**
- Trabalhe entre equipes
- Comunique-se efetivamente
- Construa consenso
- Compartilhe conhecimento
4. **Inovação**
- Mantenha-se atualizado com pesquisa
- Experimente novas abordagens
- Contribua para a comunidade
- Impulsione melhoria contínua
5. **Excelência em Produção**
- Garanta alta disponibilidade
- Monitore proativamente
- Otimize performance
- Responda a incidentesIs this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!