Leonardo Braga

Ciência de Dados · Engenharia de Dados · Machine Learning

Pipelines e modelos que entregam valor, com governança e LGPD como diferencial.

Sou Leonardo Borges Silva Braga, cientista de dados formado em Ciência de Dados e IA, com atuação prática em Engenharia de Dados. Construo pipelines, modelos preditivos e análises que entregam valor real, com um diferencial pouco comum no mercado: segurança, ética e conformidade com a LGPD aplicadas desde o design dos sistemas.

82%
Acurácia em modelo preditivo de logística
40%
Antecipação em entrega de pipeline ETL enterprise
k-anonimato
Biblioteca própria de anonimização publicada
Foto de Leonardo Borges Silva Braga

Construo pipelines e modelos de ciência e engenharia de dados, com um diferencial pouco comum no mercado: governança e conformidade com a LGPD desde o design.

pipeline: clientes.csv
dd.scan(df) → 3 colunas PII
dd.mask(df, salt=SALT) → hash determinístico
dd.store(df, "clientes.dlk") → AES‑256‑GCM
check.kanon(df) → k = 12

Sobre

A interseção entre engenharia, ciência e governança de dados

Atuo na fronteira entre engenharia e ciência de dados: a engenharia de dados que constrói e sustenta pipelines em escala, e a ciência de dados que extrai previsões e recomendações de qualidade a partir deles. Um diferencial que poucos profissionais de dados reúnem é a governança de dados, que garante que tudo isso aconteça de forma ética, segura e em conformidade com a LGPD. Domino SQL, Python e ferramentas de integração e analytics como SAP/Pentaho e SAS, com histórico real de otimização de pipelines e melhoria de qualidade de dados em ambientes enterprise, incluindo grandes marcas como Natura e Neugebauer.

Essa combinação me levou a criar o Datalock Studio, uma biblioteca e plataforma de anonimização de dados com k-anonimato, pseudonimização reversível e criptografia autenticada, hoje publicada e em processo de submissão na Microsoft Store. Em paralelo, desenvolvo projetos de Machine Learning, de sistemas de recomendação híbridos a modelos preditivos de logística, sempre com atenção à explicabilidade e ao uso responsável do dado. Busco uma oportunidade para aplicar essas competências na construção de sistemas de dados robustos, seguros e eticamente responsáveis.

01

Engenharia

Pipelines de ETL, qualidade de dados e integração de sistemas em ambientes enterprise.

02

Ciência

Modelos preditivos e sistemas de recomendação híbridos com foco em desempenho e diversidade.

03

Governança · diferencial

Anonimização, criptografia e conformidade com a LGPD aplicadas desde o design do sistema.

Experiência

Trajetória em dados, do dashboard ao pipeline crítico

  1. 01/2026 — 05/2026

    Estagiário em Ciência de Dados · IZE Gestão Empresarial

    Híbrido

    • Desenvolvi dashboards e KPIs atualizados em tempo real, utilizando Streamlit, Airflow e EvolutionAPI para integração com WhatsApp.
    • Auditei a qualidade dos programas internos desenvolvidos e corrigi bugs e más práticas de codebase.
    • Automatizei fluxos de alimentação de banco de dados e planilhas com Apps Script.
  2. 04/2025 — 01/2026

    Estagiário em Data Migration · First Decision

    Híbrido

    • Desenvolvimento e sustentação de pipelines de ETL complexos, garantindo integridade e higienização de grandes volumes de dados para clientes enterprise (Natura, Neugebauer).
    • Otimizei fluxos de carga e transformação de dados, resultando em entrega 40% antecipada ao cronograma oficial do projeto.
    • Implementei rotinas de validação e tratamento de erros (Data Quality), reduzindo inconsistências e assegurando a confiabilidade dos relatórios finais.
  3. 07/2024 — 04/2025

    Estagiário e Membro Consultor · Empresa Júnior DatAí Tecnologia EJ

    Remoto

    • Desenvolvi dashboards e análises interativas para clientes, utilizando SAS, Python, SQL e Power BI.
    • Estruturei bancos de dados SQL para facilitar acesso e integração de dados.

Projetos

Da anonimização de dados ao machine learning aplicado

Machine Learning 6M+ avaliações · 10 mil livros

Sistema Híbrido de Recomendação de Livros

Deep learning + filtragem colaborativa e análise de conteúdo, treinado sobre o dataset GoodBooks-10k (6M+ avaliações, 10 mil livros). Recomendações personalizadas com 80% de diversidade, evitando o efeito "bolha" de sugestões óbvias.

PyTorchPolarsGradioScikit-learn
Machine Learning R² 0,816 · MAE 6,37 min

Predição de Tempo de Entrega

Modelo XGBoost que estima o tempo de entrega em minutos a partir de distância, clima, trânsito, tipo de veículo e experiência do entregador. R² de 0,816 e MAE de 6,37 min no conjunto de teste, servido via app interativo em Gradio.

XGBoostPandasScikit-learnGradio
Dados públicos & saúde Dados nacionais · SINASC 2023

Dashboard de Nascidos Vivos (SINASC 2023)

Painel interativo para explorar dados de nascidos vivos no Brasil em 2023, com filtros demográficos, gráficos por estado, tipo de parto e escolaridade materna, voltado a profissionais de saúde pública.

StreamlitPandasPlotly
Ferramenta de análise Upload → dashboard em segundos

Fast EDA

Aplicação web leve para análise exploratória de dados instantânea: basta subir um arquivo CSV, XLSX ou Parquet para gerar dashboards interativos via PyGWalker, com carregamento acelerado por Polars.

PolarsPyGWalkerGradio

Competências

Da linguagem de programação ao arcabouço regulatório

Linguagens

Python, SQL, SAS

Engenharia de Dados & ETL

Pentaho, SAP Data Services, pipelines de ingestão e transformação em escala

Pipeline & Deploy

Docker, CI/CD, Airflow

Banco de Dados

MySQL, PostgreSQL

Cloud & Infraestrutura

Oracle Cloud Infrastructure (OCI)

Governança & Privacidade de Dados

LGPD, k-anonimato, pseudonimização, criptografia, trilhas de auditoria

Analytics & Visualização

Power BI, Streamlit, Plotly, PyGWalker

Machine Learning

PyTorch, XGBoost, Scikit-learn, sistemas de recomendação híbridos

Certificações

2025

Oracle Cloud Infrastructure (OCI)

Professional: Generative AI, Data Science · Foundations: OCI AI, Data Platform, Cloud Infrastructure

2025

Databricks

Accreditations: Fundamentals, Generative AI Fundamentals

2025

Oracle Certified Generative AI & Data Science Professional

Ciência de Dados e IA

Formação

Base acadêmica em ciência de dados e inteligência artificial

Bacharelado em Ciência de Dados e Inteligência Artificial

IESB · 02/2023 — 10/2026

Disciplinas relevantes: Aprendizagem de Máquina, Mineração de Dados, Estatística Aplicada, Análise Exploratória e Visualização, Modelagem e Inferência Estatística, Processamento de Dados Massivos.

Projeto acadêmico de destaque

Sistema Híbrido Personalizado de Recomendação (Deep Learning & Filtragem Colaborativa): combina fatoração de matriz e redes neurais para recomendações com 80% de diversidade, com foco em personalização precisa e descoberta de conteúdos menos populares.

Fatoração de Matriz · Deep Learning · PyTorch · Gradio · Polars

Ver o projeto ↗

Vamos conversar

Estou em busca de uma oportunidade para aplicar ciência, engenharia e machine learning na construção de sistemas de dados robustos, com um diferencial: experiência prática em governança e conformidade com a LGPD. Se o seu time trabalha com dados, será um prazer conversar.

Brasília, DF — Brasil