Category

Data & Analytics

Data analysis, BI, visualization, datasets, statistics, and ML workflows

13,287
skills in category
554
pages available
Security grades appear on each card once the skill has been scanned. Newly imported skills may briefly show without a grade until the backfill job runs.
Open in full browser

Browse data & analytics skills

Showing 7,057–7,080 of 13,287 skills

Cosmic DatabaseA

Acesse o banco de dados de mutações de câncer COSMIC. Consulte mutações somáticas, Cancer Gene Census, assinaturas mutacionais, fusões gênicas para pesquisa de câncer e oncologia de precisão. Requer autenticação.

datapythongo
0
11
Cellxgene CensusA

Consulte o CZ CELLxGENE Census (61M+ células). Filtre por tipo de célula/tecido/doença, recupere dados de expressão, integre com scanpy/PyTorch, para análise de célula única em escala populacional.

datapythongo
0
11
BioservicesA

Ferramenta Python primária para 40+ serviços de bioinformática. Preferida para workflows multi-banco de dados: UniProt, KEGG, ChEMBL, PubChem, Reactome, QuickGO. API unificada para queries, mapeamento de IDs, análise de pathways. Para controle REST direto, use skills individuais de banco de dados (uniprot-database, kegg-database).

datapythongo
0
11
Biorxiv DatabaseA

Ferramenta eficiente de busca em banco de dados para o servidor de pré-prints bioRxiv. Use essa competência ao pesquisar pré-prints de ciências da vida por palavras-chave, autores, intervalos de datas ou categorias, recuperando metadados de artigos, baixando PDFs ou conduzindo revisões de literatura.

datapythongo
0
11
AnndataA

Esta habilidade deve ser usada ao trabalhar com matrizes de dados anotados em Python, particularmente para análise de genômica de célula única, gerenciamento de medições experimentais com metadados ou manipulação de datasets biológicos em larga escala. Use quando as tarefas envolvam objetos AnnData, arquivos h5ad, dados de RNA-seq de célula única ou integração com ferramentas scanpy/scverse.

datapythongo
0
11
Alphafold DatabaseA

Acesse mais de 200 milhões de estruturas de proteínas previstas por IA do AlphaFold. Recupere estruturas por ID do UniProt, baixe arquivos PDB/mmCIF, analise métricas de confiança (pLDDT, PAE) para descoberta de fármacos e biologia estrutural.

datapythongo
0
11
AeonA

Esta skill deve ser usada para tarefas de machine learning em séries temporais, incluindo classificação, regressão, clustering, forecasting, detecção de anomalias, segmentação e busca de similaridade. Use quando trabalhar com dados temporais, padrões sequenciais ou observações indexadas por tempo que requerem algoritmos especializados além de abordagens padrão de ML. Particularmente adequada para análise univariada e multivariada de séries temporais com APIs compatíveis com scikit-learn.

datapythongo
0
11
SpreadsheetA

Use quando as tarefas envolvem criar, editar, analisar ou formatar planilhas (`.xlsx`, `.csv`, `.tsv`) com Python (`openpyxl`, `pandas`), especialmente quando fórmulas, referências e formatação precisam ser preservadas e verificadas.

datapython
0
11
Kotlin Coroutines ExpertA

Padrões avançados para Kotlin Coroutines e Flow, cobrindo structured concurrency, tratamento de erros e testes.

datakotlinapi
0
11
Post Training VerlA

Fornece orientação para treinar LLMs com aprendizado por reforço usando verl (Volcano Engine RL). Use ao implementar RLHF, GRPO, PPO ou outros algoritmos de RL para pós-treinamento de LLMs em escala com backends de infraestrutura flexíveis.

datapythongo
0
11
Post Training TorchforgeA

Fornece orientação para treinamento RL agentico nativo do PyTorch usando torchforge, biblioteca da Meta que separa infraestrutura de algoritmos. Use quando você quer abstrações limpas de RL, fácil experimentação de algoritmos, ou treinamento escalável com Monarch e TorchTitan.

datapythongo
0
11
Post Training SimpoA

Simple Preference Optimization para alinhamento de LLMs. Alternativa sem modelo de referência ao DPO com melhor desempenho (+6.4 pontos no AlpacaEval 2.0). Sem modelo de referência necessário, mais eficiente que DPO. Use para alinhamento de preferências quando quer treinamento mais simples e rápido que DPO/PPO.

datapythongo
0
11
Optimization HqqA

Quantização Half-Quadratic para LLMs sem dados de calibração. Use ao quantizar modelos com precisão 4/3/2-bit sem necessidade de conjuntos de calibração, para workflows de quantização rápida, ou ao fazer deploy com vLLM ou HuggingFace Transformers.

datapythongo
0
11
Model Architecture MambaA

Modelo de espaço de estados com complexidade O(n) versus O(n²) dos Transformers. Inferência 5× mais rápida, sequências de milhão de tokens, sem cache KV. SSM seletivo com design aware de hardware. Mamba-1 (d_state=16) e Mamba-2 (d_state=128, multi-head). Modelos 130M-2.8B no HuggingFace.

datapythongo
0
11
Model Architecture LitgptA

Implementa e treina LLMs usando LitGPT da Lightning AI com 20+ arquiteturas pré-treinadas (Llama, Gemma, Phi, Qwen, Mistral). Use quando precisar de implementações limpas de modelos, entendimento educacional de arquiteturas ou fine-tuning de produção com LoRA/QLoRA. Implementações em arquivo único, sem camadas de abstração.

datapythongo
0
11
Mlops Weights And BiasesA

Rastreie experimentos de ML com logging automático, visualize treinamento em tempo real, otimize hiperparâmetros com sweeps e gerencie registro de modelos com W&B - plataforma colaborativa de MLOps

datapythongo
0
11
Mlops TensorboardA

Visualize métricas de treinamento, depure modelos com histogramas, compare experimentos, visualize grafos de modelos e perfil de desempenho com TensorBoard - kit de visualização de ML do Google

datapythongo
0
11
Infrastructure Lambda LabsB

Instâncias GPU em nuvem reservadas e sob demanda para treinamento e inferência de ML. Use quando você precisar de instâncias GPU dedicadas com acesso SSH simples, sistemas de arquivos persistentes ou clusters multi-node de alto desempenho para treinamento em larga escala.

datapythongo
0
11
Distributed Training Pytorch LightningA

Framework PyTorch de alto nível com classe Trainer, treinamento distribuído automático (DDP/FSDP/DeepSpeed), sistema de callbacks e boilerplate mínimo. Escala de laptop para supercomputador com o mesmo código. Use quando quiser loops de treinamento limpos com boas práticas integradas.

datapythongo
0
11
Distributed Training Megatron CoreA

Treina modelos de linguagem grandes (2B-462B de parâmetros) usando NVIDIA Megatron-Core com estratégias avançadas de paralelismo. Use ao treinar modelos >1B de parâmetros, precisar de máxima eficiência de GPU (47% MFU em H100), ou necessitar de paralelismo tensor/pipeline/sequência/contexto/expert. Framework pronto para produção usado em Nemotron, LLaMA, DeepSeek.

datagobash
0
11
Distributed Training DeepspeedA

Orientação especializada e abrangente para treinamento distribuído com DeepSpeed - estágios de otimização ZeRO, paralelismo de pipeline, FP16/BF16/FP8, 1-bit Adam, atenção esparsa

datapythongo
0
11
Data ScientistA

Cientista de dados especializado em análises avançadas, machine learning e modelagem estatística. Trabalha com análise de dados complexa, modelagem preditiva e business intelligence.

datapythongo
0
11
Data Processing Ray DataA

Processamento escalável de dados para workloads de ML. Execução em streaming em CPU/GPU, suporta Parquet/CSV/JSON/imagens. Integra-se com Ray Train, PyTorch, TensorFlow. Escala de uma única máquina para centenas de nós. Use para inferência em lote, pré-processamento de dados, carregamento de dados multi-modal ou pipelines distribuídos de ETL.

datapythongo
0
11
Tpl Dominio Relatorios AnalyticsA

Template do pack (dominio/13-relatorios-analytics.md). Orienta o agente em regras de negocio e requisitos de produto alinhado a esse contexto.

datajavascriptgo
0
11