Data & Analytics
Data analysis, BI, visualization, datasets, statistics, and ML workflows
Browse data & analytics skills
Showing 7,057–7,080 of 13,287 skills
Acesse o banco de dados de mutações de câncer COSMIC. Consulte mutações somáticas, Cancer Gene Census, assinaturas mutacionais, fusões gênicas para pesquisa de câncer e oncologia de precisão. Requer autenticação.
Consulte o CZ CELLxGENE Census (61M+ células). Filtre por tipo de célula/tecido/doença, recupere dados de expressão, integre com scanpy/PyTorch, para análise de célula única em escala populacional.
Ferramenta Python primária para 40+ serviços de bioinformática. Preferida para workflows multi-banco de dados: UniProt, KEGG, ChEMBL, PubChem, Reactome, QuickGO. API unificada para queries, mapeamento de IDs, análise de pathways. Para controle REST direto, use skills individuais de banco de dados (uniprot-database, kegg-database).
Ferramenta eficiente de busca em banco de dados para o servidor de pré-prints bioRxiv. Use essa competência ao pesquisar pré-prints de ciências da vida por palavras-chave, autores, intervalos de datas ou categorias, recuperando metadados de artigos, baixando PDFs ou conduzindo revisões de literatura.
Esta habilidade deve ser usada ao trabalhar com matrizes de dados anotados em Python, particularmente para análise de genômica de célula única, gerenciamento de medições experimentais com metadados ou manipulação de datasets biológicos em larga escala. Use quando as tarefas envolvam objetos AnnData, arquivos h5ad, dados de RNA-seq de célula única ou integração com ferramentas scanpy/scverse.
Acesse mais de 200 milhões de estruturas de proteínas previstas por IA do AlphaFold. Recupere estruturas por ID do UniProt, baixe arquivos PDB/mmCIF, analise métricas de confiança (pLDDT, PAE) para descoberta de fármacos e biologia estrutural.
Esta skill deve ser usada para tarefas de machine learning em séries temporais, incluindo classificação, regressão, clustering, forecasting, detecção de anomalias, segmentação e busca de similaridade. Use quando trabalhar com dados temporais, padrões sequenciais ou observações indexadas por tempo que requerem algoritmos especializados além de abordagens padrão de ML. Particularmente adequada para análise univariada e multivariada de séries temporais com APIs compatíveis com scikit-learn.
Use quando as tarefas envolvem criar, editar, analisar ou formatar planilhas (`.xlsx`, `.csv`, `.tsv`) com Python (`openpyxl`, `pandas`), especialmente quando fórmulas, referências e formatação precisam ser preservadas e verificadas.
Padrões avançados para Kotlin Coroutines e Flow, cobrindo structured concurrency, tratamento de erros e testes.
Fornece orientação para treinar LLMs com aprendizado por reforço usando verl (Volcano Engine RL). Use ao implementar RLHF, GRPO, PPO ou outros algoritmos de RL para pós-treinamento de LLMs em escala com backends de infraestrutura flexíveis.
Fornece orientação para treinamento RL agentico nativo do PyTorch usando torchforge, biblioteca da Meta que separa infraestrutura de algoritmos. Use quando você quer abstrações limpas de RL, fácil experimentação de algoritmos, ou treinamento escalável com Monarch e TorchTitan.
Simple Preference Optimization para alinhamento de LLMs. Alternativa sem modelo de referência ao DPO com melhor desempenho (+6.4 pontos no AlpacaEval 2.0). Sem modelo de referência necessário, mais eficiente que DPO. Use para alinhamento de preferências quando quer treinamento mais simples e rápido que DPO/PPO.
Quantização Half-Quadratic para LLMs sem dados de calibração. Use ao quantizar modelos com precisão 4/3/2-bit sem necessidade de conjuntos de calibração, para workflows de quantização rápida, ou ao fazer deploy com vLLM ou HuggingFace Transformers.
Modelo de espaço de estados com complexidade O(n) versus O(n²) dos Transformers. Inferência 5× mais rápida, sequências de milhão de tokens, sem cache KV. SSM seletivo com design aware de hardware. Mamba-1 (d_state=16) e Mamba-2 (d_state=128, multi-head). Modelos 130M-2.8B no HuggingFace.
Implementa e treina LLMs usando LitGPT da Lightning AI com 20+ arquiteturas pré-treinadas (Llama, Gemma, Phi, Qwen, Mistral). Use quando precisar de implementações limpas de modelos, entendimento educacional de arquiteturas ou fine-tuning de produção com LoRA/QLoRA. Implementações em arquivo único, sem camadas de abstração.
Rastreie experimentos de ML com logging automático, visualize treinamento em tempo real, otimize hiperparâmetros com sweeps e gerencie registro de modelos com W&B - plataforma colaborativa de MLOps
Visualize métricas de treinamento, depure modelos com histogramas, compare experimentos, visualize grafos de modelos e perfil de desempenho com TensorBoard - kit de visualização de ML do Google
Instâncias GPU em nuvem reservadas e sob demanda para treinamento e inferência de ML. Use quando você precisar de instâncias GPU dedicadas com acesso SSH simples, sistemas de arquivos persistentes ou clusters multi-node de alto desempenho para treinamento em larga escala.
Framework PyTorch de alto nível com classe Trainer, treinamento distribuído automático (DDP/FSDP/DeepSpeed), sistema de callbacks e boilerplate mínimo. Escala de laptop para supercomputador com o mesmo código. Use quando quiser loops de treinamento limpos com boas práticas integradas.
Treina modelos de linguagem grandes (2B-462B de parâmetros) usando NVIDIA Megatron-Core com estratégias avançadas de paralelismo. Use ao treinar modelos >1B de parâmetros, precisar de máxima eficiência de GPU (47% MFU em H100), ou necessitar de paralelismo tensor/pipeline/sequência/contexto/expert. Framework pronto para produção usado em Nemotron, LLaMA, DeepSeek.
Orientação especializada e abrangente para treinamento distribuído com DeepSpeed - estágios de otimização ZeRO, paralelismo de pipeline, FP16/BF16/FP8, 1-bit Adam, atenção esparsa
Cientista de dados especializado em análises avançadas, machine learning e modelagem estatística. Trabalha com análise de dados complexa, modelagem preditiva e business intelligence.
Processamento escalável de dados para workloads de ML. Execução em streaming em CPU/GPU, suporta Parquet/CSV/JSON/imagens. Integra-se com Ray Train, PyTorch, TensorFlow. Escala de uma única máquina para centenas de nós. Use para inferência em lote, pré-processamento de dados, carregamento de dados multi-modal ou pipelines distribuídos de ETL.
Template do pack (dominio/13-relatorios-analytics.md). Orienta o agente em regras de negocio e requisitos de produto alinhado a esse contexto.