Skills DirectorySkills Directory
SkillsLearnSecurityCategoriesDocsCommunityBlog
Sign InSubmit Skill
Skills Directory

Security-tested agent skills for Claude, coding agents, and AI workflows.

Directory

  • Browse Skills
  • All Skills A–Z
  • Claude Skills
  • Claude Code Skills
  • Agent Skills
  • Categories
  • Submit a Skill

Learn

  • Learn Hub
  • Install Claude Skills
  • Write SKILL.md
  • Skills vs MCP
  • Directories Compared

Security

  • Security
  • Methodology
  • Secure Claude Skills
  • Security Badges

Company

  • About
  • Community
  • Blog
  • API Docs
  • Advertise

2026 Skills Directory. All rights reserved.

Back to skills

Llm Leaderboard Tracker

ASecurity

Acompanha a posição e a qualidade de modelos de LLM ao longo do tempo, detectando novidades e mudanças de ranking. Gatilho: usuário quer saber "qual o melhor LLM agora", "o que mudou no ranking", "tem modelo novo no topo", ou precisa monitorar modelos (benchmark de qualidade, comparação de custo/qualidade) de forma recorrente. Não-gatilho: não é para rodar um modelo local (use o modelo direto); não é para escolher modelo pontual sem histórico (use roteamento-modelos-baratos). Outcome: diff en...

2 stars
0 votes
0 copies
0 views
Added 9/19/2026
ai-agentspythongonodeapi

Works with

api

Security Analysis

A100/100

Scanned 9/19/2026

Install to Claude Code

$npx -y skills add majinmagros/magros.ai-skills --skill llm-leaderboard-tracker --agent claude-code

Installs into .claude/skills of the current project.

Are you the author of Llm Leaderboard Tracker?

Add the live security badge to your README — it updates automatically with every re-scan.

Security grade badge for Llm Leaderboard Tracker
[![Security: A — Skills Directory](https://www.skillsdirectory.com/api/skills/majinmagros-llm-leaderboard-tracker/badge)](https://www.skillsdirectory.com/skills/majinmagros-llm-leaderboard-tracker)

More formats (shields.io, HTML) on the badges page.

Download Zip
Files
SKILL.md
---
name: llm-leaderboard-tracker
description: Acompanha a posição e a qualidade de modelos de LLM ao longo do tempo, detectando novidades e mudanças de ranking. Gatilho: usuário quer saber "qual o melhor LLM agora", "o que mudou no ranking", "tem modelo novo no topo", ou precisa monitorar modelos (benchmark de qualidade, comparação de custo/qualidade) de forma recorrente. Não-gatilho: não é para rodar um modelo local (use o modelo direto); não é para escolher modelo pontual sem histórico (use roteamento-modelos-baratos). Outcome: diff entre snapshot atual e anterior (entradas novas, subidas/quedas, variação de score) + alerta quando um modelo cruza um limiar de interesse.
---

# LLM Leaderboard Tracker

Monitora rankings de LLM de forma **reprodutível e histórica** (não opinião de momento).

## Quando usar

- "qual o melhor LLM agora?", "o que mudou no ranking?", "tem modelo novo no topo?"
- Monitorar qualidade/custo dos modelos de forma recorrente (snapshot + diff)
- Alertar quando modelo cruza limiar (top-N, score X)
- Não use para: rodar modelo local; escolha pontual sem histórico (isso é roteamento-modelos-baratos)

> ✅ **VERIFICADO (2026-08-26):** fontes oficiais confirmadas nesta sessão.

## Pipeline

### 1. Definir fontes de ranking (verificadas)
- **LMArena** — preferência humana em pareado. Oficial: `arena.ai/leaderboard`;
  espelho Hugging Face: `lmarena-ai/arena-leaderboard`.
- **Hugging Face Open LLM Leaderboard** — ⚠️ **aposentado/arquivado em 2025**
  (não usar como fonte agregada). Use no lugar: leaderboards comunitários via
  OpenEvals (`find-a-leaderboard`) e leaderboards por tarefa (código, matemática, etc.).
- Leaderboards específicos por tarefa (código, math, vision) conforme o interesse.
Princípio: **use API oficial quando existir**; scraping só como fallback, com seletor versionado.

### 2. Snapshot
- Para cada fonte, capture (modelo, score, rank, data) em JSON.
- Arquivo de estado: `state/leaderboard-<fonte>.json` (crie se não existir).
- Use script determinístico (Node/Python) — não confie em leitura manual.

### 3. Diff
- Carregue snapshot anterior; calcule:
  - `NOVO`: modelo ausente antes.
  - `SUBIU` / `DESCEU`: variação de rank/score além de tolerância.
  - `CRUZOU-LIMIAR`: entrou no top-N ou passou de score X definido pelo usuário.

### 4. Relatório + alerta
- Tabela de movers; destaque `NOVO` e `CRUZOU-LIMIAR`.
- Salve novo snapshot como atual.
- Opcional: emitir alerta (mensagem/resumo) quando houver `NOVO` ou mudança relevante.

## Regras
- Sempre salvar snapshot antes de sobrescrever — o diff é o valor da skill.
- Scores de fontes diferentes não são comparáveis diretamente; reporte por fonte.
- Se a fonte muda de metodologia, anote a data da mudança no estado.

## Estado sugerido
```
state/leaderboard-lmarena.json  -> [{model, score, rank, ts}]
state/leaderboard-hf.json       -> [{model, score, rank, ts}]
```

## Watchlist Batch 16 (2026-09-13, #45 #47 #49)

Nomes citados nos vídeos, a confirmar nos snapshots: "Astra" (OpenAI),
"Fable 5.1" / "Mythos 5.1" (Anthropic), "GPT 5.6 Sol" / "Terra",
"Images 2.5 Flair" / "Sunburst" (imagem). Todos ainda rumor ou medição
de autor — só entram no ranking com fonte oficial.

### Watchlist Batch 17a (#51): GLM-5.2 (open weights, tier A), MiniMax-M3
(tier B, melhor custo), Qwen local (tier leve). Rumor/medicao de autor —
so entra no ranking com fonte oficial.

### Watchlist Batch 17g (#74 #82): DeepSeek V4 Flash 0731 (72.5% King
Bench), stealth OX Alpha ($0/$0 OpenRouter). Medicao de autor — fonte
oficial antes do ranking.

### Watchlist Batch 17h (#92-109, AI Revolution roundups — tudo rumor ou
medicao de autor ate confirmacao oficial)
- OpenAI: GPT-6 Astra/Soul/Terra/Luna (hierarquia vazada); GPT 5.6
  familia lancada (Sol + conjectura math, Terra, Luna); Astra = classe
  Fable p/ enterprise.
- Anthropic: Opus 5 lancado 24/jul (oficial); Fable 5 superado por
  metade do preco (alegacao do canal).
- China open: Kimi K3 2.8T pesos abertos (HF, servido por providers US;
  demanda pausou assinaturas); MiniMax 2.7T a caminho; DeepSeek V4.1
  Flash 763B; Qwen (destilacao atribuida, ver #53).
- Outros: Thinking Machines Inklings MoE 975B/41B ativos (open);
  Grok 4.5 (SpaceX IA); Orca world model; Gemini 4.0 (checkpoint
  vazado); SeaDream 5.0 Pro (ByteDance).

## Exemplo real validado (2026-08-26)
- Fonte: `arena.ai/leaderboard` (LMArena oficial).
- Snapshot topo: `claude-fable-5` (#1), `claude-opus-4-6-high` (#2),
  `claude-opus-4-7-high` (#3), `meta-muse-spark-1.2` (#4).
- Nota crítica aplicada: HF Open LLM Leaderboard **aposentado em 2025** →
  não usado como fonte agregada; usado LMArena + leaderboards comunitários.
- Diff real: detectaria `NOVO` / `CRUZOU-LIMIAR` ao re-snapshotar.

Attribution

majinmagrosmajinmagros
View sourceMore from majinmagros →
SSkills DirectorySkills Directory

Ship a skill? Prove it's safe.

Free 120-pattern security scan, letter grade, and an embeddable README badge.

Submit a skill

Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.

Comments (0)

No comments yet. Be the first to comment!

SSkills DirectorySkills Directory

Ship a skill? Prove it's safe.

Free 120-pattern security scan, letter grade, and an embeddable README badge.

Submit a skill

Related Skills

Caveman

Ultra-compressed communication mode. Cuts token usage ~75% by speaking like caveman while keeping full technical accuracy. Supports intensity levels: lite, full (default), ultra, wenyan-lite, wenyan-full, wenyan-ultra. Use when user says "caveman mode", "talk like caveman", "use caveman", "less tokens", "be brief", or invokes /caveman. Also auto-triggers when token efficiency is requested.

1023331 votes

Hyperplan

Adversarial multi-agent planning skill. Self-orchestrates 5 hostile category members (unspecified-low, unspecified-high, deep, ultrabrain, artistry) via team-mode for ruthless cross-critique debate, distills only the defensible insights, then MANDATORILY hands the distilled insight bundle to the `plan` agent for executable plan formalization. Use when planning needs maximum rigor and surfacing of weak assumptions, blind spots, and over-engineering. Triggers: 'hyperplan', 'hpp', '/hyperplan', ...

686011 votes

Mcp Code Execution

Routes multi-tool workflows through MCP servers for large datasets and pipelines. Use when Bash tool overhead is limiting throughput on data-heavy tasks.

3331 votes

catchup

Recovers prior coding-agent session context by running `catchup <agent> --since-compact`, which extracts a clean summary of a previous Codex, Claude Code, Antigravity, OpenCode, or Pi Agent session. Use when the user says "catch up", "what did the last session do", "get me up to speed", "I switched agents", or asks to recover/summarize a previous session before continuing. Do NOT use for the current conversation, git history, or any non-agent log.

611 votes

math-skill

A comprehensive mathematical reasoning skill for AI assistants — handles arithmetic to research-level problems with rigorous step-by-step reasoning, systematic verification, and transparent uncertainty handling

381 votes
View all in ai-agents →