Skills DirectorySkills Directory
SkillsLearnSecurityCategoriesDocsCommunityBlog
Sign InSubmit Skill
Skills Directory

Security-tested agent skills for Claude, coding agents, and AI workflows.

Directory

  • Browse Skills
  • All Skills A–Z
  • Claude Skills
  • Claude Code Skills
  • Agent Skills
  • Categories
  • Submit a Skill

Learn

  • Learn Hub
  • Install Claude Skills
  • Write SKILL.md
  • Skills vs MCP
  • Directories Compared

Security

  • Security
  • Methodology
  • Secure Claude Skills
  • Security Badges

Company

  • About
  • Community
  • Blog
  • API Docs
  • Advertise

2026 Skills Directory. All rights reserved.

Back to skills

Roteamento Modelos Baratos

ASecurity

Use when choosing cheap models and routing them in agent loops — OpenRouter as provider in Claude Code, cost-per-task budgeting, using a low-cost model as executor while a strong model verifies, and when cheap+verifier loops become viable. Triggers on "rotear modelo barato", "OpenRouter no Claude Code", "custo por tarefa", "modelo barato pra loop", "DeepSeek", "huggingface barato".

2 stars
0 votes
0 copies
0 views
Added 9/19/2026
ai-agentsgoapi

Works with

claude codecursorapi

Security Analysis

A100/100

Scanned 9/19/2026

Install to Claude Code

$npx -y skills add majinmagros/magros.ai-skills --skill roteamento-modelos-baratos --agent claude-code

Installs into .claude/skills of the current project.

Are you the author of Roteamento Modelos Baratos?

Add the live security badge to your README — it updates automatically with every re-scan.

Security grade badge for Roteamento Modelos Baratos
[![Security: A — Skills Directory](https://www.skillsdirectory.com/api/skills/majinmagros-roteamento-modelos-baratos/badge)](https://www.skillsdirectory.com/skills/majinmagros-roteamento-modelos-baratos)

More formats (shields.io, HTML) on the badges page.

Download Zip
Files
SKILL.md
---
name: roteamento-modelos-baratos
description: Use when choosing cheap models and routing them in agent loops — OpenRouter as provider in Claude Code, cost-per-task budgeting, using a low-cost model as executor while a strong model verifies, and when cheap+verifier loops become viable. Triggers on "rotear modelo barato", "OpenRouter no Claude Code", "custo por tarefa", "modelo barato pra loop", "DeepSeek", "huggingface barato".
metadata:
  origin: ECC
---

# Skill: Roteamento de Modelos Baratos (custo-por-tarefa)

Padrões para usar modelos de baixo custo sem perder qualidade: quem gera em
volume é barato, quem decide/valida é forte. A métrica que importa é
**custo por tarefa concluída**, não preço por token no papel.

## Quando usar

- Loop de geração/verificação que hoje usa modelo caro em todo lugar.
- Escolher provedor/modelo para um job de volume.
- Calcular se um projeto (ex: gerar 100 candidatos) cabe no orçamento.

## Padrões

### 1. Executor barato + verificador forte
- Modelo barato gera candidatos em massa (DeepSeek V4 Flash e similares).
- Modelo forte verifica/rankeia — o custo é por verificação, não por geração.
- Sempre meça nota/qualidade do executor antes de confiar no volume.

### 2. OpenRouter (ou DeepSeek direto) no Claude Code
- Configure OpenRouter como provider (3 env vars: `ANTHROPIC_BASE_URL`,
  `ANTHROPIC_AUTH_TOKEN`, `ANTHROPIC_MODEL`) e escolha modelos por custo/task.
- **Caveat oficial do OpenRouter**: o Claude Code "é garantido só com o
  provedor first-party da Anthropic" e "é otimizado para modelos Anthropic e
  pode não funcionar com outros provedores" (tool-use/parsing pode quebrar).
  Teste o loop antes de depender.
- Alternativa sem agregador: a DeepSeek expõe endpoint Anthropic-compatível
  direto (`https://api.deepseek.com/anthropic`) para o Claude Code.
- Para tarefas repetitivas e determinísticas, o barato resolve. Suba de modelo
  só quando o verificador reprovar de forma consistente.

### 3. Custo-por-tarefa como métrica
- Preço/token é enganoso: tarefa fácil = poucos tokens no barato.
- Calcule: `custo = (tokens de entrada × preço entrada) + (tokens de saída × preço saída)` por execução, vezes o número de execuções.
- Compare o total do loop barato vs rodar tudo no caro uma vez.

### 4. Quando barato+verificador vira opção
- DeepSeek V4 Flash: preço vigente (16/08/2026+) tem **peak/off-peak** —
  off-peak ~$0.22/M entrada e ~$0.66/M saída; peak ~$0.44/$1.32; cache-hit de
  entrada bem mais barato (~$0.007–$0.014/M). O "14¢/M entrada" do anúncio era
  o preço até 15/08/2026 — **sempre confira a página oficial de pricing**
  (preços mudam com frequência).
- Regra prática: se o custo atual do job em modelo forte é alto, divida entre
  geração barata + amostragem de verificação forte (20-30% do volume).

### 5. Stack em 3 tiers + pay-twice (Batch 17a, #50 #51)

- Organize modelos em 3 tiers (SOTA / workhorse / leve) num stack unico,
  nao um modelo unico. Compare sempre com controles max (fronteira) e min
  (local): modelo isolado sem controles nao diz nada.
- "Modelo melhor vs melhor negocio": GLM-5.2 ganha em capacidade,
  MiniMax-M3 ganha em preco — a pergunta e capacidade maxima ou custo.
- Pay-twice: voce paga em dinheiro E no IP revelado nos prompts. Para
  trabalho sensivel, o tier leve local zera a segunda conta — soberania
  de dados entra no tradeoff junto com latencia, qualidade e custo.

### 6. DeepSeek V4 Flash 0731 (Batch 17f, #74)

Repost-train sem mudar o nome: bench 72.5% (King Bench), recorde em
questao 3D, agentic coding real; ~GLM 5.2 em capacidade, decide
preco/harness (no Command Code roda a $1 com tool-calls + cache
repairs). Regra: re-treinos mudam tudo sem mudar o nome — valide o
snapshot atual antes de fixar executor barato.

## Checklist
- [ ] Métrica definida é custo-por-tarefa, não preço/token.
- [ ] Verificador independente do gerador.
- [ ] Amostragem de verificação existe antes de escalar volume.
- [ ] OpenRouter configurado como provider (ou equivalente).
- [ ] Loop barato validado por nota antes de colocar em produção.

## Cursor Model Routing Nativo (enriquecimento 2026-08-20, video `7phrurXJwH8`)

O **Cursor** tem roteamento de modelos embutido (sem OpenRouter) no plano Pro/Max:

| Modo/Modelo | Característica | Quando usar |

## Exemplo

```text
Job: 100 resumos/dia no Opus = R$X/mês → executor DeepSeek Flash + verifier Sonnet 25%
Valida nota do barato antes de escalar; métrica = custo-por-tarefa, não $/token
Caveat: testa o loop no OpenRouter antes (tool-use pode quebrar fora da Anthropic)
```
|---|---|---|

Attribution

majinmagrosmajinmagros
View sourceMore from majinmagros →
SSkills DirectorySkills Directory

Ship a skill? Prove it's safe.

Free 120-pattern security scan, letter grade, and an embeddable README badge.

Submit a skill

Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.

Comments (0)

No comments yet. Be the first to comment!

SSkills DirectorySkills Directory

Ship a skill? Prove it's safe.

Free 120-pattern security scan, letter grade, and an embeddable README badge.

Submit a skill

Related Skills

Caveman

Ultra-compressed communication mode. Cuts token usage ~75% by speaking like caveman while keeping full technical accuracy. Supports intensity levels: lite, full (default), ultra, wenyan-lite, wenyan-full, wenyan-ultra. Use when user says "caveman mode", "talk like caveman", "use caveman", "less tokens", "be brief", or invokes /caveman. Also auto-triggers when token efficiency is requested.

1023331 votes

Hyperplan

Adversarial multi-agent planning skill. Self-orchestrates 5 hostile category members (unspecified-low, unspecified-high, deep, ultrabrain, artistry) via team-mode for ruthless cross-critique debate, distills only the defensible insights, then MANDATORILY hands the distilled insight bundle to the `plan` agent for executable plan formalization. Use when planning needs maximum rigor and surfacing of weak assumptions, blind spots, and over-engineering. Triggers: 'hyperplan', 'hpp', '/hyperplan', ...

686011 votes

Mcp Code Execution

Routes multi-tool workflows through MCP servers for large datasets and pipelines. Use when Bash tool overhead is limiting throughput on data-heavy tasks.

3331 votes

catchup

Recovers prior coding-agent session context by running `catchup <agent> --since-compact`, which extracts a clean summary of a previous Codex, Claude Code, Antigravity, OpenCode, or Pi Agent session. Use when the user says "catch up", "what did the last session do", "get me up to speed", "I switched agents", or asks to recover/summarize a previous session before continuing. Do NOT use for the current conversation, git history, or any non-agent log.

611 votes

math-skill

A comprehensive mathematical reasoning skill for AI assistants — handles arithmetic to research-level problems with rigorous step-by-step reasoning, systematic verification, and transparent uncertainty handling

381 votes
View all in ai-agents →