Use when choosing cheap models and routing them in agent loops — OpenRouter as provider in Claude Code, cost-per-task budgeting, using a low-cost model as executor while a strong model verifies, and when cheap+verifier loops become viable. Triggers on "rotear modelo barato", "OpenRouter no Claude Code", "custo por tarefa", "modelo barato pra loop", "DeepSeek", "huggingface barato".
Scanned 9/19/2026
Install to Claude Code
npx -y skills add majinmagros/magros.ai-skills --skill roteamento-modelos-baratos --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Roteamento Modelos Baratos?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/majinmagros-roteamento-modelos-baratos)More formats (shields.io, HTML) on the badges page.
---
name: roteamento-modelos-baratos
description: Use when choosing cheap models and routing them in agent loops — OpenRouter as provider in Claude Code, cost-per-task budgeting, using a low-cost model as executor while a strong model verifies, and when cheap+verifier loops become viable. Triggers on "rotear modelo barato", "OpenRouter no Claude Code", "custo por tarefa", "modelo barato pra loop", "DeepSeek", "huggingface barato".
metadata:
origin: ECC
---
# Skill: Roteamento de Modelos Baratos (custo-por-tarefa)
Padrões para usar modelos de baixo custo sem perder qualidade: quem gera em
volume é barato, quem decide/valida é forte. A métrica que importa é
**custo por tarefa concluída**, não preço por token no papel.
## Quando usar
- Loop de geração/verificação que hoje usa modelo caro em todo lugar.
- Escolher provedor/modelo para um job de volume.
- Calcular se um projeto (ex: gerar 100 candidatos) cabe no orçamento.
## Padrões
### 1. Executor barato + verificador forte
- Modelo barato gera candidatos em massa (DeepSeek V4 Flash e similares).
- Modelo forte verifica/rankeia — o custo é por verificação, não por geração.
- Sempre meça nota/qualidade do executor antes de confiar no volume.
### 2. OpenRouter (ou DeepSeek direto) no Claude Code
- Configure OpenRouter como provider (3 env vars: `ANTHROPIC_BASE_URL`,
`ANTHROPIC_AUTH_TOKEN`, `ANTHROPIC_MODEL`) e escolha modelos por custo/task.
- **Caveat oficial do OpenRouter**: o Claude Code "é garantido só com o
provedor first-party da Anthropic" e "é otimizado para modelos Anthropic e
pode não funcionar com outros provedores" (tool-use/parsing pode quebrar).
Teste o loop antes de depender.
- Alternativa sem agregador: a DeepSeek expõe endpoint Anthropic-compatível
direto (`https://api.deepseek.com/anthropic`) para o Claude Code.
- Para tarefas repetitivas e determinísticas, o barato resolve. Suba de modelo
só quando o verificador reprovar de forma consistente.
### 3. Custo-por-tarefa como métrica
- Preço/token é enganoso: tarefa fácil = poucos tokens no barato.
- Calcule: `custo = (tokens de entrada × preço entrada) + (tokens de saída × preço saída)` por execução, vezes o número de execuções.
- Compare o total do loop barato vs rodar tudo no caro uma vez.
### 4. Quando barato+verificador vira opção
- DeepSeek V4 Flash: preço vigente (16/08/2026+) tem **peak/off-peak** —
off-peak ~$0.22/M entrada e ~$0.66/M saída; peak ~$0.44/$1.32; cache-hit de
entrada bem mais barato (~$0.007–$0.014/M). O "14¢/M entrada" do anúncio era
o preço até 15/08/2026 — **sempre confira a página oficial de pricing**
(preços mudam com frequência).
- Regra prática: se o custo atual do job em modelo forte é alto, divida entre
geração barata + amostragem de verificação forte (20-30% do volume).
### 5. Stack em 3 tiers + pay-twice (Batch 17a, #50 #51)
- Organize modelos em 3 tiers (SOTA / workhorse / leve) num stack unico,
nao um modelo unico. Compare sempre com controles max (fronteira) e min
(local): modelo isolado sem controles nao diz nada.
- "Modelo melhor vs melhor negocio": GLM-5.2 ganha em capacidade,
MiniMax-M3 ganha em preco — a pergunta e capacidade maxima ou custo.
- Pay-twice: voce paga em dinheiro E no IP revelado nos prompts. Para
trabalho sensivel, o tier leve local zera a segunda conta — soberania
de dados entra no tradeoff junto com latencia, qualidade e custo.
### 6. DeepSeek V4 Flash 0731 (Batch 17f, #74)
Repost-train sem mudar o nome: bench 72.5% (King Bench), recorde em
questao 3D, agentic coding real; ~GLM 5.2 em capacidade, decide
preco/harness (no Command Code roda a $1 com tool-calls + cache
repairs). Regra: re-treinos mudam tudo sem mudar o nome — valide o
snapshot atual antes de fixar executor barato.
## Checklist
- [ ] Métrica definida é custo-por-tarefa, não preço/token.
- [ ] Verificador independente do gerador.
- [ ] Amostragem de verificação existe antes de escalar volume.
- [ ] OpenRouter configurado como provider (ou equivalente).
- [ ] Loop barato validado por nota antes de colocar em produção.
## Cursor Model Routing Nativo (enriquecimento 2026-08-20, video `7phrurXJwH8`)
O **Cursor** tem roteamento de modelos embutido (sem OpenRouter) no plano Pro/Max:
| Modo/Modelo | Característica | Quando usar |
## Exemplo
```text
Job: 100 resumos/dia no Opus = R$X/mês → executor DeepSeek Flash + verifier Sonnet 25%
Valida nota do barato antes de escalar; métrica = custo-por-tarefa, não $/token
Caveat: testa o loop no OpenRouter antes (tool-use pode quebrar fora da Anthropic)
```
|---|---|---|Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!