Run huge models locally via quantization (GGUF/GPTQ/AWQ). Use when 740B in 25GB (Colibri) or need 1000x cheaper local inference with llama.cpp/Ollama. Triggers on \"Colibri\", \"quantizacao\", \"GGUF\", \"local llm\", \"ollama\", \"vLLM local\"
Scanned 9/19/2026
Install to Claude Code
npx -y skills add majinmagros/magros.ai-skills --skill local-llm-efficiency --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Local Llm Efficiency?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/majinmagros-local-llm-efficiency)More formats (shields.io, HTML) on the badges page.
---
name: local-llm-efficiency
description: "Run huge models locally via quantization (GGUF/GPTQ/AWQ). Use when 740B in 25GB (Colibri) or need 1000x cheaper local inference with llama.cpp/Ollama. Triggers on \"Colibri\", \"quantizacao\", \"GGUF\", \"local llm\", \"ollama\", \"vLLM local\""
---
# Local LLM Efficiency — Colibri 740B@25GB
> Fonte: `Maestros da IA — 1p0HXLv_5wM` (PANIC, Colibri), transcript `1p0HXLv_5wM.pt.dedup.txt:40-120`
Cloud pay-to-play vs local 1000x cheaper, lento/experimental mas movimento open-source.
## Quando usar
- Rodar modelo gigante em consumer hardware (25-32GB RAM)
- Custo cloud inviável, precisa offline/grátis
- Validar claim 740B@25GB antes de comprar hardware
## Técnicas
| Método | Ferramenta | Trade-off |
|---|---|---|
| GGUF | llama.cpp, Ollama, LM Studio | CPU, lento, 100% offline |
| GPTQ/AWQ/EXL2 | AutoGPTQ, vLLM | GPU, mais rápido |
| Speculative decoding | vLLM | + velocidade |
## Workflow
1. Escolha modelo + quant (ex: `Q4_K_M` → 25GB)
2. `ollama run <model>:q4` ou `llama.cpp --model model.gguf`
3. Benchmark: tokens/s, RAM, qualidade vs cloud (use `agent-eval`)
4. Decida: cloud (veloz) vs local (barato) — veja `local-ai-hardware` para TCO
## Checklist
- [ ] Modelo + quant validados
- [ ] Benchmark local vs cloud
- [ ] Fonte primária Colibri verificada (anti-hallucination)
## Tese independencia (Batch 17a, #50 #53)
Nuvem = aluguel do modelo + entrega do seu IP (pay-twice); governo ou
vendor pode cortar seu acesso (caso Fable/export-ban). Local open source
= privacidade total, custo de eletricidade, controle e offline. Direcao:
velocidade, custo e memoria — quando o local ficar bom o bastante, a
vantagem da nuvem vira so conveniencia.
## Referências
## Exemplo
```text
Claim "740B em 25GB" → valida: Q4_K_M via Ollama/llama.cpp no hardware real
Benchmark: tokens/s + RAM + qualidade vs cloud (agent-eval); fonte Colibri checada
Resultado: lento mas 1000x mais barato → vale p/ lote offline, não p/ interativo
```
Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!