Calculadora de Hardware para IA Local
Dimensionamento em tempo real com dados da comunidade open-weight global.
Descubra em tempo real quais modelos em alta rodam suave na sua máquina sem travamentos.
Como Escolher o Modelo Certo para o Seu Setup
Rodar inteligência artificial localmente garante 100% de privacidade, zero censura e independência de assinaturas na nuvem. Entenda o que realmente dita o desempenho da sua máquina.
Por que a VRAM da GPU é muito mais rápida que a memória RAM?
A diferença brutal de velocidade entre a placa de vídeo e a memória convencional do PC resume-se a dois fatores de hardware: barramento e distância física:
- Distância e Barramento da GPU: Os módulos de VRAM (GDDR6/GDDR6X) ficam colados a milímetros do chip da placa de vídeo, conectados por trilhas ultra curtas e barramentos largos (128 a 384 bits). Isso entrega transferências de 300 GB/s até mais de 1.000 GB/s.
- O Gargalo da Memória RAM: Os pentes de RAM convencionais ficam distantes no soquete da placa-mãe, operando em canais mais estreitos (128-bit dual-channel). Módulos DDR4/DDR5 raramente passam de 40 a 80 GB/s. Como cada palavra (token) gerada exige reler bilhões de parâmetros inteiros na memória, passar essa montanha de dados pela placa-mãe vira um gargalo mecânico inevitável.
- Resultado Prático: Quando o modelo cabe inteiro na VRAM, a geração voa a 30 a 60+ tokens/s. Se faltar espaço e ele transbordar para a RAM, a velocidade cai drasticamente.
O que são os formatos Q4, Q5 e Q8?
Modelos originais (FP16) são pesados demais para computadores comuns. A quantização compacta a precisão matemática das variáveis com perda quase imperceptível de inteligência:
- Q4_K_M: O equilíbrio padrão. Reduz pela metade o uso de memória com 98% da inteligência original.
- Q5_K_M / Q6_K: Mais fidelidade em lógica matemática e escrita refinada, com leve aumento de consumo.
- Q8_0: Precisão máxima dos pesos abertos, indicada quando sobra espaço de VRAM.
E compressões extremas (Q1 a Q3) ou avançadas? Formatos muito baixos como Q2 e Q3 espremem modelos gigantes (como 70B) em hardware modesto, mas causam degradação perceptível de raciocínio. Métodos modernos de quantização como imatrix (importance matrix) e tecnologias recentes (como AWQ e EXL2) recuperam boa parte dessa perda ao identificar e preservar os neurônios mais críticos antes de comprimir o restante.
Referência Rápida de Memória
| Tamanho do Modelo | VRAM Mínima (Q4) | Uso Recomendado |
|---|---|---|
| 3B a 4B | 3 GB a 4 GB | Uso leve, tarefas rápidas, notebooks modestos ou CPU pura. |
| 7B a 9B | 6 GB a 8 GB | Sweet spot gamer (placas de 8GB VRAM). Excelente raciocínio e redação geral. |
| 12B a 14B | 10 GB a 12 GB | Programação complexa, retenção de janelas longas de contexto. |
| 32B a 70B | 20 GB a 24 GB+ | Tier comercial (nível GPT-4). Requer RTX 3090/4090 ou Macs Apple Silicon. |
Melhores programas para rodar seus modelos no Windows, Linux ou Mac:
LM Studio
Interface gráfica moderna com busca e download de modelos direto do Hugging Face em um clique.
Recomendado p/ DevsOllama
Super leve, roda em segundo plano e expõe uma API local compatível com as rotas padrão da OpenAI.
P.S.: Conforme você se aprofundar, esses mesmos modelos locais podem ser integrados a agentes autônomos (sistemas capazes de navegar na web, executar código e orquestrar múltiplas tarefas em cadeia). É um território um pouco mais avançado, mas ter um LLM rodando na máquina é o ponto de partida essencial para isso.

