Calculadora de modelo de IA Local

Calculadora de modelo de IA Local

Calculadora de Hardware para IA Local

Dimensionamento em tempo real com dados da comunidade open-weight global.
Descubra em tempo real quais modelos em alta rodam suave na sua máquina sem travamentos.

Guia Rápido

Como Escolher o Modelo Certo para o Seu Setup

Rodar inteligência artificial localmente garante 100% de privacidade, zero censura e independência de assinaturas na nuvem. Entenda o que realmente dita o desempenho da sua máquina.

Por que a VRAM da GPU é muito mais rápida que a memória RAM?

A diferença brutal de velocidade entre a placa de vídeo e a memória convencional do PC resume-se a dois fatores de hardware: barramento e distância física:

  • Distância e Barramento da GPU: Os módulos de VRAM (GDDR6/GDDR6X) ficam colados a milímetros do chip da placa de vídeo, conectados por trilhas ultra curtas e barramentos largos (128 a 384 bits). Isso entrega transferências de 300 GB/s até mais de 1.000 GB/s.
  • O Gargalo da Memória RAM: Os pentes de RAM convencionais ficam distantes no soquete da placa-mãe, operando em canais mais estreitos (128-bit dual-channel). Módulos DDR4/DDR5 raramente passam de 40 a 80 GB/s. Como cada palavra (token) gerada exige reler bilhões de parâmetros inteiros na memória, passar essa montanha de dados pela placa-mãe vira um gargalo mecânico inevitável.
  • Resultado Prático: Quando o modelo cabe inteiro na VRAM, a geração voa a 30 a 60+ tokens/s. Se faltar espaço e ele transbordar para a RAM, a velocidade cai drasticamente.

O que são os formatos Q4, Q5 e Q8?

Modelos originais (FP16) são pesados demais para computadores comuns. A quantização compacta a precisão matemática das variáveis com perda quase imperceptível de inteligência:

  • Q4_K_M: O equilíbrio padrão. Reduz pela metade o uso de memória com 98% da inteligência original.
  • Q5_K_M / Q6_K: Mais fidelidade em lógica matemática e escrita refinada, com leve aumento de consumo.
  • Q8_0: Precisão máxima dos pesos abertos, indicada quando sobra espaço de VRAM.

E compressões extremas (Q1 a Q3) ou avançadas? Formatos muito baixos como Q2 e Q3 espremem modelos gigantes (como 70B) em hardware modesto, mas causam degradação perceptível de raciocínio. Métodos modernos de quantização como imatrix (importance matrix) e tecnologias recentes (como AWQ e EXL2) recuperam boa parte dessa perda ao identificar e preservar os neurônios mais críticos antes de comprimir o restante.

Referência Rápida de Memória

Tamanho do Modelo VRAM Mínima (Q4) Uso Recomendado
3B a 4B 3 GB a 4 GB Uso leve, tarefas rápidas, notebooks modestos ou CPU pura.
7B a 9B 6 GB a 8 GB Sweet spot gamer (placas de 8GB VRAM). Excelente raciocínio e redação geral.
12B a 14B 10 GB a 12 GB Programação complexa, retenção de janelas longas de contexto.
32B a 70B 20 GB a 24 GB+ Tier comercial (nível GPT-4). Requer RTX 3090/4090 ou Macs Apple Silicon.

Melhores programas para rodar seus modelos no Windows, Linux ou Mac:

P.S.: Conforme você se aprofundar, esses mesmos modelos locais podem ser integrados a agentes autônomos (sistemas capazes de navegar na web, executar código e orquestrar múltiplas tarefas em cadeia). É um território um pouco mais avançado, mas ter um LLM rodando na máquina é o ponto de partida essencial para isso.