Esta pesquisa é para quem quer montar, em casa, uma máquina realmente forte para executar modelos de linguagem localmente, com privacidade e sem depender de uma API por requisição. O foco é inferência de modelos quantizados, incluindo chat, agentes, RAG, programação e experimentos de fine-tuning. Treinar um modelo de fronteira do zero é outra categoria de orçamento e não é um objetivo realista para um único PC doméstico.
Resumo executivo
- Para LLMs, VRAM é o primeiro critério. Uma GPU rápida com pouca memória pode ser menos útil que uma GPU um pouco mais lenta com capacidade suficiente para o modelo.
- A escolha mais simples e compatível continua sendo NVIDIA por causa de CUDA, PyTorch, llama.cpp, vLLM, Ollama e da maior quantidade de tutoriais.
- A configuração doméstica de topo em 2026 é uma RTX 5090 de 32 GB, mas ela exige gabinete grande, fonte ATX 3.1 de alta potência, boa ventilação e orçamento muito elevado.
- O melhor custo/capacidade costuma estar em uma RTX 3090 usada de 24 GB, desde que a placa seja testada e o consumo/temperatura sejam aceitáveis.
- Para modelos de 70B em 4-bit, planeje aproximadamente 48 GB de VRAM útil, mais memória para o contexto. Uma única placa de 24 ou 32 GB não é suficiente sem offload para RAM.
- O ponto de equilíbrio recomendado para um primeiro PC sério é 128 GB de RAM, SSD NVMe de 2 TB e uma GPU NVIDIA com pelo menos 24 GB. A CPU precisa ser boa, mas não deve consumir o orçamento que deveria ir para a GPU.
Metodologia e limites
Foram cruzadas especificações de fabricantes, documentação dos runtimes e preços observados no varejo brasileiro em 7 de setembro de 2026. Preços são fotografias de mercado, não promessa de estoque: variam por loja, modelo, garantia, importação e câmbio. Desempenho em tokens por segundo depende do modelo, quantização, contexto, backend, temperatura e número de usuários; as faixas abaixo são orientação de planejamento, não benchmark universal.
1. Quanto de memória um modelo precisa
Uma aproximação útil é:
memória dos pesos ≈ parâmetros × bytes por parâmetro
memória total ≈ pesos + KV cache + runtime + contexto + margem
Em 4-bit, um modelo de 7B não ocupa exatamente 3,5 GB: metadados, escalas, buffers e o KV cache elevam o uso real. Para escolher uma GPU, deixe pelo menos 10–20% de folga.
| Tamanho do modelo | 4-bit: pesos e overhead típico | GPU recomendada | Uso provável |
|---|---|---|---|
| 3B–8B | 4–7 GB | 8–12 GB | assistente rápido, notebook, código básico |
| 12B–16B | 8–12 GB | 16 GB | ótimo primeiro modelo, programação e RAG |
| 27B–34B | 18–25 GB | 24–32 GB | raciocínio/código mais fortes |
| 70B–72B | 40–50 GB | 48 GB ou duas GPUs | qualidade alta, agentes e programação |
| 100B–120B | 65–85 GB | 96 GB ou várias GPUs | experimento avançado, baixa velocidade fora de workstation |
Contexto grande pode adicionar muitos gigabytes de KV cache. Uma janela de 128k tokens não é “grátis”: quantização do KV, contexto efetivamente usado e arquitetura do modelo mudam o resultado. Para uso doméstico, comece com 8k–32k e aumente medindo.
2. GPUs candidatas
| GPU | VRAM | Consumo de referência | Onde faz sentido | Observações |
|---|---|---|---|---|
| NVIDIA RTX 5090 | 32 GB GDDR7 | cerca de 575 W, conforme o modelo | topo doméstico, 30B–40B quantizados, geração rápida | maior desempenho GeForce, muito cara e exigente em fonte/fluxo de ar |
| NVIDIA RTX 4090 | 24 GB GDDR6X | 450 W | excelente desempenho de inferência e jogos | ainda muito rápida, mas 24 GB limita 70B sem segunda GPU/offload |
| NVIDIA RTX 3090/3090 Ti | 24 GB GDDR6X | 350/450 W | melhor capacidade por real no usado | calor, idade, garantia e desgaste precisam ser verificados |
| NVIDIA RTX 5070 Ti | 16 GB GDDR7 | fabricante/AIB | 12B–16B, uso misto e menor consumo que 5090 | 16 GB é limite claro para modelos maiores |
| NVIDIA RTX 4070 Ti Super | 16 GB GDDR6X | 285 W | PC mais eficiente, 7B–16B | boa eficiência, mas não substitui 24 GB |
| NVIDIA RTX 5060 Ti 16 GB | 16 GB GDDR7 | classe intermediária | entrada racional para modelos menores | velocidade menor; prefira 16 GB à versão de 8 GB para LLM |
| NVIDIA RTX PRO 5000 Blackwell | 48 ou 72 GB ECC | cerca de 300 W | workstation profissional, 70B em uma placa | preço e disponibilidade são de workstation, não de gamer |
| NVIDIA RTX PRO 6000 Blackwell | 96 GB GDDR7 ECC | 600 W | máxima capacidade em uma GPU de desktop | tecnicamente excelente, financeiramente difícil de justificar em casa |
| AMD Radeon RX 7900 XTX | 24 GB GDDR6 | 355 W | alternativa com muita VRAM e Linux/ROCm | ROCm melhorou, mas CUDA ainda oferece menos atrito e mais compatibilidade |
O que a tabela não mostra
Memória não é o mesmo que velocidade. Duas RTX 3090 podem acomodar um modelo de 70B, mas a comunicação entre placas, barramento PCIe, quantização e backend determinam a velocidade. Em llama.cpp, dividir camadas entre GPUs é viável; em outros runtimes, suporte multi-GPU pode ser mais trabalhoso. Não compre duas placas sem conferir espaço físico, linhas PCIe, refrigeração e fonte.
Minha leitura das principais opções
RTX 5090 32 GB: é a escolha de desempenho para quem quer o melhor PC doméstico sem entrar em placas profissionais. A página oficial da NVIDIA confirma 32 GB GDDR7 na Founders Edition. No mercado brasileiro foram observadas cotações muito discrepantes, aproximadamente de R$ 22 mil a R$ 34 mil em modelos parceiros; confirme estoque, garantia e preço à vista antes de decidir.
RTX 4090 24 GB: continua sendo uma excelente placa para tokens/s, geração de imagens e jogos, mas uma 5090 oferece mais capacidade. Só faz sentido pagar preço de 4090 perto de uma 5090 quando a disponibilidade ou o consumo forem decisivos.
RTX 3090 usada: é a escolha de capacidade por custo. Teste memória, artefatos, ventiladores, hotspot e estabilidade por várias horas. Duas placas de 24 GB formam uma plataforma interessante para 70B, porém podem consumir mais de 700 W só em GPU.
RX 7900 XTX: seus 24 GB são atraentes e a AMD documenta suporte a Linux/Ubuntu e ROCm. Para quem quer a menor fricção com softwares prontos, a NVIDIA ainda é a recomendação; para quem aceita configurar ROCm e verificar compatibilidade do projeto, a Radeon é uma alternativa legítima.
RTX PRO 5000/6000: resolvem o problema de capacidade em uma placa e trazem ECC, mas o preço, o consumo e a disponibilidade tornam essas opções adequadas a um orçamento profissional. Não são “melhor custo-benefício” para um hobby doméstico.
3. Configurações recomendadas
A. Equilíbrio sério: 24 GB
- GPU: RTX 3090 usada em bom estado ou RTX 4090 conforme o preço.
- CPU: Ryzen 9 7900/9900 ou Core equivalente; não é necessário comprar o topo para inferência.
- RAM: 128 GB DDR5 (2×64 GB), com placa-mãe que aceite expansão.
- Armazenamento: NVMe PCIe 4.0 de 2 TB; segundo SSD para modelos é conveniente.
- Fonte: 1000–1200 W de boa qualidade, ATX 3.0/3.1, cabos nativos para a GPU.
- Uso: 7B–34B em uma placa; 70B com offload ou duas GPUs.
É a configuração que eu recomendaria para a maioria dos entusiastas: muito mais capacidade que uma máquina gamer comum, sem entrar no custo extremo da 5090.
B. Topo doméstico: RTX 5090
- GPU: RTX 5090 32 GB.
- CPU: Ryzen 9 9950X/9950X3D ou Core Ultra 9 atual; escolha pelo preço, refrigeração e tarefas secundárias.
- RAM: 128 GB DDR5; 192/256 GB se pretende fazer offload de modelos grandes ou executar muitos serviços.
- Placa-mãe: dois slots físicos bem espaçados, BIOS atualizada e suporte à quantidade de RAM escolhida.
- Fonte: 1200 W de alta qualidade como ponto de partida; confira a recomendação do fabricante da placa parceira. Para segunda GPU, dimensione 1600 W ou mais após calcular picos reais.
- Gabinete: grande, com entrada frontal e exaustão traseira/superior; confirme comprimento, espessura e raio de curvatura do cabo de alimentação.
- Uso: modelos de 30B–40B quantizados com boa velocidade; modelos maiores com offload.
Não compre uma 5090 para depois economizar em fonte, gabinete ou refrigeração. O ganho de desempenho desaparece se a placa reduzir clock por temperatura ou se a máquina reiniciar sob carga.
C. Capacidade máxima por real: duas RTX 3090
- Duas RTX 3090 de 24 GB, preferencialmente com procedência e testes.
- CPU com muitas linhas PCIe e placa-mãe que mantenha os dois slots utilizáveis.
- 128–256 GB de RAM.
- Fonte de 1600 W de marca confiável, ou cálculo profissional equivalente.
- Gabinete de workstation; duas placas próximas podem sufocar a superior.
É uma solução de capacidade, não de simplicidade. Os 48 GB não se comportam exatamente como uma única GPU de 48 GB, e nem todo programa distribui o modelo igualmente. Para hobby e llama.cpp, pode ser excelente; para operação sem manutenção, uma placa profissional de 48/72/96 GB é mais limpa, porém muito mais cara.
D. Entrada eficiente: 16 GB
- GPU: RTX 5070 Ti, RTX 4070 Ti Super ou RTX 5060 Ti 16 GB.
- RAM: 64 GB, idealmente 128 GB se o orçamento permitir.
- CPU: Ryzen 7/Core 7 moderno.
- Fonte: 750–850 W, de acordo com a GPU.
- Uso: 7B–16B quantizados, embeddings, RAG, transcrição e ferramentas auxiliares.
Não é um “PC para qualquer LLM”, mas é uma máquina boa para aprender. Evite 8 GB se a intenção já é executar modelos locais: a diferença de preço para 16 GB costuma comprar muitos meses de vida útil.
4. CPU, RAM, placa-mãe, armazenamento e refrigeração
CPU
Inferência majoritariamente na GPU não exige o maior número de núcleos. Priorize, nesta ordem: GPU/VRAM, RAM, fonte e refrigeração. Ryzen 9 9950X/9950X3D e Intel Core Ultra 9 são opções fortes para uma máquina híbrida de LLM, compilação e jogos; Ryzen 7 ou Core 7 bastam quando o orçamento vai para uma GPU melhor. CPU forte ajuda no pré-processamento, embeddings, compressão, compilação e offload, mas não transforma uma GPU de 16 GB em uma de 32 GB.
Memória RAM
- 64 GB: mínimo confortável para uma GPU de 16–24 GB.
- 128 GB: recomendação principal para um PC sério.
- 192/256 GB: útil para offload de 70B+, múltiplos modelos, bancos vetoriais e containers.
Em DDR5, dois módulos grandes normalmente oferecem melhor estabilidade que quatro módulos. Verifique a lista de memória da placa-mãe, atualize o BIOS e teste com MemTest86 ou ferramenta equivalente antes de confiar em cargas longas.
Placa-mãe e PCIe
Escolha pelo espaçamento físico e pelas linhas disponíveis, não pelo nome “gaming”. Para duas GPUs, confirme no manual se os dois slots operam em x8/x8 e se M.2, SATA ou USB não desabilitam o segundo slot. Muitas placas com dois conectores têm espaço insuficiente para placas de três ou quatro slots.
SSD
Comece com NVMe de 2 TB. Modelos ocupam dezenas ou centenas de gigabytes quando se acumulam quantizações, caches e versões. Um segundo SSD dedicado aos modelos facilita reinstalação do sistema. SSD PCIe 4.0 costuma ser o ponto de equilíbrio; Gen5 traz mais calor e raramente muda a velocidade de geração depois que o modelo está carregado na VRAM.
Fonte e refrigeração
Use fonte de marca reconhecida, padrão ATX 3.0/3.1, conectores nativos 12V-2x6/12VHPWR quando exigidos e margem para picos. Não use adaptadores baratos ou cabos modulares de outra fonte. Para GPU de 450–600 W, fluxo de ar é parte do orçamento: duas ventoinhas frontais, exaustão traseira/superior e filtros limpos. Monitore temperatura da GPU, hotspot, memória e estabilidade durante uma carga de várias horas.
5. Software para começar
Sistema operacional
Linux (Debian/Ubuntu, Fedora ou Arch/Omarchy) tende a oferecer o caminho mais previsível para CUDA, ROCm, Docker, systemd e serviços headless. Windows 11 com WSL2 funciona e pode ser conveniente para jogos, mas adiciona uma camada de diagnóstico. Para um servidor doméstico, eu usaria Linux nativo e acessaria a interface pelo navegador.
Runtimes e interfaces
| Ferramenta | Melhor uso | Observação |
|---|---|---|
| llama.cpp | controle, GGUF, CPU/GPU, multi-GPU | excelente para entender camadas, quantização e offload |
| Ollama | começar rápido e expor API local | simples; verifique onde os modelos são armazenados |
| Open WebUI | interface web, usuários e conexão com Ollama/llama.cpp | bom front-end para casa e pequena equipe |
| LM Studio | desktop com GUI | conveniente no Windows/macOS/Linux, menos ideal como daemon |
| vLLM | servidor de inferência e múltiplos usuários | mais exigente; excelente quando throughput importa |
| SGLang | serving e experimentação avançada | confira suporte ao modelo e à GPU escolhidos |
| text-generation-webui | laboratório de backends e extensões | flexível, mas requer mais decisões |
Instale primeiro um runtime, carregue um único modelo conhecido e meça. Não instale cinco stacks CUDA diferentes no mesmo ambiente sem isolamento. Docker ajuda a fixar versões, mas a imagem precisa combinar driver do host, CUDA/ROCm e arquitetura da GPU.
6. Estimativas de desempenho
Não use uma tabela de tokens/s da internet como promessa. Uma RTX 5090 pode ser várias vezes mais rápida que uma 3090 em alguns kernels, mas um modelo maior, contexto longo ou multi-GPU muda completamente o resultado. Meça com o modelo que realmente pretende usar:
llama-bench -m modelo.gguf -ngl 999 -p 512 -n 128
Registre modelo, quantização, contexto, batch, temperatura, versão do driver e temperatura da GPU. Para chat interativo, latência do primeiro token e tokens/s durante a resposta importam mais que pico sintético. Para muitos usuários, throughput total e fila importam mais que a velocidade de uma única conversa.
7. Custo e realidade do mercado brasileiro
Em setembro de 2026, cotações observadas para RTX 5090 variaram aproximadamente de R$ 22.300 a R$ 34.000 conforme loja e modelo. Módulos DDR5 de 64 GB e SSDs também apresentaram variações muito grandes; não monte um orçamento usando preços de lançamento ou anúncios sem estoque confirmado. Some:
- GPU e garantia;
- CPU, placa-mãe e 128 GB de RAM;
- fonte ATX 3.1 e cabos;
- gabinete e ventoinhas;
- dois SSDs se a máquina for servidor;
- nobreak ou proteção elétrica;
- eletricidade: uma GPU de 575 W em carga contínua consome muito mais que um desktop comum.
Uma máquina 5090 completa pode passar facilmente de R$ 35–45 mil no Brasil. Duas 3090 podem custar menos por gigabyte de VRAM, mas aumentam ruído, calor, risco e consumo. Uma workstation RTX PRO de 96 GB é tecnicamente a solução mais limpa para modelos grandes em uma placa, porém seu preço deve ser comparado com uma VPS/cloud de GPU antes da compra.
8. Segurança e operação doméstica
- Não exponha Ollama, Open WebUI ou vLLM diretamente à internet sem autenticação, TLS e controle de rede.
- Faça bind em localhost ou na interface da LAN/Tailscale; firewall deve bloquear portas de administração.
- Separe modelos baixados de fontes não verificadas. Prefira Hugging Face do autor e confira o repositório original.
- Lembre que prompts, documentos de RAG e históricos podem conter dados pessoais.
- Monitore temperatura, consumo, disco cheio e memória; um modelo travado pode deixar um serviço sem resposta.
- Use containers/ambientes separados quando testar drivers, quantizações ou plugins.
- Faça backup das configurações, prompts, índices vetoriais e modelos finamente ajustados. Rebaixar o modelo é mais fácil que reconstruir o trabalho.
9. Recomendação final por perfil
| Perfil | Configuração que faz mais sentido |
|---|---|
| Quero aprender gastando menos | GPU NVIDIA 16 GB, 64–128 GB RAM, Linux, Ollama + Open WebUI |
| Quero qualidade/capacidade equilibrada | RTX 3090 usada testada, 128 GB RAM, fonte 1000–1200 W |
| Quero a máquina doméstica mais rápida | RTX 5090 32 GB, 128 GB RAM, fonte 1200 W+, gabinete grande |
| Quero 70B sem depender de offload | 48 GB reais: duas 3090 bem montadas ou RTX PRO 5000/6000 |
| Quero máxima capacidade em uma placa | RTX PRO 6000 Blackwell 96 GB, workstation profissional |
| Quero baixo consumo e Linux aberto | RX 7900 XTX 24 GB, somente após verificar ROCm e o runtime escolhido |
| Quero servir vários usuários | NVIDIA, 24–32 GB ou mais, vLLM/SGLang, 128–256 GB RAM e métricas |
Conclusão
Para um PC doméstico “top” de LLM, eu montaria uma plataforma Linux com 128 GB de RAM, dois NVMe de 2 TB, CPU Ryzen 9 ou Core Ultra 9, fonte ATX 3.1 de qualidade e uma RTX 5090 de 32 GB. Se o orçamento não comportar a 5090, a alternativa mais racional é uma RTX 3090 usada de 24 GB cuidadosamente testada, não uma placa nova de 8 GB. Se o objetivo principal for rodar 70B com folga, pule diretamente para 48 GB ou 96 GB de VRAM e aceite o custo de workstation/multi-GPU.
A decisão deve começar pelo modelo que você quer executar, sua quantização e o contexto desejado. Depois dimensione VRAM, RAM, fonte, PCIe e refrigeração. Comprar CPU cara e uma GPU pequena produz um computador excelente para tarefas gerais, mas não o PC de LLM que você pediu.
Fontes consultadas
- NVIDIA GeForce RTX 5090: especificações oficiais
- NVIDIA GeForce RTX 4090: especificações
- NVIDIA RTX PRO 6000 Blackwell Workstation Edition
- AMD Radeon RX 7900 XTX: especificações
- AMD ROCm: especificações de GPUs
- llama.cpp no GitHub
- Ollama
- Open WebUI
- LM Studio
- vLLM
- SGLang
- NVIDIA CUDA Toolkit
- NVIDIA Container Toolkit
- AMD ROCm documentação
- Releases e preços observados no varejo: Terabyte
- Releases e preços observados no varejo: Pichau
Nota sobre atualidade
Pesquisa concluída em 7 de setembro de 2026. Especificações de fabricantes, drivers, suporte de runtimes, disponibilidade e preços brasileiros mudam rapidamente. Confirme a ficha técnica do modelo exato, a garantia e a compatibilidade do runtime antes de comprar.
Did this resonate?
Related documents
- 001
- 002
- 003
- 004
- 005