Murad Library
Murad LibraryREF-0558MD

Como montar um PC doméstico de alto desempenho para rodar LLMs localmente

Catalogued
Reading
16 min read

Esta pesquisa é para quem quer montar, em casa, uma máquina realmente forte para executar modelos de linguagem localmente, com privacidade e sem depender de uma API por requisição. O foco é inferência de modelos quantizados, incluindo chat, agentes, RAG, programação e experimentos de fine-tuning. Treinar um modelo de fronteira do zero é outra categoria de orçamento e não é um objetivo realista para um único PC doméstico.

Resumo executivo

  • Para LLMs, VRAM é o primeiro critério. Uma GPU rápida com pouca memória pode ser menos útil que uma GPU um pouco mais lenta com capacidade suficiente para o modelo.
  • A escolha mais simples e compatível continua sendo NVIDIA por causa de CUDA, PyTorch, llama.cpp, vLLM, Ollama e da maior quantidade de tutoriais.
  • A configuração doméstica de topo em 2026 é uma RTX 5090 de 32 GB, mas ela exige gabinete grande, fonte ATX 3.1 de alta potência, boa ventilação e orçamento muito elevado.
  • O melhor custo/capacidade costuma estar em uma RTX 3090 usada de 24 GB, desde que a placa seja testada e o consumo/temperatura sejam aceitáveis.
  • Para modelos de 70B em 4-bit, planeje aproximadamente 48 GB de VRAM útil, mais memória para o contexto. Uma única placa de 24 ou 32 GB não é suficiente sem offload para RAM.
  • O ponto de equilíbrio recomendado para um primeiro PC sério é 128 GB de RAM, SSD NVMe de 2 TB e uma GPU NVIDIA com pelo menos 24 GB. A CPU precisa ser boa, mas não deve consumir o orçamento que deveria ir para a GPU.

Metodologia e limites

Foram cruzadas especificações de fabricantes, documentação dos runtimes e preços observados no varejo brasileiro em 7 de setembro de 2026. Preços são fotografias de mercado, não promessa de estoque: variam por loja, modelo, garantia, importação e câmbio. Desempenho em tokens por segundo depende do modelo, quantização, contexto, backend, temperatura e número de usuários; as faixas abaixo são orientação de planejamento, não benchmark universal.

1. Quanto de memória um modelo precisa

Uma aproximação útil é:

memória dos pesos ≈ parâmetros × bytes por parâmetro
memória total ≈ pesos + KV cache + runtime + contexto + margem

Em 4-bit, um modelo de 7B não ocupa exatamente 3,5 GB: metadados, escalas, buffers e o KV cache elevam o uso real. Para escolher uma GPU, deixe pelo menos 10–20% de folga.

Tamanho do modelo4-bit: pesos e overhead típicoGPU recomendadaUso provável
3B–8B4–7 GB8–12 GBassistente rápido, notebook, código básico
12B–16B8–12 GB16 GBótimo primeiro modelo, programação e RAG
27B–34B18–25 GB24–32 GBraciocínio/código mais fortes
70B–72B40–50 GB48 GB ou duas GPUsqualidade alta, agentes e programação
100B–120B65–85 GB96 GB ou várias GPUsexperimento avançado, baixa velocidade fora de workstation

Contexto grande pode adicionar muitos gigabytes de KV cache. Uma janela de 128k tokens não é “grátis”: quantização do KV, contexto efetivamente usado e arquitetura do modelo mudam o resultado. Para uso doméstico, comece com 8k–32k e aumente medindo.

2. GPUs candidatas

GPUVRAMConsumo de referênciaOnde faz sentidoObservações
NVIDIA RTX 509032 GB GDDR7cerca de 575 W, conforme o modelotopo doméstico, 30B–40B quantizados, geração rápidamaior desempenho GeForce, muito cara e exigente em fonte/fluxo de ar
NVIDIA RTX 409024 GB GDDR6X450 Wexcelente desempenho de inferência e jogosainda muito rápida, mas 24 GB limita 70B sem segunda GPU/offload
NVIDIA RTX 3090/3090 Ti24 GB GDDR6X350/450 Wmelhor capacidade por real no usadocalor, idade, garantia e desgaste precisam ser verificados
NVIDIA RTX 5070 Ti16 GB GDDR7fabricante/AIB12B–16B, uso misto e menor consumo que 509016 GB é limite claro para modelos maiores
NVIDIA RTX 4070 Ti Super16 GB GDDR6X285 WPC mais eficiente, 7B–16Bboa eficiência, mas não substitui 24 GB
NVIDIA RTX 5060 Ti 16 GB16 GB GDDR7classe intermediáriaentrada racional para modelos menoresvelocidade menor; prefira 16 GB à versão de 8 GB para LLM
NVIDIA RTX PRO 5000 Blackwell48 ou 72 GB ECCcerca de 300 Wworkstation profissional, 70B em uma placapreço e disponibilidade são de workstation, não de gamer
NVIDIA RTX PRO 6000 Blackwell96 GB GDDR7 ECC600 Wmáxima capacidade em uma GPU de desktoptecnicamente excelente, financeiramente difícil de justificar em casa
AMD Radeon RX 7900 XTX24 GB GDDR6355 Walternativa com muita VRAM e Linux/ROCmROCm melhorou, mas CUDA ainda oferece menos atrito e mais compatibilidade

O que a tabela não mostra

Memória não é o mesmo que velocidade. Duas RTX 3090 podem acomodar um modelo de 70B, mas a comunicação entre placas, barramento PCIe, quantização e backend determinam a velocidade. Em llama.cpp, dividir camadas entre GPUs é viável; em outros runtimes, suporte multi-GPU pode ser mais trabalhoso. Não compre duas placas sem conferir espaço físico, linhas PCIe, refrigeração e fonte.

Minha leitura das principais opções

RTX 5090 32 GB: é a escolha de desempenho para quem quer o melhor PC doméstico sem entrar em placas profissionais. A página oficial da NVIDIA confirma 32 GB GDDR7 na Founders Edition. No mercado brasileiro foram observadas cotações muito discrepantes, aproximadamente de R$ 22 mil a R$ 34 mil em modelos parceiros; confirme estoque, garantia e preço à vista antes de decidir.

RTX 4090 24 GB: continua sendo uma excelente placa para tokens/s, geração de imagens e jogos, mas uma 5090 oferece mais capacidade. Só faz sentido pagar preço de 4090 perto de uma 5090 quando a disponibilidade ou o consumo forem decisivos.

RTX 3090 usada: é a escolha de capacidade por custo. Teste memória, artefatos, ventiladores, hotspot e estabilidade por várias horas. Duas placas de 24 GB formam uma plataforma interessante para 70B, porém podem consumir mais de 700 W só em GPU.

RX 7900 XTX: seus 24 GB são atraentes e a AMD documenta suporte a Linux/Ubuntu e ROCm. Para quem quer a menor fricção com softwares prontos, a NVIDIA ainda é a recomendação; para quem aceita configurar ROCm e verificar compatibilidade do projeto, a Radeon é uma alternativa legítima.

RTX PRO 5000/6000: resolvem o problema de capacidade em uma placa e trazem ECC, mas o preço, o consumo e a disponibilidade tornam essas opções adequadas a um orçamento profissional. Não são “melhor custo-benefício” para um hobby doméstico.

3. Configurações recomendadas

A. Equilíbrio sério: 24 GB

  • GPU: RTX 3090 usada em bom estado ou RTX 4090 conforme o preço.
  • CPU: Ryzen 9 7900/9900 ou Core equivalente; não é necessário comprar o topo para inferência.
  • RAM: 128 GB DDR5 (2×64 GB), com placa-mãe que aceite expansão.
  • Armazenamento: NVMe PCIe 4.0 de 2 TB; segundo SSD para modelos é conveniente.
  • Fonte: 1000–1200 W de boa qualidade, ATX 3.0/3.1, cabos nativos para a GPU.
  • Uso: 7B–34B em uma placa; 70B com offload ou duas GPUs.

É a configuração que eu recomendaria para a maioria dos entusiastas: muito mais capacidade que uma máquina gamer comum, sem entrar no custo extremo da 5090.

B. Topo doméstico: RTX 5090

  • GPU: RTX 5090 32 GB.
  • CPU: Ryzen 9 9950X/9950X3D ou Core Ultra 9 atual; escolha pelo preço, refrigeração e tarefas secundárias.
  • RAM: 128 GB DDR5; 192/256 GB se pretende fazer offload de modelos grandes ou executar muitos serviços.
  • Placa-mãe: dois slots físicos bem espaçados, BIOS atualizada e suporte à quantidade de RAM escolhida.
  • Fonte: 1200 W de alta qualidade como ponto de partida; confira a recomendação do fabricante da placa parceira. Para segunda GPU, dimensione 1600 W ou mais após calcular picos reais.
  • Gabinete: grande, com entrada frontal e exaustão traseira/superior; confirme comprimento, espessura e raio de curvatura do cabo de alimentação.
  • Uso: modelos de 30B–40B quantizados com boa velocidade; modelos maiores com offload.

Não compre uma 5090 para depois economizar em fonte, gabinete ou refrigeração. O ganho de desempenho desaparece se a placa reduzir clock por temperatura ou se a máquina reiniciar sob carga.

C. Capacidade máxima por real: duas RTX 3090

  • Duas RTX 3090 de 24 GB, preferencialmente com procedência e testes.
  • CPU com muitas linhas PCIe e placa-mãe que mantenha os dois slots utilizáveis.
  • 128–256 GB de RAM.
  • Fonte de 1600 W de marca confiável, ou cálculo profissional equivalente.
  • Gabinete de workstation; duas placas próximas podem sufocar a superior.

É uma solução de capacidade, não de simplicidade. Os 48 GB não se comportam exatamente como uma única GPU de 48 GB, e nem todo programa distribui o modelo igualmente. Para hobby e llama.cpp, pode ser excelente; para operação sem manutenção, uma placa profissional de 48/72/96 GB é mais limpa, porém muito mais cara.

D. Entrada eficiente: 16 GB

  • GPU: RTX 5070 Ti, RTX 4070 Ti Super ou RTX 5060 Ti 16 GB.
  • RAM: 64 GB, idealmente 128 GB se o orçamento permitir.
  • CPU: Ryzen 7/Core 7 moderno.
  • Fonte: 750–850 W, de acordo com a GPU.
  • Uso: 7B–16B quantizados, embeddings, RAG, transcrição e ferramentas auxiliares.

Não é um “PC para qualquer LLM”, mas é uma máquina boa para aprender. Evite 8 GB se a intenção já é executar modelos locais: a diferença de preço para 16 GB costuma comprar muitos meses de vida útil.

4. CPU, RAM, placa-mãe, armazenamento e refrigeração

CPU

Inferência majoritariamente na GPU não exige o maior número de núcleos. Priorize, nesta ordem: GPU/VRAM, RAM, fonte e refrigeração. Ryzen 9 9950X/9950X3D e Intel Core Ultra 9 são opções fortes para uma máquina híbrida de LLM, compilação e jogos; Ryzen 7 ou Core 7 bastam quando o orçamento vai para uma GPU melhor. CPU forte ajuda no pré-processamento, embeddings, compressão, compilação e offload, mas não transforma uma GPU de 16 GB em uma de 32 GB.

Memória RAM

  • 64 GB: mínimo confortável para uma GPU de 16–24 GB.
  • 128 GB: recomendação principal para um PC sério.
  • 192/256 GB: útil para offload de 70B+, múltiplos modelos, bancos vetoriais e containers.

Em DDR5, dois módulos grandes normalmente oferecem melhor estabilidade que quatro módulos. Verifique a lista de memória da placa-mãe, atualize o BIOS e teste com MemTest86 ou ferramenta equivalente antes de confiar em cargas longas.

Placa-mãe e PCIe

Escolha pelo espaçamento físico e pelas linhas disponíveis, não pelo nome “gaming”. Para duas GPUs, confirme no manual se os dois slots operam em x8/x8 e se M.2, SATA ou USB não desabilitam o segundo slot. Muitas placas com dois conectores têm espaço insuficiente para placas de três ou quatro slots.

SSD

Comece com NVMe de 2 TB. Modelos ocupam dezenas ou centenas de gigabytes quando se acumulam quantizações, caches e versões. Um segundo SSD dedicado aos modelos facilita reinstalação do sistema. SSD PCIe 4.0 costuma ser o ponto de equilíbrio; Gen5 traz mais calor e raramente muda a velocidade de geração depois que o modelo está carregado na VRAM.

Fonte e refrigeração

Use fonte de marca reconhecida, padrão ATX 3.0/3.1, conectores nativos 12V-2x6/12VHPWR quando exigidos e margem para picos. Não use adaptadores baratos ou cabos modulares de outra fonte. Para GPU de 450–600 W, fluxo de ar é parte do orçamento: duas ventoinhas frontais, exaustão traseira/superior e filtros limpos. Monitore temperatura da GPU, hotspot, memória e estabilidade durante uma carga de várias horas.

5. Software para começar

Sistema operacional

Linux (Debian/Ubuntu, Fedora ou Arch/Omarchy) tende a oferecer o caminho mais previsível para CUDA, ROCm, Docker, systemd e serviços headless. Windows 11 com WSL2 funciona e pode ser conveniente para jogos, mas adiciona uma camada de diagnóstico. Para um servidor doméstico, eu usaria Linux nativo e acessaria a interface pelo navegador.

Runtimes e interfaces

FerramentaMelhor usoObservação
llama.cppcontrole, GGUF, CPU/GPU, multi-GPUexcelente para entender camadas, quantização e offload
Ollamacomeçar rápido e expor API localsimples; verifique onde os modelos são armazenados
Open WebUIinterface web, usuários e conexão com Ollama/llama.cppbom front-end para casa e pequena equipe
LM Studiodesktop com GUIconveniente no Windows/macOS/Linux, menos ideal como daemon
vLLMservidor de inferência e múltiplos usuáriosmais exigente; excelente quando throughput importa
SGLangserving e experimentação avançadaconfira suporte ao modelo e à GPU escolhidos
text-generation-webuilaboratório de backends e extensõesflexível, mas requer mais decisões

Instale primeiro um runtime, carregue um único modelo conhecido e meça. Não instale cinco stacks CUDA diferentes no mesmo ambiente sem isolamento. Docker ajuda a fixar versões, mas a imagem precisa combinar driver do host, CUDA/ROCm e arquitetura da GPU.

6. Estimativas de desempenho

Não use uma tabela de tokens/s da internet como promessa. Uma RTX 5090 pode ser várias vezes mais rápida que uma 3090 em alguns kernels, mas um modelo maior, contexto longo ou multi-GPU muda completamente o resultado. Meça com o modelo que realmente pretende usar:

llama-bench -m modelo.gguf -ngl 999 -p 512 -n 128

Registre modelo, quantização, contexto, batch, temperatura, versão do driver e temperatura da GPU. Para chat interativo, latência do primeiro token e tokens/s durante a resposta importam mais que pico sintético. Para muitos usuários, throughput total e fila importam mais que a velocidade de uma única conversa.

7. Custo e realidade do mercado brasileiro

Em setembro de 2026, cotações observadas para RTX 5090 variaram aproximadamente de R$ 22.300 a R$ 34.000 conforme loja e modelo. Módulos DDR5 de 64 GB e SSDs também apresentaram variações muito grandes; não monte um orçamento usando preços de lançamento ou anúncios sem estoque confirmado. Some:

  • GPU e garantia;
  • CPU, placa-mãe e 128 GB de RAM;
  • fonte ATX 3.1 e cabos;
  • gabinete e ventoinhas;
  • dois SSDs se a máquina for servidor;
  • nobreak ou proteção elétrica;
  • eletricidade: uma GPU de 575 W em carga contínua consome muito mais que um desktop comum.

Uma máquina 5090 completa pode passar facilmente de R$ 35–45 mil no Brasil. Duas 3090 podem custar menos por gigabyte de VRAM, mas aumentam ruído, calor, risco e consumo. Uma workstation RTX PRO de 96 GB é tecnicamente a solução mais limpa para modelos grandes em uma placa, porém seu preço deve ser comparado com uma VPS/cloud de GPU antes da compra.

8. Segurança e operação doméstica

  • Não exponha Ollama, Open WebUI ou vLLM diretamente à internet sem autenticação, TLS e controle de rede.
  • Faça bind em localhost ou na interface da LAN/Tailscale; firewall deve bloquear portas de administração.
  • Separe modelos baixados de fontes não verificadas. Prefira Hugging Face do autor e confira o repositório original.
  • Lembre que prompts, documentos de RAG e históricos podem conter dados pessoais.
  • Monitore temperatura, consumo, disco cheio e memória; um modelo travado pode deixar um serviço sem resposta.
  • Use containers/ambientes separados quando testar drivers, quantizações ou plugins.
  • Faça backup das configurações, prompts, índices vetoriais e modelos finamente ajustados. Rebaixar o modelo é mais fácil que reconstruir o trabalho.

9. Recomendação final por perfil

PerfilConfiguração que faz mais sentido
Quero aprender gastando menosGPU NVIDIA 16 GB, 64–128 GB RAM, Linux, Ollama + Open WebUI
Quero qualidade/capacidade equilibradaRTX 3090 usada testada, 128 GB RAM, fonte 1000–1200 W
Quero a máquina doméstica mais rápidaRTX 5090 32 GB, 128 GB RAM, fonte 1200 W+, gabinete grande
Quero 70B sem depender de offload48 GB reais: duas 3090 bem montadas ou RTX PRO 5000/6000
Quero máxima capacidade em uma placaRTX PRO 6000 Blackwell 96 GB, workstation profissional
Quero baixo consumo e Linux abertoRX 7900 XTX 24 GB, somente após verificar ROCm e o runtime escolhido
Quero servir vários usuáriosNVIDIA, 24–32 GB ou mais, vLLM/SGLang, 128–256 GB RAM e métricas

Conclusão

Para um PC doméstico “top” de LLM, eu montaria uma plataforma Linux com 128 GB de RAM, dois NVMe de 2 TB, CPU Ryzen 9 ou Core Ultra 9, fonte ATX 3.1 de qualidade e uma RTX 5090 de 32 GB. Se o orçamento não comportar a 5090, a alternativa mais racional é uma RTX 3090 usada de 24 GB cuidadosamente testada, não uma placa nova de 8 GB. Se o objetivo principal for rodar 70B com folga, pule diretamente para 48 GB ou 96 GB de VRAM e aceite o custo de workstation/multi-GPU.

A decisão deve começar pelo modelo que você quer executar, sua quantização e o contexto desejado. Depois dimensione VRAM, RAM, fonte, PCIe e refrigeração. Comprar CPU cara e uma GPU pequena produz um computador excelente para tarefas gerais, mas não o PC de LLM que você pediu.

Fontes consultadas


Nota sobre atualidade

Pesquisa concluída em 7 de setembro de 2026. Especificações de fabricantes, drivers, suporte de runtimes, disponibilidade e preços brasileiros mudam rapidamente. Confirme a ficha técnica do modelo exato, a garantia e a compatibilidade do runtime antes de comprar.

Did this resonate?

Related documents