O roteiro se repete. O time monta a primeira máquina de inteligência artificial, escolhe a placa de vídeo para IA mais forte que o orçamento permitia e descobre na primeira semana que o modelo que motivou a compra não carrega. A mensagem de erro não fala de velocidade, fala de memória insuficiente. Em outros casos o modelo carrega, o ajuste fino começa e a conclusão é estimada em dias, porque a placa tem cálculo sobrando e banda curta. Existe ainda o inverso: uma placa de 48 GB para um trabalho que caberia em 24, ociosa quase todo o mês.
A alternativa que parece resolver tudo, alugar capacidade na nuvem, revela o próprio problema no terceiro mês: a conta cresce com o número de experimentos, ninguém prevê o valor do mês seguinte, e dado sensível sai do perímetro da instituição. Escolher a placa é decidir o que fica dentro de casa e com que teto de tamanho de modelo você vai conviver nos próximos três anos.
Este artigo trata só do critério de compra: a conta de memória, a tabela de decisão por faixa de trabalho e a faixa de investimento. Os recortes de uso têm endereço próprio: para dimensionar inferência, o guia de GPU para inferência de IA; para fluxo de análise de dados, o de GPU para data science.
A regra que decide quase tudo: o modelo precisa caber na memória
Antes de comparar especificação existe uma condição binária: ou os pesos cabem na memória da placa, ou o trabalho não acontece ali. Diferente de um render que fica lento quando falta memória, um modelo que não cabe não executa, ou usa memória do sistema e cai a uma fração da velocidade. A VRAM é o primeiro filtro da compra, e o desempenho bruto vem depois.
A conta é direta. Cada parâmetro ocupa bytes conforme a precisão de armazenamento: quatro em 32 bits, dois em 16 bits, um em 8 bits e cerca de meio byte em 4 bits. Sete bilhões de parâmetros em 16 bits ocupam aproximadamente 14 GB só de pesos, e caem para perto de 3,5 GB em 4 bits. Setenta bilhões pedem perto de 140 GB em 16 bits e cerca de 35 GB em 4 bits.
Sobre esse número soma-se a margem que quase todo mundo esquece: o cache de atenção cresce com o contexto e com as requisições simultâneas, e o ambiente reserva memória de trabalho. A documentação do PyTorch sobre semântica CUDA explica por que a memória vista pelo sistema excede a soma dos tensores ativos. Some 20% a 30% ao peso calculado.
O que a quantização muda, e o que ela custa
Reduzir a precisão de armazenamento é a alavanca mais eficiente para caber em uma placa menor: de 16 para 4 bits o espaço cai a um quarto e a geração acelera. O custo é perda de qualidade que varia por tarefa, quase imperceptível em conversação e mais visível em raciocínio encadeado e em código. A decisão é pagar em hardware ou em qualidade: quem precisa do comportamento original, para validar pesquisa ou entregar saída auditável, compra memória para rodar em 16 bits. O detalhamento por tamanho de modelo está no artigo sobre quanta VRAM para rodar LLM local.
Treino, ajuste fino e inferência pedem máquinas diferentes
O mesmo modelo exige memória muito diferente conforme o que você faz com ele, e confundir os três regimes gera a maior parte dos dimensionamentos errados. Na inferência a memória é próxima do peso do modelo mais o cache de contexto. No ajuste fino completo entram pesos, gradientes e estados do otimizador juntos: com um otimizador do tipo Adam em precisão mista a regra de bolso é cerca de 16 bytes por parâmetro, o que empurra sete bilhões para além de 100 GB.
Entre os extremos está o regime que sustenta a maior parte dos projetos de empresa e de universidade: o ajuste fino com adaptadores de baixa dimensão, que congela quase todos os pesos e treina só um conjunto pequeno de matrizes novas. O consumo fica próximo do da inferência, e sete a treze bilhões passam a caber em 24 GB. Treino a partir do zero é problema de várias placas ou de servidor dedicado, tratado no guia de workstation para inteligência artificial.
VRAM por faixa de trabalho
| VRAM | O que cabe com folga | Limite prático |
|---|---|---|
| 8 a 12 GB | Até 7 bilhões quantizados, visão computacional, imagem padrão | Contexto curto, sem ajuste fino |
| 16 GB | 7 a 13 bilhões quantizados, 7 bilhões em 16 bits | Adaptadores, lote pequeno |
| 24 GB | 13 bilhões em 16 bits, até 32 bilhões quantizados | 70 bilhões só em quantização agressiva |
| 32 a 48 GB | 32 bilhões em 16 bits, 70 quantizados, contexto longo | Treino completo fora de alcance |
| 80 GB ou mais | 70 bilhões em 16 bits, ajuste fino completo | Projeto de infraestrutura |
Banda de memória, o gargalo real na geração de texto
Na geração de texto, token por token, o processador gráfico lê os pesos relevantes da memória para produzir cada saída, e essa leitura é o que limita a velocidade. O trabalho aritmético é pequeno diante do volume movimentado, então a placa passa a maior parte do tempo esperando a memória: duas placas com cálculo parecido entregam velocidades bem diferentes quando a banda difere. Priorize a placa com mais banda por gigabyte e desconfie de muita memória sobre barramento estreito, combinação que carrega o modelo e não permite usá-lo com fluidez.
Precisão numérica e o suporte de hardware por geração
Formatos numéricos reduzidos são o que torna uma GPU para IA rápida, e o suporte a eles depende da geração da placa, não só da sua capacidade. A documentação da NVIDIA sobre treino em precisão mista descreve o mecanismo: metade dos bytes acessados significa metade do tempo nas camadas limitadas por memória, com uma cópia mestre dos pesos em precisão maior para preservar a estabilidade do treino. Gerações recentes trouxeram suporte nativo a formatos de 8 bits e, nas mais novas, de 4 bits.
Confirme antes da compra se a geração suporta o formato que sua biblioteca usa: uma placa anterior com memória generosa pode ser bom negócio para inferência e mau negócio para treino, porque perde esse atalho. No lado da AMD, a página de aceleração de IA das placas Radeon documenta a linha e a memória disponível, incluindo a variante profissional de 32 GB.
Linha profissional ou linha de consumo para IA
A comparação raramente é sobre velocidade e quase sempre sobre memória, confiabilidade e onde a máquina vai ficar. A linha voltada ao mercado doméstico tem a melhor relação entre cálculo e preço quando a máquina fica na mesa de um pesquisador. A profissional oferece mais memória por placa, correção de erro, drivers com validação estendida e consumo pensado para operação contínua, faixa que a NVIDIA documenta na página das GPUs profissionais de desktop, hoje de 16 GB até 96 GB.
| Critério | Linha de consumo | Linha profissional |
|---|---|---|
| Memória por placa | De 8 a 32 GB | De 16 a 96 GB |
| Correção de erro na memória | Não | Sim nos modelos superiores |
| Validação de driver | Ciclo curto | Ramo validado, suporte estendido |
| Formato e dissipação | Larga, ar solto no gabinete | Compacta, fluxo direcionado |
| Uso em servidor | Restrito pelos termos do fabricante | Previsto em contrato |
O que costuma decidir não é técnico, é contratual e operacional: se a máquina vai para um rack ou vai atender vários usuários, os termos de licenciamento e o formato físico passam a mandar. Se é individual e a carga é experimentação, a linha de consumo entrega mais trabalho por real investido. O critério transversal está no guia de placa de vídeo para workstation.
Mais de uma placa: o que escalona e o que não escalona
A pergunta mais frequente sobre duas ou quatro placas tem resposta que decepciona: a memória não soma. Duas placas de 24 GB não formam uma de 48 GB para um modelo único de 40 GB. Dividir o modelo entre placas é possível, técnica conhecida como paralelismo de modelo, mas a banda da comunicação entre elas é uma ordem de magnitude menor que a da memória interna de cada uma. Sem ponte de interligação dedicada, que as gerações recentes de placa de estação de trabalho deixaram de trazer, a troca passa pelo barramento PCIe e o ganho encolhe.
O que escalona bem é trabalho paralelo independente: lotes diferentes do mesmo treino, experimentos simultâneos ou requisições distintas com uma cópia do modelo por placa. Em troca, a exigência sobre o resto do computador para IA cresce: linhas de PCIe para cada placa, espaçamento real entre os encaixes, fonte com margem sobre a soma dos picos e fluxo de ar para várias placas quentes por horas.
Workstation local ou nuvem
A comparação honesta não é sobre qual é mais barato, é sobre que tipo de custo você quer ter. Capacidade alugada serve a pico ocasional e treino pontual: você paga pelas horas e não imobiliza capital. Máquina própria ganha quando a utilização é alta e contínua: o custo é conhecido antes de acontecer e não cresce quando o time faz mais experimentos. O segundo argumento pesa em setor público, saúde, jurídico e pesquisa com dado sensível, porque o processamento local mantém o dado no perímetro da instituição. Na maioria dos casos que a Zenion atende o desenho é híbrido: máquina local para o dia a dia e capacidade alugada para o treino grande de duas ou três vezes por ano.
Tabela de decisão: qual placa de vídeo para IA comprar
| Faixa de trabalho | VRAM alvo | Classe de placa | O que dá para fazer | Investimento na placa |
|---|---|---|---|---|
| Experimentação e aprendizado | 12 a 16 GB | Consumo intermediária | Até 13 bilhões quantizados, geração de imagem, prova de conceito | R$ 2.500 a R$ 8.000 |
| Ajuste fino de modelo médio | 24 GB | Topo de consumo ou entrada profissional | Adaptadores em 7 a 13 bilhões, 16 bits, contexto longo | R$ 9.000 a R$ 20.000 |
| Treino sério ou modelo grande local | 32 a 48 GB | Profissional de estação de trabalho | 32 bilhões em 16 bits, 70 quantizado, correção de erro | R$ 25.000 a R$ 60.000 |
| Operação crítica com várias placas | 2 a 4 placas de 48 GB ou mais | Profissional em máquina projetada para isso | Atendimento simultâneo, treino distribuído | Acima de R$ 100.000 |
As faixas em reais são ordem de grandeza e variam com câmbio, importação, tributação e configuração: trate a coluna como hierarquia de investimento, não como cotação.
Erros de compra mais comuns
O mais caro é escolher pela capacidade de cálculo e descobrir o limite de memória depois, o que produz uma máquina rápida na tarefa que não é a sua. O segundo é dimensionar pelo modelo de hoje e não pelo que a equipe vai querer em doze meses, porque trocar de placa custa mais que ter comprado uma faixa acima. O terceiro é montar tudo em volta da placa e esquecer o resto: linhas de PCIe insuficientes, memória de sistema menor que a da placa, armazenamento lento e fonte no limite. Os dois últimos são opostos: pagar o prêmio da linha profissional sem precisar de memória, correção de erro ou licença de servidor, ou colocar placa de consumo em rack compartilhado e descobrir o problema térmico em produção.
Configuração Zenion recomendada
A Zenion trabalha com três respostas distintas, porque tratar tudo como um caso só é o que gera a máquina errada. Para experimentação, aprendizado e prova de conceito, a linha Render acomoda uma placa de 16 a 24 GB com dissipação adequada e espaço de expansão. Para ajuste fino de modelo médio, a linha Supreme sustenta placa de 24 a 48 GB, com memória de sistema acima da memória da placa e armazenamento rápido, o gargalo silencioso de quem treina com dado local. Para treino, carga máxima e mais de uma placa, a linha Infinite é projetada em torno de linhas de PCIe suficientes, espaçamento real entre as placas, fonte com margem sobre o pico somado e fluxo de ar validado. Qual das três serve ao seu caso sai do software, do tamanho dos modelos e de quantas pessoas dividem a máquina.
Perguntas frequentes
Qual é a melhor placa de vídeo para IA?
Não existe uma melhor em absoluto, existe a menor que comporta o seu maior modelo com folga de 20% a 30%. Defina o modelo alvo e a precisão, calcule a memória necessária e escolha a placa com mais banda dentro dessa faixa.
Quanta VRAM eu preciso para rodar IA local?
Multiplique os parâmetros pelos bytes da precisão: dois bytes em 16 bits, cerca de meio byte em 4 bits. Sete bilhões pedem perto de 14 GB em 16 bits e cerca de 3,5 GB quantizados, mais margem para contexto e ambiente.
Placa de linha de consumo serve para IA ou preciso de placa profissional?
Serve bem para máquina individual de experimentação e ajuste fino com adaptadores. A linha profissional se justifica quando falta memória na de consumo, ou quando você precisa de correção de erro e licença para servidor compartilhado.
Vale mais a pena montar um computador para IA ou alugar GPU na nuvem?
Nuvem ganha em pico ocasional e treino grande e pontual. Máquina própria ganha quando a utilização é alta e contínua, porque o custo deixa de variar todo mês, e quando o dado sensível precisa permanecer na instituição.
A decisão, em uma frase
Comece pelo maior modelo que você precisa rodar nos próximos dois anos, calcule a memória que ele exige na precisão em que aceita rodá-lo, acrescente um terço de margem, e só então escolha entre linha de consumo e profissional pelo critério de onde a máquina vai ficar e quem vai dividi-la. A equipe da Zenion dimensiona workstations profissionais a partir do software e do fluxo de trabalho, não de uma lista de peças.