Aviso de “Promoção”

Duas placas de vídeo para IA instaladas lado a lado dentro de um gabinete de workstation aberto

Placa de vídeo para IA: como escolher a certa

O roteiro se repete. O time monta a primeira máquina de inteligência artificial, escolhe a placa de vídeo para IA mais forte que o orçamento permitia e descobre na primeira semana que o modelo que motivou a compra não carrega. A mensagem de erro não fala de velocidade, fala de memória insuficiente. Em outros casos o modelo carrega, o ajuste fino começa e a conclusão é estimada em dias, porque a placa tem cálculo sobrando e banda curta. Existe ainda o inverso: uma placa de 48 GB para um trabalho que caberia em 24, ociosa quase todo o mês.

A alternativa que parece resolver tudo, alugar capacidade na nuvem, revela o próprio problema no terceiro mês: a conta cresce com o número de experimentos, ninguém prevê o valor do mês seguinte, e dado sensível sai do perímetro da instituição. Escolher a placa é decidir o que fica dentro de casa e com que teto de tamanho de modelo você vai conviver nos próximos três anos.

Este artigo trata só do critério de compra: a conta de memória, a tabela de decisão por faixa de trabalho e a faixa de investimento. Os recortes de uso têm endereço próprio: para dimensionar inferência, o guia de GPU para inferência de IA; para fluxo de análise de dados, o de GPU para data science.

A regra que decide quase tudo: o modelo precisa caber na memória

Antes de comparar especificação existe uma condição binária: ou os pesos cabem na memória da placa, ou o trabalho não acontece ali. Diferente de um render que fica lento quando falta memória, um modelo que não cabe não executa, ou usa memória do sistema e cai a uma fração da velocidade. A VRAM é o primeiro filtro da compra, e o desempenho bruto vem depois.

A conta é direta. Cada parâmetro ocupa bytes conforme a precisão de armazenamento: quatro em 32 bits, dois em 16 bits, um em 8 bits e cerca de meio byte em 4 bits. Sete bilhões de parâmetros em 16 bits ocupam aproximadamente 14 GB só de pesos, e caem para perto de 3,5 GB em 4 bits. Setenta bilhões pedem perto de 140 GB em 16 bits e cerca de 35 GB em 4 bits.

Sobre esse número soma-se a margem que quase todo mundo esquece: o cache de atenção cresce com o contexto e com as requisições simultâneas, e o ambiente reserva memória de trabalho. A documentação do PyTorch sobre semântica CUDA explica por que a memória vista pelo sistema excede a soma dos tensores ativos. Some 20% a 30% ao peso calculado.

O que a quantização muda, e o que ela custa

Reduzir a precisão de armazenamento é a alavanca mais eficiente para caber em uma placa menor: de 16 para 4 bits o espaço cai a um quarto e a geração acelera. O custo é perda de qualidade que varia por tarefa, quase imperceptível em conversação e mais visível em raciocínio encadeado e em código. A decisão é pagar em hardware ou em qualidade: quem precisa do comportamento original, para validar pesquisa ou entregar saída auditável, compra memória para rodar em 16 bits. O detalhamento por tamanho de modelo está no artigo sobre quanta VRAM para rodar LLM local.

Treino, ajuste fino e inferência pedem máquinas diferentes

O mesmo modelo exige memória muito diferente conforme o que você faz com ele, e confundir os três regimes gera a maior parte dos dimensionamentos errados. Na inferência a memória é próxima do peso do modelo mais o cache de contexto. No ajuste fino completo entram pesos, gradientes e estados do otimizador juntos: com um otimizador do tipo Adam em precisão mista a regra de bolso é cerca de 16 bytes por parâmetro, o que empurra sete bilhões para além de 100 GB.

Entre os extremos está o regime que sustenta a maior parte dos projetos de empresa e de universidade: o ajuste fino com adaptadores de baixa dimensão, que congela quase todos os pesos e treina só um conjunto pequeno de matrizes novas. O consumo fica próximo do da inferência, e sete a treze bilhões passam a caber em 24 GB. Treino a partir do zero é problema de várias placas ou de servidor dedicado, tratado no guia de workstation para inteligência artificial.

VRAM por faixa de trabalho

VRAM O que cabe com folga Limite prático
8 a 12 GB Até 7 bilhões quantizados, visão computacional, imagem padrão Contexto curto, sem ajuste fino
16 GB 7 a 13 bilhões quantizados, 7 bilhões em 16 bits Adaptadores, lote pequeno
24 GB 13 bilhões em 16 bits, até 32 bilhões quantizados 70 bilhões só em quantização agressiva
32 a 48 GB 32 bilhões em 16 bits, 70 quantizados, contexto longo Treino completo fora de alcance
80 GB ou mais 70 bilhões em 16 bits, ajuste fino completo Projeto de infraestrutura

Banda de memória, o gargalo real na geração de texto

Na geração de texto, token por token, o processador gráfico lê os pesos relevantes da memória para produzir cada saída, e essa leitura é o que limita a velocidade. O trabalho aritmético é pequeno diante do volume movimentado, então a placa passa a maior parte do tempo esperando a memória: duas placas com cálculo parecido entregam velocidades bem diferentes quando a banda difere. Priorize a placa com mais banda por gigabyte e desconfie de muita memória sobre barramento estreito, combinação que carrega o modelo e não permite usá-lo com fluidez.

Precisão numérica e o suporte de hardware por geração

Formatos numéricos reduzidos são o que torna uma GPU para IA rápida, e o suporte a eles depende da geração da placa, não só da sua capacidade. A documentação da NVIDIA sobre treino em precisão mista descreve o mecanismo: metade dos bytes acessados significa metade do tempo nas camadas limitadas por memória, com uma cópia mestre dos pesos em precisão maior para preservar a estabilidade do treino. Gerações recentes trouxeram suporte nativo a formatos de 8 bits e, nas mais novas, de 4 bits.

Confirme antes da compra se a geração suporta o formato que sua biblioteca usa: uma placa anterior com memória generosa pode ser bom negócio para inferência e mau negócio para treino, porque perde esse atalho. No lado da AMD, a página de aceleração de IA das placas Radeon documenta a linha e a memória disponível, incluindo a variante profissional de 32 GB.

Linha profissional ou linha de consumo para IA

A comparação raramente é sobre velocidade e quase sempre sobre memória, confiabilidade e onde a máquina vai ficar. A linha voltada ao mercado doméstico tem a melhor relação entre cálculo e preço quando a máquina fica na mesa de um pesquisador. A profissional oferece mais memória por placa, correção de erro, drivers com validação estendida e consumo pensado para operação contínua, faixa que a NVIDIA documenta na página das GPUs profissionais de desktop, hoje de 16 GB até 96 GB.

Critério Linha de consumo Linha profissional
Memória por placa De 8 a 32 GB De 16 a 96 GB
Correção de erro na memória Não Sim nos modelos superiores
Validação de driver Ciclo curto Ramo validado, suporte estendido
Formato e dissipação Larga, ar solto no gabinete Compacta, fluxo direcionado
Uso em servidor Restrito pelos termos do fabricante Previsto em contrato

O que costuma decidir não é técnico, é contratual e operacional: se a máquina vai para um rack ou vai atender vários usuários, os termos de licenciamento e o formato físico passam a mandar. Se é individual e a carga é experimentação, a linha de consumo entrega mais trabalho por real investido. O critério transversal está no guia de placa de vídeo para workstation.

Mais de uma placa: o que escalona e o que não escalona

A pergunta mais frequente sobre duas ou quatro placas tem resposta que decepciona: a memória não soma. Duas placas de 24 GB não formam uma de 48 GB para um modelo único de 40 GB. Dividir o modelo entre placas é possível, técnica conhecida como paralelismo de modelo, mas a banda da comunicação entre elas é uma ordem de magnitude menor que a da memória interna de cada uma. Sem ponte de interligação dedicada, que as gerações recentes de placa de estação de trabalho deixaram de trazer, a troca passa pelo barramento PCIe e o ganho encolhe.

O que escalona bem é trabalho paralelo independente: lotes diferentes do mesmo treino, experimentos simultâneos ou requisições distintas com uma cópia do modelo por placa. Em troca, a exigência sobre o resto do computador para IA cresce: linhas de PCIe para cada placa, espaçamento real entre os encaixes, fonte com margem sobre a soma dos picos e fluxo de ar para várias placas quentes por horas.

Workstation local ou nuvem

A comparação honesta não é sobre qual é mais barato, é sobre que tipo de custo você quer ter. Capacidade alugada serve a pico ocasional e treino pontual: você paga pelas horas e não imobiliza capital. Máquina própria ganha quando a utilização é alta e contínua: o custo é conhecido antes de acontecer e não cresce quando o time faz mais experimentos. O segundo argumento pesa em setor público, saúde, jurídico e pesquisa com dado sensível, porque o processamento local mantém o dado no perímetro da instituição. Na maioria dos casos que a Zenion atende o desenho é híbrido: máquina local para o dia a dia e capacidade alugada para o treino grande de duas ou três vezes por ano.

Tabela de decisão: qual placa de vídeo para IA comprar

Faixa de trabalho VRAM alvo Classe de placa O que dá para fazer Investimento na placa
Experimentação e aprendizado 12 a 16 GB Consumo intermediária Até 13 bilhões quantizados, geração de imagem, prova de conceito R$ 2.500 a R$ 8.000
Ajuste fino de modelo médio 24 GB Topo de consumo ou entrada profissional Adaptadores em 7 a 13 bilhões, 16 bits, contexto longo R$ 9.000 a R$ 20.000
Treino sério ou modelo grande local 32 a 48 GB Profissional de estação de trabalho 32 bilhões em 16 bits, 70 quantizado, correção de erro R$ 25.000 a R$ 60.000
Operação crítica com várias placas 2 a 4 placas de 48 GB ou mais Profissional em máquina projetada para isso Atendimento simultâneo, treino distribuído Acima de R$ 100.000

As faixas em reais são ordem de grandeza e variam com câmbio, importação, tributação e configuração: trate a coluna como hierarquia de investimento, não como cotação.

Erros de compra mais comuns

O mais caro é escolher pela capacidade de cálculo e descobrir o limite de memória depois, o que produz uma máquina rápida na tarefa que não é a sua. O segundo é dimensionar pelo modelo de hoje e não pelo que a equipe vai querer em doze meses, porque trocar de placa custa mais que ter comprado uma faixa acima. O terceiro é montar tudo em volta da placa e esquecer o resto: linhas de PCIe insuficientes, memória de sistema menor que a da placa, armazenamento lento e fonte no limite. Os dois últimos são opostos: pagar o prêmio da linha profissional sem precisar de memória, correção de erro ou licença de servidor, ou colocar placa de consumo em rack compartilhado e descobrir o problema térmico em produção.

Configuração Zenion recomendada

A Zenion trabalha com três respostas distintas, porque tratar tudo como um caso só é o que gera a máquina errada. Para experimentação, aprendizado e prova de conceito, a linha Render acomoda uma placa de 16 a 24 GB com dissipação adequada e espaço de expansão. Para ajuste fino de modelo médio, a linha Supreme sustenta placa de 24 a 48 GB, com memória de sistema acima da memória da placa e armazenamento rápido, o gargalo silencioso de quem treina com dado local. Para treino, carga máxima e mais de uma placa, a linha Infinite é projetada em torno de linhas de PCIe suficientes, espaçamento real entre as placas, fonte com margem sobre o pico somado e fluxo de ar validado. Qual das três serve ao seu caso sai do software, do tamanho dos modelos e de quantas pessoas dividem a máquina.

Perguntas frequentes

Qual é a melhor placa de vídeo para IA?
Não existe uma melhor em absoluto, existe a menor que comporta o seu maior modelo com folga de 20% a 30%. Defina o modelo alvo e a precisão, calcule a memória necessária e escolha a placa com mais banda dentro dessa faixa.

Quanta VRAM eu preciso para rodar IA local?
Multiplique os parâmetros pelos bytes da precisão: dois bytes em 16 bits, cerca de meio byte em 4 bits. Sete bilhões pedem perto de 14 GB em 16 bits e cerca de 3,5 GB quantizados, mais margem para contexto e ambiente.

Placa de linha de consumo serve para IA ou preciso de placa profissional?
Serve bem para máquina individual de experimentação e ajuste fino com adaptadores. A linha profissional se justifica quando falta memória na de consumo, ou quando você precisa de correção de erro e licença para servidor compartilhado.

Vale mais a pena montar um computador para IA ou alugar GPU na nuvem?
Nuvem ganha em pico ocasional e treino grande e pontual. Máquina própria ganha quando a utilização é alta e contínua, porque o custo deixa de variar todo mês, e quando o dado sensível precisa permanecer na instituição.

A decisão, em uma frase

Comece pelo maior modelo que você precisa rodar nos próximos dois anos, calcule a memória que ele exige na precisão em que aceita rodá-lo, acrescente um terço de margem, e só então escolha entre linha de consumo e profissional pelo critério de onde a máquina vai ficar e quem vai dividi-la. A equipe da Zenion dimensiona workstations profissionais a partir do software e do fluxo de trabalho, não de uma lista de peças.

Compartilhe nas mídias