Aviso de “Promoção”

Workstation para Inteligência Artificial: Guia 2026

Workstation para Inteligência Artificial: Guia 2026

Você roda a célula que carrega o modelo e recebe CUDA out of memory. Reduz o batch size, roda de novo, mesma mensagem. Reduz o contexto, quantiza para 4 bits, e finalmente o modelo entra na placa, só que agora responde devagar e com qualidade pior. Duas horas depois você desiste e sobe tudo para […]

Quanta VRAM para rodar LLM local: guia e tabela

Quanta VRAM para rodar LLM local: guia e tabela

Você baixa um modelo de 70 bilhões de parâmetros, manda carregar e recebe CUDA out of memory em três segundos. Troca por uma versão quantizada, o modelo entra, e a geração sai a dois tokens por segundo, mais devagar do que você lê. Aumenta o contexto para processar um contrato inteiro e o erro de […]