Aviso de “Promoção”

Quanta VRAM para rodar LLM local: guia e tabela

Quanta VRAM para rodar LLM local: guia e tabela

Você baixa um modelo de 70 bilhões de parâmetros, manda carregar e recebe CUDA out of memory em três segundos. Troca por uma versão quantizada, o modelo entra, e a geração sai a dois tokens por segundo, mais devagar do que você lê. Aumenta o contexto para processar um contrato inteiro e o erro de […]