Entusiasta adiciona 32GB de VRAM, executando LLMs de 27 bilhões de parâmetros mais rápido que a nuvem.
GPU Antiga, Desempenho Atual
Um entusiasta da computação deu uma nova vida a uma GPU empresarial barulhenta e quase obsoleta (mas com muita VRAM) para inferência local de LLMs.
Agora, ele desfruta de um sistema com 32GB de VRAM total, o dobro do que tinha, investindo apenas $266 (aproximadamente R$ 1.300).
Um excelente resultado, especialmente em tempos de escassez de memória!
O Segredo por Trás do Upgrade
- GPU: Oscar Molnar adquiriu uma Tesla V100 SXM2 de 16GB HBM2 a um custo baixo.
- Adaptador: Um adaptador SXM2 para PCIe foi essencial.
- Mod de Refrigeração: Uma modificação PWM foi aplicada ao ruidoso cooler, descrito como “tão barulhento quanto um cortador de grama”.
Essas GPUs estão acessíveis no eBay, algumas por menos de $140, diretamente da China.
A Montagem Não é Simples
Não basta apenas plugar a Tesla V100 SXM2 no PC. Molnar gastou cerca de $66 em um adaptador SXM2 para PCIe no eBay.
Lidando com o Ruído Infernal
- O cooler padrão da Tesla V100 SXM2 produzia 82dB, comparável a um “triturador de lixo ou cortador de grama”.
- A solução: redirecionar os fios do ventilador e conectá-los ao header PWM da placa-mãe.
- Alternativa: adquirir um cabo jumper “2.54mm male to PH2.0 female”.
- Detalhe importante: O ventilador só precisa operar a 10% da capacidade para manter a GPU abaixo de 50°C em carga máxima.
Configuração Final e Vantagens
Com o hardware ajustado, Molnar agora tem um sistema com 32GB de VRAM:
- RTX 4080: 16GB VRAM (Arquitetura Ada)
- Tesla V100: 16GB VRAM (Arquitetura Volta)
É possível encontrar Tesla V100s com 32GB de VRAM, mas o custo seria o dobro.
Desempenho Impressionante para LLMs
- Aproveitar os 32GB de VRAM para LLMs foi simples usando NixOS e um driver Nvidia legado que suporta as arquiteturas Volta e Ada.
- Resultado: Um modelo de 27 bilhões de parâmetros rodando a 32 tokens por segundo.
- Molnar afirma ser “rápido o suficiente para uso interativo” e superior à maioria das APIs de nuvem.