Upgrade DIY: Tesla V100 de $266 Turbina PC Gamer para IA

Entusiasta adiciona 32GB de VRAM, executando LLMs de 27 bilhões de parâmetros mais rápido que a nuvem.

GPU Antiga, Desempenho Atual

Um entusiasta da computação deu uma nova vida a uma GPU empresarial barulhenta e quase obsoleta (mas com muita VRAM) para inferência local de LLMs.

Agora, ele desfruta de um sistema com 32GB de VRAM total, o dobro do que tinha, investindo apenas $266 (aproximadamente R$ 1.300).

Um excelente resultado, especialmente em tempos de escassez de memória!

O Segredo por Trás do Upgrade

  • GPU: Oscar Molnar adquiriu uma Tesla V100 SXM2 de 16GB HBM2 a um custo baixo.
  • Adaptador: Um adaptador SXM2 para PCIe foi essencial.
  • Mod de Refrigeração: Uma modificação PWM foi aplicada ao ruidoso cooler, descrito como “tão barulhento quanto um cortador de grama”.

Essas GPUs estão acessíveis no eBay, algumas por menos de $140, diretamente da China.

A Montagem Não é Simples

Não basta apenas plugar a Tesla V100 SXM2 no PC. Molnar gastou cerca de $66 em um adaptador SXM2 para PCIe no eBay.

Lidando com o Ruído Infernal

  • O cooler padrão da Tesla V100 SXM2 produzia 82dB, comparável a um “triturador de lixo ou cortador de grama”.
  • A solução: redirecionar os fios do ventilador e conectá-los ao header PWM da placa-mãe.
  • Alternativa: adquirir um cabo jumper “2.54mm male to PH2.0 female”.
  • Detalhe importante: O ventilador só precisa operar a 10% da capacidade para manter a GPU abaixo de 50°C em carga máxima.

Configuração Final e Vantagens

Com o hardware ajustado, Molnar agora tem um sistema com 32GB de VRAM:

  • RTX 4080: 16GB VRAM (Arquitetura Ada)
  • Tesla V100: 16GB VRAM (Arquitetura Volta)

É possível encontrar Tesla V100s com 32GB de VRAM, mas o custo seria o dobro.

Desempenho Impressionante para LLMs

  • Aproveitar os 32GB de VRAM para LLMs foi simples usando NixOS e um driver Nvidia legado que suporta as arquiteturas Volta e Ada.
  • Resultado: Um modelo de 27 bilhões de parâmetros rodando a 32 tokens por segundo.
  • Molnar afirma ser “rápido o suficiente para uso interativo” e superior à maioria das APIs de nuvem.
Baseado no artigo de Tom’s Hardware