Cerebras Revoluciona a IA em Escala de Wafer

Hot Chips 2026: Arquitetura Nexus triplica performance e CS-6 trará DRAM empilhada para o futuro da IA.

Avanços na IA de Larga Escala

  • A Cerebras, conhecida por seus motores de escala de wafer (WSEs) para inferência de IA de baixa latência e alto rendimento, revela seu roadmap futuro.

  • Esses WSEs são cruciais para serviços como o ChatGPT-5.6 Sol Ultrafast da OpenAI.

Nexus: A Nova Arquitetura de Rack

  • O novo design de rack Nexus para o acelerador CS-4 aprimora o desempenho dos três WSEs WS-3T.

  • Cada CS-4 incorpora três wafers WS-3T em “mochilas” autocontidas com energia, rede e resfriamento líquido.

  • Módulos de E/S desacoplados fornecem conexões RoCE v2 RDMA e conexões diretas entre wafers.

  • O design vertical dos WSEs no Nexus elimina a necessidade de PCBs, minimizando perdas de energia.

  • Isso permite o dobro da energia para o WSE, resultando em velocidades de clock e desempenho até duas vezes maiores no WS-3T.

Desafios e Soluções de Memória

  • Apesar do avanço, a demanda por memória em IA continua a crescer devido ao tamanho dos modelos.

  • O WS-3T ainda é limitado a 44GB de memória por wafer, e um rack CS-4 atinge 132GB, menos que sistemas concorrentes.

  • A Cerebras aborda isso com sua futura geração.

O Futuro: CS-6 com DRAM Empilhada

  • A próxima geração, o CS-6 (duas gerações à frente), integrará empilhamento 3D de DRAM sobre a lógica e o wafer SRAM.

  • Essa inovação visa manter a liderança de desempenho em inferência, reduzindo a área do chip.

  • A redução de área pode permitir à Cerebras aumentar o número de WSEs produzidos.

Escalabilidade e Desempenho

  • Sistemas CS-4 podem ser conectados usando a mesma interconexão wafer-a-wafer, oferecendo 2.4 Tb/s por wafer.

  • A arquitetura da Cerebras requer apenas a passagem de ativações do modelo entre WSEs, otimizando o uso da largura de banda.

  • A arquitetura CS-4 pavimenta o caminho para o acelerador CS-5 em 2027, prometendo até 10.000 tokens/segundo por usuário para modelos menores.

Baseado no artigo de Tom’s Hardware