A Cerebras, conhecida por seus motores de escala de wafer (WSEs) para inferência de IA de baixa latência e alto rendimento, revela seu roadmap futuro.
Esses WSEs são cruciais para serviços como o ChatGPT-5.6 Sol Ultrafast da OpenAI.
O novo design de rack Nexus para o acelerador CS-4 aprimora o desempenho dos três WSEs WS-3T.
Cada CS-4 incorpora três wafers WS-3T em “mochilas” autocontidas com energia, rede e resfriamento líquido.
Módulos de E/S desacoplados fornecem conexões RoCE v2 RDMA e conexões diretas entre wafers.
O design vertical dos WSEs no Nexus elimina a necessidade de PCBs, minimizando perdas de energia.
Isso permite o dobro da energia para o WSE, resultando em velocidades de clock e desempenho até duas vezes maiores no WS-3T.
Apesar do avanço, a demanda por memória em IA continua a crescer devido ao tamanho dos modelos.
O WS-3T ainda é limitado a 44GB de memória por wafer, e um rack CS-4 atinge 132GB, menos que sistemas concorrentes.
A Cerebras aborda isso com sua futura geração.
A próxima geração, o CS-6 (duas gerações à frente), integrará empilhamento 3D de DRAM sobre a lógica e o wafer SRAM.
Essa inovação visa manter a liderança de desempenho em inferência, reduzindo a área do chip.
A redução de área pode permitir à Cerebras aumentar o número de WSEs produzidos.
Sistemas CS-4 podem ser conectados usando a mesma interconexão wafer-a-wafer, oferecendo 2.4 Tb/s por wafer.
A arquitetura da Cerebras requer apenas a passagem de ativações do modelo entre WSEs, otimizando o uso da largura de banda.
A arquitetura CS-4 pavimenta o caminho para o acelerador CS-5 em 2027, prometendo até 10.000 tokens/segundo por usuário para modelos menores.