La afirmación principal es directa: ejecutando el modelo GLM-5.2 en aceleradores MI355X de AMD, wafer.ai midió 2.626 tokens por segundo por nodo, con un costo estimado en más de la mitad de lo que costaría una implementación comparable de Nvidia Blackwell. Para cualquiera que presupueste inferencia a escala, esa brecha de costo por token es el número que importa.

Por qué esto merece tu atención: el cuello de botella práctico en la entrega de modelos grandes hoy en día rara vez es el rendimiento pico bruto, sino el throughput por dólar y por vatio en un nodo completo, además de si la pila de software realmente entrega esos números en producción. AMD históricamente ha rezagado no en silicio sino en la madurez de su runtime y kernels. Una cifra de throughput creíble de terceros en un modelo actual sugiere que esa brecha se está cerrando, y les da a los compradores poder de negociación en un mercado donde la oferta y precios de Nvidia han dominado.

GLM-5.2 alcanza 2.626 tok/s/nodo en AMD MI355X a aproximadamente la mitad del costo de Blackwell

Algunas salvedades antes de reasignar presupuesto. Los benchmarks adyacentes a proveedores tienden a estar optimizados para el mejor caso: tamaños de lote, longitudes de secuencia, cuantización y configuración de paralelismo de tensores oscilan dramáticamente el throughput, y las comparaciones "por nodo" dependen de cómo se especifica cada nodo. La ventaja de costo reportada también depende de precios de hardware asumidos y utilización, que varían mucho por contrato y región. Trata el 2x como una señal direccional, no como una partida garantizada.

Qué puedes hacer con esto: si ejecutas cargas de inferencia y estás atado a un único proveedor, esta es una razón para hacer tu propia prueba directa. Prueba con tu modelo real, tu distribución real de longitud de entrada y salida, y tu SLA de latencia objetivo, luego calcula tokens por segundo por dólar, no solo por nodo. Verifica el soporte de software para tu framework de entrega (vLLM, SGLang, o tu pila interna) en ROCm antes de comprometerte, ya que la cobertura de kernels y el soporte de cuantización son donde las implementaciones de AMD más frecuentemente tropiezan.

La conclusión más amplia es presión competitiva. Cada resultado creíble de inferencia de AMD reduce el poder de precios de Nvidia y expande tus opciones de negociación. Incluso si nunca compras un MI355X, benchmarks como este son munición útil cuando negocias capacidad o evalúas instancias en la nube.