Si has leído los diagramas de arquitectura de "Attention Is All You Need" y aún no sientes que comprendas los transformers, vale la pena dedicar una hora a Transformer Explainer del Polo Club de Georgia Tech. Es una visualización interactiva que ejecuta un modelo GPT-2 real directamente en tu navegador, para que puedas escribir un prompt y ver cómo el modelo lo procesa de principio a fin.

La herramienta recorre todo el pipeline: tokenización, embeddings de tokens y posición, el mecanismo de auto-atención (vectores de consulta, clave y valor), el procesamiento multicapa y la proyección final en una distribución de probabilidades para el siguiente token. Puedes ajustar la configuración de temperatura y ver cómo reformula esas probabilidades de salida, lo que hace tangible un parámetro de muestreo abstracto.

Lo que hace que esto sea más que un diagrama es que los números están en vivo. Como un modelo real está haciendo inferencia localmente, los pesos de atención y activaciones que ves corresponden al texto que ingresaste, no a un ejemplo predefinido. Eso cierra la brecha entre las matemáticas que lees y lo que un modelo hace con tu entrada específica.

Para desarrolladores, esta es una herramienta práctica de capacitación y enseñanza. Úsala para explicar a un stakeholder sin experiencia en ML por qué importan la longitud de contexto y la atención, para construir intuición antes de profundizar en un framework como PyTorch o Hugging Face Transformers, o para verificar tu propio modelo mental de cómo interactúan la temperatura y la predicción del siguiente token. Los conceptos escalan hacia modelos modernos de clase GPT aunque el modelo visualizado sea el GPT-2 más pequeño.

Combina bien con la investigación subyacente y otros explicadores del grupo (han construido herramientas interactivas similares para CNNs y modelos de difusión). Comienza aquí para entender la estructura del sistema, luego lee el artículo original cuando las partes móviles ya tengan sentido.