Gemma 4 26B en un Xeon de 13 años: 5 tokens/seg sin GPU
Un aficionado ejecutó un modelo de 26 mil millones de parámetros a aproximadamente 5 tokens por segundo en hardware de servidor de una década de antigüedad sin tarjeta gráfica. Aquí te explicamos por qué es importante y cómo probar la inferencia solo con CPU.







