GPU 없이 13년 된 Xeon 프로세서에서 Gemma 4 26B 모델을 초당 5 토큰 속도로 실행하는 것이 가능하다. 이는 GPU 없이도 대규모 언어 모델을 구동할 수 있음을 보여준다. 이 기술은 구형 하드웨어에서도 효율적인 추론 성능을 달성하는 방법을 제시한다.