AMD ha concretado la adquisición de Taalas, una startup con sede en Toronto que ha desarrollado una tecnología disruptiva para el sector de la inteligencia artificial. La empresa integra los pesos de los modelos de IA directamente en el silicio de sus chips, una técnica que permite alcanzar velocidades de procesamiento significativamente superiores a las de las unidades de procesamiento gráfico (GPU) convencionales.

17.000 tokens por segundo en inferencia

Rendimiento extremo frente a la competencia

La arquitectura de Taalas rompe con el esquema tradicional de utilizar memoria HBM para almacenar los pesos de los modelos. Al convertirlos en circuitos integrados específicos de modelo (MSIC), la velocidad de ejecución se dispara. En pruebas realizadas con el modelo Llama 3.1 8B de Meta, el chip HC1 logró procesar 16.960 tokens por segundo.

  • Comparativa de velocidad · Factor de mejora
  • Respecto a las GPU de Nvidia · 48 veces más rápido
  • Respecto a Cerebras · 8,5 veces más rápido

Esta capacidad posiciona a AMD para competir directamente en el mercado de servicios de inferencia premium, un sector donde Nvidia ya ha establecido alianzas estratégicas de gran envergadura. La estrategia de AMD contempla combinar sus racks Helios con estos nuevos aceleradores, delegando la generación de tokens a los chips de Taalas para maximizar la eficiencia.

Desafíos de la arquitectura en silicio

A pesar de su potencia, la tecnología presenta una limitación estructural: la rigidez. Una vez que los chips se fabrican y despliegan, el modelo de IA queda grabado de forma fija. Cualquier modificación profunda del modelo requeriría una nueva fabricación de las capas de metal del chip, aunque la empresa asegura que este proceso es considerablemente más económico y rápido que fabricar un chip desde cero.

Limitación técnica

El modelo de IA queda fijo en el chip tras su fabricación, lo que exige nuevas capas de metal para cambios significativos.

No obstante, este avance ofrece ventajas críticas para el desarrollo de modelos complejos. La alta velocidad permitiría implementar técnicas de razonamiento extendido, donde el modelo dedica más tiempo a procesar la información antes de responder, sin penalizar la experiencia del usuario final con tiempos de espera prolongados.