Sin categoría

Meta y Nvidia amplían su cooperación en infraestructura para IA con foco en Blackwell y futuros desarrollos

Meta y Nvidia avanzan en una colaboración estratégica orientada al desarrollo de infraestructura para inteligencia artificial (IA) a gran escala. La iniciativa contempla la adopción de arquitecturas actuales y futuras de procesamiento gráfico, así como ajustes técnicos para optimizar el entrenamiento de modelos de lenguaje y aplicaciones de realidad aumentada.

Infraestructura y capacidad de cómputo

Meta es uno de los principales clientes de la arquitectura Blackwell de Nvidia para el periodo 2024-2025. Esta generación incluye los chips B200 y está diseñada para cargas de trabajo intensivas en inteligencia artificial.

En paralelo, Nvidia anunció que su próxima arquitectura, denominada Rubin, sucederá a Blackwell en un horizonte cercano a 2026. El director ejecutivo de Nvidia, Jensen Huang, presentó públicamente esta hoja de ruta tecnológica en el marco de eventos recientes del sector.

En términos de capacidad, el director ejecutivo de Meta, Mark Zuckerberg, confirmó que la compañía construye una infraestructura que contará con el equivalente a 600.000 GPUs H100 hacia finales de 2024. El objetivo declarado es ampliar de forma significativa la potencia de cómputo disponible para el entrenamiento de modelos avanzados de IA. Alcanzar niveles cercanos a 120 exaflops supondría un salto de magnitud poco habitual en la computación civil.

Personalización y optimización

Uno de los aspectos más relevantes de la cooperación es la posibilidad de que Meta personalice partes del firmware de los chips de Nvidia. Este tipo de apertura es inusual en un ecosistema tradicionalmente cerrado y busca optimizar el entrenamiento de los modelos de la familia Llama.

Actualmente, Meta está enfocada en el despliegue y entrenamiento de Llama 4, mientras que Llama 5 permanece como un desarrollo proyectado. Los ajustes de hardware y firmware se centran en mejorar el rendimiento inmediato de estas generaciones de modelos.

La estrategia incluye además el co-diseño para facilitar que entornos como PyTorch operen de forma más eficiente sobre el hardware, con el fin de reducir los tiempos de entrenamiento de modelos de gran escala.

Arquitectura Blackwell: avances técnicos

La arquitectura Blackwell introduce mejoras frente a la generación anterior Hopper (H100). Entre los avances destacados se encuentra una segunda generación del denominado “Transformer Engine”, con soporte para precisión dinámica FP4. Esta tecnología permite utilizar menos bits en ciertos cálculos sin comprometer la precisión en operaciones complejas, lo que se traduce en mayor velocidad y menor consumo energético.

Otra innovación es NVLink 5, el nuevo sistema de interconexión que posibilita que hasta 576 GPUs operen de manera coordinada como si se tratara de un único procesador. La velocidad de comunicación entre chips aumenta de forma significativa frente a la generación previa, un factor clave para modelos que no caben en la memoria de una sola tarjeta.

Blackwell también incorpora un motor dedicado de descompresión de datos. Tradicionalmente, esta tarea recaía en la CPU antes de transferir la información a la GPU. Al integrarse directamente en el chip, se reduce la latencia en el procesamiento de grandes volúmenes de datos, como los que manejan plataformas sociales y aplicaciones de realidad aumentada.

En comparación con la H100, Blackwell amplía el soporte de parámetros de IA —de hasta 1,8 billones a cifras cercanas a 10 billones—, duplica el ancho de banda y adopta la precisión FP4 frente a FP8, lo que impacta en velocidad y eficiencia.

Realidad aumentada y computación en el borde

El proyecto de gafas de realidad aumentada de Meta, conocido como Project Orion, forma parte de esta estrategia. La propuesta combina procesamiento en la nube —respaldado por la infraestructura de centros de datos— con chips de bajo consumo integrados en el dispositivo, bajo un esquema de edge AI.

El objetivo es reducir la latencia en aplicaciones como traducción en tiempo real y asistencia visual, apoyándose en modelos que operan desde la nube pero interactúan con sensores en el entorno físico.

Eficiencia energética

Ante el aumento en el consumo energético de los chips de última generación —que pueden alcanzar hasta 1.200 vatios por unidad—, ambas compañías han explorado sistemas de refrigeración líquida por inmersión para centros de datos. Este método podría reducir el consumo energético frente a los sistemas tradicionales de aire y mejorar la viabilidad operativa de infraestructuras de gran escala.

En conjunto, la cooperación entre Meta y Nvidia refleja la intensificación de la carrera tecnológica por desarrollar modelos de inteligencia artificial cada vez más complejos, apoyados en arquitecturas especializadas y centros de datos de alta capacidad.

Facebook
Twitter
Instagram
Whatsapp
LinkedIn