NOTICIAS

DeepSeek apuesta fuerte por chips de Huawei para entrenar un modelo de IA de 8 billones de parámetros

El fundador Liang Wenfeng calificó la migración de Nvidia como una de las apuestas estratégicas más grandes de la compañía, mientras invierte 4.500 millones de dólares en cómputo y busca una valuación de 74.000 millones. (Fuente: Android Headlines / The Information)

¿Alguna vez te preguntaste qué hace falta para construir un modelo de IA tan masivo que hace que los chatbots más destacados de hoy parezcan prototipos livianos? La potencia china de IA DeepSeek está entrenando actualmente un modelo de 2 billones de parámetros —probablemente su próximo V4.1 Pro— y tiene la mira puesta en una bestia asombrosa de 8 billones de parámetros.

Para poner esa escala en perspectiva, el Qwen 3.8 Max de Alibaba ronda los 2,4 billones de parámetros. Mientras tanto, el Kimi K3 de Moonshot AI llega a 2,8 billones. Una arquitectura de 8 billones de parámetros triplicaría aproximadamente esas cifras, estableciendo un nuevo estándar completamente nuevo para el cómputo bruto de IA.

Construir modelos de IA ultra grandes normalmente requiere miles de GPU de primera línea de Nvidia. Pero bajo los estrictos controles de exportación de Estados Unidos, el fundador de DeepSeek, Liang Wenfeng, está llevando adelante un giro estratégico masivo. Durante una reunión cerrada con inversores, Liang reveló que DeepSeek planea desplegar chips domésticos de Huawei —específicamente la próxima serie Ascend 950— para el entrenamiento de modelos a gran escala, empezando tan pronto como fines de 2026, según The Information.

Liang no endulzó la situación. Les dijo a los inversores que alejarse del ecosistema centrado en Nvidia es una de las apuestas estratégicas más grandes de la compañía, y una que simplemente tiene que funcionar. Los laboratorios chinos anteriormente usaban hardware doméstico principalmente para correr inferencia básica. Sin embargo, DeepSeek está dando un paso al frente para usar el silicio de Huawei para las intensas demandas computacionales del entrenamiento de modelos a escala completa.

Las cifras de hardware que requiere este salto son asombrosas. Entrenar un modelo de esta escala requeriría aproximadamente 50.000 chips Nvidia de primera línea, o hasta 200.000 chips Ascend 950 de Huawei. Para financiar este impulso de infraestructura, DeepSeek está invirtiendo alrededor de 4.500 millones de dólares en poder de cómputo mientras finaliza una nueva ronda de financiamiento que podría llevar su valuación hacia los 74.000 millones de dólares.

Sin embargo, sustituir a Nvidia no es una tarea de un día para el otro. Huawei todavía enfrenta restricciones de suministro en torno a componentes de memoria avanzados, lo que significa que DeepSeek está tomando por ahora un enfoque de doble vía: sigue aprovechando el hardware existente de Nvidia junto con el silicio doméstico. La transición de hardware viene con obstáculos técnicos reales, pero la apuesta de DeepSeek muestra que la carrera por la escala masiva de IA está encontrando nuevos caminos ingeniosos hacia adelante.

Nota elaborada con asistencia de IA. Fuentes verificadas y contenido editado por el equipo de Infosertec. Conocé nuestro proceso editorial.

Deja un comentario

Descubre más desde

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo