3 min de lectura

AMD MI350P: 144 GB de memoria y 4 TB/s

AMD Instinct MI350PHBM3Eинференс LLM

AMD Instinct MI350P incorpora 144 GB de memoria HBM3E y hasta 4 TB/s de ancho de banda. Es una opción PCIe relevante para inferencia de modelos grandes, donde alojar pesos y contexto en un acelerador puede simplificar el despliegue. AMD aún no ha anunciado un precio oficial.

Qué ofrece realmente AMD MI350P

Conviene empezar por la cifra principal: AMD Instinct MI350P incorpora 144 GB de memoria HBM3E con un ancho de banda máximo de 4 TB/s. AMD indica estas especificaciones en la página del producto, junto con una interfaz de memoria de 4096 bits. Para un único acelerador PCIe, es una propuesta seria para la inferencia de modelos grandes.

La capacidad de memoria importa más aquí que una comparación abstracta de unidades de cálculo. Los 144 GB aumentan la posibilidad de alojar en un solo dispositivo un modelo, una ventana de contexto ampliada o un lote de solicitudes mayor. No garantizan una generación rápida, pero reducen la presión por dividir el modelo entre varios aceleradores.

El ancho de banda de 4 TB/s es especialmente relevante en operaciones limitadas por la lectura de pesos desde memoria. Sin embargo, es un valor máximo de la ficha técnica, no una velocidad prometida para una LLM concreta. El resultado real dependerá del formato de los pesos, el tamaño del lote, la longitud del contexto, los kernels de inferencia y la madurez del software.

MI350P forma parte del ecosistema ROCm y de la línea arquitectónica CDNA 4 con AMD Infinity. AMD lo presenta como un acelerador de servidor para sistemas estándar refrigerados por aire, no como una tarjeta gráfica para estación de trabajo. Por eso, compararlo directamente con una RTX 6000 solo por la memoria puede resultar llamativo, pero mezcla categorías de producto distintas.

El precio sigue siendo menos claro. A fecha del 20 de agosto de 2026, AMD no había publicado un precio minorista oficial en la página de producto disponible. La estimación de unos 20.000 dólares parece una suposición del mercado, así que todavía es pronto para usarla en cálculos de infraestructura.

Por qué 144 GB cambian realmente el panorama

Para inferencia, no es una actualización cosmética: la memoria adicional puede sustituir una configuración compleja de varias tarjetas por un solo acelerador. Menos comunicación entre dispositivos supone un despliegue más sencillo y una latencia potencialmente más predecible, aunque el resultado final debe validarse con cada modelo.

La mayor ventaja aparecerá cuando un modelo casi quepa en una memoria menor o cuando el contexto y el lote consuman rápidamente el margen disponible. La capacidad por sí sola no elimina las limitaciones de ROCm, los problemas de compatibilidad con frameworks ni la necesidad de kernels optimizados de calidad. Primero comprobaría la compatibilidad con el modelo necesario y la estabilidad de su perfil de ejecución; después miraría los atractivos terabytes por segundo.

MI350P parece una alternativa creíble a los aceleradores de NVIDIA para inferencia a gran escala, pero todavía no un sustituto evidente. No solo decidirán los 144 GB: también la disponibilidad, el precio real y la facilidad con que estas especificaciones se conviertan en tokens por segundo.

Anteriormente analizamos Cocoon y cómo la computación confidencial transforma la economía y la privacidad de la inferencia de IA. Las nuevas cifras de AMD sobre capacidad HBM3E y ancho de banda muestran por qué la infraestructura para estas cargas se está convirtiendo en un campo competitivo.