2 хв читання

AMD MI350P: 144 ГБ пам’яті та 4 ТБ/с

AMD Instinct MI350PHBM3Eинференс LLM

AMD Instinct MI350P отримав 144 ГБ пам’яті HBM3E та пікову пропускну здатність 4 ТБ/с. Це помітний PCIe-варіант для інференсу великих моделей, де розміщення ваг і контексту на одному прискорювачі має значення. Офіційної ціни AMD поки не назвала, тому оцінка близько 20 тисяч доларів лишається припущенням.

Що саме пропонує AMD MI350P

Почати варто з головної цифри: AMD Instinct MI350P отримав 144 ГБ пам’яті HBM3E з піковою пропускною здатністю 4 ТБ/с. Саме такі характеристики AMD вказує на сторінці продукту разом із 4096-бітним інтерфейсом пам’яті. Для одного PCIe-прискорювача це серйозна заявка на інференс великих моделей.

Обсяг пам’яті тут важливіший за абстрактне порівняння обчислювальних блоків. 144 ГБ підвищують шанси розмістити модель, розширений контекст або більший пакет запитів на одному пристрої. Це не гарантує високої швидкості генерації, але зменшує потребу ділити модель між кількома прискорювачами.

Пропускна здатність 4 ТБ/с особливо важлива для операцій, що впираються у зчитування ваг із пам’яті. Водночас це пікове значення зі специфікації, а не обіцяна швидкість конкретної LLM. Реальний результат залежатиме від формату ваг, розміру пакета, довжини контексту, ядер інференсу та зрілості програмного стека.

MI350P належить до екосистеми ROCm і архітектурної лінійки CDNA 4 з AMD Infinity. AMD позиціонує його як серверний прискорювач для стандартних систем із повітряним охолодженням, а не як відеокарту для робочої станції. Тому пряме порівняння з RTX 6000 лише за обсягом пам’яті може виглядати ефектно, але змішує різні класи пристроїв.

Із ціною ситуація менш визначена. Станом на 20 серпня 2026 року AMD не вказала офіційну роздрібну ціну на доступній сторінці продукту. Оцінка на рівні близько 20 тисяч доларів фігурує як ринкове припущення, тому будувати на ній розрахунки вартості інфраструктури зарано.

Чому 144 ГБ справді змінюють розклад

Для інференсу це не косметичне оновлення: додаткова пам’ять може замінити складну багатокарткову конфігурацію одним прискорювачем. Менше обміну між пристроями означає простіше розгортання і потенційно передбачуванішу затримку, хоча фінальний результат все одно потрібно перевіряти на конкретній моделі.

Найбільший виграш буде у сценаріях, де модель майже вміщується в менший обсяг пам’яті або де контекст і пакет швидко з’їдають запас. Проте сама місткість не скасовує обмежень ROCm, сумісності фреймворків і потреби в якісних оптимізованих ядрах. Насамперед я б перевірив підтримку потрібної моделі та стабільність її робочого профілю, а вже потім дивився на красиві терабайти за секунду.

MI350P виглядає реальною альтернативою прискорювачам NVIDIA для великого інференсу, але поки не очевидною заміною. Вирішальними будуть не лише 144 ГБ, а й доступність, фактична ціна та те, наскільки легко ці характеристики перетворюються на токени за секунду.

Раніше ми розглядали Cocoon і те, як конфіденційні обчислення змінюють економіку та приватність ШІ-інференсу. Нові показники AMD щодо HBM3E й пропускної здатності показують, чому інфраструктура для таких завдань стає конкурентним полем.