Qwen-Image-2.1: 7B і до 10 референсів
Qwen-Image-2.1генерация изображениймодели с открытыми весами
Що саме випустила Alibaba
Тут привертає увагу не гучне порівняння з GPT Image 1.5, а поєднання 7B і повноцінного редагування. В офіційному репозиторії Qwen на GitHub Alibaba описує Qwen-Image-2.1 як єдину модель для генерації та редагування зображень; 7 млрд параметрів належать саме візуальному генеративному компоненту.
Модель приймає до 10 референсних зображень і вміє об'єднувати їх в одній композиції. Такий режим потрібен не лише для перенесення стилю: серед заявлених сценаріїв є збереження ідентичності, складання одягу або продукту з кількох джерел і керування окремими елементами сцени.
Редагування також не виглядає декоративною функцією. Заявлено точні локальні зміни, видалення фону та нативний прозорий вивід RGBA. У документації згадується і роздільність 2K, тому Qwen-Image-2.1 орієнтується не тільки на гарні демонстрації, а й на макети, картки, схеми та інші матеріали з подальшою обробкою.
Окремий акцент зроблено на тексті, інфографіці та щільних сторінках із версткою. Це історично проблемна зона дифузійних моделей: великий заголовок вони вже часто опановують, але дрібні підписи та зв'язний макет нерідко перетворюють на візуальну кашу.
Alibaba заявляє перевагу над GPT Image 1.5 у власних бенчмарках. Незалежний GenAI Showdown показує стриманішу картину: Qwen-Image-2.1 отримала 7 із 15 проти 4 із 15 у Qwen-Image 1.0, але залишилася позаду Ideogram 4 з результатом 8 із 15. Відгуки про текст також розходяться: одні хвалять дрібні написи, інші отримують нечитабельний результат.
Станом на 22 вересня 2026 року ваги доступні через Hugging Face, а код опублікований на GitHub. Проте термін open source тут потребує застереження: на сторінці ліцензії вказано Qwen Research License Agreement, а доступні описи зазначають некомерційні обмеження. Точніше називати її моделлю з відкритими вагами, а не моделлю з дозвільною ліцензією OSI.
Чому компактність важливіша за перемогу в таблиці
Практична цінність Qwen-Image-2.1 у тому, що сильну генерацію та редагування вмістили у відносно компактний візуальний компонент. Це робить локальні експерименти реалістичнішими, хоча опубліковані дані не дають універсальної відповіді щодо вимог до пам'яті та швидкості на конкретному обладнанні.
Я б насамперед перевіряв не загальний бал, а три речі: стабільність дрібного тексту, збереження об'єктів під час роботи з кількома референсами та точність локальних правок. Саме тут гарні приклади зазвичай розходяться з повторюваним робочим процесом.
Отже, це не автоматична заміна закритим генераторам. Водночас відкриті ваги, редагування й до 10 референсів в одній моделі справді змінюють ситуацію для досліджень і локальних прототипів. Головне невирішене питання тепер не в ефектності демо, а в тому, наскільки стабільно модель зберігає заявлені сильні сторони поза ним.