2 хв читання

Union Alpha та Laguna лідирують у незавершеному тесті

AI-моделиLLMтестирование моделей

Union Alpha та Laguna-S-2.1 показали найкращі проміжні результати у практичному тесті безкоштовних моделей. Водночас Union Alpha працювала повільно, а Laguna залежала від нестабільного провайдера. Незавершений запуск доводить: надійність API, обробка контексту й доступність функцій важать не менше за базову якість моделі.

Що показав перший запуск моделей

Я б поки не називав це рейтингом, але початкова картина вже цікава: Union Alpha та Laguna-S-2.1 показали себе краще за інші. Первинним джерелом тут є не картка моделі й не стандартизований бенчмарк, а нотатки розробника з опублікованого обговорення реального незавершеного запуску.

Одночасно тестували Union Alpha, Nex-N2.5-Pro, Dots-3-Note, Laguna-S-2.1, Cohere North-mini-code, Nemotron-3-Ultra, Gemma-4-31B і GLM-5.2. Остання працювала без tool calling і з контекстним вікном 32K. Запуск довелося перервати через грозу та відключення комп’ютерів від живлення, тому результати відображають лише стан на момент зупинки.

Union Alpha була повільною, зате продовжувала працювати. Laguna-S-2.1 виглядала переконливо за якістю, але її підвів нестабільний провайдер. Це важлива відмінність: у прикладному сценарії модель, що відповідає трохи гірше, але передбачувано доступна, іноді корисніша за сильнішу модель за ненадійним API.

Nex-N2.5-Pro отримала обережну оцінку як перспективна модель. Cohere North-mini-code здалася слабкою, Dots-3-Note давав збої на великому контексті, а щодо Nemotron-3-Ultra не вдалося зробити висновок через нестабільну роботу провайдера. Gemma-4-31B і GLM-5.2 у цьому запуску показали слабкий результат, хоча причини окремо не розбирали.

В обговоренні також пролунала гіпотеза, що в основі іншої системи, JEV, може бути Qwen 2.5 на 14B, а непрямою ознакою назвали вікно 32K. Це OSINT-реконструкція, а не підтверджена архітектура. Саму JEV учасник на той момент ще не тестував.

Чому стабільність важливіша за гарний список моделей

Головний практичний висновок простий: такий запуск вимірює не лише інтелект моделі, а й увесь шлях до відповіді. Провайдер, затримка, утримання довгого контексту та доступність tool calling можуть змінити результат сильніше, ніж різниця в абстрактній якості генерації.

Union Alpha виграє цей попередній раунд не швидкістю, а тим, що не припиняла відповідати. Laguna-S-2.1 виглядає сильним кандидатом, однак нестабільний доступ робить її ризикованою для тривалих агентних завдань. Dots-3-Note вже окреслила конкретнішу межу: проблеми виникають зі зростанням контексту.

У наступному запуску я б насамперед відокремив помилки моделі від помилок провайдера, а потім повторив однакові завдання з фіксованою довжиною контексту. Інакше слабкий API легко сприйняти за слабку LLM, а випадкову вдалою відповідь — за стабільну якість.

Це ще не остаточний вердикт, а корисний знімок інженерної реальності: модель обирають як частину всієї системи, і назва на endpoint часто говорить менше, ніж її поведінка після кількох годин роботи.

Раніше ми порівнювали безкоштовні AI-інструменти для підсумовування зустрічей за точністю, обмеженнями безкоштовних тарифів і ризиком галюцинацій. Це оцінювання доповнює стрес-тест, показуючи, чому реальні умови роботи так само важливі, як результати бенчмарків.