Union Alpha и Laguna впереди в незавершённом тесте
AI-моделиLLMтестирование моделей
Что показал первый прогон моделей
Я бы пока не называл это рейтингом, но первый расклад уже занятный: лучше остальных себя показали Union Alpha и Laguna-S-2.1. Первичный источник здесь не карточка модели и не стандартизированный бенчмарк, а заметки разработчика из опубликованного обсуждения с реальным незавершённым прогоном.
В тест одновременно отправили Union Alpha, Nex-N2.5-Pro, Dots-3-Note, Laguna-S-2.1, Cohere North-mini-code, Nemotron-3-Ultra, Gemma-4-31B и GLM-5.2. Последняя работала без tool calling и с контекстным окном 32K. Прогон пришлось прервать из-за грозы и отключения компьютеров от сети, поэтому результаты отражают только состояние на момент остановки.
Union Alpha оказалась медленной, зато продолжала работать. Laguna-S-2.1 выглядела убедительно по качеству, но её подвёл нестабильный провайдер. Это важное различие: в прикладном сценарии модель, которая отвечает чуть хуже, но предсказуемо доступна, иногда полезнее сильной модели за ненадёжным API.
Nex-N2.5-Pro получил осторожную оценку как многообещающий. Cohere North-mini-code показался слабым, Dots-3-Note ломался на большом контексте, а по Nemotron-3-Ultra вывод сделать не удалось из-за нестабильной работы провайдера. Gemma-4-31B и GLM-5.2 в этом прогоне пошли плохо, хотя причин отдельно не разбирали.
Отдельно в обсуждении прозвучала гипотеза, что под капотом другой системы, JEV, может находиться Qwen 2.5 на 14B, а косвенным признаком назвали окно 32K. Это именно OSINT-реконструкция, а не подтверждённая архитектура. Саму JEV участник к тому моменту ещё не тестировал.
Почему стабильность здесь важнее красивого списка моделей
Главный практический вывод простой: такой прогон измеряет не только интеллект модели, но и весь тракт до ответа. Провайдер, задержка, удержание длинного контекста и доступность tool calling способны перевернуть результат сильнее, чем разница в абстрактном качестве генерации.
Union Alpha выигрывает предварительный раунд не скоростью, а тем, что продолжала отвечать. Laguna-S-2.1 выглядит сильным кандидатом, однако нестабильный доступ делает её рискованной для длинных агентных задач. Dots-3-Note уже обозначил более конкретную границу: проблемы возникают при росте контекста.
Я бы в следующем прогоне первым делом разделил ошибки модели и ошибки провайдера, затем повторил одинаковые задачи с фиксированной длиной контекста. Иначе слабый API легко принять за слабую LLM, а случайный удачный ответ за устойчивое качество.
Пока это не финальный вердикт, а полезный снимок инженерной реальности: модель выбирают по всей системе, и название на endpoint часто говорит меньше, чем её поведение после нескольких часов работы.