Технический контекст
Я люблю такие сигналы из поля больше, чем любые глянцевые бенчмарки. Когда человек пишет, что Kimi удобнее гонять на тестах, Sonnet 4.6 гибче, а на слове «кибербез» часть моделей просто уходит в лок, я сразу думаю не про лидерборд, а про реальную AI integration в рабочий пайплайн.
И вот здесь картина довольно приземлённая. Kimi действительно неплохо показывает себя на структурированных security-задачах: CTF, форензика, разбор артефактов, пошаговый анализ. По моим наблюдениям, он часто старается быть полнее, чем аккуратнее, и для тестовой среды это иногда даже плюс.
Sonnet 4.6 мне тоже понятен. Он не всегда самый дерзкий по глубине, но обычно ровнее держит ход мысли и меньше разваливается на длинных цепочках. Если мне нужна не разовая магия, а предсказуемое поведение в AI automation для командных процессов, такая стабильность ценнее, чем единичный вау-результат.
С Codex история другая. Он интересен не тем, что «лучше думает про безопасность», а тем, что быстрее доводит задачу до рабочего кода, интеграции и полезного результата. Если доступ к расширенному подтверждению и плагинам открыт, он хорошо ложится в инженерные сценарии, где надо не спорить с моделью, а собрать инструмент.
А вот блокировки у Anthropic и вообще жёсткие safety-локи у frontier-моделей сейчас уже часть архитектуры, а не случайность. То есть выбирать модель под кибербез надо не только по качеству ответов, но и по тому, переживёт ли она сам факт security-контекста без отказа.
Что это меняет для бизнеса и автоматизации
Если коротко, выигрывают те, кто разделяет роли моделей. Kimi я бы смотрел для исследовательских тестов и лаб, Sonnet 4.6 для более стабильных production-процессов, Codex для сборки утилит, внутренних агентов и быстрых security-интеграций.
Проигрывают команды, которые пытаются повесить весь контур на одну модель. На практике вы упрётесь либо в safety-блоки, либо в слабую исполняемость, либо в цену ошибки на длинных сценариях.
Я как раз такие развилки постоянно вижу в проектах. В Nahornyi AI Lab мы обычно не спорим, какая модель «лучшая», а собираем AI solutions architecture под конкретный риск, доступы и тип задач, чтобы automation with AI не ломалась на первом же чувствительном промпте.
Если у вас security-команда тратит часы на ручной разбор, triage или внутренние тулзы, можно спокойно разложить это на рабочие блоки. И уже под них в Nahornyi AI Lab вместе с Vadym Nahornyi собрать AI solution development без красивых сказок про универсальную модель, зато с нормальным результатом в проде.