Kaggle открыл конкурс coding-агентов на Gemma 4
Gemma 4KaggleAI-агенты
Что именно предлагает конкурс
Меня здесь цепляет сама постановка: Kaggle предлагает не написать еще один чат-бот, а дообучить открытую Gemma 4 до автономного coding-агента. На официальной странице соревнования Kaggle под названием Google - The Gemma 4 Developer Agent Competition акцент сделан на практических сценариях разработки и работе на повседневном оборудовании. Призовой фонд на момент анонса составляет $100 000, срок подачи заявок - 25 ноября 2026 года.
Техническая база выглядит подходящей именно для агента. В официальном обзоре Google для Gemma 4 заявлены текстовый, аудио- и графический вход, поддержка более 140 языков и контекст от 128K до 256K токенов. Такой контекст может вместить заметную часть репозитория, описание задачи, историю изменений и результаты выполнения инструментов, хотя сам по себе размер окна еще не гарантирует аккуратную работу с кодом.
В документации Gemini API также указаны размещенные модели gemma-4-31b-it и gemma-4-26b-a4-b-it для разработки приложений и прототипов. Примеры в документации NVIDIA показывают многошаговые диалоги, обработку изображений и вызов функций. Для coding-агента последний пункт особенно важен: без надежного управления инструментами модель остается генератором текста, а не участником рабочего цикла.
Соревнование, судя по описанию, нацелено на агентную инженерию, а не на одиночный прогон модели по статическому набору задач. Значение будут иметь планирование, выбор инструментов, проверка результата и восстановление после ошибки. Именно на таких переходах между моделью и средой обычно разваливаются красивые демонстрации.
Полная схема оценки и формат отправки в предоставленных материалах не подтверждены. Поэтому сравнивать будущие решения по существу получится только с учетом официальных правил Kaggle, а не одного размера модели или контекста.
Почему это больше, чем конкурс промптов
Главное изменение простое: центр тяжести смещается с ответа модели на поведение всей системы. Сильным окажется не обязательно агент с самым эффектным рассуждением, а тот, кто стабильно читает состояние проекта, вызывает нужный инструмент и проверяет собственные изменения.
Я бы в первую очередь смотрел на надежность циклов исправления, изоляцию выполнения кода и деградацию на длинных задачах. Отдельный вопрос связан с обещанием работы на повседневном оборудовании: большой контекст полезен, но он же повышает требования к памяти и задержке. Здесь инженерные компромиссы быстро становятся важнее презентационных возможностей.
Так что хайп вокруг автономности пока лучше держать под контролем. Настоящий результат конкурса определит не то, насколько убедительно Gemma 4 пишет код, а то, насколько редко ее агент теряет нить задачи после первого сбоя.