3 мин чтения

Kaggle открыл конкурс coding-агентов на Gemma 4

Gemma 4KaggleAI-агенты

Kaggle открыл конкурс Google Gemma 4 Developer Agent Competition: участникам предлагают дообучить открытую модель до автономного coding-агента. Призовой фонд составляет $100 000, заявки принимают до 25 ноября 2026 года. Конкурс важен тем, что проверяет надежность агентной инженерии на обычном оборудовании, а не только результаты бенчмарков.

Что именно предлагает конкурс

Меня здесь цепляет сама постановка: Kaggle предлагает не написать еще один чат-бот, а дообучить открытую Gemma 4 до автономного coding-агента. На официальной странице соревнования Kaggle под названием Google - The Gemma 4 Developer Agent Competition акцент сделан на практических сценариях разработки и работе на повседневном оборудовании. Призовой фонд на момент анонса составляет $100 000, срок подачи заявок - 25 ноября 2026 года.

Техническая база выглядит подходящей именно для агента. В официальном обзоре Google для Gemma 4 заявлены текстовый, аудио- и графический вход, поддержка более 140 языков и контекст от 128K до 256K токенов. Такой контекст может вместить заметную часть репозитория, описание задачи, историю изменений и результаты выполнения инструментов, хотя сам по себе размер окна еще не гарантирует аккуратную работу с кодом.

В документации Gemini API также указаны размещенные модели gemma-4-31b-it и gemma-4-26b-a4-b-it для разработки приложений и прототипов. Примеры в документации NVIDIA показывают многошаговые диалоги, обработку изображений и вызов функций. Для coding-агента последний пункт особенно важен: без надежного управления инструментами модель остается генератором текста, а не участником рабочего цикла.

Соревнование, судя по описанию, нацелено на агентную инженерию, а не на одиночный прогон модели по статическому набору задач. Значение будут иметь планирование, выбор инструментов, проверка результата и восстановление после ошибки. Именно на таких переходах между моделью и средой обычно разваливаются красивые демонстрации.

Полная схема оценки и формат отправки в предоставленных материалах не подтверждены. Поэтому сравнивать будущие решения по существу получится только с учетом официальных правил Kaggle, а не одного размера модели или контекста.

Почему это больше, чем конкурс промптов

Главное изменение простое: центр тяжести смещается с ответа модели на поведение всей системы. Сильным окажется не обязательно агент с самым эффектным рассуждением, а тот, кто стабильно читает состояние проекта, вызывает нужный инструмент и проверяет собственные изменения.

Я бы в первую очередь смотрел на надежность циклов исправления, изоляцию выполнения кода и деградацию на длинных задачах. Отдельный вопрос связан с обещанием работы на повседневном оборудовании: большой контекст полезен, но он же повышает требования к памяти и задержке. Здесь инженерные компромиссы быстро становятся важнее презентационных возможностей.

Так что хайп вокруг автономности пока лучше держать под контролем. Настоящий результат конкурса определит не то, насколько убедительно Gemma 4 пишет код, а то, насколько редко ее агент теряет нить задачи после первого сбоя.

Ранее мы разбирали, как AI coding-агент справляется с задачей создания системного ПО и в каких местах его результат может подвести на практике. Этот опыт помогает оценить инженерные компромиссы при создании developer-агента на Gemma 4.