Kaggle відкрив конкурс coding-агентів на Gemma 4
Gemma 4KaggleAI-агенты
Що саме пропонує конкурс
Тут привертає увагу сама постановка: Kaggle пропонує не створити ще один чат-бот, а донавчити відкриту Gemma 4 до автономного coding-агента. На офіційній сторінці змагання Kaggle під назвою Google - The Gemma 4 Developer Agent Competition акцент зроблено на практичних сценаріях розробки та роботі на звичайному обладнанні. На момент анонсу призовий фонд становить $100 000, а дедлайн подання заявок — 25 листопада 2026 року.
Технічна база виглядає доречною саме для агента. В офіційному огляді Google для Gemma 4 заявлено текстовий, аудіо- та графічний вхід, підтримку понад 140 мов і контекст від 128K до 256K токенів. Такий контекст може вмістити значну частину репозиторію, опис завдання, історію змін і результати роботи інструментів, хоча сам розмір вікна ще не гарантує акуратної роботи з кодом.
У документації Gemini API також зазначено розміщені моделі gemma-4-31b-it і gemma-4-26b-a4-b-it для розробки застосунків і прототипів. Приклади в документації NVIDIA показують багатокрокові діалоги, обробку зображень і виклики функцій. Останній пункт особливо важливий для coding-агента: без надійного керування інструментами модель лишається генератором тексту, а не учасником робочого циклу.
Судячи з опису, змагання націлене на агентну інженерію, а не на один запуск моделі по статичному набору завдань. Значення матимуть планування, вибір інструментів, перевірка результату та відновлення після помилки. Саме на таких переходах між моделлю та середовищем зазвичай руйнуються красиві демонстрації.
Повну схему оцінювання та формат подання в наданих матеріалах не підтверджено. Тому майбутні рішення варто порівнювати лише з урахуванням офіційних правил Kaggle, а не за одним лише розміром моделі чи контексту.
Чому це більше, ніж конкурс промптів
Головна зміна проста: центр ваги зміщується з відповіді моделі на поведінку всієї системи. Сильним буде не обов'язково агент із найефектнішим міркуванням, а той, хто стабільно читає стан проєкту, викликає потрібний інструмент і перевіряє власні зміни.
Насамперед я б дивився на надійність циклів виправлення, ізоляцію виконання коду та деградацію на довгих завданнях. Окреме питання пов'язане з обіцянкою роботи на звичайному обладнанні: великий контекст корисний, але він також підвищує вимоги до пам'яті та затримки. Тут інженерні компроміси швидко стають важливішими за презентаційні можливості.
Тож хайп навколо автономності поки варто стримувати. Справжній результат конкурсу визначить не те, наскільки переконливо Gemma 4 пише код, а те, наскільки рідко її агент втрачає нитку завдання після першого збою.