2 мин чтения

Needle 3: модель от 8 до 29 МБ с гибкой глубиной

Needle 3локальные моделидлинный контекст

Needle 3 от Cactus Compute — компактная модель для локальной автоматизации с развёртываемыми подсетями от 2 до 20 слоёв и заявленным размером от 8 до 29 МБ. Её архитектура необычна, но официальные материалы пока не подтверждают качество поиска фактов в длинном контексте.

Что именно выпустила Cactus Compute

Я бы описал Needle 3 не как чемпиона длинного контекста, а как очень компактную, масштабируемую по глубине модель для локальной автоматизации. Cactus Compute в репозитории проекта и карточке модели на Hugging Face называет её Laddered Simple Attention Network и указывает развёртываемые подсети от 2 до 20 слоёв. Заявленный размер составляет от 8 до 29 МБ.

Внутри использованы Monarch Hadamard MLP, GQA-внимание с каузальными свёрточными ответвлениями, энграммная память n-грамм с чтением через gather и многоканальные гиперсвязи. Набор выглядит не как случайная коллекция трюков: цель, судя по описанию, в том, чтобы удержать модель маленькой и пригодной для разных бюджетов вычислений. Возможность выбрать глубину здесь принципиальнее одного фиксированного размера.

Официальное позиционирование тоже довольно узкое и практичное: вызов инструментов, структурированное извлечение, мобильные действия и локальные агенты с ограничением по схеме. Документация пакета описывает класс Needle, формат ответа, работу с инструментами, настроенные веса, интерфейс командной строки и офлайн-режим. То есть релиз стоит оценивать прежде всего как компонент для устройств и автоматизации, а не как универсальную большую модель.

На 19 сентября 2026 года в доступных официальных материалах не видно таблицы long-context-бенчмарков или результатов needle-in-a-haystack именно для Needle 3. Это неприятный, но важный пробел: название легко подталкивает к выводу о сильном поиске иголки в стоге, однако опубликованные фрагменты такого вывода не подтверждают. Архитектура интересная; качество извлечения на большой глубине контекста пока остаётся открытым вопросом.

Что меняется для локальных агентов

Главное изменение в том, что разработчик получает не один жёсткий вариант модели, а семейство развёртываемых подсетей внутри общей архитектуры. Это полезно там, где один и тот же агент должен помещаться в разные ограничения устройства. Выигрывают сценарии с локальным вызовом инструментов и предсказуемым структурированным выводом.

Я бы первым делом проверял не красивую схему архитектуры, а три вещи: точность выбора инструмента, соблюдение заданной схемы и деградацию при уменьшении числа слоёв. Отдельный тест нужен памяти n-грамм: важно понять, помогает ли она на реальных повторяющихся шаблонах или лишь добавляет ещё один механизм со своими краевыми случаями.

Поэтому релиз выглядит содержательнее обычной гонки параметров, но не доказывает заявленную пользователем связь с эффективным длинным контекстом. У Needle 3 уже есть ясная инженерная форма, а убедительной публичной картины её пределов пока нет.

Ранее мы разбирали Pony Alpha в OpenRouter — модель с контекстным окном 200 тысяч токенов для тестирования архитектур и рабочих сценариев. Этот пример помогает сопоставить подход Needle 3 к задачам длинного контекста с доступными на рынке моделями.