Пост Александра Ванга и новый дефицит данных
данные для ИИсинтетические данныеScale AI
Что в публикации можно утверждать точно
Я бы не стал делать вид, что знаю содержание поста: точный текст публикации Александра Ванга в X недоступен в предоставленных материалах. Индексированная запись датирована 2 октября 2026 года, поэтому приписывать ей конкретные формулировки или выводы было бы выдумкой.
Доступный контекст, однако, вполне предметный. В смежных интервью и материалах Scale AI Ванг последовательно говорит о переходе от массовых данных из открытого интернета к проприетарным корпоративным наборам, экспертным данным для передовых задач и синтетическим примерам с человеческой проверкой.
Технически это означает смену узкого места. Недостаточно сгенерировать еще один массив правдоподобных ответов: нужны правила отбора, специалисты предметной области, контроль ошибок и контур оценки, который не вознаграждает модель за убедительно оформленную ерунду.
Отдельно выделяется идея гибридных human-AI пайплайнов. Модель помогает создавать и масштабировать данные, а человек направляет процесс и проверяет качество. Это не отмена разметки, а ее переход на более сложный уровень: от простых меток к оценке рассуждений, специализированных ответов и поведения системы.
Почему выбор модели уже не решает задачу
Практический вывод здесь сильнее очередного спора о моделях: устойчивое преимущество смещается в данные и обратную связь. Одинаковая базовая модель может давать принципиально разный результат в зависимости от качества корпуса, схемы оценивания и того, как ошибки возвращаются в пайплайн.
Для разработчиков это меняет приоритеты. Сначала я бы проверял происхождение данных, покрытие редких случаев, согласованность экспертных оценок и защиту от накопления синтетических ошибок. Только после этого имеет смысл обсуждать тонкую настройку или замену модели.
Для Scale AI такой тезис логично расширяет роль компании от разметки к инфраструктуре данных и оценивания. Но главная инженерная интрига остается прежней: синтетические данные легко масштабировать, а доверие к ним по-прежнему масштабируется плохо.