3 мин чтения

EEG не читает мысли: speech decoding без хайпа

EEGBCIspeech-decoding

EEG speech decoding пока не равен чтению мыслей: неинвазивный сигнал шумный, плохо переносится между людьми и годится в основном для ограниченных интерфейсов. В обзоре Frontiers и работах 2024-2025 годов фигурируют примерно 70-80% точности на узких задачах и около 20-50% на более сложных.

EEG-to-text пока упирается не в модель, а в сигнал

Главный факт простой: неинвазивный EEG speech decoding все еще не похож на свободное «мысли в текст». В обзоре Frontiers о covert speech decoding прямо перечислены низкий SNR, мышечные артефакты, слабое пространственное разрешение и практические проблемы сетапа; обзор 2025 года добавляет inter-subject variability и маленькие разнородные корпуса.

Поэтому демо надо читать аккуратно. В статье Frontiers 2024 года для неинвазивного EEG речь идет примерно о 70-80% на жестко ограниченных задачах, а на более сложных сценариях цифры падают примерно до 20-50%. Это не «плохой продукт», это физика канала: электрод, гель, мышечные артефакты, сессия, конкретный человек.

Мой первый вопрос к любому такому анонсу: что именно декодируется? Свободная фраза, выбранное слово, символ из интерфейса, класс сцены или реакция на стимул? Эти вещи часто склеивают в один красивый заголовок, хотя инженерно это разные задачи с разной ценой ошибки.

Рабочие пайплайны обычно хитрее заголовков

Самый надежный путь сейчас - не «прочитать мысль», а сузить пространство выбора. Eye-tracking показывает, куда человек смотрит, ERP вроде P300 подтверждает реакцию на нужный символ или слово, а модель делает классификацию не из бесконечного языка, а из маленького меню.

Вот тут маркетинг чаще всего начинает жонглировать словами. Если система показывает клавиатуру, ловит взгляд над символом и подтверждает выбор через event-related potential, это может быть полезным BCI. Но называть это полноценным thoughts-to-text - уже натяжка.

С видео похожая история. За десятилетие сильно выросла не магия декодирования мозга, а качество генераторов: GAN, diffusion, DiT, flow matching. Пайплайн «сигнал -> классификация сцены -> красивая генерация» может выглядеть как чтение визуального опыта, хотя EEG часто несет грубую семантику, а не точный кадр.

Где это реально меняет расклад

Реальная польза есть там, где задача заранее зажата рамками: выбор команд, простые игры, интерфейсы с кнопками, клиническая коммуникация, imaginary movements. Там низкая пропускная способность не убивает сценарий, если система честно проектируется вокруг ограничений.

Главный риск - cross-patient accuracy. Модель, которая выглядит прилично на одном человеке или в одной сессии, может резко сдуться на другом пациенте, другом дне и другом наборе электродов. Инвазивные подходы получают куда лучший сигнал, но даже там сложность пайплайна быстро возвращает всех на землю.

Так что мой вывод сухой: EEG BCI живой и местами очень полезный, но «декодирование мыслей» пока чаще упаковка для классификатора, интерфейса выбора и хорошего генератора. Самое интересное здесь не вау-демо, а честная граница между сигналом и дорисовкой.

Мы уже разбирали актуальные AI-инструменты для транскрибации и саммаризации совещаний, такие как Otter.ai и Granola. Их точность и риски галлюцинаций перекликаются с задачей преобразования ЭЭГ-сигналов в осмысленный текст, где интерпретация данных ещё сложнее.