EEG не читает мысли: speech decoding без хайпа
EEGBCIspeech-decoding
EEG-to-text пока упирается не в модель, а в сигнал
Главный факт простой: неинвазивный EEG speech decoding все еще не похож на свободное «мысли в текст». В обзоре Frontiers о covert speech decoding прямо перечислены низкий SNR, мышечные артефакты, слабое пространственное разрешение и практические проблемы сетапа; обзор 2025 года добавляет inter-subject variability и маленькие разнородные корпуса.
Поэтому демо надо читать аккуратно. В статье Frontiers 2024 года для неинвазивного EEG речь идет примерно о 70-80% на жестко ограниченных задачах, а на более сложных сценариях цифры падают примерно до 20-50%. Это не «плохой продукт», это физика канала: электрод, гель, мышечные артефакты, сессия, конкретный человек.
Мой первый вопрос к любому такому анонсу: что именно декодируется? Свободная фраза, выбранное слово, символ из интерфейса, класс сцены или реакция на стимул? Эти вещи часто склеивают в один красивый заголовок, хотя инженерно это разные задачи с разной ценой ошибки.
Рабочие пайплайны обычно хитрее заголовков
Самый надежный путь сейчас - не «прочитать мысль», а сузить пространство выбора. Eye-tracking показывает, куда человек смотрит, ERP вроде P300 подтверждает реакцию на нужный символ или слово, а модель делает классификацию не из бесконечного языка, а из маленького меню.
Вот тут маркетинг чаще всего начинает жонглировать словами. Если система показывает клавиатуру, ловит взгляд над символом и подтверждает выбор через event-related potential, это может быть полезным BCI. Но называть это полноценным thoughts-to-text - уже натяжка.
С видео похожая история. За десятилетие сильно выросла не магия декодирования мозга, а качество генераторов: GAN, diffusion, DiT, flow matching. Пайплайн «сигнал -> классификация сцены -> красивая генерация» может выглядеть как чтение визуального опыта, хотя EEG часто несет грубую семантику, а не точный кадр.
Где это реально меняет расклад
Реальная польза есть там, где задача заранее зажата рамками: выбор команд, простые игры, интерфейсы с кнопками, клиническая коммуникация, imaginary movements. Там низкая пропускная способность не убивает сценарий, если система честно проектируется вокруг ограничений.
Главный риск - cross-patient accuracy. Модель, которая выглядит прилично на одном человеке или в одной сессии, может резко сдуться на другом пациенте, другом дне и другом наборе электродов. Инвазивные подходы получают куда лучший сигнал, но даже там сложность пайплайна быстро возвращает всех на землю.
Так что мой вывод сухой: EEG BCI живой и местами очень полезный, но «декодирование мыслей» пока чаще упаковка для классификатора, интерфейса выбора и хорошего генератора. Самое интересное здесь не вау-демо, а честная граница между сигналом и дорисовкой.