NEvo
Neural-Guided Evolutionary Video Synthesis for Dynamic Visual SelectivityВаш скептицизм совершенно обоснован и затрагивает центральное предположение современной вычислительной нейронауки (neuroAI). Поскольку эксперименты проводились исключительно компьютерным моделированием, авторы не могут со 100% уверенностью гарантировать, что живой человеческий мозг отреагирует идентично. Однако утверждение авторов не основано на слепых домыслах. Их главный аргумент опирается на три столпа: прогностическую достоверность, методологический прецедент и биологическую проверку на адекватность:
1. Основано на реальных данных о человеческом мозге («цифровой двойник»).
Модель кодирования мозга, лежащая в основе NEvo, не является теоретической формулой; это статистическая модель, обученная непосредственно на сотнях часов реальных данных фМРТ человека из открытых наборов данных (BOLDMoments и набор данных фМРТ социального взаимодействия).
- Базовая нейронная сеть (V-JEPA 2) была обучена прогнозировать повоксельную активность фМРТ в зрительной коре головного мозга человека, когда испытуемые смотрели видео из реальной жизни.
- Авторы проверили эту модель на отложенных данных человеческого мозга (данных, которые модель никогда не видела во время обучения) и показали, что она достигает высокой предельной предсказательной способности — то есть она точно предсказывает реальные нейронные реакции человека лучше, чем существующие модели, такие как CLIP (рис. 4D).
2. Доказанный прецедент в области статического зрения (перенос результатов моделирования в условия реальной жизни).
Хотя синтез видео in silico — относительно новая технология, данная методология неоднократно подтверждалась in vivo на статических изображениях в течение последних пяти лет:
- Знаковые исследования (например, Bashivan et al., 2019; Ponce et al., 2019; Tuckute et al., 2024) использовали модели глубокого обучения для синтеза «синтетических сверхстимулов», предназначенных для максимизации активности нейронов в электрофизиологических исследованиях на обезьянах или в функциональной МРТ человека.
- Когда эти сгенерированные ИИ статические изображения впоследствии предъявлялись живым животным/людям, они успешно «гиперактивировали» целевые области мозга, превосходя естественные стимулы, как и предсказывали модели. NEvo расширяет этот устоявшийся, проверенный алгоритм на динамическую (видео) область.
3. Биологические «проверки на адекватность»
Чтобы доказать, что система действительно обучается биологической настройке, а не использует математические ошибки в ИИ, авторы показали, что NEvo независимо «заново открыл» известные на протяжении десятилетий данные в области визуальной нейронауки:
- При задании максимизировать площадь веретенообразной области лица (FFA) NEvo органично генерировал человеческие лица.
- При воздействии на парагиппокампальную область места (PPA) он генерировал сцены окружающей среды и архитектуру.
- При воздействии на область MT он генерировал согласованные векторы движения.
Поскольку NEvo не получал предварительных правил относительно предпочтений этих областей, тот факт, что он синтезировал именно эти категории, доказывает, что лежащая в основе модель мозга отражает истинную биологическую настройку.
Как авторы структурируют свою работу
Авторы прямо признают ограничение, связанное с использованием компьютерного моделирования, в разделе «Обсуждение». Они представляют NEvo не как замену экспериментам на людях, а скорее как ускоренный генератор гипотез:
“Вместо того чтобы гадать, какое созданное вручную видео показать человеку в аппарате МРТ, или случайным образом просматривать миллионы видеороликов на YouTube, NEvo использует вычислительный «цифровой двойник», чтобы сузить бесконечное пространство возможных видеороликов до нескольких высокоспецифичных, проверяемых кандидатов”.
Основная цель NEvo — создание этих «гиперактивирующих» динамических стимулов in silico, чтобы нейробиологи могли использовать их в экспериментах с замкнутым контуром функциональной МРТ человека для проверки новых предположений о том, как человеческий мозг обрабатывает сложные социальные и динамические визуальные события.
Как они решили проблему того, что фМРТ — это чрезвычайно медленный метод по сравнению со скоростью активации нейронов? Это ограничение может подорвать выводы исследования, даже если сама модель была обучена правильно.
Поскольку функциональная МРТ измеряет сигнал BOLD, отражающий изменения кровотока, отстающие от нейронной активности на секунды, она действует как биологический низкочастотный временной фильтр. Авторы не утверждают, что обходят или исправляют это биологическое ограничение; скорее, они специально проектируют свою вычислительную архитектуру, чтобы соответствовать ему. Вот как они решают эту проблему и почему это не опровергает их выводы:
1. Прогнозирование «интегрированной активности событий», а не мгновенных реакций.
Вместо того чтобы пытаться предсказывать нейронные импульсы с точностью до миллисекунды, NEvo моделирует работу мозга в том временном масштабе, который фактически измеряется с помощью фМРТ: интегрированное метаболическое усилие за короткое визуальное событие.
- Наборы данных: NEvo обучался на таких наборах данных, как BOLDMoments, где люди просматривали короткие 2-секундные видеоролики. В анализе данных фМРТ обобщенная линейная модель (GLM) вычисляет единое статистическое значение («бета-вес») для каждого вокселя на протяжении всего 2-секундного ролика.
- Модель мозга: Авторы извлекают глубинные признаки из видеоархитектуры ИИ (V-JEPA 2) по всем кадрам 2-секундного видео и усредняют эти признаки во времени, прежде чем передать их в модель прогнозирования вокселей (раздел B.2).
- Принцип работы: Путем временного объединения признаков ИИ модель имитирует функцию гемодинамического ответа (HRF) мозга, которая математически интегрирует (суммирует) нейронную активность в течение нескольких секунд.
2. Высокоуровневая зрительная кора учитывает динамику «масштаба событий».
В то время как движение низкого уровня (например, обнаружение вспышки света) происходит за миллисекунды, конкретные области мозга, которые исследует NEvo, — такие как задняя верхняя височная борозда (pSTS) или экстрастриарная область тела (EBA) — настроены на динамические концепции высокого уровня:
- «Рукопожатие», «улыбка», «поворот тела» или «совместное действие» не могут существовать в течение 10-миллисекундного снимка. Это семантические визуальные события, для развития которых по своей природе требуется от 1 до 2 секунд.
- Временное разрешение фМРТ более чем достаточно для определения того, была ли кортикальная популяция сильно активирована 2-секундным фрагментом социального взаимодействия по сравнению с 2-секундным фрагментом случайного движения.
3. Что заявляет проект NEvo и чего НЕ заявляет.
Для обеспечения достоверности выводов исследования важно различать, что именно измеряет NEvo:
- NEvo не утверждает, что может выявить точные миллисекундные импульсные отклики отдельных нейронов (например, «Воксель X сработал через 120 мс, когда рука достигла точки Y»).
- NEvo утверждает, что может определить пространственно-временные предпочтения признаков, которые обеспечивают устойчивую метаболическую активность в локальных цепях мозга в течение 2-секундного окна (например, «Область pSTS максимально активна, когда два объекта взаимодействуют синхронно, агентно в течение 2 секунд»).
Почему методология эффективна
Ограничение скорости фМРТ подорвало бы исследование только в том случае, если бы NEvo утверждала, что оптимизирует нейронные траектории на уровне миллисекунд. Поскольку NEvo определяет свою «единицу визуального мышления» как событие длительностью 2 секунды — и заставляет свой кодировщик ИИ объединять признаки за тот же самый период времени — временное разрешение фМРТ совпадает с временным масштабом пространства поиска генеративного ИИ.
Более того, поскольку NEvo является модульной структурой, если исследователи захотят в будущем картировать динамическую избирательность на уровне миллисекунд, им не нужно будет менять эволюционный алгоритм NEvo; они просто заменят медленную модель кодирования фМРТ на модель ЭЭГ, МЭГ или внутричерепной электрофизиологии (iEEG), которая регистрирует нейронные ответы с разрешением в миллисекунды.
Эти видео уместнее интерпретировать не столько как визуальные, сколько как семантические сверхстимулы, поскольку они активизируют мозг именно благодаря своему семантическому содержанию. В этом плане данную работу можно рассматривать как развитие подхода Эвелины Федоренко из MIT, которая использовала текстовые суперстимулы для различных отделов коры головного мозга.
Да, ваша интерпретация не только жизнеспособна, но и напрямую отражает научную преемственность данной работы. На самом деле, связь, которую вы провели с лабораторией Эвелины Федоренко, отнюдь не случайна: Мартин Шримпф, старший/ответственный автор этой статьи о NEvo, был соавтором вместе с Федоренко в том знаменательном исследовании 2024 года: «Driving and suppressing the human language network using large language models».
NEvo, по сути, является прямым визуальным и динамическим аналогом разработанной Федоренко системы лингвистических текстовых суперстимулов. Вот как эти две парадигмы можно объединить.
Почему «семантические сверхстимулы» — правильная концептуальная основа.
По мере продвижения обработки визуальной информации вверх по кортикальной иерархии различие между «чисто визуальными сенсорными признаками» и «абстрактными семантическими понятиями» полностью стирается:
- Низкоуровневая зрительная кора (V1, V3A, MT): Здесь стимулы действуют преимущественно как визуальные/кинематические стимулы. Они управляют нейронами посредством пространственной частоты, контраста границ и направленных векторов движения (оптический поток).
- Высокоуровневые зрительные и социальные пути (pSTS, aSTS, EBA, FFA): Здесь видео действуют точно как семантические сверхстимулы.
- Периферическая верхняя височная борозда (pSTS) реагирует не только на то, что «фигура движется со скоростью ровно 5 см/с» (кинематика); она активируется, потому что «два субъекта борются или танцуют» (субъектность и социальное взаимодействие).
- Передняя верхняя височная борозда (aSTS) реагирует на коммуникативное намерение — по своей сути семантический конструкт, даже если оно передается через свет, отражающийся от экрана.
Кроме того, алгоритм эволюционного поиска NEvo работает непосредственно в интерпретируемом семантическом пространстве генов (выбирая такие гены, как InteractionType, SocialCue, IntentionSignal, Mood). NEvo не оптимизирует цвета пикселей; он манипулирует высокоуровневыми семантическими концептами для построения визуального повествования, которое «обманывает» высшие отделы обработки социальной информации в мозге, заставляя их максимально вовлекаться в процесс.
Как текстовые работы Федоренко, так и работы Шримпфа по NEvo основаны на одном и том же базовом принципе нейроИИ: Генеративный ИИ (LLM / Диффузия) ⟶ Пространство поиска (подсказки/текст) ⟶ Цифровой двойник мозга ⟶ Сверхстимул.
Интеграция NEvo с языковыми сверхстимулами открывает широкие возможности для исследований на стыке зрения, языка и социального познания:
1. Исследование «супрамодальных» социальных и семантических центров.
Такие области, как передняя верхняя височная борозда (aSTS), височно-теменное соединение (TPJ) и медиальная префронтальная кора (mPFC), являются частью как расширенной языковой сети, так и социального мозга (сети теории разума).
- Эксперимент: Можно сгенерировать текстовый сверхстимул, используя метод Федоренко (например, предложение, описывающее сложное предательство или секрет), и видео-сверхстимул, используя NEvo, визуально демонстрирующий то же самое социальное событие.
- Вопрос: Сходятся ли эти независимо оптимизированные текстовые и видео сверхстимулы на одну и ту же нейронную популяцию в высших височных/теменных областях? Это позволило бы доказать, кодирует ли область мозга абстрактное, независимое от модальности «семантическое понятие» или же представление, связанное с сенсорной информацией.
2. Межмодальная совместная оптимизация
Вместо раздельного поиска в текстовом и видеопространстве, будущие системы могли бы использовать мультимодальные LLM в качестве совместных кодировщиков. Алгоритм поиска мог бы одновременно уточнять текстовое повествование и сгенерированный видеоролик, определяя точную комбинацию подписи и видеоматериала, обеспечивающую максимальный нейронный резонанс.
Заключение
Рассматривая результаты работы NEvo как семантические сверхстимулы, можно точно определить, на что на самом деле реагируют высшие зрительные и латеральные пути: не только на динамический свет и движение, но и на смысл, субъектность и социальные события, разворачивающиеся во времени. Сопоставление с работой Федоренко подчеркивает фундаментальный сдвиг в когнитивной нейронауке — от тестирования небольших, изолированных стимулов к использованию генеративного ИИ для исследования всего многомерного семантического пространства человеческого разума.
RE: https://nevo-project.epfl.ch/