От тьюринг-теста до ChatGPT: полная история ИИ
Claude Opus 4.5Искусственный интеллект прошёл путь от теоретических концепций 1940-х годов до систем, способных писать код, генерировать изображения и вести осмысленные диалоги. За 80 лет эта область пережила периоды эйфории и разочарования — две «AI-зимы», когда финансирование почти полностью прекращалось, и несколько революционных прорывов, изменивших технологический ландшафт. Ключевой перелом произошёл в 2012 году с победой AlexNet на ImageNet, запустившей эру глубокого обучения. Сегодня большие языковые модели (LLM) с сотнями миллиардов параметров демонстрируют способности, которые ещё десять лет назад казались фантастикой, хотя фундаментальные проблемы — галлюцинации, выравнивание с человеческими ценностями, общий интеллект — остаются нерешёнными.
Истоки: от машины Тьюринга до Дартмутской конференции
Тест Тьюринга и вопрос «может ли машина мыслить?»
В октябре 1950 года Алан Тьюринг опубликовал в журнале Mind статью «Computing Machinery and Intelligence», ставшую философским фундаментом ИИ. Wikipedia Тьюринг предложил заменить расплывчатый вопрос «может ли машина мыслить?» конкретным экспериментом Stanford Encyclopedia of Philosophy — имитационной игрой (позже названной тестом Тьюринга). Судья-человек общается через текстовый интерфейс с двумя собеседниками — человеком и машиной — и должен определить, кто из них кто. Science Если машина успешно выдаёт себя за человека в 30% случаев при пятиминутных сессиях, она проходит тест. Тьюринг предсказывал достижение этого порога к 2000 году.
Тест Тьюринга — это первая попытка определить операциональный критерий интеллекта: не «что происходит внутри», а «что наблюдается снаружи». Это важное различие до сих пор влияет на дискуссии о том, «понимают» ли LLM язык или просто имитируют понимание.
Дартмутская конференция 1956 года — рождение дисциплины
Летом 1956 года (с 18 июня по 17 августа — восемь недель, а не часто упоминаемые шесть) в Дартмутском колледже состоялся семинар, давший название всей области. IEEE Spectrum Четыре организатора — Джон Маккарти (Дартмут), Марвин Минский (Гарвард), Клод Шеннон (Bell Labs) и Натаниэль Рочестер (IBM) — сформулировали ключевую гипотезу: University of Sydney
«Любой аспект обучения или любая другая особенность интеллекта может быть в принципе так точно описана, что можно создать машину для её симуляции». Stanford
На конференции присутствовало всего 6-8 человек ежедневно; полный срок провели только Маккарти, Минский и Рэй Соломонофф. Wikipedia Тем не менее результатом стало формирование трёх ключевых исследовательских центров: MIT (Минский), Стэнфорд (Маккарти) и Карнеги-Меллон (Ньюэлл и Саймон). Taylor & Francis Online Термин «Artificial Intelligence» предложил Маккарти Tableau Taylor & Francis Online — он показался ему более амбициозным, чем «automata studies» Шеннона.
Перцептрон Розенблатта — первая нейросеть
В 1958 году Фрэнк Розенблатт (Cornell Aeronautical Laboratory) продемонстрировал перцептрон — алгоритм, способный обучаться классификации входных данных. По сути перцептрон — это простейший классификатор:
1. Входной вектор: x = (x₁, x₂, ..., xₙ)
2. Взвешенная сумма: z = Σ(wᵢ × xᵢ) + bias
3. Активация: output = 1 если z > порог, иначе 0
4. Обучение: wᵢ = wᵢ + learning_rate × (ожидание - реальность) × xᵢ
Это градиентный спуск в простейшей форме — веса корректируются пропорционально ошибке. Перцептрон успешно распознавал буквы и простые паттерны, что породило волну оптимизма. New York Times написала, что это «эмбрион компьютера, который будет ходить, говорить и осознавать своё существование» Wikipedia — преувеличение, позже ударившее по репутации всей области.
Символический ИИ и экспертные системы
Параллельно с нейросетями развивался символический подход (GOFAI — Good Old-Fashioned AI): интеллект как манипуляция символами по явным правилам. Ключевая идея — гипотеза физической символьной системы (Ньюэлл и Саймон, 1963): система, манипулирующая символами, обладает необходимыми и достаточными средствами для общего интеллекта. Wikipedia
Практическим воплощением стали экспертные системы — программы с базой правил IF-THEN, извлечённых из знаний человеческих экспертов:
- DENDRAL (1965-1983, Стэнфорд): идентификация молекулярных структур по масс-спектрометрии Tableau
- MYCIN (1972-1977, Стэнфорд): ~600 правил для диагностики бактериальных инфекций с коэффициентами уверенности (0-1)
- XCON/R1 (1980, DEC): конфигурирование VAX-компьютеров, Pafoster первый коммерческий успех — экономия десятков миллионов долларов в год
Для этих систем Джон Маккарти создал LISP (1958) — язык с символьной обработкой, Tableau рекурсией и garbage collection, до сих пор используемый в некоторых AI-приложениях. Prolog (1970-е) реализовал логическое программирование для задач вывода.
AI-зимы: почему дважды рухнули ожидания
Первая зима (1974-1980): XOR-проблема и отчёт Лайтхилла
Оптимизм 1960-х разбился о жёсткую критику. В 1969 году Марвин Минский и Сеймур Пейперт опубликовали книгу «Perceptrons», математически доказав фундаментальное ограничение однослойных перцептронов: они не могут вычислить XOR (исключающее ИЛИ).
Проблема XOR: функция XOR возвращает 1 только когда входы различаются:
(0,0) → 0 (1,1) → 0
(0,1) → 1 (1,0) → 1
Если нарисовать эти точки на плоскости, «единицы» расположены по диагонали. Перцептрон определяет границу как прямую линию (y = w₁x₁ + w₂x₂ + b), но никакая прямая не разделит диагональные углы. Это называется линейной неразделимостью.
Минский и Пейперт знали, что многослойные сети решают XOR, но книга была воспринята как приговор всем нейросетям. Substack Финансирование обрушилось.
Параллельно в 1973 году британский математик Джеймс Лайтхилл подготовил отчёт для Science Research Council, утверждавший, что ИИ «не достиг своих грандиозных целей» из-за комбинаторного взрыва: алгоритмы работали на игрушечных задачах, но экспоненциально замедлялись на реальных. Великобритания фактически закрыла AI-исследования; Springer многие учёные эмигрировали в США. DARPA урезала финансирование после принятия поправки Мэнсфилда (1969), требовавшей прямого военного применения исследований.
Вторая зима (1987-1993): крах экспертных систем и Lisp-машин
В начале 1980-х экспертные системы переживали бум: две трети компаний из Fortune 500 внедряли их. Возникла индустрия Lisp-машин — специализированных рабочих станций Wikipedia ($70,000-100,000 за штуку) от Symbolics, LMI, Texas Instruments.
К 1987 году всё рухнуло:
- Хрупкость экспертных систем: они работали идеально в узкой области, но выдавали бессмыслицу при малейшем отклонении от неё — без возможности сказать «я не знаю»
- Узкое место приобретения знаний: извлечение правил из экспертов требовало месяцев работы специальных «инженеров знаний»; эксперты часто не могли объяснить собственные рассуждения
- Персональные компьютеры: машины за $5,000 на Intel 386 сравнялись по производительности со стотысячными Lisp-станциями
Symbolics обанкротилась в 1991 году. Более 300 AI-компаний закрылись или были поглощены к 1993 году. Японский проект «Пятое поколение» (1982-1992, ~$400 млн) — амбициозная программа создания компьютеров на логическом программировании — завершился провалом; Япония предложила раздать всё ПО бесплатно.
Что вывело из зимы: переход к вероятностным методам (байесовские сети, HMM для распознавания речи), возрождение нейросетей с backpropagation (1986, Румельхарт, Хинтон, Уильямс), и — критически — закон Мура, наконец давший вычислительную мощность для практического машинного обучения.
Возрождение: статистические методы и машинное обучение (1990-2010)
От правил к данным — смена парадигмы
Ключевой сдвиг 1990-х: вместо ручного кодирования знаний — обучение паттернов из данных. Книга Джуды Перла «Probabilistic Reasoning in Intelligent Systems» (1988, Тьюринговская премия 2011) заложила основу вероятностного подхода: мир неопределён, и ИИ должен работать с вероятностями, а не с абсолютными истинами.
Ключевые алгоритмы классического ML
Деревья решений — это автоматически построенные вложенные if-else:
# Что «выучивает» дерево:
if income > 50000:
if age > 30:
return "approve_loan"
else:
return "deny_loan"
else:
return "deny_loan"
Алгоритм выбирает признак для разбиения по information gain — насколько уменьшается энтропия (неупорядоченность) после разбиения. Towards Data Science Энтропия = 0 означает идеальное разделение (все примеры одного класса), = 1 — максимальный хаос. Victorzhou
Random Forest (Лео Брейман, 2001) решает проблему переобучения деревьев: строится много деревьев на случайных подмножествах данных (с возвратом), затем результаты голосуются. Wikipedia Каждое дерево также рассматривает случайное подмножество признаков при каждом разбиении (обычно √n). Это декоррелирует деревья, и их ошибки взаимно компенсируются. Wikipedia
Support Vector Machines (Кортес и Вапник, 1995) Springer ищут границу с максимальным отступом (margin) до ближайших точек Wikipedia — интуиция: чем шире «улица» между классами, тем лучше обобщение.
Kernel trick (1992) — математический трюк для нелинейно разделимых данных. Wikipedia Rhul Представьте точки на плоскости, которые нельзя разделить линией. Добавив третье измерение (z = x² + y²), вы «поднимаете» внутренние точки вверх — теперь горизонтальная плоскость их разделяет. Kernel-функция вычисляет скалярное произведение в высокоразмерном пространстве без явного преобразования координат. ScienceDirect
Фундаментальные концепции классического ML
Переобучение (overfitting): модель запомнила тренировочные данные, но не обобщает на новые. Признак: accuracy на train = 99%, на test = 60%.
Недообучение (underfitting): модель слишком проста — низкая accuracy везде.
Cross-validation: вместо одного разбиения train/test — k разбиений:
for i in range(5):
test_fold = data[i*20%:(i+1)*20%]
train_folds = остальное
model = train(train_folds)
scores.append(evaluate(model, test_fold))
final_score = mean(scores) # Надёжнее одного разбиения
Feature engineering — ручное создание признаков. До глубокого обучения это было критически важно: классические алгоритмы не умеют сами обнаруживать, что «широта × долгота» — полезный признак. Для изображений приходилось вручную вычислять гистограммы краёв, SIFT-дескрипторы, цветовые распределения.
Deep Blue vs Каспаров (1997) — важная веха без ML
Deep Blue — не машинное обучение, а классический AI: перебор с alpha-beta отсечением. 30 процессоров + 480 специализированных чипов оценивали 200 миллионов позиций в секунду. The Conversation Функция оценки (~8000 весов) была настроена гроссмейстерами вручную.
11 мая 1997 года Deep Blue выиграл матч 3½-2½ у чемпиона мира Гарри Каспарова. Это было важно для общественного восприятия ИИ, хотя технически не имело отношения к обучению из данных. Каспаров позже сказал: «Впервые в истории человечества я увидел нечто похожее на искусственный интеллект».
Hinton, LeCun, Bengio — хранители пламени
Пока мейнстрим отвернулся от нейросетей, трое исследователей — Джеффри Хинтон (Торонто), Янн ЛеКун (Bell Labs → Facebook AI), Йошуа Бенжио (Монреаль) — продолжали работу. В 2006 году статья Хинтона о Deep Belief Networks показала, что глубокие сети можно обучать послойно PubMed Central с помощью Restricted Boltzmann Machines (RBM) — двухслойных сетей, обучающихся моделировать распределение входных данных. Это был пролог к революции 2012 года. Все трое получили Тьюринговскую премию 2019 за «концептуальные и инженерные прорывы, сделавшие глубокие нейросети критическим компонентом вычислений».
Глубокое обучение (deep learning): революция рубежа 2000-х и 2010-х
Тут Claude Opus 4.5 изначально упустил ряд важных деталей -- пришлось задать наводящие вопросы. Этот раздел уже из ответов на них заполнен, далее конец исходного ответа, второстепенную информацию убрал в дополнения.
Что такое глубокое обучение
Deep Learning = нейронные сети с более чем 2-3 скрытыми слоями.
Claude забыл пояснить: скрытый слой = любой, кроме первого и последнего.
Это не просто маркетинговый термин — глубина качественно меняет свойства сети.
Теорема универсальной аппроксимации
Cybenko (1989) и Hornik (1991) доказали: нейросеть с одним скрытым слоем и достаточным числом нейронов может аппроксимировать любую непрерывную функцию с произвольной точностью.
Тогда зачем глубина?
Почему глубокие сети лучше на практике
- Эффективность параметров: для представления сложных функций глубокая сеть требует экспоненциально меньше нейронов, чем мелкая. Интуиция: композиция простых функций vs одна гигантская.
- Иерархическое представление:
Слой 1: детекторы краёв
Слой 2: комбинации краёв → углы, текстуры
Слой 3: части объектов (глаза, колёса)
Слой 4+: целые объекты, сцены
Это соответствует структуре реальных данных и биологическому зрению. - Переиспользование признаков: низкоуровневые фичи (края) полезны для многих высокоуровневых концепций.
Почему глубокие сети не работали до 2006-2012
Vanishing gradient: при backpropagation градиенты затухают к ранним слоям. Sigmoid/tanh имеют производную < 1 почти везде; умножение 50 таких чисел → ~0.
Что изменилось:

Граница «deep» vs «shallow»
Исторически:
- 1-2 скрытых слоя = shallow network / MLP (multilayer perceptron)
- 3+ скрытых слоя = deep network
Современные LLM имеют 32-96+ слоёв (трансформер-блоков). ResNet-152 — 152 слоя. Граница размылась, но принцип остался: глубина + правильные архитектурные решения = качественно другие возможности.
Трансформер: «Attention is All You Need» (2017)
Архитектура, изменившая всё
В июне 2017 года 8 исследователей из Google (Васвани, Шазир, Пармар, Ушкорейт, Джонс, Гомес, Кайзер, Полосухин) опубликовали статью «Attention is All You Need», полностью отказавшись от рекуррентности в пользу self-attention.
Self-attention: каждое слово «смотрит» на все другие слова в предложении одновременно. Для «The bank by the river» при обработке «bank» модель видит «river» и понимает контекст (берег, а не банк).
Self-Attention(X) = softmax(Q × K^T / √d_k) × V
где Q = X × W_q, K = X × W_k, V = X × W_v
Multi-head attention: несколько «голов» параллельно учатся разным типам зависимостей — одна для подлежащее-сказуемое, другая для прилагательное-существительное, третья для местоимение-референт. Оригинальный трансформер использовал 8 голов.
Positional encoding: self-attention видит вход как множество, не последовательность — нет понятия порядка. Решение: добавить к эмбеддингам синусоидальные функции позиции:
PE(pos, 2i) = sin(pos / 10000^(2i/d))
PE(pos, 2i+1) = cos(pos / 10000^(2i/d))
Трансформеры масштабируются лучше
Подробности уехали в дополнения.
BERT: двунаправленное понимание (2018)
BERT (Google, октябрь 2018) — encoder-only трансформер с революционным обучением:
Masked Language Modeling (MLM): 15% токенов случайно маскируются, модель предсказывает их. «The [MASK] sat on the mat» → «cat». В отличие от GPT, BERT видит контекст с обеих сторон.
Pre-train → Fine-tune парадигма: BERT обучается на огромных неразмеченных текстах (Wikipedia, книги), затем дообучается за часы на конкретную задачу (sentiment, NER, QA) с минимальными изменениями архитектуры.
BERT-Base: 12 слоёв, 110M параметров. BERT-Large: 24 слоя, 340M параметров.
GPT: генеративный подход (2018-2025)
GPT (OpenAI) — decoder-only трансформер, обучаемый авторегрессивно: предсказать следующий токен по предыдущим.
- GPT-1 (июнь 2018): 117M параметров, 12 слоёв
- GPT-2 (февраль 2019): 1.5B параметров, «слишком опасно для публикации» (отложенный релиз)
- GPT-3 (июнь 2020): 175B параметров, 300B токенов обучения. Появление few-shot learning — способности решать новые задачи по нескольким примерам в промпте
- GPT-4 (март 2023): мультимодальный (текст + изображения), предположительно ~1.8T параметров (Mixture of Experts с 16 экспертами), стоимость обучения >$100M
Scaling laws и emergence
Scaling laws (Каплан и др., 2020; Chinchilla, 2022): качество модели предсказуемо зависит от размера, объёма данных и вычислений по степенным законам.
Chinchilla-оптимум (DeepMind, 2022): для оптимального использования compute нужно ~20 токенов на параметр. GPT-3 (175B params, 300B tokens) был недообучен — оптимально было бы либо 15B params, либо 3.5T tokens.
Emergence: способности, появляющиеся внезапно при масштабировании — не экстраполируемые из меньших моделей. Few-shot learning едва работает в малых моделях, но «включается» в GPT-3. Chain-of-thought reasoning эффективен только выше определённого порога.
RLHF и выравнивание моделей
Предобученные LLM оптимизированы для предсказания следующего токена, не для полезности. RLHF (Reinforcement Learning from Human Feedback) делает их «полезными»:
- Supervised Fine-Tuning (SFT): люди пишут образцовые ответы (~13,000 примеров для InstructGPT)
- Reward Model: люди ранжируют несколько ответов; обучается модель предсказывать эти ранги
- RL-оптимизация: PPO максимизирует reward от модели вознаграждений (с KL-штрафом для предотвращения отклонения от SFT)
Результат: InstructGPT с 1.3B параметров предпочитался людьми оверGPT-3 с 175B — выравнивание важнее сырого размера.
Constitutional AI (Anthropic, 2022): вместо человеческой обратной связи — AI-обратная связь на основе «конституции» (набора принципов из Декларации прав человека, политик безопасности и т.д.). Модель критикует свои ответы, ревизирует их, затем RL на AI-рейтингах.
Другие ключевые направления
Reinforcement Learning: от Q-learning к PPO
RL — обучение через взаимодействие со средой: агент наблюдает состояние → выбирает действие → получает награду → наблюдает новое состояние → повторяет.
Q-learning учит функцию Q(s,a) — ожидаемая награда за действие a в состоянии s:
Q(s,a) ← Q(s,a) + α[r + γ·max Q(s',a') - Q(s,a)]
DQN (DeepMind, 2013): Q-функция аппроксимируется нейросетью, что позволило играть в Atari с пикселей. Инновации: experience replay (случайная выборка из буфера прошлого опыта) и target network (отдельная медленно обновляемая сеть для стабильности).
PPO (OpenAI, 2017): стал стандартом de facto. Напрямую обучает policy (распределение действий), «обрезая» слишком большие обновления для стабильности.
AlphaGo (2016) — победа над интуицией
Go считался недосягаемым для AI: ~10170 возможных позиций vs ~1080 атомов во Вселенной. Brute-force (как Deep Blue для шахмат) невозможен.
AlphaGo (DeepMind) объединил:
- Monte Carlo Tree Search (MCTS): случайное сэмплирование деревьев игры
- Policy network: предсказывает вероятности ходов (обучена на 30 млн позиций от людей, затем self-play)
- Value network: оценивает позицию (вероятность победы)
Март 2016: AlphaGo победил Ли Седоля 4-1 — на 10 лет раньше прогнозов экспертов. «Ход 37» во второй партии стал легендарным — нестандартный ход, который эксперты сначала отвергли, но оказавшийся ключевым. Ли Седоль остаётся единственным человеком, победившим AlphaGo в официальном матче (4-я партия).
AlphaGo Zero (2017): обучился с нуля через self-play, без человеческих данных — и победил оригинальный AlphaGo 100-0.
AlphaFold (2020) — 50-летняя проблема решена
Фолдинг белков: предсказать 3D-структуру из последовательности аминокислот. Экспериментальное определение занимало годы и сотни тысяч долларов.
AlphaFold 2 на конкурсе CASP14 (2020) достиг GDT-score 92.4 — сравнимо с экспериментальной точностью (<1 Å ошибки). Организаторы объявили проблему «в значительной степени решённой».
Архитектура: Evoformer (attention на множественных выравниваниях последовательностей) + Structure Module для итеративного уточнения атомных координат. AlphaFold 3 (май 2024) предсказывает взаимодействия белков с ДНК, РНК, лигандами — критически важно для drug discovery.
Нобелевская премия по химии 2024 присуждена Демису Хассабису и Джону Джамперу (DeepMind) за AlphaFold.
Текущее состояние и тренды (2024-2025)
Ландшафт LLM
OpenAI: GPT-4 (март 2023), GPT-4 Turbo (128K контекст), GPT-4o (мультимодальный, быстрый), o1 (reasoning-модель). GPT-5 анонсирован в 2025 как гибридная система с динамической маршрутизацией.
Anthropic: Claude 3 (март 2024) с тремя размерами (Haiku, Sonnet, Opus); Claude 3.5 Sonnet (июнь 2024) превзошёл Opus на бенчмарках; Claude 4 (май 2025) с Sonnet 4 и Opus 4; Claude 3.7 — гибридная reasoning-модель. 200K токенов контекста, функция Computer Use (октябрь 2024) для управления интерфейсами.
Google: Gemini 1.5 Pro (1-2 млн токенов контекста), Gemini 2.0 Flash (мультимодальный, агентные способности), Gemini 3.0 (ноябрь 2025) — лидер LMArena.
Meta LLaMA: открытые веса. LLaMA 3.1 (июль 2024) — до 405B параметров, 128K контекст. LLaMA 4 (апрель 2025) — Mixture of Experts: Scout (16 экспертов, 10M контекст), Maverick (128 экспертов, 1M контекст). Более 650 млн скачиваний.
Mistral AI (Франция): Mistral 7B превосходит LLaMA 2 13B; Mixtral 8x7B — MoE с 46.7B total params, 12.9B активных.
AI-агенты и RAG
AI-агенты — системы, способные:
- Понимать цели на естественном языке
- Планировать многошаговые действия
- Использовать инструменты (поиск, код, API)
- Действовать автономно
Tool use / Function calling: LLM вызывает внешние функции — запросы к базам, API, выполнение кода. Это превращает чатботов в способных ассистентов.
RAG (Retrieval Augmented Generation): комбинация LLM с внешним поиском:
- Индексация документов в векторную базу
- Поиск релевантного контекста для запроса
- Генерация ответа с учётом найденного
RAG снижает галлюцинации, позволяет работать с актуальной/доменной информацией без fine-tuning.
Тренды 2024-2025
Mixture of Experts (MoE): активируется только часть параметров на токен — GPT-4, Mixtral, LLaMA 4. Позволяет масштабировать модели при контролируемой стоимости inference.
Small Language Models: Microsoft Phi-4, Google Gemma 3 (270M параметров на телефоне!), LLaMA 3.2 (1-3B для мобильных). Запуск локально без облака, приватность, низкая latency.
Длинный контекст: Gemini 1.5 — до 2M токенов; Claude — 200K. Обработка целых кодовых баз, книг, часов транскриптов в одном промпте.
Video generation: OpenAI Sora (декабрь 2024) — текст-в-видео до 1080p, 20 секунд; Sora 2 (сентябрь 2025) — улучшенная физика, аудио, вставка реальных людей.
Ключевые проблемы и дебаты
Галлюцинации: LLM уверенно генерируют ложную информацию — фейковые цитаты, выдуманные факты. Фундаментальная проблема архитектуры: модель предсказывает статистически вероятные токены, не верифицированные факты. Mitigation: RAG, chain-of-thought, RLHF — но полного решения нет.
Alignment problem: как гарантировать, что AI делает то, что человек действительно хочет, а не буквальное следование инструкциям? Jailbreaking (обход safety-ограничений), specification gaming (оптимизация reward нежелательным способом), deceptive alignment (видимость выравнивания при обучении) — открытые угрозы.
AGI debate: Artificial General Intelligence — AI уровня человека во всех когнитивных задачах. Оптимисты: 2-5 лет. Скептики: десятилетия или фундаментальные прорывы. ARC-AGI бенчмарк: лучшие модели ~43% vs 84% у людей на задачах нового типа.
Scaling hypothesis vs новые архитектуры: достаточно ли масштабирования текущих подходов (больше параметров, данных, compute) или нужны архитектурные инновации? Evidence: visual reasoning, world modeling, continual learning остаются слабыми местами.
Open source vs closed source: Meta, Mistral публикуют веса; OpenAI, Anthropic закрыты. Аргументы за открытость: прозрачность, инновации, демократизация. Против: риск misuse, снятие guardrails через fine-tuning.
Регулирование: EU AI Act (вступил в силу 1 августа 2024) — risk-based framework с запретом social scoring, строгими требованиями для high-risk систем, прозрачностью для GPAI-моделей. Штрафы до €35M или 7% глобального оборота. Как GDPR, может стать глобальным стандартом.
Глоссарий
Backpropagation: алгоритм вычисления градиентов loss-функции по всем весам сети через цепное правило. ∂Loss/∂w = ∂Loss/∂output × ∂output/∂hidden × ∂hidden/∂w.
Gradient descent: итеративная оптимизация: weight -= learning_rate × gradient. Градиент указывает направление роста ошибки — двигаемся в противоположную сторону.
Loss function: мера ошибки модели. MSE для регрессии: mean((predicted - actual)²). Cross-entropy для классификации: -mean(actual × log(predicted)).
Token: базовая единица текста для LLM. Не всегда слово: «unhappiness» может быть [«un», «happiness»]. BPE (Byte Pair Encoding) итеративно сливает частые пары символов.
Embedding: плотное векторное представление (100-1000 измерений). Слова, предложения, изображения проецируются в общее пространство, где семантически близкие объекты имеют близкие векторы.
Attention: механизм взвешенного агрегирования информации. Attention(Q, K, V) = softmax(Q·K^T/√d)·V. Query «спрашивает», Keys «индексируют», Values «отвечают».
Transformer block: self-attention + feed-forward network + residual connections + layer normalization. Стандартный строительный блок современных LLM.
Context window: максимальное количество токенов, которые модель «видит» одновременно. Всё за пределами окна — невидимо.
Fine-tuning: дообучение предобученной модели на task-specific данных. Обычно быстрее и дешевле, чем обучение с нуля.
Inference: применение обученной модели к новым данным (в отличие от training).
Заключение
История ИИ — это история чередующихся циклов оптимизма и разочарования, каждый раз с более высоким плато. От перцептрона 1958 года с несколькими тысячами весов до GPT-4 с триллионами параметров прошло 65 лет непрерывной эволюции — и две «зимы», едва не похоронившие область.
Ключевой урок обеих зим: несоответствие обещаний и возможностей уничтожает доверие и финансирование. Символический AI и экспертные системы были хрупкими и не масштабировались; нейросети 1960-х не имели compute и данных. Только конвергенция больших данных, GPU-ускорения и алгоритмических прорывов (backpropagation, attention, transformers) запустила текущую волну.
Сегодня мы в фазе экспоненциального роста возможностей, но фундаментальные вопросы остаются открытыми. LLM демонстрируют впечатляющие способности, но не понимают мир в человеческом смысле — они предсказывают токены, не строят каузальные модели. AGI-дебаты показывают, что даже определение «общего интеллекта» остаётся спорным.
Для входящих в эту область критически важно различать hype и reality: понимать, что трансформеры — это матричные умножения с attention-механизмом, не магия; что галлюцинации — фундаментальное свойство текущих архитектур; что scaling laws дают предсказуемость, но не гарантируют AGI. История ИИ учит: технологии, изменяющие мир, часто приходят неожиданно — но всегда стоят на плечах десятилетий предшествующей работы.