Чему я научилась в OpenAI

Чему я научилась в OpenAI

@ai_longreads

Размышления бывшей сотрудницы Anthropic и OpenAI о проектировании оценок, пост-обучении моделей, природе исследований в ИИ и о том, почему субъективные способности моделей — следующий рубеж прогресса.

Это AI-перевод статьи, сделанный каналом Про AI: Лучшие Статьи и Исследования.


Чему я научилась в OpenAI

Things I learned at OpenAI Автор: Karina Nguyen Оригинальный текст:

Мой первый день в Anthropic начался в квартире в Нью-Йорке в 2022 году.

Когда я писала похожий пост об Anthropic около двух лет назад, Claude Code ещё не существовал, а навыки ИИ в программировании были куда более ограниченными. Мир стоял на пороге появления моделей, которые наконец смогут глубоко мыслить и решать сложные задачи, ранее казавшиеся недостижимыми.

Я пришла в OpenAI именно потому, что хотела внести вклад в смену парадигмы в момент, когда она происходит. Многое изменилось, но я всегда мечтала создавать оптимистичные видения будущего с помощью ИИ ([новый терминал Mesh](https://autumn-detective-45e.notion.site/Mesh-Reimagining-a-more-Humane-Command-Line-42140fd0338f47b19b9d365ecf7cce56), [визуальная рекомендательная система на ИИ InterAlia](https://x.com/karinanguyen/status/1587217615885406213)). Разница сейчас — в тайминге. Если AGI наступит через 2–5 лет, а я верю, что так и будет, отдача от высокой инициативности беспрецедентна.

Никогда ещё не было лучшего момента для создания нового и работы над самыми сложными и амбициозными задачами нашего времени. Экономика создания ценности переоценивается, потому что лучшие разработчики теперь могут делать больше, чем раньше (благодаря таким инструментам, как Claude Code), и получать больше от результата (рычаг умножается). Разрыв между средними и выдающимися результатами растёт, а потенциал всё более асимметричен.

Уроки

Оценки и benchmark'и (бенчмарки, эталонные тесты)

  • Хорошие оценки (evals) на удивление сложно проектировать. Лучшие из них достаточно просты, чтобы стать повсеместными, но при этом достаточно конкретны, чтобы измерять что-то осмысленное. Чёткие выходные данные, быстрая обратная связь, очевидные сигналы. Большинство оценок проваливаются хотя бы по одному из этих критериев. Трение при настройке инфраструктуры, интерпретации результатов или отладке ошибок определяет, будут ли исследователи вообще использовать их в цикле итераций. (Мы подробнее писали об этом в статье SimpleQA.)
  • Отличный benchmark (бенчмарк) становится точкой Шеллинга. Как только он появляется, вся область ориентируется на него, потому что каждый хочет заявить, что побил его. Вы двигаете область вперёд, стимулируя всех оптимизировать свои модели под бенчмарки. Вот почему создание правильной оценки иногда важнее, чем создание модели, которая показывает на ней хорошие результаты.

- Например, мы недавно выпустили PostTrainBench именно по этой причине.

Пост-обучение и продукт

  • Проектирование смесей данных для пост-обучения ближе к искусству, чем к инженерии. То же относится к изобретению методов, которые учат модели новым способностям. Человеческий вкус и креативность здесь имеют огромное значение.
  • Сбои в alignment (выравнивании) иногда являются сбоями абстракции, а не намерения. Многие нежелательные поведения возникают из-за того, что модель не может правильно абстрагировать принцип в разных контекстах.
  • Я пришла к убеждению, что пост-обучение — это следующий рубеж прогресса в ИИ, особенно для субъективных и трудноизмеримых способностей вроде эмоционального интеллекта, вкуса, юмора и творческого суждения. Базовые модели становятся всё более способными. Вопрос в том, знаем ли мы, как раскрыть то, что уже заложено в них, и как изобретать совершенно новые поведения, чтобы обучить их. Объективные способности имеют чёткие бенчмарки. Субъективные требуют иного мастерства: интуиции в работе с данными, чувства того, что работает, методов, которые мы ещё только изобретаем. Это рубеж, который действительно важен, и почти никто пока над ним не работает.
  • Я начала смотреть на продукты с точки зрения обучающих сигналов. ChatGPT canvas, например, был не просто интерфейсом для письма. Это был механизм сбора пользовательских сигналов о том, как люди хотят взаимодействовать с моделями. Продукт формирует данные, данные формируют модель, модель формирует то, чем может стать продукт.

Природа исследований в ИИ

  • Внутренний инструментарий — недооценённое конкурентное преимущество. Лаборатория с лучшим UX для оценок и обучения итерирует быстрее и раньше обнаруживает проблемы. Это накапливается.
  • Ключевой навык — проектировать эксперименты, дающие максимум информации на единицу вычислений (FLOP), потому что не все эксперименты стоят затраченных ресурсов. Важно понимать, когда маленькая аблация расскажет вам всё необходимое, а когда действительно нужно запускать на полном масштабе. Есть и мета-навык: распознавать, когда общепринятая мудрость области о том, что требует масштаба, на самом деле ошибочна, и вы можете узнать нужное за малую долю стоимости.
  • Результат, который никто не понимает, не распространяется. Выделите одно чёткое утверждение, одну хорошую визуализацию, одно запоминающееся число.
  • Разрыв между «пробовать случайные вещи» и «систематически сужать гипотезы» отделяет посредственных исследователей от эффективных. Отладочная интуиция — обучаемый навык, который приходит после проведения сотен экспериментов.
  • Самый долговечный навык в исследованиях ИИ — не какой-то конкретный технический вклад, а способность раз за разом определять, что важно именно сейчас, и быстро действовать. Выбор правильных задач столь же важен, как и их качественное выполнение.
  • Дерзкие идеи получают больше поддержки. У талантливых людей есть выбор; они не потратят его на инкрементализм. Если вы просите чьё-то время, вы обязаны предложить миссию, стоящую риска.
  • Некоторые открытия являются следствием инфраструктуры — невозможно прийти к определённым идеям, пока нет систем, которые позволяют их проверить. Сначала появляется инструментарий, затем — инсайт. Вот почему исследователи часто тратят время на инженерные задачи.
  • При этом некоторые находки зависят от инфраструктуры, а не являются инфраструктурно-агностичными. Они возникают из конкретного стека и окружения. Другие системы могли бы привести к совершенно иным открытиям.
  • Иногда начать с нуля эффективнее, чем инкрементально исправлять. Например, «прикручивание» личности к существующей модели означает борьбу с паттернами, оптимизированными под другое.
  • Личность модели — отражение людей, которые её обучали. Это буквальнее, чем большинство думает.

Среда

  • Человеческая политика и рассогласованность, возможно, является одним из ключевых узких мест на пути к AGI.
  • В быстро меняющемся окружении всё постоянно трансформируется: люди уходят, проекты сдвигаются, приоритеты перетасовываются. Естественно чувствовать дестабилизацию из-за этого, и я определённо её чувствовала. Глубоко заботьтесь о работе и людях, но старайтесь не привязывать своё чувство стабильности к какой-либо конкретной конфигурации — будьте адаптивны. Человек, с которым вы сотрудничаете сегодня, может оказаться где-то ещё через месяц. Это не повод заботиться меньше, а повод присутствовать, пока это длится.

Alignment (выравнивание) и влияние на общество

  • Одно из наиболее значимых обновлений моего мышления: более высокая способность коррелирует с лучшим alignment. Более способные модели менее склонны к обману, потому что лучше понимают, что обман подрывает доверие, и могут рассуждать о долгосрочных последствиях. Ценности вроде «будь полезен» или «будь честен» абстрактны; правильное применение их в различных контекстах требует сложного reasoning (рассуждения).
  • Риски становятся реальными только тогда, когда они становятся осязаемыми, но ждать инцидентов — почти слишком поздно. Мы создали оценки сикофантии в Anthropic за годы до того, как реальные инциденты с ChatGPT сделали этот риск очевидным для всех остальных.
  • Alignment — это культурная проблема. Социальный ущерб от AGI — психологическая зависимость, лишение возможностей, эрозия автономности — ближе, чем большинство людей осознаёт. Это глубоко тревожит. Особенно печально видеть, как часть индустрии развлечений сопротивляется этому моменту. Мало кто обладает большей властью формировать то, как человечество воображает будущее. Вместо сопротивления они могли бы рассказывать истории, помогающие миллиардам людей понять, что надвигается, и как встретить это с инициативой и заботой.

Первую половину двадцатых я провела, работая над Claude и ChatGPT. Миллиарды людей теперь просыпаются рядом с системами, в которых есть крошечная частичка моей любви. После этого иначе жить уже невозможно.

Мне 25, и я знаю, что хочу посвятить жизнь тем трудным проблемам, за которые ещё никто не брался. Обучать интеллект эмпатии, сторителлингу, творческому суждению, мастерству создания моделей и выравниванию ИИ-систем с тем, что действительно важно для нас, людей. Придумывать продукты, в которых люди и ИИ будут взаимодействовать по-новому. Вот работа, ради которой стоит жить.

Если что-то из этого вас вдохновляет, буду рада пообщаться (мой email — karina@thoughtfullab.com, или напишите мне в личные сообщения, наш сайт). Лучшая работа в моей жизни случалась рядом с людьми, которым было глубоко не всё равно.


Подпишитесь на канал и каждый день читайте лучшие материалы про AI переведенные на русский!

Нашли интересную статью для перевода? Пришлите нашему боту: @ailongreadsbot

Report Page