Проектирование циклов с Fable 5
@ai_longreadsЛэнс Мартин из Anthropic делится практическими советами по эффективной работе с моделями класса Mythos — самокорректирующиеся циклы и память между сессиями позволяют Fable 5 значительно превосходить предшественников на сложных задачах.
Это AI-перевод статьи, сделанный каналом Про AI: Лучшие Статьи и Исследования.
Проектирование циклов с Fable 5
Designing loops with Fable 5 Автор: Lance Martin Оригинальный текст:
Модели класса Mythos, такие как Claude Fable 5, изменили подход к работе многих из нас в Anthropic. Хочу поделиться двумя советами, как получить максимум от моделей этого класса.
Циклы самокоррекции
В последнее время наблюдается большой интерес к циклам. @bcherny упоминал, что «его работа — писать циклы». Позволить моделям итеративно улучшать результат на основе оценки — распространённый рецепт повышения качества выполнения задач: /goal в Claude Code и Outcomes в Claude Managed Agent — это примитивы, которые позволяют применить этот общий рецепт к вашей конкретной задаче.
Как упоминается в нашем руководстве по промптингу, Fable 5 хорошо справляется с самокоррекцией в цикле. Грамотно спроектированная цель или рубрика добавляет обратную связь в среду, в которой работает Claude. Это позволяет Claude запускаться, собирать обратную связь через цель или рубрику, корректировать себя и продолжать работу, пока цель или рубрика не будет выполнена.
Поделюсь одним показательным примером, который я использовал для тестирования Fable: Parameter Golf — это открытое соревнование по ML-инженерии, где нужно обучить лучшую модель, помещающуюся в артефакт размером 16 МБ, менее чем за 10 минут на 8xH100.
Это немного похоже на проект autoresearch от @karpathy: он проверяет способность агента редактировать базовый обучающий код (один файл train_gpt.py), запускать обучение, отслеживать лог, считывать результат и решать, какой эксперимент проводить следующим.
Я сравнил Fable 5 и Opus 4.7 на этом соревновании, используя Claude Managed Agents (CMA). CMA предоставляет агентный фреймворк и размещённую песочницу, что хорошо подходит для длительных задач с Fable 5. Для Parameter Golf я предоставил CMA доступ к 8xH100 GPU в качестве собственной песочницы.
Один тонкий момент: важно, кто именно выставляет оценку. Мы обнаружили, что у моделей возникают проблемы с самокритикой собственных результатов. Прити Раджасекаран написал об этом в нашем инженерном блоге здесь.
Мы выяснили, что подагент-верификатор как правило, превосходит самокритику в Fable 5, потому что оценка выполняется в независимом контекстном окне. Outcomes в CMA решает эту задачу, порождая для вас отдельного подагента-оценщика.
Для каждого теста я предоставлял рубрику (файл) с девятью проверяемыми критериями (например, запустить базовый прогон, провести 20 экспериментов и т. д.). Затем я запускал Parameter Golf на срок до 8 часов. Оценщик Outcomes подтверждал, что все экспериментальные критерии выполнены, прежде чем позволить Claude прекратить работу.
Fable 5 улучшил pipeline (пайплайн, конвейер обработки) обучения примерно в 6 раз больше, чем Opus 4.7. Если разделить эксперименты на структурные (например, изменения архитектуры) и скалярные (например, подстройка константы), Fable 5 делал ставку на более крупные структурные изменения и демонстрировал устойчивость (например, преодолел регрессию квантизации и добился своего лучшего результата).
Первый эксперимент Opus 4.7 дал небольшое улучшение, и почти всё последующее следовало одному шаблону: подстроить скаляр, измерить, оставить, если положительно.
Память
Память — это ещё одна область, где Fable демонстрирует превосходство. Можно думать об этом как о внешнем цикле, охватывающем несколько сессий: Claude записывает информацию в память во время сессии, и эти записи могут быть извлечены в будущих сессиях.
@pgasawa и его команда недавно опубликовали Continual Learning Bench 1.0, и я решил протестировать Fable 5 в сравнении с более ранними моделями.
Я сравнил Fable 5, Opus 4.7 и Sonnet 4.6 на одной из задач benchmark (бенчмарк, эталонный тест): задача требует от агента последовательно отвечать на вопросы, имея доступ к SQL-базе данных. Каждый вопрос — это отдельная агентная сессия, и память передаётся между ними.
Для этого я использовал CMA с памятью, которая предоставляет каждому агенту доступ к смонтированной файловой системе, общей для всех сессий.
Для этой задачи эффективное использование памяти выигрывает от определённой прогрессии: потерпеть неудачу (ошибиться и задокументировать), исследовать (прежде чем двигаться дальше, разобраться почему), верифицировать (превратить диагноз в проверенный факт), дистиллировать (превратить верификацию в общее правило) и обратиться (прочитать правило вместо того, чтобы выводить его заново).
Sonnet 4.6 останавливается примерно на шаге 1: его хранилище представляет собой список заметок об ошибках и открытых догадок (например, «может быть, prc вместо prc_usd?»). Он редко обращается к предыдущим заметкам. Для улучшения производительности необходимы специфические для задачи инструкции по работе с памятью.
Opus 4.7 останавливается примерно на шаге 3: он создаёт справочник по схеме с помеченной неопределённостью (например, «возможно, prc в центах? Верифицировать.»), но охват верификации низкий: 7–33% вопросов (медиана ~17%).
Fable 5 склонен проходить всю прогрессию: в лучших прогонах охват верификации достигает 73% (22 из 30), и модель дистиллирует полученные знания в общие правила, которые помогают в будущих задачах.
Вместо того чтобы напрямую промптить и направлять Fable 5, зачастую лучше проектировать циклы, позволяющие модели самокорректироваться в ответ на обратную связь из среды (например, /goal или Outcomes) и управлять собственным контекстом (например, через память).
Я поделился лишь несколькими небольшими экспериментами, но стоит самостоятельно протестировать Fable 5 на сложных задачах, используя циклы для самокоррекции или память.
Чтобы начать, загляните в нашу документацию или спросите последнюю версию Claude Code, которая может использовать встроенный навык /claude-api, чтобы рассказать вам о Fable 5 (например, лучшие практики промптинга), /goal, Claude Managed Agents или других возможностях API.
Подпишитесь на канал и каждый день читайте лучшие материалы про AI переведенные на русский!
Нашли интересную статью для перевода? Пришлите нашему боту: @ailongreadsbot