Grok 4.6 — полевое руководство

Grok 4.6 — полевое руководство

@ai_longreads

Разработчик Cursor несколько недель использовал Grok 4.6 как основную рабочую модель и специально собрал на нём несколько проектов, чтобы прощупать пределы. Главный вывод: короткий промпт плюс жёстко заданная проверка результата дают больше, чем длинные детальные спецификации.

Это AI-перевод статьи, сделанный каналом Про AI: Лучшие Статьи и Исследования.


Grok 4.6 — полевое руководство

Grok 4.6 – A field guide Автор: eric zakariasson Оригинальный текст:

Grok 4.6 вышел! Я несколько недель использовал его как основную рабочую модель на обычной смеси из программирования и knowledge work (интеллектуальной работы с информацией), а ещё собрал на нём несколько проектов специально для того, чтобы прощупать, где он держит удар.

Он хорош во всём этом. Но сильнее всего выделяется то, как он общается и насколько он быстрый, — а вовсе не какой-то отдельный скачок в способностях.

Плотная по информации коммуникация

Он работает в связке так, что с ним легко идти рядом. Его сводки плотно набиты реальной информацией, а не пересказом моей же задачи обратно мне, а короткие апдейты по ходу работы говорят достаточно, чтобы понять, стоит ли вмешиваться.

Он молчит, пока правки небольшие, и начинает комментировать, когда затрагивает много файлов. Чтобы правильно нащупать эту границу, потребовалось больше настройки, чем можно подумать. Иногда он всё ещё сообщает мне то, что мне не нужно, — над этим мы работаем.

Восхитительная скорость

4.5 тоже был быстрым. 4.6 быстрый и при этом заметно умнее, и это сочетание подтолкнуло меня к более синхронному способу работы. Вместо того чтобы заранее загружать кучу контекста и ждать, я прошу что-то небольшое, смотрю на результат и иду дальше. Та же самая сессия может перейти к задаче с длинным горизонтом — достаточно просто её попросить.

Я переключаюсь между синхронным и асинхронным режимами в зависимости от того, в чём лучшие модели оказываются хороши в конкретный месяц. Асинхронный режим позволяет сделать больше, пока я нахожусь где-то ещё, но я теряю нить и в итоге разбираю большой дифф (список изменений в коде) на холодную. 4.6 тянет меня обратно к синхронной работе — а именно там я и предпочитаю быть, когда мне важен результат.

Большая часть этих недель была обычной работой. Он ходил за меня по сайтам, в том числе создавал API-ключи, прокликивая консоль провайдера. Он делал функциональное и визуальное QA (контроль качества) на запущенных приложениях. Он разгрёб мой инбокс до горстки тредов, которые действительно требовали ответа, — это ощущение не приедается никогда. Он помог мне набросать посты о запуске Cursor SDK Bridge и /rename-chat, а ещё собрал для них обоих ролик-анонс на Remotion!

Короткие промпты, строгая проверка

Часть этих недель я потратил на то, чтобы стравить разные стили промптинга (составления запросов к модели) друг с другом. Длинные против коротких — и меняют ли результат конкретные формулировки вроде «work very hard» («работай очень усердно»). Обнаружил я вот что: формулировка почти не давала вообще никакой разницы.

А вот длина давала — правда, не так, как я предполагал. Длинный промпт покупает конкретику: если вы точно знаете, чего хотите, — запишите это. Короткий промпт отдаёт больше решений вкусу модели. Раньше этот размен был аргументом за то, чтобы расписывать всё. У 4.6 вкус достаточно хорош, чтобы короткий промпт плюс ясно выраженное предпочтение обычно приводили куда-то в хорошее место.

Длинные спецификации по-прежнему прекрасно работают, если такая у вас есть. Я дал ему подробную спеку на виджет обратной связи с записью сессии, серверным обработчиком и отправкой задач облачному агенту — и он прошёл всё это от начала до конца с разумной структурой. Он действительно повторяется в компонентах, если не попросить его разбить их на части.

Один из проектов, которые я собрал, — приложение-таблица; я дал его обеим моделям по два раза. Один прогон получил двухстраничную спецификацию, покрывающую каждый элемент тулбара, каждое сочетание клавиш и каждую формулу, какие я только смог придумать. Другой получил три предложения.

Build a polished Sheets/Excel-style app in Next.js and an AI chat that can analyze the sheet. Use the Cursor SDK for all AI features. Preload a realistic sample workbook so it looks good immediately.

Оба приложения вернулись практически одинаковыми. Что действительно изменило результат — так это одно добавленное предложение:

Verify the function and design after implementation, and keep on iterating and verifying until it's production ready.

Эта единственная строчка оказалась самой рычажной вещью, которую я нашёл за эти недели! С ней модель открывает приложение, прокликивает реальные пользовательские сценарии, проверяет, что вложенные формулы вычисляются корректно, и чинит то, что находит. Ничего из этого не работает без нормального умения пользоваться браузером — именно оно вообще делает этот цикл возможным.

Тот же принцип действует и там, где результат сложнее проинспектировать. «Улучши текстуры» на 3D-сцене не дало мне ничего, а «сделай снимок текущего кадра, перечисли, что с ним не так, и почини только это» сработало сразу.

Все сравнения дальше по тексту прогонялись одним и тем же промптом через обе модели в изолированных рабочих пространствах, так что ничего из этого не является моими воспоминаниями о прошлом месяце.

Ещё вам не нужно говорить ему работать усердно или продолжать давить, пока не закончит. Он и сам будет идти дальше довольно долго. Гораздо важнее сказать, что означает «готово», — потому что иначе он решит это за вас.

Идём дальше

В детстве я играл в Age of Empires 2 в неприличных количествах. Тысячи часов. Поэтому воссоздать её было первым проектом, который мне захотелось попробовать. Я попросил браузерную стратегию с экономикой, строительством, боями, туманом войны, целями и HUD (игровым интерфейсом), который новичок сможет прочитать без инструкций.

4.5 построил работоспособный плоский прототип. 4.6 с первой же попытки вернул изометрический 3D-мир, где HUD и миникарта уже на месте. Гораздо ближе к оригиналу!

Продолжая ностальгический заход, следующим я сделал MSN Messenger.

Обе модели явно знали референс и справились хорошо. У 4.6 просто больше лоска — вплоть до отдельных окон переписки и «подмигиваний».

Я постоянно пользуюсь Excalidraw, и у него открытый исходный код — что сделало его очевидным местом, чтобы посмотреть, как модели справляются с реальной кодовой базой, а не с пустой папкой. Я попросил у обеих режим презентации: сохранять именованные виды, менять их порядок и показывать их как управляемое пошаговое повествование. Промпт был намеренно расплывчатым насчёт того, как именно это строить.

Обе приходят примерно в одну и ту же точку, что впечатляет для настолько расплывчатого промпта! 4.6 просто внимательнее к деталям на первом проходе, а на практике это означает меньше кругов, где я тыкаю пальцем в недочёты.

Здесь же кусается пропуск проверки. В одном из более ранних прогонов сводка читалась как «готово», а добавление вида на самом деле не работало. Один круг «запусти и покажи мне» вскрыл сломанный импорт.

Повседневная работа

Я не собираю презентации и отчёты каждый день, но многие собирают, и мне хотелось посмотреть, как он справляется с такого рода работой. Поэтому я дал обеим моделям один и тот же выдуманный квартальный отчёт и попросил презентацию для совета директоров.

Обе компетентны, и разрыв — в подаче, а не в анализе. 4.5 в основном раскладывает цифры по слайдам, тогда как 4.6 всерьёз работает над структурой и иерархией, так что это читается как презентация, которую кто-то сделал, а не как выгрузка данных.

Видео как код

Эта тема заслуживает больше места, потому что в последнее время я трачу на неё много времени. Remotion — это видео как код: каждый кадр представляет собой React-компонент, который рендерится исходя из текущего номера кадра, а всё целиком компилируется в MP4 через headless Chromium (браузер без графического интерфейса) и FFmpeg. Ваше видео живёт в git. Это по-настоящему увлекательный способ работы! И это же странная штука, чтобы отдать её модели, потому что нельзя понять, справилась ли она, просто проверив, что оно запускается.

Я попросил ролик-анонс на 60–90 секунд для X TypeScript SDK и дал ему документацию, от которой можно отталкиваться.

Я сужу о таких вещах по тому, есть ли сюжетная линия и держится ли темп. Большинство моделей проваливаются здесь одинаково: заголовки капсом, текст в рамочках и всё вылетает на экран разом. Оба ролика по большей части этого избегают, и 4.6 смотреть интереснее.

После нескольких дней таких прогонов по разным моделям видео — это то место, где я вижу самый широкий разброс. Две модели, которые ощущаются одинаково способными на веб-приложении, здесь могут оказаться совсем не рядом друг с другом.

Где ему нужно рулевое управление

Почти всё, где мне приходилось его направлять, сводилось к одному: насколько легко модели проверить собственную работу.

Сайт — лёгкий случай. DOM — это текст, поэтому она может прочитать страницу, сделать скриншот и сравнить с тем, что задумывала. Именно поэтому цикл проверки так хорошо работает на UI-задачах.

3D сложнее, потому что там есть целое измерение, которое нельзя проинспектировать чтением. Видео сложнее ещё больше, поскольку время — дополнительное измерение, и проверить свою работу означает захватить последовательность кадров и рассуждать о разнице между ними. У физики проблема той же формы. У модели хорошее чувство того, как мир должен себя вести, но подтвердить, что он действительно так себя повёл, — не то, на что может ответить один скриншот.

Практический ответ — дать ей способ посмотреть или смириться с тем, что проверяете вы.

Почему он у меня по умолчанию

В «острых» моделях — тех, что выдающиеся в чём-то одном конкретном, — есть настоящая ценность. Но большая часть моей работы — это не что-то одно конкретное. День ото дня мне нужна модель, которую я хорошо знаю: где у меня наработана интуиция о том, как она себя ведёт, где она достаточно надёжна, чтобы что-то ей передать, и где я понимаю её недостатки достаточно хорошо, чтобы обходить их не задумываясь.

Именно этим для меня и стал 4.6. Со стороны программирования он тянет интерактивную и визуальную работу, где я реагирую по ходу дела, плюс долгие сессии в настоящем репозитории. Со стороны интеллектуальной работы это инбокс, браузерное QA и прокликивающие задачи, за которыми не стоит никакого API. Он не лучшая мыслимая модель ни в одном из этих пунктов, но он хорош во всех них, и я знаю, чего от него ждать.

Я по-прежнему остаюсь вовлечён там, где результат оценивают по тому, как он выглядит. Движению, 3D и финальной полировке нужен референс и цикл со скриншотами, а не описание. И я записываю критерии приёмки, вместо того чтобы доверять сводке, которая говорит, что всё готово.

Попробуйте

Grok 4.6 доступен прямо сейчас в Cursor, SpaceXAI API, на OpenRouter и везде, где вы получаете свои токены!

Попробуйте и расскажите, что думаете. Мы будем продолжать его улучшать, так что оставляйте обратную связь в любом случае — хорошую или плохую, — потому что именно она подсказывает нам, куда давить дальше.

Очень любопытно услышать, что вы в итоге на нём соберёте!


Подпишитесь на канал и каждый день читайте лучшие материалы про AI переведенные на русский!

Нашли интересную статью для перевода? Пришлите нашему боту: @ailongreadsbot

Report Page