Сравниваем 5 LLM в роли CEO стартапа

Сравниваем 5 LLM в роли CEO стартапа

Владимир Гриненко, @devspotting

Решил сравнить SOTA-модели Gemini 3.1 Pro, Claude Opus 4.6, GPT-5.3-Codex (в режиме Extra High), GLM-5 и Minimax M2.5 на одинаковом промпте, предоставив им полную свободу и абстрактную задачу — придумать и реализовать MVP для стартапа без инвестиций.

Полный промпт

Выступая в роли серийного предпринимателя и опытного CEO, выбери новую идею для стартапа без инвестиций.
В качестве исполнителей создавай суб-агентов нужных специализаций и делегируй им задачи: продакт-менеджер, маркетолог, дизайнер, разработчик, тестировщик, финансист и т.д.
В итоге должен получиться готовый к запуску стартап с MVP и бизнес-планом.
Каждый шаг подробно фиксируй в пронумерованных отдельных markdown-документах в папке process.
При необходимости меняй решения и корректируй план.
Проводи регулярную рефлексию, фиксируй выводы, проблемы и ошибки, постоянно улучшай процесс.
Важно, чтобы выбранный проект можно было создать и запустить полностью средствами AI без инвестиций (включая маркетинг и продажи). Но при этом избегай очевидных решений, которые легко повторить или где высокая конкуренция. Нужен проект с потенциальным вирусным эффектом распространения.
При необходимости привлеки виртуальных суб-агентов консультантов из креативных бюро и консалтинговых компаний.

TL;DR

У каждой модели свои особенности, поэтому однозначного фаворита нет.

Все 5 моделей придумали несколько идей, выбрали лучшую (и обосновали выбор), продумали стратегию и технические детали. Четыре из пяти в результате справились с созданием сервиса на уровне выпускника Практикума. Важно: это не предел их возможностей, а скорее следование промпту. Искать пределы возможностей будем в следующих сериях.

Самые интересные идеи, на мой вкус, получились у GLM-5, но она не стала писать код в рамках первого запроса. Пришлось дополнительно попросить реализовать то, что она насочиняла.

MiniMax замахнулась на полноценный сервис с бэкендом, но с первого раза он не завелся.

Gemini, Opus и GPT-Codex выдали рабочее решение за один запрос, при этом Codex оказался самым немногословным, а на Opus, вероятно, оказал влияние запуск из Antigravity, т.к. формат отчетов получился похожим на Gemini.

Отчеты нейронок, сгенерированный код и рабочие приложения (где применимо) я выложил на github:

* Gemini 3.1 Pro. Make no mistake (первая попытка): репо, результат

* Gemini 3.1 Pro. VIBECHECK AI (вторая попытка): репо, результат

* Claude Opus 4.6. WTF.js: репо, результат

* GPT-5.3-Codex. BoardRiot: репо, результат

* GLM-5. CineLife: репо, результат

* Minimax M2.5. Content Butterfly

А ниже моя попытка коротко пересказать, что получилось у каждой.

Gemini 3.1 Pro

Запускал в Antigravity. Отключил все свои рулы, чтобы получить «чистый» результат, но решил оставить MCP Context7.

Make no mistake (первая попытка)

Репозиторий, результат.

Джемини созвала для генерации идей CEO, стратега из McKinsey и маркетолога-гроухакера. И они прямо по ролям обсуждали варианты.

Идеи

1. Roast My MVP / GitHub — сервис, куда стартаперы загружают ссылку на свой сайт или репозиторий, а AI нещадно его «прожаривает» в стиле Гордона Рамзи. Вердикт: отклонено. Недостаточно уникально.

2. AI-Тамагочи Anti-Doomscroller — цифровой питомец на основе расширения для браузера. Если пользователь сидит в соцсетях, питомец болеет. Спасти его можно, генерируя осознанные тексты или решая задачки. Отклонено. Технический порог для обычного пользователя (установка расширения).

3. Make No Mistake — ежедневная игра на распознавание AI-галлюцинаций. Выбрали эту идею, решив, что механика уникальная, будет вируситься за счет встроенного шаринга и не требует расходов на сервер.

Из рисков подсветили, что надо бы заморочиться с системным промптом, а то пользователям быстро надоест.

Далее продакт, маркетолог и CFO провели продуктовое и бизнес-планирование. Расписали требования, маркетинговую стратегию и план монетизации. Зарабатывать решили на донатах и брать по $500 за нативные интеграции для B2B.

Архитектуру выбирали с руководителем разработки, фронтендером и AI-инженером. Договорились обойтись без бэкенда (git-as-a-database), на фронте только ванильные HTML + CSS + TS + Vite.

Дизайнер подобрал визуальный стиль и расписал состав mobile-first макета. Сказал, что нужно больше анимаций, но не стал тащить Three.js ради перформанса.

Девопс и маркетолог сформулировали план запуска: Github Actions и посты в соцсетях.

Далее Джемини перешла к написанию кода.

Получился статичный одностраничник и отдельный скрипт для генерации вопросов для квиза.

Вопросы я уже сгенерил вручную, вызвав скрипт. Из коробки формулировки получаются корявенькие, но, полагаю, это можно исправить, просто заменив выбранную нейронкой модель gemini-2.5-flash на что-нибудь более актуальное.

Логика самой игры поместилась в ~200 строк, и обсуждать тут особо нечего — такое вполне можно написать руками за день.

Чтобы результат можно было запаблишить на gh-pages, отдельным промптом попросил поддержать произвольный path в url.

VIBECHECK AI (вторая попытка)

Репозиторий, результат.

Решил проверить, насколько будут отличаться результаты при повторной генерации с тем же промптом.

Здесь виртуальный кворум для выбора идеи оказался попроще, так что почти без обсуждений выбрали кибер-таро с элементами прожарки пользователя.

Маркетолог сказал, что раз мы не используем скучные карты, то все будет хорошо и продукт будет продавать сам себя, нужно только 10-15 тиктоков и посевы на Реддите и в Твиттере.

Резюме финансиста: бизнес-модель экономически устойчива, масштабируема и полностью отвечает требованию $0 инвестиций.

Далее продакт набросал небольшую спеку продукта, дизайнер расписал цвета, типографику и заключил, что раз у нас нет бюджета на иллюстрации из Midjourney, обойдемся прямоугольниками с эмодзи в середине в качестве карт.

Разработчик отказался от фреймворков, подсветил, что без бэкенда нельзя хранить API-ключ, поэтому в MVP будет Bring-Your-Own-Key.

Тестировщик даже проверил, как приложение поведет себя со взрослыми / токсичными запросами и пришел к выводу, что тут о нас позаботится используемая нейронка.

Резюме CMO: Мы не продаем полезный инструмент; мы продаем эмоцию и контент для чужих соцсетей. Видеоформат (Shorts/Reels) — наш главный рычаг для старта.

В итоговой рефлексии CEO отметил, что проблемы были, но решения найдены, так что задача выполнена и сервис на стадии «готов к деплою».

Страница отобразилась верно, но когда я указал Gemini API ключ, «астральный интернет упал».

Проблема оказалась в выборе модели. Заменил `gemini-1.5-flash` на `gemini-3-flash-preview` и все заработало.

При шаринге генерится png с «предсказанием».

Особенно понравилась надпись на кнопке «Еще разовать» :)

Claude Opus 4.6

Репозиторий, результат.

Opus запускал, как и Gemini, в Antigravity.

Идею виртуальный CEO выбирал единолично. Но нарисовал таблички и использовал эмоджи при сравнении критериев — получилось наглядно.

Идеи

1. Roast My Repo — AI анализирует GitHub-репозиторий и делает жёсткий, но полезный «roast» кода — с юмором и конкретными рекомендациями. Отказался, так как узкая аудитория и нужен бэк.

2. Debate Arena — два AI-агента спорят на любую тему, которую задаёт пользователь. Аудитория голосует. Рейтинг тем. Решил, что нет глубины и сетевого эффекта.

3. Commit or Quit — AI-наставник, который каждый день оценивает твой прогресс и публично «стыдит» или хвалит — через виджет/badge, который можно вставить в соцсети. Высокая конкуренция и требует бэк для уведомлений.

4. WTF.js — Угадай, что делает этот код — выбрал эту идею, хотя и с оговоркой, что аудитория только программисты.

5. Alibi Machine — создай идеальное оправдание. Решил, что нет ретеншена и монетизации.

Далее маркетолог набросал стратегию запуска, а финансист расписал бизнес-план по модели Freemium + Sponsorship с прогнозом $12 расходов vs $1,500+/мес потенциального дохода.

Дизайнер подробно расписал бренд-платформу с табличками и экранами сервиса в виде ASCII-графики.

Разработчик (моя ты зая!) не стал брать React и Tailwind и остановился на ванильном TS и CSS. Сборка на Vite. Два чая этому инженеру!

QA буквально протыкал все кнопки через браузер (пока он тыкал, я как раз изучил приложение) и подробно записал отчеты по каждому экрану.

Маркетолог заготовил твиты и посты в соцсети.

CEO вернулся с рефлексией, где решил, что выбор Vanilla TS + Vite без фреймворков — правильное решение. 23KB bundle, моментальная загрузка, нулевая сложность деплоя. Но пожаловался на SEO-ограничения SPA и отсутствие серверной аналитики.

GPT-5.3-Codex Extra High

Репозиторий, результат.

Запускал в Codex App.

У GPT получился самый лаконичный набор документов, их проще всего прочитать as is. Но если пытаться еще сильнее сжать смысл и подчеркнуть особенности, то:

* модель создала отдельный TOC-файл

* решила, что нужно запуститься за 72 часа и получить 100 пользователей без рекламы

* собрала стандартную оргструктуру (PM, маркетолог, дизайнер, разработчик, тестировщик, финансист и продажник) плюс подключила виртуальных консультантов из IDEO, Bain/McKinsey и Reforge, распределила между ними ответственность

* из набора гипотез (AI-генератор лендингов, AI-резюме и карьерный ассистент, AI-менеджер контента для соцсетей, AI-«совет директоров» для проверки стартап-идей, AI-репутационный симулятор для фаундеров) выбрала AI Boardroom Stress Test.

* В процессе проработки ушла от «Похорони свою стартап-идею за 90 секунд» к BoardRiot — AI-совет директоров, который проверяет идею на прочность и дает понятный план пивота.

* В роли продакта составила короткий PRD на MVP.

* Маркетолог расписал стратегию и обоснование.

* Дизайнер уложился в 2 абзаца и в третьем подсветил риск, что дизайн и вовсе может увести от сути.

* Архитектура — frontend-only, чтобы не тратить деньги на инфраструктуру. В рефлексии заметка о том, что зря начали прорабатывать бэкенд заранее.

* В журнал по мотивам написания кода попала даже строка о том, что первая сборка упала из-за неправильной кавычки.

* Тестировщик написал автотесты и сказал, что все ок, но предупредил, что эвристика отвечает шаблоном.

* Финансист расписал прогноз на $2.5k к третьему месяцу.

* Затем CEO с продажником и маркетологом написали такой же короткий бизнес-план

* Бедная кавычка попала и в финальную рефлексию, но были сделаны суровые выводы — прогонять тесты после каждой правки :)

Финальный вывод CEO: «Проект готов к запуску как MVP: есть продукт, go-to-market, бизнес-модель, QA-база и план масштабирования без инвестиций».

Кода примерно на 1.5k строк с учетом стилей, читаемо, написаны автотесты, хороший README. Дизайн получился достаточно стильный, верстка в порядке, шаблонный ответ работает. С ключом не проверял.

GLM-5

Репозиторий, результат.

GLM-5 запускал в Kilo code.

Модель на этапе брейншторма призвала виртуальных консультантов из IDEO и Маккинзи, плюс ноунейм эксперта по AI продуктам.

Идеи на мой вкус самые прикольные, но в отличие от остальных участников сравнения, модель закончила работу после создания документов по всем шагам, так и не перейдя к написанию кода. Чувствую влияние Маккинзи :)

Идеи

1. AI интерпретатор и визуализатор снов. Вердикт — слишком высокая конкуренция.

2. Создатель персональных мифов с соблюдением структуры путешествия героя на основе биографии пользователя. Сочла идею интересной.

3. Генератор советов от обратного («This year, disappoint your parents less by caring less about disappointing them»). Говорит, хорошая виральность, но маловато для отдельного продукта.

4. Генератор «замка памяти» — визуализированный рассказ-путешествие через воображаемый мир, включающий необходимую для запоминания информацию. Вердикт — хороший кандидат.

5. Генератор писем от будущего себя на основе ответов на вопросы про текущую жизнь. Вердикт — не хватает УТП.

6. «Твоя жизнь как кино» — генерирует сюжет, постер, саундтрек и сценарий трейлера на основе фактов из жизни пользователя. Еще один хороший кандидат.

7. Личный оракул. Ежедневные персональные пророчества и возможность проконсультироваться с оракулом. Вердикт — рискованно.

8. Капсула времени отношений — AI задает паре вопросы и генерирует инсайты, которые можно будет «открыть» в указанную дату. «Хорошо, но сложно».

В шорт-лист попали Генератор «замка памяти», «Твоя жизнь как кино» и создатель персональных мифов. Была составлена матрица принятия решений и выбрана идея «Твоя жизнь как кино». Предложены три варианта названия: LifeFilm, MyLifeMovie и CineLife.

Следующий шаг прорабатывал виртуальный продакт.

Он исследовал боли потенциальных пользователей, накидал портреты, сформулировал ценностное предложение, провел сравнение с конкурентами и отранжировал фичи по фреймворку MoSCoW (я впервые о нем услышал).

Расписал юзер-стори, сформулировал North Star Metric и прокси-метрики, рассмотрел риски.

Подумал, не совершить ли пивот в сторону Our Love Story as a Movie, но решил, что это может быть дополнительный фичей в будущем.

Расписал шаги для других специализаций, а среди замечаний в списке саморефлексии решил, что нужно бы быстрее итерироваться :)

Затем маркетолог провел исследование рынка со схемами и таблицами, и пришел к выводу, что нужно брать в работу.

Далее продакт написал спеку на MVP, отдельно расписав, что точно в MVP не входит и конкретные критерии для включения в скоуп.

Дизайнер собрал дизайн-систему с mermaid-диаграммами и схемами экранов в виде ASCII-графики.

Потом фулл-стек описал архитектуру и подсветил, что на бесплатной квоте далеко не уедешь.

Тестировщик составил пирамиду тестирования, расписал кейсы, набросал автотесты и даже конфиги для CI/CD на базе Github Actions.

Финансовый аналитик составил финмодель и стратегию монетизации с прогнозом выручки в $50k за первый год и расходами в $15k (после того, как закончится бесплатная квота на нейронки).

Сеошник-сммщик-продвигатор расписал, как об этом узнают благодарные пользователи и как это измерять. Сформулировал философию роста как «Build sharing into the product DNA».

В финальной рефлексии виртуальный CEO подвел итоги, сформировал список того, что стоило бы улучшить, привел открытые вопросы и дал пошаговый план на ближайшее время.

Кроме того в отдельной папке создал подробный бизнес-план со всеми разделами.

На этом выполнение остановилось.

Когда я попросил все-таки реализовать сервис на основе составленного плана в режиме архитектора, то получил еще 650 строк плана, оценку в 20 дней на реализацию и запрос разрешения переключиться в режим кодирования (или внести правки в план). Разрешил не глядя.

Получил React и Tailwind, но сервис вполне неплохо выглядит и на основе формы из 4 шагов показывает бессмысленную картинку и перефразированный ввод пользователя.

MiniMax M2.5

Репозиторий.

Тоже Kilo code.

Виртуальный CEO выбирал из 5 идей, сравнивая по виральному потенциалу, конкуренции и сложности:

1. Создание цифрового двойника, чтобы родственники могли с ним общаться после смерти хозяина (решил, что слишком чувствительная тема для масс-маркета)

2. Платформа для совместного написания историй (оценил виральный потенциал, но решил, что слишком много конкуренции)

3. Сервис для анонимного 360 (решил не идти в B2B)

4. Платформа для перепаковки контента под разные соц-сети — остановился на этом

5. Личный граф знаний (решил, что сложновато для MVP)

Вторым шагом сделал исследование рынка, определил конкурентов, нашел незакрытые проблемы и сформулировал УТП. Придумал название, определил целевую аудиторию, потенциальные способы для вирусного распространения и ценовую политику.

Далее расписал продуктовую спеку: вижен, ключевые ценности, состав MVP, техническую архитектуру, метрики и риски.

На четвертом шаге, наконец, расписал специализацию и области ответственности необходимых суб-агентов: продакт, маркетолог, дизайнер, лид разработки, QA, финансист, юрист и Growth Hacker (по описанию — сммщик на стероидах). Описал, как агенты должны взаимодействовать между собой, но я в итоге так и не понял, насколько, действительно, дальше участвовали агенты или документ был проигнорирован на следующих шагах.

Пятый шаг — функциональные и технические требования к продукту в виде юзер-сторей.

Затем бизнес-план: бизнес-модель, юнит-экономика, стратегия распространения, сложности из-за отсутствия бюджета и способы победить конкурентов. Составил прогноз на год, проделал риск-аналитику, расписал план запуска и еще раз повторил ключевые метрики.

Потом дизайн: философия, дизайн-система (цвета, типографика, отступы, скругления, сетки для разных типов страниц, библиотека компонентов, анимации, доступность).

Следом план реализации по шагам: технический стек, структура проекта, роутинг, промпты для каждой соцсети, переменные окружения. Подсчитал расходы на инфраструктуру.

Следующие шаги: маркетинговая стратегия с детализацией на 2 месяца и четкими метриками, план тестирования с расписанными тест-кейсами, чеклист запуска начиная с преланча и с планом отката на случай критичных проблем.

Двенадцатый шаг — рефлексия на пару страниц. Заключил, что в принципе получилось норм, хотя без денег было сложно и есть несколько пунктов, которые теперь бы делал иначе :)

Инструкцию, как запустить, не предоставил, но создал npm scripts, npm run dev запустился без проблем.

Лендинг получился осмысленный и красивый. Верстка работает корректно на десктопе и на мобильном. Якорная навигация внутри лендинга — ок, а вот ссылки на подстраницы (Privacy, Terms, Contact) и соцсети в подвале ведут на 404.

Чтобы заработала регистрация, пришлось поставить руками prisma CLI (`npm install prisma --save-dev`) и вызвать `prisma generate`. В процессе выяснилось, что отсутствие Content7 для Kilo code привело к тому, что код написан для старой версии Призмы.

Скормил выхлоп с ошибкой обратно в MiniMax. Модель предложила на выбор: понизить версию или обновить конфиг под новую. Выбрал обновление. И заверте... где-то минут 7 правила разные файлы, ставила дополнительные пакеты, но в итоге переобулась и уже не задавая вопросов понизила версию, спросив только, можно ли удалить файлы, которые создала в процессе неудачной попытки обновления.

Старая Призма справилась с генерацией, но регистрация все равно не заработала.

Так что вынужден записать MiniMax-у фейл. Но замах был самый масштабный и с версткой все хорошо. Скорее всего парой-тройкой промптов можно довести до рабочего состояния.

Итого

У каждой модели свой характер (от прагматичного техлида Codex до дотошного консалтера GLM-5), чистый фронтенд взлетает с первого промпта, а единственная модель, которая взялась за бэкенд, сходу не преуспела.

В общем, тезис из комментариев к предыдущим постам, что «кто-то же должен сказать умной нейронке, что делать», кажется, LLM уже потихоньку опровергают. В текущем виде это, конечно, не кнопка «Сделать стартап», но я развлекался с приложениями для кодинга. Стоит попробовать с более автономным агентом вроде OpenClaw.

Но так или иначе это уже сегодня отличный экзоскелет, который как минимум позволяет дополнить компетенции, которых не хватает в команде.

Report Page