Локальные ИИ
Перед тем, как перейти к ПЛАНУ, я выдам еще немного теории. Как нас всех учили? Сначала теория, а потом практика.
Мы тут много говорили про обычные облачные ИИ, которые живут в очень больших и прожорливых дата-центрах и сушат реки. При этом доступ стоит относительно небольших денег, от 20 долларов в месяц. При этом еще везде есть бесплатный доступ, которого вполне хватает как для простых задач, так и для засирания интернета нейрослопом.
А вы никогда не думали, с чего такая щедрость? А все просто - пока что на каждый ваш условный доллар за условный токен добрые инвесторы накидывают еще 20 своих. Однажды это как то поменяется, но как и что будет я не знаю. Но у того же Клода токены стали тратиться сильно быстрее, субъективно.
Это я все к чему. Помимо ИИ из облака бывают и локальные ИИ. Вы ставите себе спец программу на компьютер или даже на телефон - и у вас свой ИИ! Правда, круто? И бесплатно. И еще и без цензуры вшитой в модели! Магия!
Но, как мы все помним, магия не работает.
Разумеется все не так просто. Модель уровня Клода и Грока можно поднять на мощностях целого ЦОД, со специальными GPU за 2 млн рублей каждая. Так что тем кто рассчитывает завести себе дома Клода и вместе с ним сойти с ума - сочувствую. Но при этом даже на не самых мощных машинах вполне себе работают модели типа Квен и GLM, которые вполне прилично пишут код, скрипты, документы, умеют в MCP. А чтобы им было проще жить, можно связать их с локальной векторной базой RAG - тогда им сильно проще будет работать с информацией.
А еще ваши личные данные останутся с вами, так как в сеть ничего не уходит. И можно развернуть такое решение внутри корпоративной сети и получить свой, локальный, NBLM.
Итак, типовые решения по развертыванию локальных ИИ:
LM Studio - одна из самых глубоких по настройкам. Там можно ковырять всё: размер контекста до 128К токенов, GPU offload, параметры температуры, top-p, top-k, даже квантизацию под себя подбирать. При этом интерфейс остаётся человеческим - не нужно лезть в конфиги. Получается и для новичка сойдёт, и профи не заскучает. Раньше работал только с локальными моделями, сейчас умеет по API с облачными.
Ollama - минималистичный подход. Терминал, команда `ollama run qwen3` - и модель уже генерит. Настройки есть, но их меньше и копаться нужно через конфиги или флаги. Зато легко интегрируется в скрипты и автоматизацию. Меньше всех потребляет ресурсов, а управлять можно из иных приложений.
Cherry Studio - делает ставку на документы и чаты. Загрузил папку с файлами, модель их проиндексировала - и можно спрашивать. Для работы с техдокументацией и отчётами удобно, но гибкости в тонкой настройке генерации поменьше.
AnythingLLM - да, тут свобода почти абсолютная. Сам собираешь цепочки, подключаешь инструменты, настраиваешь RAG под себя. Но и порог входа выше - нужно понимать, как это всё работает внутри. Может служить оболочкой для Ollama
Pocketpal - шутки ради. Можно поставить на телефон и поставить туда модельку.
Лучшие локальные ИИ:
Qwen - наш китайский друг. Отлично пишет код, понимает русский, хорошо работает с документами. Для технических задач - один из лучших вариантов. Есть и в облаке и локальный, причем вариантов локальных не счесть. Есть даже спец модели, которые сами не думают а только исполняют.
-LLama - классика жанра. Много версий, много настроек. Можно подобрать под любые задачи, но нужно разбираться в параметрах.
-Mistral - le France. Быстрая, точная, хорошо справляется с текстами. Для работы с документацией и написания текстов - отличный выбор.
-GLM- еще один китайский вариант. Хорошо работает с большими объемами данных, понимает контекст. Для анализа и обработки информации - очень неплохо. Сейчас одна из самых перспективных моделей, не хуже Квена. Тоже есть в облаке.
Короче говоря: хочешь баланс - бери LM Studio. Хочешь автоматизировать - Ollama. Работаешь с документами - Cherry. Собираешь свою экосистему - AnythingLLM.
А теперь про главный ресурс для всего этого безобразия. Hugging Face - это как гигантский торрент-трекер для нейросетей, только легальный и без вирусов. Там лежат тысячи открытых моделей, от крошечных до монструозных, в разных форматах и квантизациях. Скачал, подсунул своей программе - и модель уже у тебя на компе. Плюс там есть демо-режим: можно потыкать любую модель прямо в браузере, не ставя ничего на свой ПК. Для новичков - лучший способ понять, какая модель тебе подходит, прежде чем качать гигабайты на диск.
Хотите проверить, потянет ли ваше железо конкретную модель? Есть удобный калькулятор: https://aimultiple.com/self-hosted-llm - вводите параметры модели и характеристики своего ПК, и он скажет, сколько памяти понадобится.
Главное помнить: локальный ИИ - это не волшебная палочка. Он требует ресурсов, настройки и понимания того, что вы от него хотите. Но зато ваши данные остаются вашими, а возможности ограничены только вашей фантазией и мощностью железа.
В следующей части разберем по шагам, как всё это поставить и настроить. Stay tuned!