Локальный ИИ часто показывают слишком красиво.
На видео человек запускает модель одной командой, задаёт вопрос — и через секунду получает идеальный ответ. За кадром остаются гигабайты образов, память, квантование, контекст, драйверы и момент, когда модель внезапно отвечает хуже облачной, хотя ты потратил вечер на настройку.
У меня локальные модели тоже не стали магической заменой всему. Зато они хорошо встроились в общую инфраструктуру.
Зачем запускать модель у себя
Первый ответ очевидный: контроль.
Запрос можно обрабатывать внутри своей системы. Можно тестировать API, менять модели, подключать собственные инструменты и не зависеть от одного внешнего интерфейса.
Но есть и менее пафосная причина — это просто интересно.
Когда видишь, сколько памяти занимает модель, как меняется скорость от длины контекста и почему одна настройка внезапно ломает tool calling, начинаешь намного лучше понимать, что происходит за кнопкой обычного AI-чата.
Совместимый API оказался важнее конкретной модели
Модель сегодня одна, завтра другая.
Поэтому полезнее строить приложения не вокруг конкретного названия, а вокруг понятного интерфейса. Тогда клиент отправляет запрос в привычном формате, а внутри можно переключать локальный или внешний бэкенд.
Это не всегда работает идеально. Разные модели по-разному интерпретируют системные инструкции, инструменты и структурированный вывод. То, что стабильно работает на одной, может развалиться на другой без единой ошибки в коде.
Особенно это заметно на агентах.
Агент — это место, где всё начинает ломаться интереснее
Обычный чат отвечает текстом. Агент должен ещё понять задачу, выбрать инструмент, вызвать его, прочитать результат и не потерять контекст по дороге.
Звучит просто только в презентации.
На практике модель может вызвать не тот инструмент, придумать несуществующий путь, повторять одно действие, слишком рано решить, что задача выполнена или красиво объяснить ошибку вместо исправления.
Поэтому хороший агент — это не «самая умная модель». Это ограничения, понятные инструменты, журналы, лимиты шагов и возможность увидеть, что он реально сделал.
Где локальный ИИ полезен мне
Лучше всего он работает в задачах, где можно проверить результат:
- обработка заметок;
- черновая классификация;
- поиск по материалам;
- генерация небольших заготовок;
- работа с локальными файлами;
- технические эксперименты через API.
Хуже — там, где нужен безошибочный факт, длинная автономная цепочка или сложное решение без внешней проверки.
Модель может быть уверенной и неправой. Локальность это не лечит.
Почему я всё равно продолжаю
Потому что в связке с сайтом, заметками, Matrix и автоматизацией ИИ становится не отдельной игрушкой, а ещё одним слоем системы.
Он может читать локальный контекст, помогать с материалами, вызывать инструменты и возвращать результат в привычный канал.
Не цифровой сотрудник. Пока скорее способ быстрее связывать разные части инфраструктуры. И именно в этом он у меня работает лучше всего.
Inference запускает vLLM, кандидаты собраны в каталоге моделей, весь проект — в Разработке Aiban.