Локальный ИИ часто показывают слишком красиво.

На видео человек запускает модель одной командой, задаёт вопрос — и через секунду получает идеальный ответ. За кадром остаются гигабайты образов, память, квантование, контекст, драйверы и момент, когда модель внезапно отвечает хуже облачной, хотя ты потратил вечер на настройку.

У меня локальные модели тоже не стали магической заменой всему. Зато они хорошо встроились в общую инфраструктуру.

Зачем запускать модель у себя

Первый ответ очевидный: контроль.

Запрос можно обрабатывать внутри своей системы. Можно тестировать API, менять модели, подключать собственные инструменты и не зависеть от одного внешнего интерфейса.

Но есть и менее пафосная причина — это просто интересно.

Когда видишь, сколько памяти занимает модель, как меняется скорость от длины контекста и почему одна настройка внезапно ломает tool calling, начинаешь намного лучше понимать, что происходит за кнопкой обычного AI-чата.

Совместимый API оказался важнее конкретной модели

Модель сегодня одна, завтра другая.

Поэтому полезнее строить приложения не вокруг конкретного названия, а вокруг понятного интерфейса. Тогда клиент отправляет запрос в привычном формате, а внутри можно переключать локальный или внешний бэкенд.

Это не всегда работает идеально. Разные модели по-разному интерпретируют системные инструкции, инструменты и структурированный вывод. То, что стабильно работает на одной, может развалиться на другой без единой ошибки в коде.

Особенно это заметно на агентах.

Агент — это место, где всё начинает ломаться интереснее

Обычный чат отвечает текстом. Агент должен ещё понять задачу, выбрать инструмент, вызвать его, прочитать результат и не потерять контекст по дороге.

Звучит просто только в презентации.

На практике модель может вызвать не тот инструмент, придумать несуществующий путь, повторять одно действие, слишком рано решить, что задача выполнена или красиво объяснить ошибку вместо исправления.

Поэтому хороший агент — это не «самая умная модель». Это ограничения, понятные инструменты, журналы, лимиты шагов и возможность увидеть, что он реально сделал.

Где локальный ИИ полезен мне

Лучше всего он работает в задачах, где можно проверить результат:

  • обработка заметок;
  • черновая классификация;
  • поиск по материалам;
  • генерация небольших заготовок;
  • работа с локальными файлами;
  • технические эксперименты через API.

Хуже — там, где нужен безошибочный факт, длинная автономная цепочка или сложное решение без внешней проверки.

Модель может быть уверенной и неправой. Локальность это не лечит.

Почему я всё равно продолжаю

Потому что в связке с сайтом, заметками, Matrix и автоматизацией ИИ становится не отдельной игрушкой, а ещё одним слоем системы.

Он может читать локальный контекст, помогать с материалами, вызывать инструменты и возвращать результат в привычный канал.

Не цифровой сотрудник. Пока скорее способ быстрее связывать разные части инфраструктуры. И именно в этом он у меня работает лучше всего.

Inference запускает vLLM, кандидаты собраны в каталоге моделей, весь проект — в Разработке Aiban.