Main > Abyss > Гид по терминам AI моделей для локальной разработки

Гид по терминам AI моделей для локальной разработки

13.09.2026 0 comments »

Залетать в локальный ИИ без словаря — это как пытаться ковыряться в движке по звуку: вроде что-то гудит, но куда крутить непонятно. Соберу тут основные термины, которые постоянно всплывают в названиях моделей и при запуске через llama.cpp, Ollama и ComfyUI.


Архитектуры

Qwen2 / Qwen3 (Alibaba) = Мощнейшие азиатские модели, абсолютные топы в написании кода и поддержке языков.

Llama (Meta) = Эталонный стандарт индустрии, под который оптимизируют 90% софта.

Mistral (Франция) = Быстрые, злые и эффективные модели с упором на производительность.


Модальности (способности) моделей

Text = Самый базовый фундамент. Это чистокровный автокомплит, обученный на огромных массивах текста. Он не умеет вести диалог или отвечать на вопросы — он просто логично продолжает то, что ты написал. Кормить его задачками бесполезно, он допишет твой промпт в том же стиле.

Image / Vision = Способность нейросети смотреть на картинки. Если в названии модели есть намек на зрение, значит, она умеет разбирать графики, скриншоты или фотографии. В мире llama.cpp для этого мало просто скачать веса модели — тебе обязательно понадобится специальный файл-проектор mmproj (например, mmproj-model-f16.gguf), который переводит пиксели изображения в понятные для мозга модели токены.

Multimodal = Общий термин для моделей, которые обрабатывают не только текст, но и другие данные: картинки, звук или видео. Чаще всего в локальных сетапах под мультимодальностью имеют в виду как раз связку текста и зрения (Text + Vision).


Типы моделей

Instruct (или -it) = буквы -it в конце названия (или слово instruct) расшифровываются как Instructional Tuned. Эту модель специально допинали на тысячах диалогов, чтобы она понимала человеческие команды, умела писать код, структурировать ответы и выполнять роль ассистента, а не тупого генератора текста.

Uncensored = модели, из которых вырезали корпоративные страхи и морализаторство. Такая модель не будет закатывать глаза в стиле «я всего лишь языковая модель и не могу это обсуждать», когда ты попросишь её написать NSFW сценарий, разобрать уязвимость или высказать непопулярное мнение.

Abliterated = продвинутый уровень «без цензуры». Если грубый цензурный срез часто ломает модель и делает её тупой, то abliteration работает хирургически. Авторы находят в скрытых слоях конкретный «вектор отказа» и просто обнуляют его математически. В итоге цензуры нет, а интеллект и кодирующие способности остаются на все 100%.


Количество параметров (4B, 9B, 70B)

Это «объем мозга» модели в миллиардах параметров. Чем больше значение, тем больше физический размер модели и тем больше тебе надо VRAM чтобы загрузить модель.

  • 4B–9B: Идеальный легкий класс для локальных запусков на одной видеокарте, летают мгновенно.
  • 70B+: Тяжелые монстры, требующие кучи VRAM или многоядерных систем.

Квантизация (Сжатие) - например Q4_K_M

Сжатие весов модели (как JPEG для картинок). Позволяет огромной модели сжаться в 2-4 раза с минимальной потерей интеллекта, чтобы влезть в скромные 8-16-32 GB VRAM твоей видеокарты. Обычно Q4_K_M золотая середина по соотношению качества и размера. Чем больше сжатие, тем меньше физический размер в Гб, но так же тем тупее модель.

bf16 (полный оригинал - выбор современных ИИ) = Никакого сжатия вообще. Чистые 16-битные веса прямо с печки. Жрут кучу памяти и требуют жирной видюхи, зато выдают идеальное качество без компромиссов. Формат, который инженеры Google пересобрали специально для нейросетей. Он чуть проще смотрит на знаки после запятой, зато наделен огромным диапазоном значений. Числа не ломаются, модель работает стабильно и предсказуемо.

fp16 (классический формат) = Пытается записать числа максимально точно до мельчайших знаков после запятой, но у него очень узкий «карман» по диапазону. Если в процессе размышлений число получается слишком огромным или слишком микроскопическим, формат ловит переполнение, и модель начинает откровенно бредить. Из-за этой капризности с ним всегда было много геморроя. Единственная причина почему ты все еще можешь встретить этот формат - это совместимость со старым железом. Например, на старых серверных картах (например, легендарных Tesla V100) или старых потребительских GPU аппаратного ускорителя для bf16 просто нет. Если запустить bf16 модель на старом железе в bf16, она будет жутко тормозить из-за программной эмуляции. Формат fp16 для них - единственный шанс нормально шевелиться. Для современных видеокарт (вроде твоей 50-й серии) разницы в скорости работы между fp16 и bf16 нет - они обе летают мгновенно, но bf16 при этом надежнее защищает от переполнения.

Q-квантизация (например Q8, Q4_K_M, Q4_K_S и тд) = Срезают точность «по линейке» для всех весов одинаково или по фиксированным блокам. Создатели просто говорят алгоритму: сжимай всё подряд до 4 бит (или до 3 бит), не разбираясь, где там гениальная мысль, а где просто фоновый шум. Из-за этого младшие кванты (вроде Q3, Q2) часто тупые - тк у них под нож попали и важные участки мозгов.

IQ-квантизация (Importance Matrix, например IQ3_M) = Это умное сжатие с «картой мозгов». Перед тем как зажать модель, её сначала прогоняют через калибровку на куче текстов и смотрят: «Ага, вот этот конкретный вес отвечает за логику и код, а этот — просто фигня для красоты». В итоге алгоритм оставляет самые важные для ума веса четкими, а на второстепенных экономит по полной. Благодаря этой матрице важности, современный 3-битный IQ-квант (IQ3) соображает гораздо бодрее и умнее, чем старый тупой 3-битный квант (Q3), и в некоторых задачах почти не уступает более жирному 4-битному стандарту. Если нужно впихнуть невпихуемое в узкую видяшку - IQ-форматы выручают на ура. Если стоит выбор брать Q или IQ, то бери IQ.

mxfp8 / nvfp4 (железные форматы нового поколения) = Ультрасовременные форматы на 8 и 4 бита, которые понимают новые видеокарты (вроде архитектуры Blackwell и серий RTX 50-й линейки). За счет аппаратной поддержки работают молниеносно и выдают топ-качество при сильном сжатии. Так что если у тебя 5070 / 5080 / 5090, или что-то современнее, то это твой выбор.

mlx (чисто для Mac) = Формат от Apple, запиленный специально под объединенную память макбуков на процессорах M1/M2/M3/M4. На обычном железе с NVIDIA он не нужен, это тусовка маководов.

exl2 (ExLlamaV2) = это специализированный формат квантования и движок, созданный разработчиком turboderp исключительно для работы с языковыми моделями на видеокартах NVIDIA с использованием CUDA. В отличие от GGUF, который задумывался как универсальный формат и под процессор, и под видеокарту, EXL2 с самого начала затачивался под одну задачу: выжимать абсолютный максимум скорости генерации токенов из кремния NVIDIA. В чем главная фишка: EXL2 поддерживает «дробное» квантование с плавающей битовой сеткой (например, можно сжать модель не строго в 4 или 3 бита, а в среднем на 4.25 bpw или 3.5 bpw). Это позволяет идеально подогнать размер модели под оставшийся объем VRAM, не теряя лишнего. Скорость: На железе NVIDIA движок ExLlamaV2 (через бэкенды вроде TabbyAPI или интеграции в Open WebUI) часто работает заметно быстрее, чем стандартный llama.cpp на CUDA.


Квантование Weighted vs Static

Иногда вы можете найти одну и ту же модель отмеченную как weighted, а другую как static. Пример

Всегда бери weighted / imatrix, если есть выбор. Они выдают заметно более качественный результат при том же размере файла, потому что алгоритм учитывает реальную ценность каждого веса для языковой модели.

Weighted / с использованием imatrix (Importance Matrix)

  • Вычисляет "важность" (importance) каждого веса на основе того, как часто и сильно он активируется при обработке текста.
  • «Умное» сжатие: важные веса, отвечающие за логику и знания, получают больше бит (меньше портятся), а менее важные сжимаются сильнее.
  • Качество генерации - выше! Модель сохраняет больше точности оригинала, меньше галлюцинирует и лучше справляется со сложными задачами.
  • Скорость работы - одинаковая при инференсе (в рантайме модель работает так же быстро, вся магия происходит на этапе создания файла).

Статичное квантование (Static)Статичное квантование (Static)

  • Использует стандартный набор калибровочных данных, чтобы определить единую сетку квантования для каждого тензора.
  • Не учитывает специфику конкретной модели или ее уникальные слои - всё стрижется под одну гребенку.
  • Качество генерации базовое. На некоторых сложных промптах может чаще ошибаться или терять логику.
  • Квантование быстрее, но на генерацию это не влияет.

Gemma - A4B vs E4B

Иногда вы можете найти модели с различиями в аббревиатурах A4B и E4B. Пример:

В аббревиатурах моделей серий вроде Gemma 4 буквы A и E обозначают разные подходы к оптимизации параметров в архитектуре.

  • A (в 26B-A4B) расшифровывается как Active parameters (активные параметры). Это MoE модель (Mixture-of-Experts - это когда вместо одной большой нейросети работает целая команда из десятков узкоспециализированных «экспертов», но на каждый вопрос отвечают только самые подходящие): у нее 25.2 миллиарда параметров суммарно, но на каждый токен роутер включает только 4 миллиарда (8 активных экспертов из 128). То есть «мозгов» много, а работает быстро, как легкая модель.
  • E (в E4B) расшифровывается как Effective parameters (эффективные параметры). Это компактная плотная (dense) модель, у которой около 4.5B эффективных параметров (хотя с учетом таблиц вложений Per-Layer Embeddings весит чуть больше). Она создана специально для слабого железа, телефонов и локального запуска на ноутах.

Если проще:

  • A4B = это мощная MoE-архитектура с хитроумным переключением экспертов
  • E4B = легкая и эффективная мини-модель для девайсов.

Другие сокращения

Другие сокращения которые вы можете встретить в именах файлов моделей

GSQ = Gumbel-Softmax Quantization = Умный метод побитового сжатия. Он ковыряется в каждом отдельном весе модели и подбирает идеальную глубину (2, 3 или 4 бита), чтобы сберечь самые важные параметры от деградации.

RCO = Riemannian Constrained Optimization = Алгоритм глобального бюджетирования. Он берет карту чувствительности от GSQ и распределяет общий лимит памяти по тензорам так, чтобы модель вписалась в жесткий размер файла, но не потеряла в логике

MTP = Multi-Token Prediction = Наличие специальных весов ( NextN / предсказание нескольких токенов) для спекулятивного декодирования. Модель учится генерировать по несколько токенов за один шаг. Обычно спекулятивное декодирование нужно включать отдельно (например в llama.cpp, это параметры --spec-type draft-mtp)


GGUF против Non-GGUF (Safetensors и др)

GGUF = Единый бинарный файл, созданный специально для llama.cpp. В него уже зашиты все веса, и он отлично бегает как на CPU, так и на GPU.

Non-GGUF (Safetensors / PyTorch) = Исходные тяжелые веса в оригинальном формате. Их используют для тренировки, тяжелых серверов (vLLM) или конвертации в GGUF.


Разбор возможностей модели по имени файла

Разумеется, назвать файл можно как угодно, но если его готовили специалисты, то можно плюс-минус понять что там находится. Единого стандарта нет, поэтому файлы могут называться по разному, но содержат такие компоненты

Пример: gemma-4-12B-it-abliterated-uncensored-GGUF-Q4_K_M-latest.gguf

  • gemma 4 = архитектура
  • 12B = кол-во параметров
  • it = instruct = модель дополнительно натренирована для ведения диалогов
  • abliterated-uncensored = убраны ограничения, модель отвечает максимально открыто
  • GGUF= готовая модель для llama.cpp / comfyui
  • Q4_K_M = сжатие весов модели
  • latest = версия модели

Другие примеры

  • gpt-oss:latest
  • qwen3.8:27b
  • qwen2.5:14b-instruct-q4_K_M
  • mistral:7b-instruct-v0.3-q8_0
  • openbmb/minicpm-v4.5:latest

Типы моделей в ComfyUI (Checkpoint, Diffusion model, UNet)

Checkpoint = Всё в одном флаконе для генерации картинок (содержит внутри и диффузию, и текстовый кодировщик, и декодер).

Diffusion model / UNet = Математический движок генерации, который убирает шум и собирает саму картинку.

LoRA = Точечная заплатка поверх основной модели. Весит мало (обычно несколько сотен МБ). Помогает повысить концентрацию модели на определенных объектах, например на глазах, или конкретных чертах лица персонажа. В отличии от больших моделей, можно тренировать локально под определенные нужды, например под именно твоё лицо.


Компоненты генерации в ComfyUI (Checkpoint, LoRA, VAE, CLIP)

Checkpoint = Тяжелый файл-комбайн «все в одном», который содержит в себе полный набор для генерации картинок: сам диффузионный движок (UNet/Diffusion model), текстовый кодировщик (CLIP) и декодер (VAE). Это готовая база, которую ты просто кидаешь в ComfyUI и сразу можешь запускать рендер, не собирая пайплайн из отдельных кусков.

Diffusion model / UNet = Чистый математический движок генерации, который отвечает исключительно за борьбу с шумом и сборку самой картинки пиксель за пикселем. В отличие от тяжелых чекпоинтов, он не содержит в себе текстовый кодировщик (CLIP) и декодер (VAE), поэтому для работы в ComfyUI его обязательно нужно подключать в пайплайн отдельными узлами вместе с CLIP и VAE.

Разница Checkpoint VS Diffusion model / UNet

  • Checkpoint = Модель + CLIP + VAE, все в одном. Расширение файлоа safetensors.
  • Diffusion model / UNet = Только модель. CLIP и VAE надо подключать дополнительно. Обычно расширение файла gguf.

Для тебя важно то, что если ты видишь файл checkpoint то по его размеру ты можешь понять поместится все что надо для генерации в твою VRAM или нет. Когда видишь GGUF модель, то тебе нужно будет загружать еще VAE и CLIP.

CLIP = Текстовый кодировщик, который переводит твой промпт на понятный для генератора картинок язык векторов.

VAE = Переводчик в / из скрытого пространства нейросети в нормальные пиксели. С помощью него ты загружаешь свою картинку в модель при инпейнте или как референс, а так же декодируешь результат чтобы сохранить его картинкой.


Золотой топ локального софта для железа с NVIDIA

Всё, что нужно для полноценной работы с текстом, картинками и обучением без облаков и цензуры

llama.cpp = Самый быстрый и легкий движок на C/C++ для запуска языковых моделей на локальном железе с полной поддержкой CUDA. Наша база. Github: https://github.com/ggml-org/llama.cpp

Ollama = Удобнейший менеджер и рантайм для локальных LLM. Сама скачивает, упаковывает и держит модели в фоне, предоставляя готовый API в одну строчку. Сайт: https://ollama.com/

ComfyUI = Абсолютный топ среди графических интерфейсов для генерации картинок и видео. Работает на нодах (узлах), позволяя собирать любые сложные пайплайны генерации. Github: https://github.com/Comfy-Org/ComfyUI

Musubi Tuner = Мощный инструмент от создателей kohya_ss для обучения LoRA-моделей под современные диффузионные архитектуры (видео и картинки). GitHub: https://github.com/kohya-ss/musubi-tuner

Open WebUI = Роскошный локальный веб-интерфейс (ведет себя как кастомный ChatGPT). Подключается к Ollama и любому OpenAI-совместимому API (llama-server), умеет работать с RAG (базами знаний), документами и веб-поиском. GitHub: https://github.com/open-webui/open-webui


Главные библиотеки и маркетплейсы моделей

Hugging Face = Главный мировой склад всего железа и софта для ИИ. Здесь лежит 99% текстовых моделей (включая все GGUF, датасеты и код). Если нужно скачать свежие веса, то тебе туда. Проверенные поставщики:

  • bartowski = главный поставщик идеальных GGUF-квантов. Если выходит новая крутая модель, у бартавски почти моментально появляются аккуратные сборки во всех возможных вариациях (от IQ3 до Q8), с которыми никогда не бывает проблем при запуске в llama.cpp
  • mradermacher = легендарный роботяга, который делает GGUF-кванты вообще на любые существующие модели, включая самые редкие экспериментальные архитектуры, аблитерированные версии и локальные мультимодальные сети.
  • unsloth = гуру эффективного дообучения (fine-tuning) и квантования. Они выпускают супер-оптимизированные версии популярных моделей (Llama, Qwen, Gemma), которые учатся в разы быстрее и жрут меньше памяти.

Civitai (civitai.com и civitai.red) = Мекка для любителей генерации картинок. Основной сайт civitai.com теперь полностью очищен под цензурные рамки (SFW-контент) и работает с обычными банковскими картами, а его брат-близнец civitai.red - это та самая свободна зона без NSFW цензуры со всеми моделями, LoRA-версиями и криптоплатежами. Аккаунты там общие, меняются только домены в ссылках. Для доступа к NSFW на RED вам нужно пройти регистрацию (и возможно включить нужные настройки в Account Settings > Content).


Утилиты и плагины

Подборка открытых и гибких утилит, плагинов и интерфейсов для редакторов, которые идеально дружат с локальными моделями через OpenAI-совместимые API (llama-server или Ollama)

Cline (бывший Claude Dev) = Главный король среди ИИ-агентов для VS Code. Сам пишет план, правит файлы, запускает команды в терминале, но перед каждым чихом спрашивает у тебя разрешение (или можно настроить автоаппрув).

Roo Code = Мощнейший форк Cline с упором на кастомные режимы (архитектор, кодер, дебаггер), где под каждую задачу можно зашить свои промпты и правила.

Continue = Стандарт де-факто для инлайн-автодополнения и боковой панели чата в VS Code и JetBrains. Отлично настраивается на работу с локальными ручками.

Aider = Терминальный ИИ-парный программист. Живешь в консоли — запускаешь аидера, он сам строит карту репозитория, правит код и автоматически делает коммиты в git, так что откатить любой косяк можно одной командой.

Open WebUI — Полноценный веб-интерфейс «своий ChatGPT» с поддержкой RAG (чтение твоих документов и PDF), управлением пользователями и подключением любых локальных бэкендов.

LM Studio = Красивый и удобный десктопный комбайн для скачивания, поиска по Hugging Face и запуска GGUF-моделей с готовым локальным сервером.

AnythingLLM = Отличная локальная программа для работы с базами знаний и документацией через агентов, умеет индексировать целые папки с кодом.

LibreChat = Продвинутый опенсорсный аналог ChatGPT чат интерфейса. Поддерживает кучу разных API.

Tabby = self-hosted AI кодинг ассистент для автодополнения кода (как локальный GitHub Copilot), который крутит модели прямо на твоем железе.

Twinny = Плагин для VS Code, созданный специально для локального инлайн-автодополнения кода через Ollama или llama.cpp абсолютно бесплатно и без отправки данных в облако.

SillyTavern = Продвинутый интерфейс для roleplay сценариев и мультиагентных локальных экспериментов с тончайшей настройкой промптов.

Author: | Tags:

Leave a Reply

Your email address will not be published. Required fields are marked *

Allowed HTML-tags: <a>, <code>, <i>, <em>, <strong>, <b>, <u>, <strike>