Мадияр Хамзанов
Article

«Своя модель» — это миф: как любой сделает свой ИИ за вечер

Инфоцыгане орут про «собственный ИИ». На деле это либо обёртка над чужим API, либо open-source моделька, дообученная за вечер на арендованном GPU за пару долларов. Разбираю, как это работает — и почему ты тоже так можешь.

AIOpen SourceПровокацияGPU14 мин
Мадияр Хамзанов
Мадияр Хамзанов
23 июля 2026
$0.34
час аренды RTX 4090
RunPod Community
~$5
один LoRA-прогон 7B
аренда по часам
2M+
открытых моделей
на Hugging Face
24 ч
до 99.3% ChatGPT
1 GPU, QLoRA

«У нас своя модель» — и почему это чаще всего понты

Каждый второй курс, каждый второй «стартап на ИИ» и каждый второй спикер на конференции выкатывает одну и ту же фразу с важным лицом: «мы построили собственную модель», «у нас свой ИИ», «мы обучили нейросеть под задачу». Звучит как ракетная наука. Как будто у них в подвале стоит датацентр, а в штате — трое бывших из OpenAI. Продаётся это ровно под таким соусом: «это сложно, дорого, доступно только избранным — поэтому платите нам».

Я разочарую. В 95% случаев за фразой «своя модель» стоит одно из двух: либо обёртка над чужим API (OpenAI, Anthropic) с системным промптом — то есть вообще никакая не «своя модель», либо дообученная open-source моделька, которую любой человек с ноутбуком и банковской картой соберёт за вечер. И то, и другое — не магия. Это конструктор, детали которого лежат в открытом доступе.

Эта статья — не чтобы обесценить работу тех, кто реально строит. Реальные R&D-команды есть, и им респект. Статья — чтобы у тебя перестала работать магия слова «своя модель». Чтобы ты понял, из чего это собрано, сколько это стоит на самом деле (спойлер: копейки), и что ты сам можешь это сделать сегодня вечером. Это не закрытый клуб. Это открытая дверь, в которую тебя просто не пускали, чтобы продать билет.

«Своя модель» — это не про гениальность. Это про то, что кто-то скачал открытые веса, арендовал видеокарту на пару часов и подкрутил её под свои данные. Магия исчезает ровно в тот момент, когда ты понимаешь цену вопроса.
Автор

Три разные вещи, которые все называют «своя модель»

Первое, что нужно разложить по полочкам — это подмена понятий. Под одной и той же фразой прячутся три совершенно разные штуки. Разница между ними — как между «я приготовил ужин», «я разогрел готовую еду» и «я построил ресторан».

не своя
Обёртка над API
Ты дёргаешь чужой GPT/Claude через API, добавляешь системный промпт «ты — юрист» и красивый интерфейс. Модель не твоя. Она живёт на серверах OpenAI, ты просто её арендуешь по токенам. 90% «ИИ-стартапов» — это оно.
чужая
Open-source как есть
Ты качаешь готовую Llama или Qwen, поднимаешь её на своём сервере и отдаёшь пользователям. Веса открыты, работает локально — это уже честнее. Но это всё ещё не «твоя» модель: ты не менял в ней ни грамма, просто хостишь чужое.
«своя»
Дообученная (fine-tune)
Ты берёшь ту же open-source модель и дообучаешь её на своих данных через LoRA. Вот это уже можно с натяжкой звать «своей моделью». И именно это стоит пару долларов и делается за вечер. Никакого подвального датацентра.
Главный трюк маркетинга: продавцы курсов и «ИИ-решений» намеренно смешивают эти три вещи. Показывают обёртку над ChatGPT, а называют её «собственной нейросетью, обученной на наших данных». Технически это ложь. Но проверить некому — слово «модель» звучит внушительно, и все кивают.

Отдельно про обучение с нуля. Вот это — да, реально дорого и сложно: обучить базовую модель уровня GPT-4 стоит десятки и сотни миллионов долларов на железо и данные. Но здесь есть один нюанс: это уже сделали за тебя. Meta, Alibaba, DeepSeek, Google и Mistral сожгли эти миллионы и выложили результат в открытый доступ бесплатно. Тебе осталось только взять и подкрутить. Об этом и разговор.

Открытые модели ИИ

Open-source модели: их не «дают избранным», их просто качают

Вся эта индустрия «своих моделей» стоит на одном фундаменте — открытых весах. На Hugging Face — это такой GitHub для нейросетей — на весну 2026 лежит более 2 миллионов открытых моделей. Не по приглашению. Не за деньги. Регистрируешься, жмёшь «скачать» — и весь мозг нейросети у тебя на диске. Вот кого реально стоит знать:

Llama (Meta)
Самая массовая open-weight семья в энтерпрайзе. Meta сожгла сотни миллионов на обучение и выложила веса. Именно с Llama началась вся волна «своих моделей».
Qwen (Alibaba)
Китайский флагман. Qwen3 235B выложен под лицензией Apache 2.0 — то есть можно даже в коммерции без ограничений. Сильнейший в своём классе.
DeepSeek
Те самые, кто взорвал рынок в 2025-м. Открытые reasoning-модели, которые по качеству дышат в спину закрытым гигантам — и всё это можно скачать.
Gemma (Google)
Лёгкая открытая семья от Google, заточена под запуск на слабом железе и на устройстве. Идеально, если нужна маленькая быстрая модель под свою задачу.
Mistral
Европейцы. Сильный мультиязычный движок, компактные модели с отличным соотношением размер/качество. Часть моделей — под свободной лицензией.
…и ещё 2 миллиона
Kimi, GLM, Phi, и тысячи уже дообученных чекпоинтов под конкретные задачи. Скорее всего, кто-то уже собрал модель, похожую на то, что тебе нужно.

Ссылки, чтобы не быть голословным — заходи и смотри своими глазами: Llama, Qwen, DeepSeek, Gemma, Mistral. Хочешь сравнить, кто сейчас сильнее — есть регулярный разбор лучших open-source LLM. Скачивание — буквально одна команда:

bash — скачать модель
$huggingface-cli download Qwen/Qwen3-8B
Кстати, ровно этот механизм часто прячется за термином «казахская LLM» — когда local-проекты берут Llama, дообучают на паре текстов и продают это как «первую национальную нейросеть». Механика та же самая: скачал открытые веса, дообучил через LoRA, назвал результат гордо.

Аренда GPU по часам — вот где вся «дороговизна» рассыпается

«Но ведь нужна видеокарта за миллионы!» — главный аргумент, которым тебя держат в стороне. И это враньё. Тебе не нужно ничего покупать. Ты арендуешь видеокарту по часам — как самокат. Поработал два часа — заплатил за два часа — вернул. Главный герой тут — RunPod. Заходишь, выбираешь видеокарту, жмёшь Deploy — через минуту у тебя своя GPU-машина в облаке. Вот актуальные цены (июль 2026):

Аренда GPU

Аренда GPU: сколько стоит час

RunPod Community Cloud, $/час, июль 2026. Не покупка за тысячи долларов — а аренда по часам.

RTX 4090 = $0.34/час. Час работы дешевле чашки кофе. Биллинг посекундный — платишь только за минуты тренировки. Источник: runpod.io/pricing

У RunPod два тарифа: Community Cloud (железо сдают частники через маркетплейс — дешевле) и Secure Cloud (собственные датацентры RunPod — дороже, но стабильнее и с гарантиями). Для экспериментов и дообучения бери Community — переплачивать не за что. Сравнение по ключевым картам:

GPU (VRAM)Community $/чSecure $/чКупить карту
RTX A5000 (24GB)$0.16$0.27~$2 000+
RTX 4090 (24GB)$0.34$0.69~$1 800
A100 (80GB)$1.19$1.39~$15 000
H100 (80GB)$1.99$2.89~$28 000
H200 (141GB)$3.59$4.39~$32 000+

Смотри на числа. H100 — та самая карта, которую все хотят и которой все хвастаются — стоит около $28 000 при покупке. Или $1.99 за час аренды. Чтобы наиграться с дообучением, тебе хватит пары часов на карте попроще. Биллинг — посекундный: включил, потренировал, выключил, заплатил за минуты. Забыл выключить — вот это единственный реальный риск (поэтому всегда останавливай под после работы).

дешевле кофе
Час на RTX 4090
$0.34
Community Cloud. Достаточно, чтобы дообучить небольшую модель.
Аренда vs покупка H100
14 000×
$1.99/час против ~$28 000 за карту. Тебе не нужна собственность — нужен результат.
по данным Spheron
Один LoRA-прогон 7B
< $5
Полное дообучение модели под свою задачу дешевле, чем бизнес-ланч.

RunPod — не единственный. Есть Vast.ai (аукцион чужих видеокарт, бывает ещё дешевле) и Lambda Labs (для тех, кто хочет посерьёзнее). Но для старта — RunPod самый человеческий. У них же есть готовый гайд по дообучению на бюджете.

Аренда GPU в датацентре

Как ты к этому подключаешься: SSH, MCP и вайбкодинг прямо на GPU

Вот часть, которую любят обходить стороной, потому что она снимает последний ореол «сложности». Ты арендовал видеокарту — и что, лезть в какую-то страшную консоль? Нет. RunPod (как и любой нормальный VPS) даёт SSH-доступ к арендованной машине. Это ровно то же самое, что я уже подробно разбирал на примере обычного сервера:

Если ты не знаешь, что такое SSH-ключи и как подключиться к удалённой машине из VSCode за 15 минут — начни отсюда: Свой VPS + VSCode: SSH-ключи и зачем это нужно. Ровно та же схема работает и с GPU-машиной на RunPod — только вместо €5-сервера у тебя видеокарта за $0.34/час.
1
Арендуй под с GPU
На RunPod жмёшь Deploy, выбираешь RTX 4090 или A100, готовый образ с PyTorch/CUDA. Через минуту машина живёт и ждёт тебя.
2
Заходи по SSH
RunPod выдаёт SSH-команду и порт. Втыкаешь свой ключ, подключаешься из VSCode как к своему серверу. Терминал, файлы, всё твоё.
3
Подрубай агента и вайбкоди
Прямо на GPU-машине запускаешь Claude Code / подключаешь MCP — и агент пишет тебе скрипт дообучения, качает модель, гоняет тренировку. Ты — направляешь.

Вот в этом весь кайф текущего момента. Есть SSH — заходи. Есть MCP — подключайся. Залетай. Тебе не нужно быть ML-инженером и вручную писать тренировочный цикл на PyTorch. Ты объясняешь агенту задачу человеческим языком: «возьми Qwen3 8B, дообучи через LoRA вот на этом датасете, сохрани адаптер». Он делает. Ты смотришь логи и правишь. Это и есть вайбкодинг — только теперь на арендованной видеокарте. Инструкция по SSH на RunPod — на пару экранов.

А что такое MCP и почему через него агент подключается к чему угодно — я разбирал отдельно: MCP простыми словами и на практике — мой open-source MCP-репозиторий. Суть: у тебя не «человек мучается с кодом», а «человек ставит задачу, агент выполняет её на железе».

Дообучение модели

LoRA на пальцах: почему дообучение ≠ обучение с нуля

Теперь про саму «магию». Обучение модели с нуля — это как вырастить человека с рождения: годы, миллионы, датацентры. А дообучение (fine-tuning) — это как взять готового специалиста и провести ему двухдневный тренинг под твою специфику. Мозги уже есть. Ты только подкручиваешь стиль, тон, знание твоих данных.

Раньше даже дообучение было тяжёлым: чтобы тронуть все веса большой модели, нужна была куча видеопамяти. Всё изменили две технологии: LoRA и QLoRA. Идея простая: не трогать весь гигантский мозг, а приклеить сбоку маленький «адаптер» — тонкий слой, который и обучается. Это в разы дешевле по памяти и времени.

LoRA — учим только «наклейку»
Базовая модель заморожена. Обучаются лишь маленькие матрицы-адаптеры (доли процента от всех весов). Результат — крошечный файл-адаптер на пару десятков мегабайт, который «надевается» на базовую модель.
QLoRA — ещё и сжимаем
QLoRA дополнительно сжимает базовую модель до 4 бит. В оригинальной работе так дообучили модель на 65 млрд параметров на одной видеокарте 48GB — и получили 99.3% от уровня ChatGPT за 24 часа на одном GPU.

Инструменты, которые делают это почти в одну команду — Unsloth (быстрее в 2 раза, память меньше на 60% — есть документация с готовыми ноутбуками), Axolotl и LLaMA-Factory. Ты редактируешь один конфиг (какая модель, какой датасет) и запускаешь. По замерам 2026 года, дообучить 3B-модель на 1000 примерах — это меньше 2 часов на RTX 3090 и считанные доллары. Вот как цена «своей модели» выглядит в реальности:

Дообучение

Сколько стоит «дообучить свою модель»

Прикидка стоимости одного LoRA/QLoRA-прогона на аренде GPU. Не миллионы. Не тысячи. Единицы долларов.

Оценка: время тренировки × цена GPU/час. Дообучить 3B-модель на своих данных — меньше доллара.
Итого рецепт «своей модели», за который берут деньги как за rocket science: (1) скачал Qwen/Llama с Hugging Face, (2) арендовал RTX 4090 на RunPod за копейки, (3) зашёл по SSH, натравил Unsloth на свои данные через LoRA, (4) через пару часов забрал адаптер. Всё. Ты только что сделал «собственный ИИ». Потратил меньше, чем на такси до аэропорта.

Когда своя модель реально нужна, а когда это понты

Теперь честно и в другую сторону — чтобы ты не побежал дообучать модель там, где это не нужно. Потому что чаще всего своя модель тебе не нужна вообще. И это нормально. 95% задач закрываются обычной обёрткой над Claude или GPT с хорошим промптом — и это правильное инженерное решение, а не «читерство».

Когда своя модель оправдана

  • • Приватные данные, которые нельзя отдавать в чужой API (медицина, банки, гостайна)
  • • Узкий домен со своим языком/жаргоном, где общие модели слабы
  • • Нужна работа офлайн / на своём железе без интернета
  • • Огромный объём вызовов, где API становится дороже своего хостинга
  • • Специфический стиль/формат ответа, который промптом не добить

Когда это понты

  • • Чат-бот поддержки — берётся обёрткой над Claude за день
  • • «Своя модель» ради строчки в питч-деке для инвесторов
  • • Задача, где общий GPT уже отвечает на 5 из 5
  • • Нет данных для дообучения — а без данных fine-tune бессмысленен
  • • «Мы обучили нейросеть», а под капотом — вызов чужого API

Я не продаю тебе «делай свою модель». Я продаю тебе трезвость. Когда в следующий раз кто-то с важным лицом скажет «у нас собственный ИИ», задай два вопроса: «это дообученная open-source модель или обёртка над чужим API?» и «на каких данных дообучали?». По тому, как человек поплывёт с ответом, ты мгновенно поймёшь, где инженерия, а где маркетинговый пузырь.

Барьер входа обнулился. Веса открыты, видеокарта стоит копейки в час, а агент напишет тебе тренировку по одному предложению. Единственное, что отделяет тебя от «своей модели» — это привычка думать, что тебе туда нельзя.
Автор

Вывод: перестань покупать билет в открытую дверь

«Своя модель» перестала быть признаком гениальности где-то в 2023-м, когда Meta выложила Llama, а исследователи придумали QLoRA. С тех пор это конструктор: открытые веса + аренда GPU по часам + LoRA + агент, который пишет код за тебя. Всё остальное — упаковка и уверенный тон.

Модельскачал с HFGPU$0.34/часДообучениеLoRA, ~$5Кодпишет агентМагия0%

Так что вместо того, чтобы платить инфоцыгану за курс «как построить свой ИИ», сделай проще: заведи Hugging Face, зарегистрируйся на RunPod, арендуй карту на час, зайди по SSH, подключи агента и попробуй дообучить что-нибудь маленькое на своих данных. Потратишь пару долларов и вечер — а взамен у тебя навсегда пропадёт магия слова «своя модель». Залетай, подключайся, пробуй. Это не закрытый клуб.

Хочешь понять всю картину, почему сегодня «уникальный продукт» так легко скопировать? Ответ прост: барьер входа в AI обнулился до цены обеда — веса открыты, GPU в аренде, агент пишет код. Уникальность теперь не в технологии, а в данных, дистрибуции и скорости исполнения.