Слово «агент» за последние два года затёрли до неузнаваемости: агентом называют и чат-бота на сайте, и скрипт с одним запросом к нейросети. Разберёмся, где настоящая разница, что нужно для запуска и во сколько это обходится в рублях.
Чем агент отличается от чат-бота
Чат-бот отвечает. Вы задали вопрос — модель сгенерировала текст. Всё, что она знает, лежит внутри неё: данные, на которых её обучали. Спросите про ваш прайс-лист или вчерашнюю заявку — она честно придумает ответ, потому что взять его негде.
Агент действует. У него есть доступ к вашим данным и к инструментам, которыми он может пользоваться сам: посмотреть в базу знаний, сходить в CRM, выполнить поиск, вызвать ваш API. Он не просто продолжает текст — он решает задачу за несколько шагов.
Практическая разница: чат-бот скажет «уточните у менеджера», агент откроет карточку клиента и назовёт статус заказа.
Из чего собирается агент
Модель — мозг. От её выбора зависит и качество, и стоимость: разброс цен между моделями достигает сотни раз, и самая дорогая нужна далеко не всегда.
База знаний (RAG) — ваши документы, инструкции, прайсы. Технология работает так: перед ответом система ищет в ваших файлах куски, относящиеся к вопросу, и подкладывает их модели. Модель отвечает уже не по памяти, а по вашим данным. Это главный способ заставить нейросеть говорить правду о вашем бизнесе.
Инструменты (MCP) — протокол, через который агент дотягивается до внешних систем. Вместо того чтобы писать интеграцию с каждым сервисом руками, вы подключаете готовый MCP-сервер, и агент начинает им пользоваться.
Канал общения — где агент встречается с человеком: виджет на сайте, мессенджер, ваше приложение через API.
С чего начать на практике
Не пытайтесь сразу собрать универсального помощника. Возьмите одну задачу, где ответ уже лежит в ваших документах — например, вопросы по условиям доставки или по внутреннему регламенту. Такой агент собирается за вечер и сразу снимает нагрузку с поддержки.
Как создать агента в облаке
Собирать инфраструктуру под ИИ с нуля — держать сервер с видеокартой, разворачивать модель, следить за очередями — дорого и почти всегда лишнее. Проще взять готовую платформу, где всё это уже есть.
Мы разбираем на примере Рег.облака и Timeweb Cloud — у последнего раздел с агентами устроен понятнее всего для старта. Порядок такой:
Шаг 1. Создать агента. В панели есть раздел AI-агентов, где агент заводится кнопкой. На старте нужно только имя и системная инструкция — текст, который объясняет модели, кто она и как себя вести.
Шаг 2. Выбрать модель. Здесь важно не гнаться за флагманом. Для ответов по документам с головой хватает недорогой модели: разница в цене между ней и топовой — десятки раз, а на простых вопросах разницы в качестве вы не заметите.
Шаг 3. Загрузить базу знаний. Раздел «Базы знаний» принимает ваши файлы и сам превращает их в поисковый индекс. Никакого кода: загрузили инструкции и прайсы — агент начал по ним отвечать.
Шаг 4. Подключить инструменты. В разделе MCP-серверов доступны готовые интеграции — Яндекс Поиск, amoCRM, Bitrix24, Контур.Фокус, VK Реклама, Context7 для работы с документацией. Подключаются в один клик.
Шаг 5. Вывести к людям. Готового агента встраивают на сайт через iframe, подключают к своему приложению по API или заводят как чат-бот.
Создать AI-агента в Timeweb CloudБазы знаний, MCP-серверы и 60+ моделей в одной панели. Оплата в рублях, по факту использования.
ПопробоватьСколько это стоит
Оплата идёт не за время работы сервера, а за токены — единицы текста, которые модель прочитала и написала. Примерно один токен на два-три символа русского текста.
Входящие токены — то, что вы отправили модели: вопрос пользователя, системная инструкция, куски из базы знаний. Исходящие — то, что она ответила. Исходящие всегда дороже, обычно в три-пять раз.
Ниже цены Timeweb Cloud за миллион токенов, актуальные на 25 июля 2026. В каталоге 61 модель, здесь — самые ходовые.
Флагманы для сложных задач
| Модель | Контекст | Входящие | Исходящие |
|---|---|---|---|
| Claude 5 Fable | 1M | 1350 ₽ | 6750 ₽ |
| GPT-5.6 Sol | 1M | 675 ₽ | 4050 ₽ |
| Claude 4.8 Opus | 1M | 675 ₽ | 3375 ₽ |
| GPT 5.4 | 1M | 338 ₽ | 2025 ₽ |
| Claude 5 Sonnet | 1M | 405 ₽ | 2025 ₽ |
| GPT-5.6 Terra | 1M | 337.5 ₽ | 2025 ₽ |
| Qwen 3.7 Max | 1M | 337.5 ₽ | 1012.5 ₽ |
| Grok 4.5 | 500K | 270 ₽ | 810 ₽ |
Рабочие лошадки — оптимум по цене и качеству
| Модель | Контекст | Входящие | Исходящие |
|---|---|---|---|
| Gemini 3.5 Flash | 1M | 202.5 ₽ | 1215 ₽ |
| GLM 5.2 | 1M | 189 ₽ | 594 ₽ |
| Grok 4.3 | 1M | 168.75 ₽ | 337.5 ₽ |
| GPT-5.6 Luna | 1M | 135 ₽ | 810 ₽ |
| GPT 5.4 Mini | 400K | 101 ₽ | 608 ₽ |
| GLM 4.7 | 200K | 81 ₽ | 297 ₽ |
| DeepSeek V4 Pro | 1M | 234.9 ₽ | 469.8 ₽ |
Дешёвые — для потока и простых ответов
| Модель | Контекст | Входящие | Исходящие |
|---|---|---|---|
| GLM 4.7 FlashX | 200K | 9.45 ₽ | 54 ₽ |
| DeepSeek V4 Flash | 1M | 18.9 ₽ | 37.8 ₽ |
| GPT 5.4 Nano | 400K | 27 ₽ | 169 ₽ |
| Qwen 3.6 Flash | 1M | 33.75 ₽ | 202.5 ₽ |
| Gemini 3.1 Flash Lite | 1M | 34 ₽ | 203 ₽ |
| Qwen 3.7 Plus | 1M | 54 ₽ | 216 ₽ |
| GPT OSS 120B | — | 68 ₽ | 67.5 ₽ |
Российские модели
| Модель | Контекст | Входящие | Исходящие |
|---|---|---|---|
| YandexGPT 5.1 Lite | 33K | 210 ₽ | 210 ₽ |
| YandexGPT 5.1 Pro | 33K | 410 ₽ | 410 ₽ |
| Alice AI LLM | 33K | 510 ₽ | 2030 ₽ |
Эмбеддинги — для баз знаний
Эти модели не пишут текст, а превращают его в числа для поиска. Именно на них работает RAG, и стоят они копейки.
| Модель | Входящие |
|---|---|
| Text Embedding 3 Small | 3 ₽ |
| Qwen Text Embedding v4 | 9 ₽ |
| Yandex Text Embeddings | 10.1 ₽ |
| Gemini Embedding 2 | 27 ₽ |
| Text Embedding 3 Large | 45 ₽ |
Картинки и речь
| Модель | Входящие | Исходящие |
|---|---|---|
| Gemini 3.1 Flash Image Preview | 68 ₽ | 8100 ₽ |
| GPT Image 2 | 675 ₽ | 4050 ₽ |
| GPT-4o mini TTS | 81 ₽ | 1620 ₽ |
| GPT-4o Transcribe | 810 ₽ | 1350 ₽ |
Считаем на живом примере
Агент отвечает на вопросы клиентов по вашей документации. Один диалог — примерно так:
- системная инструкция: 500 токенов
- три куска из базы знаний: 1500 токенов
- вопрос человека: 100 токенов
- ответ агента: 400 токенов
Итого 2100 входящих и 400 исходящих за диалог.
На дешёвой модели вроде GLM 4.7 FlashX: 2100 × 9.45 ₽ / 1 000 000 + 400 × 54 ₽ / 1 000 000 ≈ 4 копейки за диалог. Тысяча обращений в месяц обойдётся в 40 рублей.
На флагмане вроде Claude 5 Fable тот же диалог стоит около 5,5 рубля, а тысяча обращений — 5500 рублей.
Разница больше чем в сто раз. Поэтому первое правило экономии простое: начинайте с дешёвой модели и повышайте класс только там, где качества действительно не хватает. На вопросах по документам разницы обычно не видно вовсе — работу делает база знаний, а не размер модели.
Что раздувает счёт незаметно
Длинный контекст. Если подкладывать модели десять кусков из базы вместо трёх или тащить всю историю переписки в каждый запрос, входящие токены растут в разы. Следите за размером того, что отправляете, — это почти всегда основная статья расхода, а не ответы.
Когда агент не нужен
Честно: если задача решается поиском по сайту или готовым ответом из шаблона, агент будет дороже и капризнее. Он оправдан там, где вопросов много, они разные и ответ каждый раз надо собирать из ваших данных.
И ещё: агент не заменяет поддержку целиком. Разумная схема — он берёт на себя типовые вопросы и передаёт человеку всё, в чём не уверен.
Что дальше
Если под агента нужен собственный сервер — например, чтобы держать своё приложение рядом с ним, — загляните в рейтинг хостингов или подберите площадку по стране. А начать разбираться с сервером с нуля поможет первая настройка VPS.
Собрать своего агентаСоздание агента, база знаний и подключение инструментов — без своего сервера и без кода.
Открыть панель