LLM

Просто о сложном


Используй стрелки ← → для навигации

Содержание

01Что такое LLM?
02Токены — валюта LLM
03Контекстное окно
04Искусство промптинга
05Квантизация
06Что происходит при запросе?
07AI CLI — терминальные помощники
08AI IDE — редакторы с ИИ
09OpenRouter и агрегаторы
10Open Source инструменты
11Агентная архитектура
12Живое демо
13Цены: подписки и API
14Практика: AI для каждой роли

Раздел 01

Что такое LLM?

Large Language Model — Большая Языковая Модель

LLM в одном предложении

LLM — это программа, которая предсказывает следующее слово на основе всех предыдущих. Делает она это настолько хорошо, что создаётся впечатление понимания и мышления.

Аналогия

Представь автозаполнение в телефоне, но в миллион раз умнее. Ты пишешь «Привет, как...» — телефон предлагает «дела». LLM делает то же самое, но может «дописывать» целые эссе, код и стихи.

Как LLM обучается?

📚

1. Читает интернет

Книги, статьи, код, форумы — триллионы слов. Модель ищет паттерны: какие слова обычно идут друг за другом.

🧠

2. Строит связи

Миллиарды параметров (весов) запоминают эти паттерны. Параметры — это «нейроны» модели.

👨‍🏫

3. Учится у людей

Люди оценивают ответы модели: «этот хороший, этот плохой». Модель учится отвечать полезнее (RLHF).

🎯

4. Результат

Модель не «знает» факты — она знает статистику языка. Но эта статистика настолько богата, что выглядит как знание.

Примеры LLM

🟣

Claude

Anthropic
Opus, Sonnet, Haiku

🟢

GPT-4

OpenAI
ChatGPT

🔵

Gemini

Google
DeepMind

🟠

LLaMA

Meta
Open Source

🔴

Mistral

Mistral AI
Франция

DeepSeek

DeepSeek
Китай

Раздел 02

Токены

Валюта языковых моделей

Что такое токен?

Токен — это кусочек текста, с которым работает модель. Это не всегда целое слово — может быть часть слова, пробел или знак препинания.

Аналогия

Если текст — это конструктор LEGO, то токены — это отдельные кубики. Модель не видит готовую картинку — она работает с кубиками и собирает из них ответ, по одному за раз.

Как выглядит токенизация?

Фраза: «Привет, как дела?»

Привет, как дела?

6 токенов

Фраза: «Hello, how are you?»

Hello, how are you?

6 токенов

Важно

Русский текст обычно требует больше токенов, чем английский — модели обучались в основном на английском.

Зачем знать про токены?

💰

Стоимость

API моделей тарифицируется за токены. Больше токенов = дороже запрос. Обычно цена за 1M (миллион) токенов.

📏

Лимиты

У каждой модели есть лимит токенов — контекстное окно. Если текст слишком длинный, он не поместится.

Скорость

Модель генерирует по одному токену за шаг. Больше токенов в ответе = дольше ждать.

📐

Правило большого пальца

~1 токен ≈ 4 символа на английском. ~1 токен ≈ 1-2 символа на русском. 1 страница текста ≈ 300-500 токенов.

Раздел 03

Контекстное окно

Рабочая память модели

Что это?

Контекстное окно — это максимальный объём текста, который модель может «видеть» одновременно: ваш запрос + её ответ + вся история диалога.

Аналогия

Представь рабочий стол. Контекстное окно — это размер стола. Чем больше стол, тем больше документов ты можешь разложить и видеть одновременно. Маленький стол = приходится убирать старые документы, чтобы положить новые.

Размеры контекстных окон

GPT-3 (2020) — 4K токенов ≈ 3 страницы

4K

GPT-4 (2023) — 128K токенов ≈ 100 страниц

128K

Claude Opus (2025) — 200K токенов ≈ 150 страниц

200K

Gemini 2.0 (2025) — 1M токенов ≈ 750 страниц

1M

Что происходит на краю окна?

🪟

Окно заполнено

Когда диалог становится длиннее контекстного окна, самые старые сообщения «выпадают» — модель их больше не видит.

🤔

«Забывание»

Вот почему в длинных чатах модель может «забыть» то, что обсуждали в начале — эти токены уже выпали из окна.

Совет

Если модель «забыла» важную информацию — просто повторите её в новом сообщении. Или начните новый чат с ключевыми фактами в первом сообщении.

Раздел 04

Искусство промптинга

Как правильно разговаривать с LLM

Промпт = инструкция

Промпт (prompt) — это текст, который вы отправляете модели. Качество ответа напрямую зависит от качества вопроса. Мусор на входе = мусор на выходе.

Аналогия

LLM — это супер-умный стажёр. Он может сделать почти всё, но ему нужна чёткая задача. Скажи «сделай красиво» — получишь непредсказуемый результат. Скажи «сделай таблицу с 3 колонками в минималистичном стиле» — получишь именно это.

Плохой vs Хороший промпт

Плохо

«Расскажи про маркетинг»

Хорошо

«Составь план email-маркетинга для интернет-магазина одежды на 1 месяц. Бюджет 50 000 руб. Целевая аудитория — женщины 25-35 лет. Формат: таблица по неделям.»

Плохо

«Напиши код»

Хорошо

«Напиши функцию на Python, которая принимает список email-адресов и возвращает только валидные. Используй регулярные выражения. Добавь docstring и 3 теста.»

5 приёмов хорошего промпта

🎭

1. Задай роль

«Ты — опытный юрист, специализирующийся на трудовом праве...»

📋

2. Дай контекст

«У нас стартап, 10 человек, B2B SaaS для логистики...»

🎯

3. Укажи формат

«Ответь в виде нумерованного списка / таблицы / JSON / пошагово...»

🔗

4. Дай примеры

«Вот пример того, что я хочу получить: [пример]. Сделай аналогично для...»

Приём #5 — Chain of Thought

«Думай пошагово» — попроси модель рассуждать по шагам. Это реально улучшает качество ответов на сложные вопросы!

Продвинутые техники

🔄

Итерации

Не пытайся написать идеальный промпт с первого раза. Уточняй и дополняй в диалоге.

🧱

Декомпозиция

Разбей сложную задачу на шаги. Каждый шаг — отдельный промпт.

🚧

Ограничения

«Не используй X», «Ответ не длиннее Y строк», «Только на основе данного текста».

Раздел 05

Квантизация

Как уместить гиганта в ноутбук

Проблема размера

LLM — это миллиарды чисел (параметров). Каждое число хранится с высокой точностью. Модель с 70 миллиардами параметров в полном качестве занимает ~140 ГБ видеопамяти. Это несколько видеокарт за $20 000+.

Аналогия

Представь фотографию в формате RAW (50 МБ) vs JPEG (5 МБ). Разница в качестве почти незаметна глазу, но файл в 10 раз меньше. Квантизация делает то же самое с «весами» нейросети — округляет числа, чтобы модель занимала меньше памяти.

Уровни квантизации

FP16
16 бит на число
Оригинал

140 ГБ

INT8
8 бит на число
~99% качества

70 ГБ

INT4
4 бита на число
~95% качества

35 ГБ

INT2
2 бита на число
Заметная потеря

~18 ГБ

* Размеры указаны для модели с 70B параметров

Когда это нужно?

🏠

Локальный запуск

Хочешь запустить LLM на своём ноутбуке? Без квантизации не обойтись. INT4-версии работают даже на MacBook с 16 ГБ RAM.

💸

Экономия

Меньше памяти = дешевле серверы = дешевле API. Компании квантизируют модели для продакшена.

🚀

Скорость

Квантизированные модели работают быстрее — меньше данных нужно обрабатывать.

🔧

Инструменты

Ollama, llama.cpp, GGUF — популярные инструменты для запуска квантизированных моделей локально.

Раздел 06

Что происходит при запросе?

Путь от вопроса до ответа

Запрос улетает в LLM

👤
Пользователь
💬 «Расскажи про космос»
🧠
LLM
✨ «Космос — это бесконечное...»
👤
Получает ответ

Шаг за шагом

✍️
Ввод
текста
🔪
Токени-
зация
🔢
Эмбед-
динги
🧠
Транс-
формер
🎲
Выбор
токена
📝
Ответ

1. Токенизация

Ваш текст разбивается на токены и превращается в числа. Каждый токен — это число из «словаря» модели (обычно ~50 000 — 150 000 токенов в словаре).

«Расскажи про космос»

Расскажи про космос

[8492, 15743, 2891, 44521, 9103]

2. Эмбеддинги

Каждый токен превращается в вектор — координаты на «карте смыслов». Похожие слова → рядом. Разные → далеко.

ЖИВОТНЫЕ ЕДА НАУКА ЭМОЦИИ близко далеко кошка собака хомяк волк попугай пицца суши борщ кофе кв. физика нейросеть алгоритм матрица радость счастье грусть страх стол

Карта смыслов в 2D. В реальности — тысячи измерений. Похожие слова группируются, далёкие — разлетаются.

3. Трансформер (Attention)

Ядро модели — механизм внимания (Attention). Каждый токен «смотрит» на все остальные и определяет, какие важны для контекста.

Кот
сел
на
коврик
потому
что
он
устал

«он» сильнее всего связан с «Кот» — толстая яркая линия. Связь с «коврик» — слабая.

4. Генерация ответа

Модель выдаёт вероятности для каждого возможного следующего токена. Из них выбирается один — и процесс повторяется.

Следующий токен после «Космос — это»:

«бесконечное»
42%
«огромное»
25%
«пространство»
15%
«загадочное»
8%
другие
10%
Temperature

Temperature = 0 → всегда «бесконечное». Temperature = 1+ → может выбрать «загадочное» — ответ разнообразнее, но менее предсказуем.

5. Temperature

Temperature — это параметр «креативности» модели. Он управляет тем, насколько предсказуемо модель выбирает следующий токен из списка вероятностей.

Аналогия

Представь шеф-повара. При temperature = 0 он всегда готовит своё фирменное блюдо — идеально, но одинаково. При temperature = 1 он импровизирует: добавляет новые специи, пробует комбинации. При temperature = 2 он бросает в кастрюлю всё подряд — иногда гениально, чаще хаос.

🧊

T = 0

Всегда выбирает самый вероятный токен. Один и тот же промпт → один и тот же ответ. Идеально для кода, SQL, фактов.

⚖️

T = 0.5–0.8

Баланс. Небольшое разнообразие, но ответ остаётся связным. Хороший дефолт для большинства задач.

🔥

T = 1.0+

Менее вероятные токены получают шанс. Ответы разнообразнее, но могут быть менее логичными. Для креатива, brainstorm.

Как это работает технически

Вероятности токенов делятся на temperature перед softmax. T=0.5 → разрыв между лидером и остальными увеличивается (лидер выигрывает чаще). T=2.0 → разрыв сглаживается (все токены почти равновероятны).

Авторегрессия

Модель генерирует ответ по одному токену за раз. Каждый новый токен добавляется к контексту, и весь процесс повторяется.

output_tokens.generate()
Шаг 1: Космос
Шаг 2: Космос — это
Шаг 3: Космос — это бесконечное
Шаг 4: Космос — это бесконечное пространство
Шаг 5: Космос — это бесконечное пространство,
Ключевой момент

Каждый шаг — это полный проход через все слои трансформера. Для ответа в 500 токенов модель делает 500 таких проходов. Вот почему длинные ответы генерируются долго.

Раздел 07

AI CLI

Терминальные помощники для разработчиков

Что такое AI CLI?

AI CLI — это ИИ-ассистент прямо в терминале. Он видит твой проект, может читать и редактировать файлы, запускать команды — и всё это через текстовый диалог в консоли.

Аналогия

Представь, что в твоём терминале сидит опытный разработчик. Ты описываешь задачу словами, а он сам находит нужные файлы, пишет код, запускает тесты и фиксит баги. Ты лишь подтверждаешь его действия.

Claude Code

🟣

Что это?

CLI-инструмент от Anthropic. Работает в терминале, видит весь проект, может читать/писать файлы, запускать bash-команды.

🧠

Модели

Opus, Sonnet, Haiku. Контекст до 1M токенов. Агентный режим — сам исследует код, планирует и выполняет.

🔧

Фичи

Субагенты, параллельные задачи, MCP-серверы, хуки, автоматические коммиты и PR, поддержка IDE (VS Code, JetBrains).

💡

Когда использовать

Рефакторинг, фикс багов, написание тестов, code review, исследование незнакомого кодбейза, миграции.

Запуск

npm install -g @anthropic-ai/claude-code && claude

Codex CLI (OpenAI)

🟢

Что это?

CLI-агент от OpenAI. Open source. Работает в терминале с моделями GPT-4o и o3/o4-mini. Песочница для безопасного выполнения команд.

🛡️

Режимы

suggest (только предлагает), auto-edit (редактирует с подтверждением), full-auto (полная автономия в песочнице).

Запуск

npm install -g @openai/codex && codex

Gemini CLI (Google)

🔵

Что это?

CLI от Google на базе Gemini 2.5 Pro. Open source. Контекст 1M токенов. Бесплатный тариф — до 60 запросов/мин для личного использования.

🌐

Особенности

Интеграция с Google-экосистемой. Поддержка MCP-серверов. Мультимодальность — понимает изображения и скриншоты.

Запуск

npm install -g @anthropic-ai/claude-code && gemini (шутка)
npm install -g @google/gemini-cli && gemini

Сравнение CLI

🟣

Claude Code

Лучший агентный режим. Субагенты. Глубокий анализ кода. Платный (подписка Anthropic).

🟢

Codex CLI

Open source. Песочница. Хорош для простых задач. Нужен API-ключ OpenAI.

🔵

Gemini CLI

Бесплатный тариф. 1M контекст. Google-экосистема. Нужен Google-аккаунт.

Совет

Все три инструмента можно попробовать бесплатно (или почти). Лучший способ выбрать — попробовать каждый на реальной задаче из своего проекта.

Раздел 08

AI IDE

Редакторы кода со встроенным ИИ

Cursor

Что это?

Форк VS Code со встроенным ИИ. Выглядит и работает как VS Code, но с суперспособностями: автокомплит, чат, агент — всё из коробки.

🎯

Ключевые фичи

Tab-автокомплит (предсказывает целые блоки), Cmd+K (редактирование по описанию), агентный режим, встроенный чат с контекстом проекта.

🔌

Модели

Claude, GPT-4o, собственные модели Cursor. Можно подключить свой API-ключ. Автоматически выбирает лучшую модель для задачи.

💰

Цена

Free (ограниченно), Pro $20/мес, Business $40/мес. Все расширения VS Code совместимы.

Windsurf (ex-Codeium)

🏄

Что это?

AI IDE от Codeium (теперь OpenAI). Акцент на «flow» — ИИ работает параллельно с тобой, предугадывая следующие действия.

🌊

Cascade

Агентный движок. Понимает весь проект, может вносить изменения в несколько файлов одновременно, запускать команды.

Другие AI-расширения для IDE

🤖

GitHub Copilot

Расширение для VS Code / JetBrains. Автокомплит и чат от GitHub (Microsoft). $10/мес или бесплатно для студентов и open source.

🔥

Supermaven

Сверхбыстрый автокомплит (300K контекст). Расширение для VS Code, JetBrains, Neovim. Бесплатный тариф.

📦

Continue.dev

Open source расширение для VS Code / JetBrains. Подключает любую модель — облачную или локальную (Ollama).

🔑

Cline (ex-Claude Dev)

Open source расширение для VS Code. Агентный режим — сам создаёт файлы, запускает терминал. Работает с любым API.

CLI vs IDE — что выбрать?

CLI (Claude Code, Codex, Gemini)

+ Полный контроль
+ Автоматизация и скрипты
+ Работает по SSH / на серверах
+ Нет привязки к редактору
− Нет визуального интерфейса
− Порог входа выше

IDE (Cursor, Windsurf, Copilot)

+ Визуальный diff изменений
+ Tab-автокомплит в реальном времени
+ Низкий порог входа
+ Привычный интерфейс
− Привязка к конкретному редактору
− Меньше гибкости

Совет

Многие разработчики используют оба подхода: IDE для повседневной работы + CLI для сложных задач (рефакторинг, миграции, исследование кода).

Раздел 09

OpenRouter

Единый доступ ко всем моделям

Что такое OpenRouter?

OpenRouter — это агрегатор API для языковых моделей. Один API-ключ даёт доступ к сотням моделей: Claude, GPT-4, Gemini, LLaMA, Mistral, DeepSeek и многим другим.

Аналогия

Это как агрегатор такси: вместо установки отдельных приложений (Uber, Яндекс, Bolt) — одно приложение, которое показывает все варианты и цены. OpenRouter — тот же принцип для LLM API.

Зачем нужен?

🔑

Один ключ

Не нужно заводить аккаунты у каждого провайдера. Один API-ключ OpenRouter = доступ к 200+ моделям.

💸

Сравнение цен

Видишь цену за токен для каждой модели. Можно выбрать оптимальное соотношение цена/качество для задачи.

🔄

Fallback

Если одна модель недоступна — автоматически переключается на другую. Надёжность для продакшена.

🧪

Эксперименты

Легко сравнить ответы разных моделей на один и тот же промпт. Идеально для выбора модели под задачу.

Как подключить к инструментам?

OpenRouter совместим с OpenAI API форматом. Это значит, что почти любой инструмент, который умеет работать с OpenAI — может работать и с OpenRouter. Просто смени base URL и API-ключ.

Cursor

Settings → Models → OpenAI API compatible → вставить URL и ключ OpenRouter

Continue.dev

config.json → провайдер «openrouter» → любые модели через единый конфиг

Cline

Нативная поддержка OpenRouter — выбираешь провайдер из списка

Свой код

openai SDK → base_url="https://openrouter.ai/api/v1" — и готово

Раздел 10

Open Source инструменты

Бесплатные и открытые альтернативы

OpenCode

🖥️

Что это?

Open source терминальный AI-ассистент. Красивый TUI (текстовый интерфейс). Написан на Go. Работает с любым провайдером: Anthropic, OpenAI, OpenRouter, Ollama.

Фичи

LSP-интеграция (понимает типы и ошибки), сессии, подключение файлов по @ — похож на Claude Code, но open source и бесплатный.

Aider

🛠️

Что это?

Один из старейших AI CLI для кодинга. Open source, Python. «AI pair programming в терминале». Интеграция с git из коробки — автокоммиты.

🏆

Сильные стороны

Поддержка множества моделей (Claude, GPT, Gemini, DeepSeek, локальные). Architect mode — одна модель планирует, другая кодит. Бенчмарки кодинга.

Запуск

pip install aider-chat && aider

Ollama — локальные модели

Ollama позволяет запускать LLM локально на своём компьютере. Никаких API-ключей, никакой отправки данных в облако. Всё работает офлайн.

🦙

Модели

LLaMA 3.3, Qwen 2.5, DeepSeek-R1, Mistral, Gemma, CodeLLaMA — сотни моделей одной командой.

🔒

Приватность

Данные не покидают твой компьютер. Идеально для работы с конфиденциальным кодом и документами.

Запуск

brew install ollama && ollama run llama3.3

Карта инструментов

CLI (терминал)

Claude Code, Codex CLI, Gemini CLI, Aider, OpenCode

IDE (редактор)

Cursor, Windsurf, GitHub Copilot, Cline, Continue.dev, Supermaven

Агрегаторы API

OpenRouter — единый ключ ко всем моделям

Локальный запуск

Ollama, llama.cpp, LM Studio — модели на своём железе

Главный вывод

Не нужно выбирать что-то одно. Комбинируй инструменты: Cursor для ежедневного кодинга + Claude Code для сложных задач + Ollama для приватных данных + OpenRouter для экспериментов.

Раздел 11

Агентная архитектура

LLM с руками, глазами и командой

Что такое AI-агент?

Агент — это LLM, которая умеет не только думать, но и действовать: читать файлы, запускать команды, вызывать API, писать код — и сама решает, что делать дальше на каждом шаге.

Аналогия

Обычный ChatGPT — это эксперт в стеклянной комнате. Он видит только то, что ты ему покажешь через окошко, и может только говорить в ответ. Агент — это тот же эксперт, но с ключами от офиса: он может сам открывать шкафы, пользоваться компьютером и делать работу.

💬

Обычная LLM

Вопрос → Ответ текстом. Не видит файлы, не может запустить код, не помнит прошлый чат.

🤖

AI Агент

Задача → Думает → Действует → Наблюдает результат → Думает снова → ... → Готово.

Цикл агента

🧠 Думает ⚡ Действует 👁 Наблюдает 📋 Планирует

Агент крутится в цикле, пока задача не решена. Каждый виток — новый шаг к цели.

Субагенты

Субагент — это агент, которого запускает другой агент. Главный агент (оркестратор) делегирует сложные подзадачи специализированным субагентам, каждый со своим контекстом.

Аналогия

Тимлид не пишет весь код сам. Он разбивает задачу: «Петя — сделай API, Маша — напиши тесты, Саша — обнови документацию». Каждый работает параллельно в своей ветке. Тимлид собирает результаты. Субагенты — это то же самое, но вместо людей — LLM-процессы.

🎯 Оркестратор 🔍 Исследователь 💻 Кодер 🧪 Тестировщик ⚡ работают параллельно

Скиллы (Tools)

Скилл — это конкретное действие, которое агент может вызвать: прочитать файл, выполнить bash-команду, сделать HTTP-запрос, отредактировать код. Без скиллов агент — просто чат.

Аналогия

Скиллы — это приложения на телефоне. Сам телефон (LLM) умный, но без приложений бесполезен. Установил Google Maps (скилл навигации) — теперь может проложить маршрут. Установил камеру (скилл чтения файлов) — теперь видит документы.

📖

Read

Читает файлы из проекта. Агент сам решает, какой файл открыть.

✏️

Edit

Редактирует код точечно — заменяет конкретные строки, не переписывая файл целиком.

🔎

Grep / Glob

Ищет по содержимому файлов и по именам. Как Ctrl+Shift+F в IDE.

Bash

Запускает терминальные команды: тесты, билд, git, npm, pip — что угодно.

🌐

WebSearch / Fetch

Ищет информацию в интернете и загружает веб-страницы.

🤖

Agent (субагент)

Запускает другого агента для параллельной работы над подзадачей.

Rules (Правила)

Rules — это инструкции, которые агент читает перед каждым действием. Они задают стиль кода, ограничения, соглашения команды. Хранятся в файлах CLAUDE.md, .cursorrules, .clinerules и т.д.

Аналогия

Rules — это как Code Style Guide и README для нового разработчика. Когда в команду приходит стажёр, ты даёшь ему документ: «Мы используем TypeScript, пишем тесты на Vitest, деплоим через GitHub Actions, коммиты в conventional commits формате». Rules — то же самое для AI.

Без Rules

Агент пишет код по-своему: другой стиль, не те библиотеки, коммиты без формата. Каждый раз нужно объяснять заново.

С Rules

Агент сразу знает: «TypeScript strict, Vitest для тестов, conventional commits, не трогать папку legacy/». Работает как часть команды.

Пример CLAUDE.md

Мы пишем на TypeScript. Все функции типизированы. Тесты обязательны. Не используй any. База — PostgreSQL. ORM — Prisma. Пиши коммиты в формате: feat|fix|refactor: описание.

MCP — Model Context Protocol

MCP — это открытый протокол для подключения внешних инструментов к AI-агенту. Единый стандарт: любой MCP-сервер работает с любым MCP-клиентом (Claude Code, Cursor, Cline и др.).

Аналогия

MCP — это как USB. До USB у каждого устройства был свой разъём. MCP — универсальный разъём для AI: один стандарт подключает базы данных, Jira, Slack, GitHub, Figma, Terraform — что угодно. Написал MCP-сервер один раз → работает везде.

🤖 AI Агент ── MCP Protocol ── 🗄 PostgreSQL 📋 Jira 💬 Slack 🐙 GitHub 🎨 Figma Каждый MCP-сервер даёт агенту новые способности

Хуки (Hooks)

Хуки — это автоматические скрипты, которые срабатывают на определённые события агента: перед выполнением команды, после редактирования файла, при старте сессии и т.д.

Аналогия

Хуки — это как Git Hooks (pre-commit, post-push), но для AI-агента. Например: «после каждого редактирования .py файла — запусти линтер», «перед коммитом — проверь, что нет секретов», «при старте — загрузи контекст проекта из Notion».

🚦

PreToolCall

Срабатывает перед вызовом инструмента. Можно заблокировать опасные команды: rm -rf, DROP TABLE и т.д.

PostToolCall

Срабатывает после. Пример: после Edit → запустить eslint/prettier автоматически.

🎬

SessionStart

При старте сессии. Загрузить контекст проекта, проверить окружение, подтянуть последние изменения.

🔔

Notification

Отправить уведомление при завершении долгой задачи — в Slack, Telegram или системное оповещение.

Пример

PostToolCall (Edit *.py) → "ruff check --fix $FILE" — автолинтинг после каждого редактирования Python-файла

Agents Team

Agents Team — это несколько специализированных агентов, работающих вместе над одной задачей. У каждого своя роль, свои инструменты и свои правила.

Аналогия

Это как настоящая dev-команда. У тебя есть: фронтенд-разработчик (знает React, имеет доступ к Figma), бэкенд (знает Go, имеет доступ к БД), DevOps (знает Terraform, имеет доступ к облаку). Каждый видит только свой scope и имеет только свои инструменты.

👤 Ты ⚛️ Frontend Agent Skills: Edit, Glob, Bash MCP: Figma, Storybook Rules: React, TypeScript, Tailwind 🗄 Backend Agent Skills: Edit, Bash, SQL MCP: PostgreSQL, Redis Rules: Go, Clean Arch, Prisma 🧪 QA Agent Skills: Read, Bash, Grep MCP: Jira, TestRail Rules: Edge cases, Security

Как всё связано

🤖

Агент

LLM + цикл «думай → действуй → наблюдай». Мозг операции.

👥

Субагенты

Помощники, которых агент создаёт для параллельной работы.

🔧

Скиллы

Конкретные действия: Read, Edit, Bash, WebSearch и кастомные.

📜

Rules

Инструкции и ограничения. Code style, запреты, соглашения команды.

🔌

MCP

Универсальный протокол подключения внешних сервисов и данных.

Хуки

Автоматические реакции на события: линтинг, проверки, уведомления.

👥

Teams

Несколько агентов с разными ролями, работающих параллельно над задачей.

🎯

Результат

Полноценная AI-команда, которая кодит, тестирует и деплоит.

Раздел 12

Живое демо

14 бесплатных моделей: Gemini API + OpenRouter — прямо в презентации

Настройка API-ключей

Для работы демо нужны API-ключи (бесплатные). Ключи сохраняются только в браузере — никуда не отправляются кроме API провайдеров.

🔵 Google Gemini API 250-1000 req/day бесплатно

Получить: aistudio.google.com/apikey

🔀 OpenRouter 50 req/day бесплатно

Получить: openrouter.ai/keys

Чат с LLM

Модель:
Gemini модели: 250+ req/day. OpenRouter: 50 req/day. Настрой ключи на предыдущем слайде, выбери модель и пиши промпт.

Баттл моделей

Один промпт — две модели — два ответа параллельно. Выбери любые модели для сравнения.

🔵 Gemini 2.5 Flash

Выбери модель и промпт...

🔴 Qwen3 Coder 480B

Выбери модель и промпт...

Температура в действии

Один промпт, одна модель, но разная temperature. Смотрим как меняется «креативность».

Модель:

🧊 Temperature = 0

Детерминированный, точный, предсказуемый

🔥 Temperature = 1.3

Креативный, разнообразный, неожиданный

Раздел 13

Цены: подписки и API

Сколько стоит AI в 2026

Подписки на чат-боты

Сервис Free Базовый Pro Max
🟢 ChatGPT $0 $8 Go $20 Plus $200 Pro
🟣 Claude $0 $20 Pro $200 Max 20x
🔵 Gemini $0 $8 Plus $20 Pro $42 Ultra
🟠 Mistral $0 $15 Pro $25 Team
Вывод

$20/мес — стандарт индустрии (ChatGPT Plus, Claude Pro, Cursor Pro). Самый дешёвый вход — Gemini Plus за $8.

Подписки: AI для кода

Инструмент Free Pro Pro+ Teams
⚡ Cursor $0 50 req $20 $60 $40/user
🤖 Copilot $0 50 req $10 $39 $19/user
🟣 Claude Code нет $20 Pro $100-200 Max $150/user
🔵 Gemini CLI $0 1000/day! Бесплатный, нужен только Google аккаунт
Best deal

Gemini CLI — 1,000 запросов/день бесплатно. Copilot Pro — $10/мес за доступ к нескольким моделям. OpenCode + Ollama — $0 навсегда (локально).

API: цена за 1M токенов

Модель Input/1M Output/1M Уровень
DeepSeek V3.2 $0.28 $0.42 cheapest frontier
Gemini 2.5 Flash-Lite $0.10 $0.40 ultra-cheap
GPT-5.4 Nano $0.20 $1.25 budget OpenAI
Claude Haiku 4.5 $1.00 $5.00 budget Anthropic
Gemini 2.5 Flash $0.30 $2.50 sweet spot
Claude Sonnet 4.6 $3.00 $15.00 premium
Claude Opus 4.6 $5.00 $25.00 flagship
GPT-5.4 Pro $30.00 $180.00 most expensive
Разница в 600x

DeepSeek V3.2 output: $0.42/1M. GPT-5.4 Pro output: $180/1M. Разница в 430 раз за output. Для большинства задач дешёвые модели работают достаточно хорошо.

Бесплатные API лимиты

🔵

Google AI Studio

250 req/day Flash, 100/day Pro, 1000/day Flash-Lite. Без кредитки. Лучший бесплатный API.

Groq

14,400 req/day (8B), 1,000/day (70B). 30 RPM. Сверхбыстрый инференс. Без кредитки.

🔀

OpenRouter

50 req/day free, 1,000/day при $10+ на балансе. ~27 бесплатных моделей. 20 RPM.

🦙

Ollama (локально)

Безлимит навсегда. Нужно только железо: 16 ГБ RAM для 7B моделей, 64 ГБ для 70B.

Стратегия

Для экспериментов — Google AI Studio / Groq (щедрые лимиты). Для приватных данных — Ollama. Для продакшена — выбирай по цене/качеству: DeepSeek (cheapest), Gemini Flash (balanced), Claude Sonnet (premium).

Раздел 14

Практика: AI для каждой роли

Как CLI/IDE-агенты решают реальные задачи Data-специалистов

Data Architects

Боль

Ручное написание DDL-скриптов, конфигурация инфраструктуры, поддержание Data Quality — рутина, которая отъедает часы.

AI-решение

Агент подключается к тестовой БД, профилирует таблицы, находит аномалии и автоматически генерирует Terraform/dbt модели.

Пример промпта

«Подключись к PostgreSQL, спрофилируй таблицу orders: найди NULL-колонки >5%, дубли по order_id, выбросы в amount. Сгенерируй dbt-тест для каждой найденной проблемы.»

📋

DDL-генерация

Описываешь сущности словами — получаешь готовые CREATE TABLE с constraints и индексами

🔍

Data Profiling

Агент анализирует распределения, типы, NULL-rate, кардинальность — и генерирует отчёт

🏗️

IaC/dbt

Автоматическая генерация Terraform, dbt models/tests, Airflow DAGs из описания пайплайна

Data Analysts

Боль

Сложные SQL с window-функциями, чистка грязных CSV, ручной exploratory analysis — каждый отчёт с нуля.

AI-решение

IDE как SQL-копайлот: скармливаешь схему — получаешь оптимизированный SQL. CLI-агент пишет и запускает Python для очистки данных и извлечения инсайтов.

Пример промпта

«Вот схема таблиц sales и products (DDL прилагается). Напиши SQL: топ-10 продуктов по выручке за последний квартал с rolling average за 7 дней и процент от общей выручки категории.»

🧹

Data Cleaning

Агент пишет Python-скрипт: парсит CSV, заполняет пропуски, нормализует форматы дат и валют

📊

SQL Co-pilot

Объясняешь задачу на естественном языке — получаешь оптимизированный запрос с CTE и window-функциями

💡

Auto-insights

«Проанализируй этот датасет и дай топ-3 инсайта» — агент сам выбирает метод анализа и визуализацию

Methodologists

Боль

Разбор 100-страничных PDF-регламентов, поддержание глоссариев и формул расчёта метрик в актуальном состоянии.

AI-решение

Docs-as-Code: CLI-агент парсит тяжёлые PDF, извлекает формулы расчёта метрик в строгий JSON-формат — единый источник правды.

Пример промпта

«Вот PDF методологии расчёта KPI (прилагается). Извлеки все метрики в JSON-формат: {name, formula, source_tables, granularity, business_owner}. Отметь конфликты между разделами.»

📑

PDF → JSON

Автоматическое извлечение структурированных данных из регламентов и нормативных документов

📖

Глоссарий

Агент сравнивает определения терминов между документами и находит противоречия

Валидация

Проверка формул метрик на консистентность: «метрика A зависит от B, но B не определена»

Общий паттерн: Schema-First

Ключевой приём для всех ролей: не отправляй данные — отправляй схему. Экспортируй DDL, JSON Schema или структуру CSV. Агент генерирует код, ты запускаешь его локально на реальных данных.

📦
Экспорт
DDL/Schema
🤖
AI пишет
код
🧪
Тест на
dummy data
🚀
Запуск на
реальных
🔒

Безопасность

Данные не покидают корпоративный контур. AI видит только структуру — колонки, типы, связи.

🎯

Synthetic Sandbox

Агент генерирует dummy-данные с тем же распределением для тестирования пайплайнов до деплоя в прод.

Итого: Теория

🤖

LLM

Предсказывает следующий токен, обучившись на огромных объёмах текста

🧩

Токены

Кусочки текста — единица измерения. Влияют на цену и скорость

🪟

Контекст

Рабочий стол модели — сколько текста видит одновременно

✍️

Промпты

Чёткий запрос = чёткий ответ. Роль + контекст + формат

📦

Квантизация

Сжатие модели — RAW → JPEG для нейросетей

⚙️

Процесс

Токенизация → эмбеддинги → attention → генерация

Итого: Инструменты

🖥️

AI CLI

Claude Code, Codex CLI, Gemini CLI, Aider, OpenCode — ИИ-ассистенты прямо в терминале для полного контроля

💻

AI IDE

Cursor, Windsurf, Copilot, Cline — встроенный ИИ в редакторе кода для быстрой повседневной работы

🔀

OpenRouter

Один API-ключ → 200+ моделей. Агрегатор для сравнения, экспериментов и продакшена

🦙

Локальные модели

Ollama, LM Studio — запуск LLM на своём железе. Приватность и офлайн-работа

Спасибо!

Вопросы?