Зачем RAG, если есть GPT
Модель не знает ваших тарифов, SLA и регламент возврата. RAG подтягивает фрагменты из wiki, Notion или CRM KB перед ответом. Без этого бот уверенно врёт — хуже, чем silence. Я начинаю с индекса 20–50 статей и логов типовых тикетов.
Схема MVP за 3–5 дней
- Индекс документов (embeddings + vector store)
- Telegram или web-widget
- Промпт: тон, запрет выдумывать, ссылка на источник
- Handoff: «оператор» создаёт тикет в CRM с transcript
- Dashboard: deflection rate, CSAT sample
Эскалация обязательна: ключевые слова «суд», «возврат денег», негатив — сразу человек. AI закрывает повторяющиеся «где заказ» и «как оплатить», не стратегические кейсы.
Стоимость inference
Кэшируйте частые вопросы, ограничивайте max tokens, используйте smaller model для классификации intent. При 500 обращениях в день это cents, не thousands — если архитектура sane.
Качество базы знаний
RAG на мусоре = уверенные галлюцинации. Перед индексацией: актуализируйте FAQ, уберите противоречивые статьи, разбейте long PDF на chunk по 300–500 токенов с заголовками. Логируйте вопросы без good match — это backlog для новых статей. Раз в месяц re-index после правок wiki.
Метрики через 30 дней
- Deflection rate: % диалогов без оператора
- Containment: bot закрыл вопрос без эскалации
- CSAT на sample 10% диалогов
- Latency p95 — пользователь не ждёт 15 секунд
- Cost per conversation — tokens × volume
Не обещайте 100% automation — обещайте снятие рутины Tier-1. Операторы должны получать transcript и suggested reply, не начинать с «перескажите проблему». GPT-4o-mini для классификации intent + bigger model для сложного ответа — баланс cost/quality.
Итоги и рекомендации
AI-бот поддержки с RAG — не магия, а дисциплина базы знаний и эскалации. Без chunking и актуализации wiki bot галлюцинирует policies. MVP 3–5 дней: index, widget/Telegram, handoff в CRM, deflection metric. Не обещайте 100% automation — снимайте Tier-1. Ключевые слова эскалации настроены жёстко. Кэш FAQ и smaller model для intent снижают cost. Оператор получает transcript — не «перескажите проблему». CSAT на sample, latency p95, cost per dialog — dashboard через 30 дней. Re-index после правок wiki ежемесячно. GPT без RAG на support — reputational risk.Если нужен разбор под ваш стек — CRM, 1С, Telegram, mobile — напишите через форму на сайте. За 130+ проектов я видел, как команды экономят на неправильном выборе архитектуры и теряют в сезон. Fixed-price MVP после короткого brief снимает неопределённость; дальше — итерации по метрикам, а не wish-list на 50 экранов. Юридически: disclaimer «AI может ошибаться», логирование с consent. Для regulated industries (finance, med) RAG on approved docs only, block medical/financial advice class. Human review sample 5% dialogs weekly. Update prompts when product/pricing changes — stale prompt хуже stale KB. Multilingual KB if support RU+EN. Tone guide in system prompt. Block competitor mentions. Escalation queue fairness round-robin. Weekly review of unanswered low-confidence queries. Integration Zoho/Freshdesk if no custom CRM.