Зачем RAG, если есть GPT

Модель не знает ваших тарифов, SLA и регламент возврата. RAG подтягивает фрагменты из wiki, Notion или CRM KB перед ответом. Без этого бот уверенно врёт — хуже, чем silence. Я начинаю с индекса 20–50 статей и логов типовых тикетов.

Схема MVP за 3–5 дней

  • Индекс документов (embeddings + vector store)
  • Telegram или web-widget
  • Промпт: тон, запрет выдумывать, ссылка на источник
  • Handoff: «оператор» создаёт тикет в CRM с transcript
  • Dashboard: deflection rate, CSAT sample

Эскалация обязательна: ключевые слова «суд», «возврат денег», негатив — сразу человек. AI закрывает повторяющиеся «где заказ» и «как оплатить», не стратегические кейсы.

Стоимость inference

Кэшируйте частые вопросы, ограничивайте max tokens, используйте smaller model для классификации intent. При 500 обращениях в день это cents, не thousands — если архитектура sane.

Качество базы знаний

RAG на мусоре = уверенные галлюцинации. Перед индексацией: актуализируйте FAQ, уберите противоречивые статьи, разбейте long PDF на chunk по 300–500 токенов с заголовками. Логируйте вопросы без good match — это backlog для новых статей. Раз в месяц re-index после правок wiki.

Метрики через 30 дней

  • Deflection rate: % диалогов без оператора
  • Containment: bot закрыл вопрос без эскалации
  • CSAT на sample 10% диалогов
  • Latency p95 — пользователь не ждёт 15 секунд
  • Cost per conversation — tokens × volume

Не обещайте 100% automation — обещайте снятие рутины Tier-1. Операторы должны получать transcript и suggested reply, не начинать с «перескажите проблему». GPT-4o-mini для классификации intent + bigger model для сложного ответа — баланс cost/quality.

Итоги и рекомендации

AI-бот поддержки с RAG — не магия, а дисциплина базы знаний и эскалации. Без chunking и актуализации wiki bot галлюцинирует policies. MVP 3–5 дней: index, widget/Telegram, handoff в CRM, deflection metric. Не обещайте 100% automation — снимайте Tier-1. Ключевые слова эскалации настроены жёстко. Кэш FAQ и smaller model для intent снижают cost. Оператор получает transcript — не «перескажите проблему». CSAT на sample, latency p95, cost per dialog — dashboard через 30 дней. Re-index после правок wiki ежемесячно. GPT без RAG на support — reputational risk.Если нужен разбор под ваш стек — CRM, 1С, Telegram, mobile — напишите через форму на сайте. За 130+ проектов я видел, как команды экономят на неправильном выборе архитектуры и теряют в сезон. Fixed-price MVP после короткого brief снимает неопределённость; дальше — итерации по метрикам, а не wish-list на 50 экранов. Юридически: disclaimer «AI может ошибаться», логирование с consent. Для regulated industries (finance, med) RAG on approved docs only, block medical/financial advice class. Human review sample 5% dialogs weekly. Update prompts when product/pricing changes — stale prompt хуже stale KB. Multilingual KB if support RU+EN. Tone guide in system prompt. Block competitor mentions. Escalation queue fairness round-robin. Weekly review of unanswered low-confidence queries. Integration Zoho/Freshdesk if no custom CRM.

Заказать AI-чат-бота