← Все статьи

Голосовой ИИ-агент: ответы клиентам, диктовка задач, AI-обзвоны

Голосом проще, чем текстом. Голосовой ИИ-агент в бизнесе — это не только звонки в колл-центр. Разбираем три рабочих сценария.

Голосовой ИИ-агент

TL;DR. Голосовой ИИ-агент в 2026 году работает в трёх рабочих сценариях: диктовка задач владельцем в Telegram, AI-обзвон новых лидов за 3 минуты, входящая голосовая поддержка. Технически это связка STT (Deepgram) + LLM (Claude) + TTS (ElevenLabs) с латентностью 0.9–1.5 сек. Главные ошибки — робоголос, отсутствие эскалации на человека и высокая латентность >1.5 сек.

Голосовой интерфейс к ИИ-агенту удобнее текстового в трёх случаях: ты за рулём, ты в дороге, тебе быстрее наговорить, чем напечатать. По данным Wordstat, «голосовой помощник ии» — 1 183 запроса в месяц, «голосовой ассистент ии» — 502. Тема растёт с ежемесячным приростом 12–15%. Ниже — три рабочих сценария, стек 2026 года, метрики качества и грабли внедрения.

Сценарий 1: Диктовка задач владельцем

Самый недооценённый сценарий, при этом самый быстрый по внедрению. Ты говоришь голосовое в Telegram: «Расшифруй планёрку, сделай таблицу с тезисами, разнеси по ответственным». Через минуту в чате — файл .xlsx с 12 пунктами и тегами имён. Или: «Подготовь договор купли-продажи квартиры по этой выписке, скину фото» — через 5 минут Word-файл с реквизитами и привязкой к ГК РФ.

В Двоя это работает через Deepgram (распознавание речи) → Claude Opus (понимание контекста и планирование) → файловые операции и MCP-серверы. Голос принимается до 30 минут на сообщение — хватает на диктовку полноценного письма или расшифровку встречи.

Экономия: типичный предприниматель тратит 3–5 часов в неделю на «наговорить и оформить». С голосовым агентом это 15–30 минут. Плюс психологический эффект: голосом проще формулировать сложные задачи, чем печатать двумя пальцами в дороге.

Сценарий 2: AI-обзвон лидов

Когда лид оставляет заявку, агент перезванивает в течение 3 минут синтезированным голосом, квалифицирует по 3–5 вопросам и переводит на менеджера или назначает встречу в календаре. Технология готова: Voximplant + ElevenLabs, или Exolve + Yandex SpeechKit для полностью российского стека.

В кейсе VerixLaw / dcordon такая система ловит лидов в момент пика интереса. Конверсия в назначенную встречу на 35% выше, чем когда звонит человек через 4 часа — потому что за это время клиент уже прочитал 3 других сайта и часть выбрала конкурента. Первый касание побеждает.

3 минсреднее время реакции на лид
+35%конверсия vs +4 часа от человека
24/7работа в любое время
×3больше касаний за смену

Сценарий 3: Голосовая поддержка клиентов

Сложнее в реализации. ИИ-агент принимает входящий звонок, понимает контекст вопроса, отвечает или эскалирует на оператора. Хорошо для FAQ-сценариев: статус заказа, часы работы, базовая поддержка, запись на приём, отмена бронирования. Плохо для сложных финансовых вопросов и жалоб.

Риски: если агент ошибается в финансово важных вопросах (счета, оплаты, возвраты), репутация бизнеса страдает. Клиенты пишут отзывы «робот не понимает, невозможно достучаться до человека». Решение — жёсткие триггеры эскалации на человека: любое упоминание «жалоба», «возврат», «менеджер», «руководитель» → мгновенно на оператора.

Реалистичный процент автономного закрытия звонков — 40–60% для простых сценариев (пиццерии, стоматологии, интернет-магазины). В сложных нишах (финансы, медицина) — 20–30%. Всё остальное — эскалация.

Какой стек брать в 2026

ЗадачаSTT (распознавание)LLM (мозг)TTS (синтез)Телефония
Диктовка в TelegramDeepgram, WhisperClaude Opus/SonnetНе нуженНе нужна
AI-обзвон исходящийVoximplant ASRClaude SonnetElevenLabs TurboVoximplant, Exolve
Входящая поддержкаYandex SpeechKitYandexGPT, ClaudeSpeechKit, ElevenLabsМегаФон VATS, Exolve
Расшифровка звонковWhisper large-v3Claude OpusНе нуженЗапись из АТС

Три ошибки внедрения

  1. Холодный голос робота. Дефолтные голоса Yandex или Google — узнаются с первой секунды, клиент кладёт трубку. ElevenLabs, Yandex Brian или тонкая настройка через клонирование голоса — стоят $50–100/мес, но эффект на конверсию того стоит: +15–25% к успешности звонка.
  2. Нет эскалации на человека. Если агент не понял — должен мгновенно передать человеку, а не «пробовать ещё раз». Формула: два уточнения максимум, потом «сейчас соединю с оператором».
  3. Долгие паузы. Если латентность ответа больше 1.5 секунды — клиент кладёт трубку. Latency-инженерия важнее идеального голоса.

Что под капотом: латентность ответа

Главный технический вызов голосового агента — задержка от конца фразы пользователя до начала ответа. У живого оператора она ~0.4 секунды. У хорошего голосового агента — 0.8–1.2 секунды. У плохого — 3–5 секунд, клиент кладёт трубку.

Из чего складывается latency:

  • VAD (детекция конца фразы): 100–300 мс
  • STT (распознавание речи): 200–500 мс (Deepgram streaming быстрее, чем batch)
  • LLM (генерация ответа): 400–1500 мс (Claude Haiku быстрее Opus в 3 раза)
  • TTS (синтез голоса): 200–600 мс (ElevenLabs Turbo быстрее)
  • Сетевые задержки: 100–200 мс между STT/LLM/TTS сервисами

Итого реальный минимум — около 900 мс. Чтобы попасть в этот диапазон, нужна streaming-архитектура: все 4 этапа идут параллельно, а не последовательно. Например, LLM начинает генерировать ответ ещё до завершения STT — по частичной транскрипции.

Метрики качества голосового агента

МетрикаНормаЧто измеряет
Latency P50< 1.5 сСредняя задержка ответа
Latency P95< 3 сЗадержка в худших 5% случаев
STT WER< 8%% ошибочно распознанных слов
Эскалация на человека10–25%Доля звонков, переданных оператору
Автономное закрытие40–60%Доля звонков, решённых без человека
CSAT> 4.0/5Оценка клиентами
Cost per call3–15 ₽Стоимость звонка (STT+LLM+TTS+телефония)

Правовые нюансы AI-обзвона в РФ

В России действует ФЗ-38 «О рекламе» и ФЗ-152 «О персональных данных». Практические требования:

  • Согласие на звонок должно быть получено (галка на форме заявки — «согласен на связь по телефону»)
  • В начале звонка агент должен представиться как автоматизированный сервис, если это прямо спросили
  • Запись разговора — с уведомлением в первые секунды («разговор записывается для контроля качества»)
  • Персональные данные (ФИО, паспорт) в разговоре не запрашиваются — только для авторизации существующего клиента
  • Ночные звонки после 22:00 по местному времени клиента — запрещены

Сколько стоит запуск голосового агента

Разбивка бюджета на первый месяц:

  1. Voximplant или Exolve: 3 000–10 000 ₽ (в зависимости от объёма звонков)
  2. ElevenLabs Turbo: $22/мес (100 000 символов синтеза)
  3. Deepgram: $200 бесплатно, дальше $0.0043/мин
  4. Claude API: ~$50/мес при 500 звонках/день
  5. Интеграция с CRM: 40 000–80 000 ₽ разово
  6. Настройка сценариев и голоса: 60 000–120 000 ₽ разово

Итого стартовые вложения — 150–250 тыс. ₽, потом ~30 000 ₽/мес операционка. При 500 звонках в день с конверсией 15% в заявку — окупаемость за 1–2 месяца.

Частые вопросы

Отличается ли голос ElevenLabs от человека?

В 90% случаев неотличим, если правильно настроить эмоциональность и паузы. Клиенты обычно понимают, что робот, только когда агент делает 2–3 подряд «идеально ровных» ответа без человеческих оговорок.

Можно ли клонировать голос владельца?

Да, ElevenLabs делает это за 5 минут по 3-минутной записи. Юридически в РФ нужно письменное согласие владельца голоса. Использовать в звонках от лица владельца — этически спорно, лучше использовать нейтральный голос.

Что делать, если STT неправильно распознаёт имена?

Для российского рынка добавляют кастомный словарь (custom vocabulary) в Deepgram или Yandex SpeechKit — с типичными именами, названиями компаний, продуктов. Это уменьшает WER с 12–15% до 5–7%.

Сколько стоит минута разговора агента?

3–15 рублей в зависимости от стека: Yandex SpeechKit + YandexGPT — дешевле (3–5 ₽/мин), ElevenLabs + Claude Opus — дороже (10–15 ₽/мин). Живой оператор — 30–80 ₽/мин.

Как измерять качество AI-обзвона?

Три метрики: конверсия в назначенную встречу (норма 15–25%), CSAT по опросу «оцените разговор от 1 до 5» (норма >4.0), процент эскалации на человека (норма 10–25%).

Можно ли использовать голос агента в мессенджерах?

Да. Двоя отправляет голосовые сообщения в Telegram — удобно для быстрых ответов «на ходу». Клиент видит: агент прислал голосовое, слушает, отвечает своим голосовым. Полноценный голосовой диалог без телефонии.

Нужен голосовой агент?

Разберём твой кейс на бесплатном звонке: какой сценарий внедрить первым.

Получить разбор