TL;DR. Голосовой ИИ-агент в 2026 году работает в трёх рабочих сценариях: диктовка задач владельцем в Telegram, AI-обзвон новых лидов за 3 минуты, входящая голосовая поддержка. Технически это связка STT (Deepgram) + LLM (Claude) + TTS (ElevenLabs) с латентностью 0.9–1.5 сек. Главные ошибки — робоголос, отсутствие эскалации на человека и высокая латентность >1.5 сек.
Голосовой интерфейс к ИИ-агенту удобнее текстового в трёх случаях: ты за рулём, ты в дороге, тебе быстрее наговорить, чем напечатать. По данным Wordstat, «голосовой помощник ии» — 1 183 запроса в месяц, «голосовой ассистент ии» — 502. Тема растёт с ежемесячным приростом 12–15%. Ниже — три рабочих сценария, стек 2026 года, метрики качества и грабли внедрения.
Сценарий 1: Диктовка задач владельцем
Самый недооценённый сценарий, при этом самый быстрый по внедрению. Ты говоришь голосовое в Telegram: «Расшифруй планёрку, сделай таблицу с тезисами, разнеси по ответственным». Через минуту в чате — файл .xlsx с 12 пунктами и тегами имён. Или: «Подготовь договор купли-продажи квартиры по этой выписке, скину фото» — через 5 минут Word-файл с реквизитами и привязкой к ГК РФ.
В Двоя это работает через Deepgram (распознавание речи) → Claude Opus (понимание контекста и планирование) → файловые операции и MCP-серверы. Голос принимается до 30 минут на сообщение — хватает на диктовку полноценного письма или расшифровку встречи.
Экономия: типичный предприниматель тратит 3–5 часов в неделю на «наговорить и оформить». С голосовым агентом это 15–30 минут. Плюс психологический эффект: голосом проще формулировать сложные задачи, чем печатать двумя пальцами в дороге.
Сценарий 2: AI-обзвон лидов
Когда лид оставляет заявку, агент перезванивает в течение 3 минут синтезированным голосом, квалифицирует по 3–5 вопросам и переводит на менеджера или назначает встречу в календаре. Технология готова: Voximplant + ElevenLabs, или Exolve + Yandex SpeechKit для полностью российского стека.
В кейсе VerixLaw / dcordon такая система ловит лидов в момент пика интереса. Конверсия в назначенную встречу на 35% выше, чем когда звонит человек через 4 часа — потому что за это время клиент уже прочитал 3 других сайта и часть выбрала конкурента. Первый касание побеждает.
Сценарий 3: Голосовая поддержка клиентов
Сложнее в реализации. ИИ-агент принимает входящий звонок, понимает контекст вопроса, отвечает или эскалирует на оператора. Хорошо для FAQ-сценариев: статус заказа, часы работы, базовая поддержка, запись на приём, отмена бронирования. Плохо для сложных финансовых вопросов и жалоб.
Риски: если агент ошибается в финансово важных вопросах (счета, оплаты, возвраты), репутация бизнеса страдает. Клиенты пишут отзывы «робот не понимает, невозможно достучаться до человека». Решение — жёсткие триггеры эскалации на человека: любое упоминание «жалоба», «возврат», «менеджер», «руководитель» → мгновенно на оператора.
Реалистичный процент автономного закрытия звонков — 40–60% для простых сценариев (пиццерии, стоматологии, интернет-магазины). В сложных нишах (финансы, медицина) — 20–30%. Всё остальное — эскалация.
Какой стек брать в 2026
| Задача | STT (распознавание) | LLM (мозг) | TTS (синтез) | Телефония |
|---|---|---|---|---|
| Диктовка в Telegram | Deepgram, Whisper | Claude Opus/Sonnet | Не нужен | Не нужна |
| AI-обзвон исходящий | Voximplant ASR | Claude Sonnet | ElevenLabs Turbo | Voximplant, Exolve |
| Входящая поддержка | Yandex SpeechKit | YandexGPT, Claude | SpeechKit, ElevenLabs | МегаФон VATS, Exolve |
| Расшифровка звонков | Whisper large-v3 | Claude Opus | Не нужен | Запись из АТС |
Три ошибки внедрения
- Холодный голос робота. Дефолтные голоса Yandex или Google — узнаются с первой секунды, клиент кладёт трубку. ElevenLabs, Yandex Brian или тонкая настройка через клонирование голоса — стоят $50–100/мес, но эффект на конверсию того стоит: +15–25% к успешности звонка.
- Нет эскалации на человека. Если агент не понял — должен мгновенно передать человеку, а не «пробовать ещё раз». Формула: два уточнения максимум, потом «сейчас соединю с оператором».
- Долгие паузы. Если латентность ответа больше 1.5 секунды — клиент кладёт трубку. Latency-инженерия важнее идеального голоса.
Что под капотом: латентность ответа
Главный технический вызов голосового агента — задержка от конца фразы пользователя до начала ответа. У живого оператора она ~0.4 секунды. У хорошего голосового агента — 0.8–1.2 секунды. У плохого — 3–5 секунд, клиент кладёт трубку.
Из чего складывается latency:
- VAD (детекция конца фразы): 100–300 мс
- STT (распознавание речи): 200–500 мс (Deepgram streaming быстрее, чем batch)
- LLM (генерация ответа): 400–1500 мс (Claude Haiku быстрее Opus в 3 раза)
- TTS (синтез голоса): 200–600 мс (ElevenLabs Turbo быстрее)
- Сетевые задержки: 100–200 мс между STT/LLM/TTS сервисами
Итого реальный минимум — около 900 мс. Чтобы попасть в этот диапазон, нужна streaming-архитектура: все 4 этапа идут параллельно, а не последовательно. Например, LLM начинает генерировать ответ ещё до завершения STT — по частичной транскрипции.
Метрики качества голосового агента
| Метрика | Норма | Что измеряет |
|---|---|---|
| Latency P50 | < 1.5 с | Средняя задержка ответа |
| Latency P95 | < 3 с | Задержка в худших 5% случаев |
| STT WER | < 8% | % ошибочно распознанных слов |
| Эскалация на человека | 10–25% | Доля звонков, переданных оператору |
| Автономное закрытие | 40–60% | Доля звонков, решённых без человека |
| CSAT | > 4.0/5 | Оценка клиентами |
| Cost per call | 3–15 ₽ | Стоимость звонка (STT+LLM+TTS+телефония) |
Правовые нюансы AI-обзвона в РФ
В России действует ФЗ-38 «О рекламе» и ФЗ-152 «О персональных данных». Практические требования:
- Согласие на звонок должно быть получено (галка на форме заявки — «согласен на связь по телефону»)
- В начале звонка агент должен представиться как автоматизированный сервис, если это прямо спросили
- Запись разговора — с уведомлением в первые секунды («разговор записывается для контроля качества»)
- Персональные данные (ФИО, паспорт) в разговоре не запрашиваются — только для авторизации существующего клиента
- Ночные звонки после 22:00 по местному времени клиента — запрещены
Сколько стоит запуск голосового агента
Разбивка бюджета на первый месяц:
- Voximplant или Exolve: 3 000–10 000 ₽ (в зависимости от объёма звонков)
- ElevenLabs Turbo: $22/мес (100 000 символов синтеза)
- Deepgram: $200 бесплатно, дальше $0.0043/мин
- Claude API: ~$50/мес при 500 звонках/день
- Интеграция с CRM: 40 000–80 000 ₽ разово
- Настройка сценариев и голоса: 60 000–120 000 ₽ разово
Итого стартовые вложения — 150–250 тыс. ₽, потом ~30 000 ₽/мес операционка. При 500 звонках в день с конверсией 15% в заявку — окупаемость за 1–2 месяца.
Частые вопросы
Отличается ли голос ElevenLabs от человека?
В 90% случаев неотличим, если правильно настроить эмоциональность и паузы. Клиенты обычно понимают, что робот, только когда агент делает 2–3 подряд «идеально ровных» ответа без человеческих оговорок.
Можно ли клонировать голос владельца?
Да, ElevenLabs делает это за 5 минут по 3-минутной записи. Юридически в РФ нужно письменное согласие владельца голоса. Использовать в звонках от лица владельца — этически спорно, лучше использовать нейтральный голос.
Что делать, если STT неправильно распознаёт имена?
Для российского рынка добавляют кастомный словарь (custom vocabulary) в Deepgram или Yandex SpeechKit — с типичными именами, названиями компаний, продуктов. Это уменьшает WER с 12–15% до 5–7%.
Сколько стоит минута разговора агента?
3–15 рублей в зависимости от стека: Yandex SpeechKit + YandexGPT — дешевле (3–5 ₽/мин), ElevenLabs + Claude Opus — дороже (10–15 ₽/мин). Живой оператор — 30–80 ₽/мин.
Как измерять качество AI-обзвона?
Три метрики: конверсия в назначенную встречу (норма 15–25%), CSAT по опросу «оцените разговор от 1 до 5» (норма >4.0), процент эскалации на человека (норма 10–25%).
Можно ли использовать голос агента в мессенджерах?
Да. Двоя отправляет голосовые сообщения в Telegram — удобно для быстрых ответов «на ходу». Клиент видит: агент прислал голосовое, слушает, отвечает своим голосовым. Полноценный голосовой диалог без телефонии.
Нужен голосовой агент?
Разберём твой кейс на бесплатном звонке: какой сценарий внедрить первым.
Получить разбор