Быстрый отбор: сравните вендоров по scorecard
Голосовой AI-вендор даёт бизнесу агента для входящих и исходящих звонков: агент распознаёт речь, ведёт диалог, обращается к CRM, календарю, helpdesk или другим системам и переводит сложные случаи оператору. Если закупочная задача звучит как «Как выбрать поставщика голосового AI: 12 вопросов, которые стоит задать вендору», начинайте с проверяемых критериев: задержка в production, качество распознавания, безопасность данных, compliance, интеграции, цена минуты, SLA и условия выхода. Демо помогает увидеть потенциал, закупочное решение опирается на цифры, документы и результаты теста на ваших сценариях.
Используйте единую scorecard. Задайте каждому поставщику одинаковые 12 вопросов и запросите подтверждения: документацию, договорные формулировки, тестовый стенд или PoC. Такой формат встречается и в RFP-чеклистах по voice AI: Bland AI пишет о тестах на собственных сценариях, Kuyil — о проверяемых требованиях к latency, интеграциям, security и pricing, Dilr — о роли IT, Legal, Finance и Operations в enterprise-закупке.
Почему демо не закрывает закупочные риски
Демо часто проходит на подготовленном сценарии, с хорошей связью и предсказуемыми репликами. В реальных звонках клиент перебивает, говорит из машины, злится, задаёт вопрос вне базы знаний, просит изменить запись или требует оператора. При росте нагрузки команда видит задержки, ошибки телефонии, ограничения интеграций и слабые места аналитики.
До договора проверьте пять блоков:
- техника: latency, нагрузка, качество распознавания, barge-in;
- данные и ИБ: аудио, транскрипты, метаданные, доступы, subprocessors;
- юридический блок: согласие на звонок, раскрытие AI, opt-out, DPA;
- операции: эскалация, логи, контроль качества, роли команды;
- экономика: цена минуты, внедрение, SLA, хранение, перерасход, пики.
Bitbytes отдельно подчёркивает переносимость данных и тесты в production-подобных условиях. Hamming предлагает security review, где проверяют raw audio, unredacted transcripts, tool traces и использование данных для training или debugging.
Как выбрать поставщика голосового AI: 12 вопросов к вендору
1. Какую задержку ответа вы гарантируете в production
Для звонка важна end-to-end latency всего пайплайна: распознавание речи, диалоговая логика или LLM, синтез, телефония. Среднее значение мало помогает при пиковых нагрузках. Спросите p50, p95 и p99, затем попросите замер на ваших сценариях и ожидаемой пиковой одновременности. Bitbytes относит latency к ключевым инженерным критериям выбора voice agent platform.
2. Как агент работает с шумом, акцентами и перебиваниями
Проверяйте распознавание на реальных аудио: плохая связь, фоновый шум, быстрый темп речи, пожилые клиенты, перебивания. Отдельно спросите про barge-in — ситуацию, когда клиент начинает говорить во время реплики агента. Универсальная «точность 98%» без методики ничего не говорит о качестве ваших звонков. Полезнее понять, какие ошибки вендор считает критичными, как он измеряет успешный диалог и какие данные использует для оценки.
3. Как агент удерживает контекст и снижает риск галлюцинаций
Спросите, на какие источники агент опирается: база знаний, CRM, FAQ, каталог услуг, статусы заказов. Попросите live-demo на вашем контенте. Уточните, что агент делает при отсутствии ответа: задаёт уточняющий вопрос, переводит на оператора, создаёт заявку или завершает диалог по утверждённому правилу. Kuyil в RFP-чеклисте советует спрашивать про grounding, RAG, сценарные ограничения и контроль качества.
4. Какие интеграции нужны для запуска
Составьте список систем: CRM, МИС, helpdesk, ERP, календарь, биллинг, телефония, BI. Затем разделите интеграции на готовые, API-интеграции и индивидуальную разработку. Агент должен выполнять действия в системах в пределах выданных прав: создать заявку, перенести запись, отметить статус, передать лид, поставить задачу оператору. Для рискованных операций заранее задайте подтверждение человеком.
5. Где обрабатываются аудио, транскрипты и метаданные
Разделите данные на raw audio, записи звонков, транскрипты, метаданные, действия агента, tool traces и данные из CRM. Спросите, где они физически обрабатываются и хранятся, кто имеет доступ, какие subprocessors участвуют в цепочке. Попросите DPA, retention/deletion policy, правила доступа поддержки и порядок удаления данных. Эти документы лучше получить до PoC, чтобы Security и Legal не разбирали архитектуру уже после выбора фаворита.
6. Используются ли звонки клиентов для обучения моделей
Задайте прямой вопрос: попадают ли аудио, транскрипты или диалоги в обучение, дообучение, оценку качества или отладку моделей. Нужны договорные формулировки: opt-in или opt-out, сроки хранения, доступ к неанонимизированным данным, процедура удаления. Для банков, медицины, взыскания, страхования и других чувствительных отраслей этот пункт должны проверить IT, Legal и Security. Материал носит информационный характер и не является правовой консультацией.
7. Как вендор тестирует безопасность voice AI
Классическая ИБ закрывает часть рисков. Voice AI также требует проверки prompt injection, data leakage, unsafe tool actions и попыток заставить агента раскрыть данные или выполнить лишнее действие. OWASP Top 10 for LLM Applications даёт базовую рамку для LLM-рисков. Исследования по voice-agent red-teaming и auditory prompt injection показывают, что атака может приходить через аудио, поэтому спросите про red-teaming, журналирование действий и ограничения доступных операций.
8. Как решаются согласие, раскрытие AI и opt-out
Для outbound-сценариев уточните идентификацию звонящего, раскрытие факта AI-общения, отказ от звонков и списки исключений. FCC подтвердила, что AI-generated voices подпадают под правила TCPA для artificial or prerecorded voice; для telemarketing/advertising требуется prior express written consent. В ЕС Article 50 AI Act вводит transparency obligations для directly interactive AI systems с 2 августа 2026 года. Требования зависят от юрисдикции и сценария, финальную схему должен проверять юрист компании.
9. Когда агент передаёт звонок оператору
Проверьте human escalation: какие фразы, эмоции, ошибки распознавания, рискованные темы и VIP-клиенты переводятся на человека. Оператору нужны запись, транскрипт, краткое резюме, интент клиента, история попыток и заполненные поля. Автоматизация должна закрывать типовые обращения и передавать сложные звонки без потери контекста, чтобы клиенту не приходилось повторять всё с начала.
10. Какие метрики и логи доступны после запуска
Спросите про статусы звонков, причины неуспеха, длительность, долю эскалаций, частые интенты, ошибки распознавания, действия в CRM. Проверьте экспорт логов, транскриптов и отчётов в BI. Без аналитики команда не увидит, где агент экономит время операторов, где создаёт повторные обращения и какие сценарии требуют переработки.
11. Из чего складывается цена минуты и полный TCO
Попросите разложить цену: телефония, распознавание, диалоговая модель, синтез, хранение записей, интеграции, поддержка, настройка, SLA, перерасход минут и пиковая нагрузка. На публичных тарифах, проверенных 14.08.2026, рынок даёт широкий разброс: robotZvon указывает от 0,50 ₽/мин в Cloud и от 0,15 ₽/мин на отдельных корпоративных вариантах; Aiva публикует 8–25 ₽/мин; VoicePilot — 12–25 ₽/мин сверх лимита; Gong Tech — 15–28 ₽/мин; в PDF-тарифе Prosche.ai указано 35 ₽ за факт коммуникации. Цены меняются, поэтому перепроверяйте страницы на дату закупки.
Врезка по экономике минуты. Если голосовой AI собран из нескольких внешних слоёв — телефония-агрегатор, стороннее распознавание, зарубежная LLM, сторонний синтез, — каждый слой добавляет свою маржу и валютный риск в стоимость минуты. У SmartDialogs собственный пайплайн разговорного AI: распознавание, диалоговая логика и синтез работают в российских дата-центрах, поэтому из расчёта убирается часть посреднической цепочки. SmartDialogs не продаёт собственную телефонию: клиент подключает её сам по SIP к любому оператору связи, и стоимость связи нужно считать отдельно. Практический вывод для закупки: спрашивайте любого вендора, где обрабатывается звонок, чьи модели участвуют в цепочке и какие компоненты включены в минуту.
Сравнивайте полный TCO: внедрение, интеграции, поддержку, хранение, SLA, сезонные пики и стоимость ошибки. Отдельно зафиксируйте, кто оплачивает доработки сценариев после запуска и как вендор тарифицирует дополнительные окружения для тестирования.
12. Как избежать vendor lock-in
Спросите, кому принадлежат номера, записи, транскрипты, call logs, сценарии, промпты, база знаний и аналитика. Проверьте экспорт в машиночитаемом формате и условия расторжения. Уточните, можно ли хранить knowledge base на стороне заказчика и перейти с no-code на API-first без полной перестройки. Bitbytes советует обсуждать переносимость данных до внедрения, потому что миграция после года эксплуатации затрагивает отчёты, исторические звонки, интеграции и обученные сценарии.
Как провести PoC и принять решение
Выберите 1–2 сценария: входящий клиентский сервис, запись на приём, напоминание, опрос, массовый обзвон или квалификация лида. Подготовьте обезличенные данные: типовые вопросы, шумные записи, исключения, негативные реакции, сложные реплики. Заранее определите критерии успеха: latency, корректно завершённые диалоги, эскалации, ошибки интеграций, стоимость минуты, удобство аналитики.
Практические шаги:
- назначьте владельцев оценки: Operations, IT, Security, Legal, Finance;
- заведите таблицу с колонками «критерий», «вопрос», «вес», «ответ», «подтверждение», «риск»;
- используйте шкалу 0–5: нет ответа, маркетинговый ответ, документация, PoC, договор/SLA;
- запустите одинаковый тест для всех поставщиков;
- не подписывайте договор, пока не понятны latency, данные, цена минуты, SLA, переносимость и ответственность за интеграции.