Русская версия The Next Web

Аналитика Искусственный интеллект Финансы

Экономика голосового ИИ-агента: во сколько на самом деле обходится минута разговора

Экономика голосового ИИ-агента: во сколько на самом деле обходится минута разговора

Ценообразование голосовых агентов обычно отталкивается от одного показателя: стоимости минуты работы голосового агента. Однако эта цифра мало что говорит о реальных затратах на поддержание рабочей системы в продакшене.

Я убедился в этом на личном опыте, разрабатывая и запуская голосового агента для корпоративного использования. Когда вы учитываете распознавание речи, синтез речи, использование моделей, телефонию и инфраструктуру, минута работы в продакшене складывается из нескольких разных статей расходов.

Именно поэтому гораздо полезнее оценивать стоимость одного успешного взаимодействия.

Что входит в голосовую минуту

У голосового ИИ-агента в продакшене обычно выделяют пять основных уровней затрат:

  • Распознавание речи (Speech-to-text) переводит входящий аудиопоток в текст и, как правило, тарифицируется за минуту аудио.
  • Инференс языковой модели (LLM) тарифицируется по токенам, а не по времени. Более длинные звонки могут стоить дороже, так как модель обрабатывает инструкции, историю разговора и результаты вызова инструментов.
  • Синтез речи (Text-to-speech) превращает ответы обратно в аудио и обычно тарифицируется по символам, токенам или объему сгенерированной речи. Если агент говорит много, синтез речи может стать серьезной переменной затратой.
  • Телефония и транспорт добавляют сборы в зависимости от продолжительности соединения, провайдера, типа звонка и местоположения.
  • Инфраструктура голосовой связи в реальном времени включает медиасерверы, оркестрацию, вычисления, частоту сеансов, логирование и мониторинг. Управляемые платформы часто включают эти расходы в свою стоимость за минуту, но если вы создаете систему самостоятельно, вы берете на себя больше инженерных затрат.

Поэтому, когда вы видите расценки на разговорный ИИ вроде «$0.05 за минуту», это мало о чем говорит, пока вы не узнаете, что именно входит в эту сумму.

У 35-минутного звонка есть две стороны

Рассмотрим 35-минутный разговор в формате интервью. Пользователь может говорить в течение 20 минут, а агент — 12. Паузы, прерывания и переключения реплик занимают оставшееся время.

Каждый компонент затрат оценивает этот звонок по-своему. Распознавание речи в основном учитывает речь собеседника. Синтез речи учитывает речь агента. Телефония и инфраструктура могут учитывать все 35 минут подряд.

Языковая модель видит еще одно измерение: накопленный контекст.

В начале звонка модель может обрабатывать только системные инструкции и пару реплик. После 20 ходов диалога ей может потребоваться снова включить более ранние ответы, недавний диалог, результаты работы инструментов и инструкции перед формированием следующего ответа. Это означает, что поздний ответ может стоить дороже раннего, даже если на их произнесение уходит одинаковое количество времени.

Команды могут замедлить рост контекста, суммируя старый диалог, удаляя устаревшую информацию, подтягивая только релевантные данные или используя кэширование, если это позволяет модель. У каждого метода есть свои плюсы и минусы. Если удалить слишком много, система может забыть что-то важное. Но если сохранять всё, потребление токенов будет постоянно расти.

Я заметил эту разницу в долгих разговорах. Один собеседник может дать 5 четких ответов. Другой может перебивать, просить уточнений, а затем возвращаться к исходному вопросу. Оба звонка могут занять примерно одинаковое время, но второй создает больше реплик и сильнее нагружает модель.

Хотя продолжительность звонка задает отправную точку, именно ход разговора определяет, во сколько он обойдется на самом деле.

Тишина, прерывания и задержки увеличивают расходы

В реальных разговорах бывают моменты тишины. Собеседник может сделать паузу, чтобы подумать или поискать документ. И хотя система распознавания речи не будет списывать средства за каждую секунду молчания, телефония и инфраструктура сеансов продолжают тарификацию до тех пор, пока соединение активно.

Прерывания добавляют еще одну статью расходов. Если вы начинаете говорить, пока агент еще произносит свою реплику, система прервет свой ответ, хотя служба синтеза речи уже сгенерировала аудио, которое никто не услышит.

Задержки (латентность) могут усугубить проблему. Слишком медленная реакция заставляет людей повторяться или начинать новое предложение. Это порождает еще один диалоговый шаг, дополнительную обработку и увеличивает время соединения.

Для снижения задержек требуются более быстрые модели, точное определение смены реплик, улучшенная инфраструктура или дополнительные инженерные усилия. И хотя это может увеличить прямые затраты, такие меры позволяют избежать медленной работы системы, которая в конечном итоге обходится дороже из-за лишних реплик.

Неудачные звонки тоже идут в расчет

Допустим, вашей системе требуется 108 попыток, чтобы получить 100 успешных результатов. Восемь неудачных попыток уже успели задействовать транскрипцию, токены модели, генерацию речи, телефонию и инфраструктуру, прежде чем завершиться. Если пользователи совершают повторные попытки, запускается новый цикл расходов.

Практичные формулы обычно выглядят следующим образом:

Стоимость успешного результата = (Голосовой стек + издержки на сбои и повторные попытки + обработка человеком + оценка и операции) / Успешные результаты

Illustration of the voice agent cost per minute practical models
Практическая иллюстрация стоимости минуты работы голосового агента, Источник: Фелипе Дуарте Автор: Фелипе Дуарте

Важно и то, в какой именно момент происходит сбой. Потерять звонок после 34-й минуты стоит дороже, чем после 1-й. Низкая цена за минуту в рекламном объявлении не сможет компенсировать плохой процент завершения звонков.

Неанглоязычные голоса меняют экономику

Работа с неанглоязычными материалами изменила мой подход к оценке компонентов. Качество распознавания оказалось важнее заявленной цены за минуту, поскольку ошибка могла спровоцировать лишний ответ, дополнительный запрос к модели и увеличение продолжительности звонка.

Качество передачи голоса также должно оставаться высоким на протяжении долгих звонков. Определение моментов речи должно справляться с реальными акцентами, разной скоростью речи, перебиваниями и повседневными фразами, а не только с идеальным тестовым аудио.

Некоторые провайдеры берут больше за многоязычные или более продвинутые речевые модели. Но высокие расходы часто возникают из-за того, что происходит дальше. Если более дешевый распознаватель речи вызывает больше повторов и шагов классификации, в итоге разговор обходится дороже.

И это изменило мой приоритет: сначала нужно улучшить сам диалог, а уже потом — отдельный компонент.

Перевод на человека и оценка качества тоже имеют значение

Некоторые разговоры должны переводиться на живого сотрудника. Это может быть правильным исходом, но работа человека всё равно должна учитываться в финансовой модели. Если рабочий процесс регулярно требует нескольких минут ручной доработки, снижение стоимости синтеза речи на полцента вряд ли сильно повлияет на бизнес-модель.

Системам в продакшене также необходимы наблюдаемость и оценка качества. Наблюдаемость показывает, когда растет задержка, сбоит инструмент или прекращается перевод звонка. Оценка качества показывает, достиг ли разговор задуманного результата. И то, и другое требует инфраструктуры и инженерных усилий, хотя ни то, ни другое не отражается в базовом тарифе за минуту.

Создание своими силами против покупки — это вопрос объемов

Управляемые платформы берут плату за ту работу, которую при создании стека своими силами придется выполнять самостоятельно: оркестрацию, обработку медиаданных, масштабирование, интеграции и восстановление после сбоев. Самостоятельная сборка может снизить переменные затраты на API, но увеличивает фиксированные расходы на разработку и эксплуатацию.

Полезное сравнение выглядит так:

Наценка платформы за минуту x ожидаемый объем

против:

Затраты на разработку и эксплуатацию собственного стека

При небольших объемах оплата более высокого переменного тарифа все равно может оказаться выгоднее в целом. При очень больших объемах экономия нескольких центов на миллионах минут может оправдать содержание собственной инфраструктуры. Точка перехода зависит от затрат на команду, требований к надежности, характера трафика и тарифной политики платформы.

Экономика единицы голосового ИИ определяет масштабируемость

Качество модели задает минимальную планку. После этого именно экономика определяет, жизнеспособен ли конкретный сценарий использования.

30-минутное интервью, прием заявок или процесс записи на прием могут оправдать более высокие затраты, если успешное завершение приносит достаточную ценность или заменяет значительный объем человеческого труда. Двухминутное взаимодействие все равно может иметь плохую экономику, если оно требует повторных попыток, эскалации или приносит мало пользы.

Отслеживайте время соединения, время речи, объем сгенерированной речи, количество реплик, рост контекста, прерывания, повторные попытки, эскалации и процент успешного завершения. Затем сравните общую стоимость успешного результата с его ценностью.

Стоимость голосовых ИИ-агентов снижается, но неравномерно. Цены на модели, обработку речи, оркестрацию и инфраструктуру меняются с разной скоростью, постоянно переписывая жизнеспособность различных вариантов использования.

Те голосовые агенты, которые смогут масштабироваться, не просто будут использовать лучшую модель. Они объединят достатичное качество модели с продуманным дизайном диалога и операционной моделью, которая приносит достаточно ценности на каждый успешный результат.

Пока вы не рассчитаете эту цифру, вы не знаете, во сколько обходится ваш голосовой агент. Вы знаете лишь то, сколько берут за его компоненты.

Источники:

Andreessen Horowitz. (2024, May 29). Hi, AI: Our thesis on AI voice agents. https://a16z.com/ai-voice-agents/

Andreessen Horowitz. (2025, January 29). AI voice agents: 2025 update. https://a16z.com/ai-voice-agents-2025-update/

Deepgram. (2025). State of voice AI 2025. https://deepgram.com/2025-state-of-voice-ai-report

Inworld AI. (2026, July 8). Voice agent cost per minute: A worked cost model. https://inworld.ai/resources/voice-agent-cost-per-minute-2026

Softcery. (n.d.). AI voice agents calculator. https://softcery.com/ai-voice-agents-calculator