Русская версия The Next Web

Искусственный интеллект Приватность Приложения

Транскрипция теперь стоит 10 центов за час. Главным отличием больше не является модель — теперь это то, чьими разговорами вы можете обучать систему.

Транскрипция теперь стоит 10 центов за час. Главным отличием больше не является модель — теперь это то, чьими разговорами вы можете обучать систему.

Модель Grok Voice Transcribe 2.0 была выпущена 18 сентября по цене 0,10 доллара за час аудио при пакетной обработке и 0,20 доллара за час при потоковой передаче. Оба показателя остались неизменными по сравнению с предыдущей версией.

Анонс опубликован под брендом SpaceXAI — такое название xAI носит с июля, после того как в феврале компания была приобретена SpaceX. В СМИ компанию по-прежнему называют xAI, хотя в собственном футере сайта это название не используется.

Читайте заявление о точности внимательно

Компания заявляет, что модель в два раза точнее Grok Voice Transcribe 1.0. Это сравнение с собственным предшественником, а не с чьей-то чужой моделью.

В конкурентной среде заявление выглядит скромнее: утверждается, что модель занимает первое место по точности среди 32 потоковых моделей в общедоступном рейтинге Artificial Analysis, при этом компания называет ее одной из самых точных, а не самой точной. Эта оговорка исходит от самой компании, и ее стоит иметь в виду.

В ее внутренних графиках проводится сравнение с ElevenLabs Scribe v2 и Deepgram Nova-3. Это оценки, проведенные самими поставщиками на основе выбранных ими же аналогов, что является нормальной практикой, но не заменяет независимое тестирование.

Настоящая новость — это цена

Сохранение прежней цены при заявленном двукратном росте точности говорит скорее о ситуации на рынке, чем о самой модели. Разделение по спикерцам, временные метки на уровне слов и учет ключевых слов входят в стоимость без каких-либо доплат.

Еще недавно эти функции тарифицировались отдельно. Транскрипция становится базовым биржевым товаром (коммодити), и продающие ее компании конкурируют на уровне того, что они могут предложить в качестве комплексного пакета.

Давление испытывают все. OpenAI выпустила новые голосовые API-модели, а собственная модель транскрипции от Microsoft была протестирована в сравнении с Whisper, Gemini и ElevenLabs на материале 25 языков.

Откуда на самом деле берется преимущество

SpaceXAI говорит об этом прямо. Модель обучена на том, что компания называет уникальным набором данных, состоящим из живых, зашумленных, многоязычных аудиозаписей, записанных в самых разных условиях.

Компания также описывает конвейер, который генерирует эти аудиоданные. Технология Grok Voice обслуживает десятки тысяч звонков в службу поддержки ежедневно, расшифровывает миллионы часов видеокомментариев и управляет голосовым помощником в автомобилях Tesla.

Проблема распознавания чистой речи уже решена. Осталась телефония, акценты, наложения голосов и команды в автомобилях, и преимущество здесь принадлежит тому, через чьи системы проходит наибольший объем реальных разговоров.

Наборы для оценки — деталь, на которую стоит обратить внимание

Компания заявляет, что измеряет частоту ошибок в словах (WER) на четырех внутренних наборах данных, полученных из производственного трафика. К ним относятся телефонные звонки в службу поддержки, разговоры с Grok, короткие многоязычные голосовые команды и произнесенные вслух учетные данные.

Последний набор описывается как коды учетных записей, номера телефонов, адреса электронной почты и физические адреса, зачитанные вслух. Это постоянный оценочный корпус данных, состоящий из людей, зачитывающих свою собственную конфиденциальную информацию.

В анонсе нет никакой информации о том, как этот материал получается, хранится или получается ли согласие на его использование. Вполне возможно, что это регулируется корпоративными условиями, однако в заявлении об этом не говорится.

Вытекающий отсюда европейский вопрос

В звонке в службу поддержки участвуют две стороны, и только у одной из них есть договор с ИИ-провайдером. Звонящий, зачитывающий номер счета, ни на что не давал согласия.

В Европе голосовые записи считаются персональными данными, а набор данных, созданный специально на основе произнесенных учетных данных, является одним из самых чувствительных видов данных для транскрипции. Ограничение целей обработки и сроки хранения — это очевидные вопросы, на которые должны быть ответы.

Сама практика не нова, в чем и заключается суть. Люди прослушивают якобы автоматические стенограммы уже более десяти лет, и практика раскрытия информации неизменно отстает от реальности.

Где кроется реальный прирост

Главное улучшение касается многоязычности и, в частности, коротких фраз. На собственном наборе данных компании из 19 языков, состоящем из фраз голосового помощника, частота ошибок в словах снижается с 20,6% до 6,8%.

Короткие команды практически не дают модели контекста для определения языка, что как раз и является проблемой при использовании в автомобиле. Самый крупный заявленный прирост приходится на тот сценарий использования, которым SpaceXAI владеет полностью через Tesla.

Многоязычность — это также сфера, на которой сосредоточились европейские разработчики. DeepL осуществляет синхронный голосовой перевод более чем на 40 языков, а ElevenLabs включила транскрипцию в число пяти сервисов на облачной платформе правительства Великобритании.

Пример реального клиента

В Atlassian заявили, что сочли модель более точной по сравнению с их прежним поставщиком и теперь используют ее для транскрипции каждого видео Loom. Это реальный переход известного покупателя, который весит больше любого бенчмарка.

Поддержка версии 1.0 будет прекращена в течение нескольких недель, причем на время перехода доступна фиксация версии. Клиентов, использующих старую модель, переводят на новую независимо от того, просили они об этом или нет.

За чем стоит следить

Стоит проследить, задаст ли кто-нибудь вопросы по поводу корпуса учетных данных. Это действительно новое положение в анонсе, которое пока никто не заметил.

Следите за минимальным уровнем цен. При стоимости в 10 центов за час модель практически бесплатна, а бизнесом становится проходящий через нее аудиопоток.