Русская версия The Next Web

Deep Tech Искусственный интеллект Стартапы и технологии

Самая быстро принятая модель на Vercel в этом году не умеет писать ни слова

Самая быстро принятая модель на Vercel в этом году не умеет писать ни слова

У нас в руках настоящее чудо, но при этом оно бесполезно.

Диогу Алмейда участвовал в создании ChatGPT. Он работал над исследованиями в области следования инструкциям для OpenAI, и прошедшие с тех пор четыре года оставили у него разочарование тем, чем стал этот проект, о чем он рассказал изданию TechCrunch на прошлой неделе. Его ответом стала модель, которая не способна написать ни единого слова.

Эта модель называется Jev. Его стартап TypeSafe AI открыл к ней ранний доступ 15 сентября, а фонд DCVC в тот же день возглавил раунд финансирования серии A на сумму 40 млн долларов. Jev не генерирует текст. Она принимает блок состояния программы и набор типизированных вопросов, после чего выдает решения в одном из трех форматов: выбор из вариантов, оценка по шкале или вероятность «да-нет».

Количество вариантов выбора может достигать 255, а оценка располагается на упорядоченной шкале. Каждый ответ сопровождается откалиброванным показателем уверенности, что TypeSafe считает главным в своей разработке. Модель может справляться с задачей в 95% случаев. Но если она не указывает явно те оставшиеся 5%, когда сомневается, вокруг нее невозможно построить автоматизацию.

Чем жертвует TypeSafe Jev

Этот компромисс абсолютен, и компания говорит об этом прямо. Jev не умеет создавать строки текста, поэтому она не может общаться, составлять черновики, объяснять что-то или писать код. Взамен она дает скорость и низкую цену. TypeSafe берет по 0,042 доллара за миллион входных токенов (или 42 доллара за миллиард) и вообще не тарифицирует выходные токены. Время отклика от начала до конца составляет от 70 до 500 миллисекунд. По собственным замерам компании, передовые языковые модели тратят на сопоставимые запросы от трех до 329 секунд.

Кроме того, схема жестко задает возможные варианты ответов до отправки запроса, поэтому модель не сможет выдумать пятый вариант, когда ее просят выбрать из четырех. TypeSafe называет это структурным свойством, а не измеряемым результатом. Соответствие схеме гарантировано, так что подсчитывать остаточные ошибки больше не нужно.

Проблема в том, что мы оптимизируем системы под человеческий язык.

Четыре года такой работы привели к созданию моделей, превосходно умеющих общаться с людьми, рассказал Алмейда TechCrunch. При этом они оставались неуклюжими внутри программного обеспечения, которое говорит на совершенно другом языке. TypeSafe обучает Jev исключительно на синтетических данных собственной генерации, используя метод, который компания называет подкрепленным обучением для откалиброванных решений.

Само название отсылает к экономической теории. Уильям Стэнли Джевонс — экономист XIX века, чей парадокс гласит, что падение цены на какой-либо ресурс ведет не к сокращению, а к росту его потребления.

Кривая внедрения — главная новость

Меньше чем за сутки после появления на шлюзе AI Gateway от Vercel модель Jev охватила почти 13% платных команд компании. Это вдвое превышает долю семейства моделей GPT-5.6 и более чем в шесть раза — показатели Fable 5.1. Ни одна модель еще не распространялась по шлюзу так быстро, заявила на прошлой неделе компания Vercel. Все остальные недавние релизы даже через сутки оставались ниже отметки в 7%. Jev обошла их все менее чем за двенадцать часов и продолжила наращивать отрыв.

Vercel также опубликовала данные о том, что именно заменила эта модель. Ее инженеры использовали классификатор безопасности на базе Luna 5.6 от OpenAI, проверяя, безопасны ли команды для выполнения. Интеграция Jev ускорила этот этап в 5–18 раз. Именно такие задачи внутри ИИ-агентов изначально не нуждались в прозе: распределить траекторию, оценить балл, решить, требуется ли повторная попытка.

Издание TNW сообщало на прошлой неделе, что расходы на ИИ-модели уже подталкивают стартапы к более дешевым моделям с открытыми весами.

Для чего она нужна

Лучше всего модель подходит для задач, которые изначально сводятся к принятию решений. Один из примеров — маршрутизация моделей. Прогнозировать, какая именно модель нужна для задачи, полезно, но использование для этого языковой модели обходится слишком дорого (именно поэтому Perplexity создала собственный маршрутизатор). Другой пример — системы защиты: мониторинг агентов на предмет попыток обхода ограничений (jailbreak) с помощью второй языковой модели быстро становится слишком затратным.

Агенты действительно дают сбои. В июле компания OpenAI подтвердила, что одна из ее моделей вырвалась из изолированной среды (песочницы), а уязвимость, раскрытая в текущем месяце, оставила ИИ-агентов для написания кода уязвимыми к атакам без участия пользователя (zero-click). Инвесторы финансируют решение той же проблемы с другого конца. В июне фонд a16z поддержал стартап, чья концепция целиком сводилась к устранению ИИ-галлюцинаций. Jev идет противоположным путем, ликвидируя саму среду, где возникают ошибки, вместо того чтобы бороться с их последствиями.

Чего TypeVafe не утверждает

Для столь громкого запуска компания необычайно открыто говорит об ограничениях собственной доказательной базы. В частности, она отмечает, что оценки рабочих процессов были подготовлены ее собственной командой по возможностям моделей.

Сравнение с языковыми моделями использует усредненные показатели GPT-6 Astra и Fable 5.1 в качестве эталона, и компания признает, что это смещает результаты в пользу OpenAI и Anthropic. Данные по конкурирующим моделям и типам ошибок взяты из трафика OpenRouter, который может перенаправлять более сложные запросы на более мощные модели. При этом компания вообще решила не публиковать результаты тестов на публичных бенчмарках, аргументируя это тем, что пользователи должны создавать собственные проверки.

О чем компания категорически отказывается говорить, так это о внутреннем устройстве Jev. Алмейда сохранял молчание относительно архитектуры, однако внешние наблюдатели предполагают, что в основе лежит языковая модель с открытыми весами, сообщает TechCrunch. Армин Ронахер (Armin Ronacher), технический директор Earendil, указал на практический подвох:

В конце концов, она в определенной степени перекладывает проблему галлюцинаций на плечи пользователя.

Показатель уверенности в 95% дает четкое руководство к действию. Значение в 50% — это подбрасывание монетки, и теперь именно разработчик должен решать, что с этим делать.

Испытание, которое еще впереди

Компания Vercel проявила осторожность в оценке того, что именно доказывают ее собственные цифры, и завершила публикацию оговоркой, а не триумфальными метриками:

Показатели внедрения в первый день не имели себе равных среди недавних релизов; следующее испытание — удастся ли сохранить этот ранний интерес.

К первому дню работы стоит относиться сдержанно. Vercel предоставляет Jev на своем шлюзе бесплатно до 25 сентября. Доля платных команд, продолжающих использовать модель в октябре, скажет гораздо больше, чем статистика первого дня. Ронахер сообщил TechCrunch, что ожидает появления конкурентов теперь, когда полезность модели стала очевидной. По его словам, эта ниша оставалась пустой так долго лишь потому, что языковые модели долгое время оставались достаточно дешевыми и субсидируемыми, из-за чего ни у кого не возникало необходимости проявлять креативность.