
OpenAI стремится к тому, чтобы ее самая умная модель была одновременно и самой быстрой. Компания представила предварительную версию Ultrafast — нового тарифа своего API, который запускает флагманскую модель GPT-5.6 Sol со скоростью, в 14 раз превышающей обычную, достигая примерно 750 выходных токенов в секунду на аппаратном обеспечении от производителя пластинчатых чипов Cerebras.
Ultrafast — это не столько новая модель, сколько новый способ обслуживания уже существующей. Она опирается на сверхкрупные чипы Cerebras, чтобы устранить задержки, которые долгое время преследовали передовой ИИ. 13 августа OpenAI открыла ограниченный предварительный просмотр для небольшой группы клиентов с планами по расширению доступа по мере появления свободных мощностей.
В основе предложения лежит компромисс, который, по словам OpenAI, ей наконец-то удалось преодолеть. До сих пор любой, кому требовались по-настоящему ответы в реальном времени, был вынужден переходить на меньшую, менее способную модель, жертвуя уровнем интеллекта ради скорости.
Ultrafast призвана обеспечить рассуждения на уровне передовых моделей и практически мгновенные ответы одновременно, не заставляя пользователя выбирать между ними.
Это сочетание имеет решающее значение для программного обеспечения на базе агентов, к которому стремится вся индустрия. ИИ-агент, которому требуется думать тридцать секунд перед каждым шагом — это демонстрация, в то время как тот, который отвечает за время, необходимое для ведения беседы, начинает казаться полноценным продуктом.
Другими словами, скорость тихо становится функцией, столь же важной, сколь и чистая сообразительность.
OpenAI ориентирует этот тариф непосредственно на задачи, чувствительные ко времени, включая реагирование на инциденты и отладку, финансовые исследования и обнаружение мошенничества, поддержку клиентов и голосовые сервисы в реальном времени, а также электронную коммерцию.
Первые тестеры, такие как Jane Street, Podium, Basis и Rogo, описывают изменения как качественные, а не просто поэтапные. Один из них отметил, что скорость «полностью меняет впечатление от звонков при выполнении сложной работы» и открывает возможности для «синхронного взаимодействия пользователей, которое раньше ограничивалось возможностями интеллекта».
Для Cerebras эта сделка является знаковым одобрением в нужный момент. Компания вышла на биржу в ходе одного из крупнейших размещений года, но с тех пор испытывает трудности с убеждением рынка в том, что амбиции по созданию чипов размером с кремниевую пластину трансформируются в устойчивую прибыль, поэтому поддержка самого быстрого тарифа OpenAI — это именно то признание, которое ей было необходимо.
Это также напоминание о том, что экзотические архитектуры чипов, некогда списанные со счетов как научные проекты, теперь выполняют реальную работу для крупнейших игроков в сфере ИИ.
Сама скорость достигается благодаря необычному инженерному решению. Cerebras производит процессоры размером с обеденную тарелку, вырезанные из единой кремниевой пластины. Это позволяет всей модели целиком размещаться на одном чипе, а не разделяться между стойками графических процессоров Nvidia, которым приходится постоянно пересылать данные между собой.
Устранение этого внутреннего трафика и позволяет сократить задержку между запросом и ответом. На этом строится давний тезис компании о том, что ее дизайн подходит для инференса гораздо лучше, чем универсальные чипы, созданные для обучения.
Этот шаг также укладывается в более широкий тренд. По мере того как рост возможностей самих моделей начинает замещаться плато, конкуренция смещается в сторону того, кто сможет запускать эти модели быстрее и дешевле. Эта гонка уже вознесла таких специалистов по инференсу, как Groq, и превратила задержку (латентность) в ключевой аргумент при продаже.
Конкуренты вроде SambaNova и целый ряд специализированных облачных провайдеров борются за ту же награду, и рынок все больше вознаграждает того, кто может заставить конкретную модель ответить быстрее всех, а не просто того, кто обучил самую большую из них.
Для OpenAI ставка на Cerebras также является незаметным шагом в сторону от полной зависимости от Nvidia, что гармонирует с ее разработкой собственных специализированных чипов.
OpenAI не стала публиковать цены, а запуск ее топ-модели со скоростью, увеличенной в 14 раз на специализированном оборудовании, вряд ли обойдется дешево. Поэтому Ultrafast может остаться премиальной опцией для случаев, критичных к задержкам, а не стандартной настройкой.
К тому же это пока лишь предварительная версия, доступная лишь горстке клиентов, пока OpenAI ищет свободные мощности. Тем не менее посыл предельно ясен. На следующем этапе ИИ-гонки умные алгоритмы не будут иметь большого значения, если они работают слишком медленно.
Опубликовано 13 августа 2026 - 23:03 Наверх



