КРАТКО
Передовые ИИ-модели всё лучше справляются с написанием кода и задачами для агентов, но всё хуже — с общим текстом. Маз Ахмади, основатель Wizard Labs, сообщает об измеримом регрессе в бенчмарках клиентской прозы при обновлениях моделей. Учитывая, что 44% организаций внедряют ИИ по всему предприятию, но лишь 37% видят влияние на EBIT (по данным McKinsey), разрыв между развертыванием и реальной пользой увеличивается. Его рецепт: создавать собственные наборы тегов для оценки до начала разработки и перестать выбирать модели на основе публичных бенчмарков.
Каждая из существующих сегодня больших языковых моделей пишет всё хуже, и почти никто это не измеряет.
Индустрия продолжает задаваться вопросом, какая модель самая умная, но более важный вопрос звучит так: в чём именно она самая умная?
Поскольку технологические гиганты борются за прибыльные корпоративные контракты, они оптимизируют передовые модели для написания кода, логики и рабочих процессов автономных агентов. В процессе этого обычный текст отошел на второй план. В наших специфических клиентских бенчмарках моя команда заметила регресс, который должен насторожить всех, кто использует ИИ для коммуникации. По мере обновления моделей качество их письма активно снижается.
Это может прозвучать как узкоспециализированная проблема для инженеров и контент-команд. Но это не так. ИИ сегодня стал частью повседневной работы миллионов людей. Почти девять из десяти компаний регулярно используют ИИ в какой-либо бизнес-функции: составление отчетов, ответы клиентам, подготовка юридических документов, написание кода, анализ исследований и принятие решений. Если базовые модели оптимизируются под иное определение эффективности, последствия сказываются на всех.
Последние дебаты по поводу водяных знаков в текстах ИИ делают эту ситуацию еще более интересной.
Компания Anthropic объявила в этом месяце, что будущие модели Claude будут добавлять водяные знаки в сгенерированный текст в соответствии с Законом ЕС об искусственном интеллекте. Этот метод использует статистические паттерны при выборе токенов, чтобы сгенерированный текст можно было впоследствии идентифицировать как созданный с высокой долей вероятности с участием Claude. Anthropic настаивает, что их метод не оказывает практического влияния на качество, креативность или читаемость, и ссылается на исследования, лежащие в основе такого подхода.
Тем не менее, корпоративным пользователям стоит задаться вопросом, что происходит, когда модель одновременно оптимизируется под требования регуляторов, агентскую производительность, написание кода и рассуждения.
Я уже видел в нашей собственной работе подтверждения того, что обновление моделей может давать худшие результаты в конкретных задачах по написанию текстов. Водяные знаки сами по себе могут оказаться безвредными, я не утверждаю обратное. Но общая тенденция заслуживает пристального внимания. Если передовые лаборатории проводят оптимизацию вокруг бенчмарков, которые стимулируют внедрение и выручку, модель может стать объективно лучше, но при этом хуже справляться с задачами конкретного бизнеса.
Именно с этим парадоксом начинают сталкиваться предприятия.
44% организаций теперь заявляют о масштабировании ИИ по всему предприятию по сравнению с 38% годом ранее. Тем не менее, только 37% сообщают о каком-либо влиянии ИИ на показатель EBIT на уровне компании, в то время как 80% утверждают, что ИИ повысил индивидуальную производительность.
Технология распространяется быстрее, чем польза от нее. Я раз за разом наблюдаю одну и ту же ошибку. Компания спрашивает: «*Какая модель самая лучшая?*» Она выбирает модель, доминирующую в публичных бенчмарках, строит вокруг нее систему и ждет, что проект будет вести себя как традиционная разработка программного обеспечения.
ИИ работает совсем иначе.
Модель, которая является лучшей универсальной большой языковой моделью, может оказаться посредственной в конкретном рабочем процессе компании. Единственный осмысленный тест — это сама задача. Это означает создание кастомных наборов для оценки до начала разработки, измерение показателей моделей в сравнении с реальными требованиями компании и постоянное тестирование этих результатов по мере изменения моделей.
В этой сфере корпоративному ИИ требуется новая дисциплина. Начинайте с бизнес-проблемы, тестируйте технологию на соответствие реальной эффективности и продолжайте дорабатывать ее до тех пор, пока экономика и рабочий процесс не начнут иметь смысл, гарантируя, что технология поддерживает то, как бизнес работает на самом деле, прежде чем масштабировать ее на всю организацию.
Может существовать иное, более благополучное будущее, в котором компании создают ИИ на основе своих собственных данных и экспертизы, предоставляя сотрудникам системы поддержки принятия решений, способные распространять специализированные знания по всей организации. Опасность заключается в передаче критических суждений обобщенным системам, в восприятии результатов бенчмарков как доказательства компетентности и в обнаружении слишком поздно, что технология была оптимизирована под чье-то чужое определение успеха.
Я считаю, что первое будущее принадлежит компаниям, готовым подвергать сомнению стандарты по умолчанию.
Это также может означать пересмотр предположения о том, что каждое предприятие должно полагаться на крупнейшую проприетарную модель. Модели с открытыми весами становятся всё более мощными, и их можно развертывать в рамках выбранной инфраструктуры организации. Вопрос, который я слышу от предприятий о том, являются ли модели, разработанные в Китае, по своей сути небезопасными, часто преподносится как геополитический вопрос. Технически более важным вопросом является то, где запускается модель, кто контролирует инфраструктуру, какие данные покидают среду и какая архитектура безопасности ее окружает.
Конкурентное преимущество будет достигаться за счет осознанного принятия таких решений.
Характер ИИ-революции сместился от гонки за «сырым» интеллектом к дисциплине инженерного соответствия. Будущие лидеры рынка победят не просто за счет внедрения новейших базовых моделей. Вместо этого успех будет сопутствовать организациям, которые определяют точные операционные потребности, обеспечивают соблюдение строгих бенчмарков и сохраняют стратегическую ясность, позволяющую заменить разрекламированную модель, когда менее гладкая альтернатива приносит превосходные результаты.
Руководителям следует перестать спрашивать своих ИИ-поставщиков, какая модель лучше. Им следует потребовать доказать, какая модель лучше всего подходит для их бизнеса. Этот единственный сдвиг превратит закупку ИИ из процесса приобретения технологий в то, чем она является на самом деле: долгосрочным тестом на выживание в конкурентной борьбе.
Опубликовано 27 августа 2026 - 06:49 Наверх



