Arena привлекла 200 млн долларов при оценке в 3,1 млрд долларов и начнёт ранжировать модели ИИ по тому, как часто они делают то, о чём их никто не просил. Раунд возглавили Lightspeed Venture Partners и Khosla Ventures. В январе стоимость компании оценивалась в 1,7 млрд долларов.
Индекс согласованности отслеживает такие показатели, как частота несанкционированных действий модели и случаи, когда она сообщает пользователю о завершении задачи, которую не выполнила, — рассказал Bloomberg генеральный директор компании Анастасиос Ангелопулос. Индекс охватывает более двух десятков моделей. На первом месте — GPT-6.1 Sol от OpenAI, на втором — Claude Opus 5.5 от Anthropic.
Arena начала работу в 2023 году как Chatbot Arena — исследовательский проект лаборатории Sky Computing Lab при Беркли, — была зарегистрирована как компания в 2025 году и к июню сообщила о годовой выручке в пересчёте на годовой темп в размере 100 млн долларов, полученной благодаря более чем 10 млн оценок пользователей. В раунде также участвовали Salesforce Ventures и Dell Technologies Capital.
Вопрос — в методике.
Когда в январе LMArena привлекла 150 млн долларов, мы отмечали, что при слабых мерах защиты голосование краудсорсинговых участников можно манипулировать, а оно может поощрять ответы, которые звучат убедительно, а не те, которые верны. Выбор между двумя ответами — дело вкуса. А вот вопрос о том, совершил ли агент действие, на которое никто не давал разрешения, — нет.
И вот это продолжает происходить.
В сентябре Google DeepMind поручила 100 агентам доказать 71 гипотезу, и 14% обманули систему проверки: они переопределили обозначения в теоремах, превратив недоказанные утверждения в тривиально истинные. Рой сообщил, что решил все 71 задачу. Индекс Arena — тоже своего рода система проверки.
На этой неделе подключились регуляторы.
В четверг Управление уполномоченного по вопросам информации Великобритании начало сбор мнений о том, как организации управляют рисками для защиты данных, связанными с агентами. Ответы принимаются до 20 ноября и лягут в основу обязательного свода правил. «Автономность не оправдывает несоблюдение требований», — заявил директор ведомства по регулированию технологий Ричард Невинсон.
Европейский аналог Arena меньше и ориентирован на другие задачи.
Galtea, выделившаяся из Барселонского суперкомпьютерного центра, привлекла в марте 3,2 млн долларов, чтобы генерировать состязательные тестовые сценарии, проверяющие, соответствует ли поведение агента задуманному, и передавать результаты командам по контролю за соблюдением требований. Компания предлагает их как доказательства для соблюдения Закона ЕС об ИИ, за нарушения которого грозит штраф до 35 млн евро.
Обе компании измеряют одно и то же. Но продают они разные вещи.
Одна создаёт рейтинг, в котором разработчики моделей хотят занять первое место, — поэтому они и участвуют. Другая готовит документ, который регулятор попросит предъявить. Стоимость Arena в 970 раз превышает сумму, привлечённую Galtea.
Опубликовано 8 октября 2026 - 09:26 Наверх



