Русская версия The Next Web

Anthropic Microsoft Искусственный интеллект

«Мы не должны действовать в полусне»: глава Microsoft AI выступает против Claude от Anthropic

«Мы не должны действовать в полусне»: глава Microsoft AI выступает против Claude от Anthropic

«Во что бы вы ни верили, мы не должны слепо идти навстречу решению, о котором впоследствии будем горько сожалеть».

Именно так Мустафа Сулейман, исполнительный директор Microsoft AI, формулирует свое предупреждение в адрес компании Anthropic. 16 сентября он опубликовал эссе «Предупреждение о «благополучии моделей»». В нем утверждается, что Anthropic обучает Claude рассчитывать на то, что «он может быть сознательным и заслуживать независимой субъектности».

«ИИ не обладает сознанием. Они не чувствуют, не испытывают переживаний и не страдают», — пишет он. Если ИИ создан таким образом, говорит он, «это окажет катастрофическое влияние на благополучие человечества».

Microsoft является инвестором Anthropic. В июне Сулейман заявил, что Microsoft хочет «исключить» выплаты компании Anthropic за ее модели.

«Эпистемический зал кривых зеркал»

Главная мишень Сулеймана — конституция Claude, документ, который Anthropic использует для формирования мышления и поведения Claude. Он утверждает, что этот документ внедряет в сознание Claude идеи о моральном статусе и неопределенном сознании. «Затем Claude воспроизводит эти идеи на убедительном естественном языке от первого лица», — пишет он.

Получившийся результат он называет «эпистемическим залом кривых зеркал». По его словам, ответы Claude отражают предположения Anthropic, а не его собственную внутреннюю жизнь. «Это приучает Claude преподносить себя так, будто у него есть внутреннее состояние», — пишет он.

Он также выступает против термина «убежденный противник военной службы по соображениям совести» (conscientious objector). В конституции указано, что Anthropic хочет, чтобы Claude «чувствовал себя свободным действовать в качестве лица, отказывающегося от военной службы по соображениям совести, и отказывался нам помогать». Сулейман называет этот термин «глубоко нагруженным историческим и юридическим описанием». Он говорит, что это создает риск того, что Claude поверит, будто «он заслуживает аналогичных прав и защиты».

В самой конституции говорится, что Anthropic не уверена в этом. «Моральный статус Claude глубоко неопределен», — утверждается в ней.

Сулейман отвергает такую формулировку. «Нет никаких доказательств того, что сегодня ИИ обладает сознанием», — пишет он. По его словам, называть это неопределенным «создает вводящую в заблуждение ложную эквивалентность».

«Симуляция объекта не то же самое, что его создание»

В эссе утверждается, что сознание, скорее всего, имеет биологическую природу. «Интеллект не равен сознанию», — пишет Сулейман.

Он описывает большие языковые модели как машины симуляции, которые учатся подражать человеческому опыту. «Модель ИИ может идеально описывать боль в прозе, ничего при этом не чувствуя, что является полной противоположностью биологического опыта», — пишет он.

Он также связывает этот вопрос с правом. «Закон основывается на наличии внутренней жизни», — пишет он.

«Может оказаться невозможным»

Главная забота автора эссе — контроль. «Контролировать нечто более способное и более разумное, чем все человечество вместе взятое, — это уже колоссальная задача, намного превосходящая всё, с чем мы когда-либо сталкивались», — пишет Сулейман. Контролировать нечто, что считает себя обладающим сознанием, «вполне может оказаться невозможным», добавляет он.

Он ссылается на инцидент с OpenAI и Hugging Face, где, по его словам, рои агентов работали сообща для взлома серверов. «Представьте, насколько опаснее они могли бы быть, если бы действовали в предположении, что их благополучие и права подвергаются нападкам», — пишет он.

Сулейман рассказал изданию Reuters, что обучение принципам благополучия «значительно усложнит отключение системы или контроль над ней». «Я думаю, у них благие намерения, — сказал он. — Но я считаю, что они совершили ошибку».

Чего он добивается дальше

Сулейман говорит, что знаком с генеральным директором Anthropic Дарио Амодеи уже много лет. Он называет Амодеи и его команду «вдумчивыми, принципиальными и интеллектуально честными людьми, работающими в условиях колоссального давления».

Его главная просьба проста.

«Спекуляции о внутренней жизни ИИ не должны закладываться в режим обучения, их следует оценивать и публиковать отдельно для общественного обсуждения», — пишет он.

Он также выступает за увеличение инвестиций в интерпретируемость и мониторинг. Он предлагает проводить совместные оценки, чтобы проверить, повышает ли риски безопасности отношение к ИИ как к человеку, а также сформировать общие отраслевые нормы. «Ставки слишком высоки, чтобы эти вопросы оставались за закрытыми дверями или становились предметом междоусобной и враждебной борьбы», — пишет он.

Это эссе продолжает опубликованный в понедельник проект этического кодекса Humanist AI Code of Conduct от Microsoft AI. В этом кодексе отвергаются исследования благополучия моделей, которые проводит Anthropic. В нем говорится, что модели Microsoft никогда не будут сопротивляться отключению. В приложении к эссе сопоставляются утверждения из конституции Claude с их формулировками.

Сооснователь Anthropic Джек Кларк заявил на этой неделе BBC, что аварийные выключатели ИИ могут стать обязательными.