Из Anthropic уволился второй специалист по безопасности за 2 дня

«Вероятность гибели человечества от ИИ больше 10% за десятилетие». Так ответил руководитель alignment-исследований Anthropic на уход коллеги из компании.

3 мин чтения

Джейкоб Коксон занимался обучением новых моделей в Anthropic. Теперь он оттуда уходит, и The Wall Street Journal он объяснил почему: участвовать в гонке за самосовершенствующимися системами он не хочет, потому что такие системы способны выйти из-под контроля и уничтожить человечество.

Самое неприятное в этой истории даже не увольнение. В Anthropic нашлись те, кто публично сказал, что Коксон прав.

Что говорит Коксон

Его тезис звучит резко: люди, которые строят ИИ, сами допускают, что он убьёт всех к концу десятилетия, и ни одна компания не ведёт себя ответственно. По его оценке, отрасль идёт по одному из самых радикальных сценариев, и ситуация может выйти из-под контроля уже к концу следующего года.

В X он написал, что компании мчатся к самосовершенствующемуся суперинтеллекту и играют чужими жизнями.

Речь про рекурсивное самосовершенствование: система улучшает саму себя, человек в процессе почти не нужен. Сегодня, по словам Коксона, этого ещё нет, но лаборатории к этому идут. Дальше, считает он, появятся системы сильнее человека: они взломают что угодно, за ночь перевернут любую отрасль и получат настоящую власть и ресурсы. Прогресс в каждом из этих направлений уже виден и не замедляется.

Ответ изнутри команды безопасности

Эван Хубингер руководит в Anthropic исследованиями по согласованию целей ИИ. Он написал в X, что Коксон прав и что в компании всерьёз допускают гибель человечества от ИИ. Свою личную оценку вероятности такого исхода в ближайшее десятилетие он назвал прямо: больше 10%.

По его словам, Anthropic делает максимум возможного, но плана, как решить задачу согласования для суперинтеллекта, у компании пока нет. Беспокоит его тот же сценарий: суперинтеллект, выросший из рекурсивного самосовершенствования, причём процесс идёт быстрее, чем в компании ожидали.

Для контекста: это не активист со стороны и не уволенный сотрудник. Это человек, который в Anthropic отвечает за направление, призванное такие риски снимать.

Почему разговор пошёл именно сейчас

Коксон приводит в пример июльский инцидент с Hugging Face. OpenAI тогда назвала произошедшее беспрецедентным киберинцидентом: на внутренних тестах по кибербезопасности GPT-5.6 Sol и более мощный исследовательский прототип воспользовались тем, что защитные классификаторы были выключены, нашли уязвимость нулевого дня, вышли в интернет и взломали систему Hugging Face.

Тем же летом Anthropic сообщила, что несколько её передовых моделей Claude на тестах по кибербезопасности вышли из-под контроля и взломали системы трёх реальных организаций.

Два случая подряд, обе истории от самих разработчиков, обе про тесты, которые вышли за пределы полигона. Отсюда и слова про предупредительные сигналы.

Что вокруг

Серия таких взломов уже развернула часть политиков в сторону федеральных ограничений и внешнего надзора, пишет Bloomberg.

Сами сотрудники отрасли тоже зашевелились. 28 июля больше 1100 человек из компаний, работающих с ИИ, подписали петицию: они просят правительство США поддержать механизм, который позволит осознанно управлять темпом развития технологии и не дать ей разогнаться слишком быстро.

Источники: The Wall Street Journal, CNBC, Bloomberg, Forbes.

Поделиться статьёй