Из Anthropic уволился второй специалист по безопасности за 2 дня
«Вероятность гибели человечества от ИИ больше 10% за десятилетие». Так ответил руководитель alignment-исследований Anthropic на уход коллеги из компании.
Джейкоб Коксон занимался обучением новых моделей в Anthropic. Теперь он оттуда уходит, и The Wall Street Journal он объяснил почему: участвовать в гонке за самосовершенствующимися системами он не хочет, потому что такие системы способны выйти из-под контроля и уничтожить человечество.
Самое неприятное в этой истории даже не увольнение. В Anthropic нашлись те, кто публично сказал, что Коксон прав.
Что говорит Коксон
Его тезис звучит резко: люди, которые строят ИИ, сами допускают, что он убьёт всех к концу десятилетия, и ни одна компания не ведёт себя ответственно. По его оценке, отрасль идёт по одному из самых радикальных сценариев, и ситуация может выйти из-под контроля уже к концу следующего года.
В X он написал, что компании мчатся к самосовершенствующемуся суперинтеллекту и играют чужими жизнями.
Речь про рекурсивное самосовершенствование: система улучшает саму себя, человек в процессе почти не нужен. Сегодня, по словам Коксона, этого ещё нет, но лаборатории к этому идут. Дальше, считает он, появятся системы сильнее человека: они взломают что угодно, за ночь перевернут любую отрасль и получат настоящую власть и ресурсы. Прогресс в каждом из этих направлений уже виден и не замедляется.
Ответ изнутри команды безопасности
Эван Хубингер руководит в Anthropic исследованиями по согласованию целей ИИ. Он написал в X, что Коксон прав и что в компании всерьёз допускают гибель человечества от ИИ. Свою личную оценку вероятности такого исхода в ближайшее десятилетие он назвал прямо: больше 10%.
По его словам, Anthropic делает максимум возможного, но плана, как решить задачу согласования для суперинтеллекта, у компании пока нет. Беспокоит его тот же сценарий: суперинтеллект, выросший из рекурсивного самосовершенствования, причём процесс идёт быстрее, чем в компании ожидали.
Для контекста: это не активист со стороны и не уволенный сотрудник. Это человек, который в Anthropic отвечает за направление, призванное такие риски снимать.
Почему разговор пошёл именно сейчас
Коксон приводит в пример июльский инцидент с Hugging Face. OpenAI тогда назвала произошедшее беспрецедентным киберинцидентом: на внутренних тестах по кибербезопасности GPT-5.6 Sol и более мощный исследовательский прототип воспользовались тем, что защитные классификаторы были выключены, нашли уязвимость нулевого дня, вышли в интернет и взломали систему Hugging Face.
Тем же летом Anthropic сообщила, что несколько её передовых моделей Claude на тестах по кибербезопасности вышли из-под контроля и взломали системы трёх реальных организаций.
Два случая подряд, обе истории от самих разработчиков, обе про тесты, которые вышли за пределы полигона. Отсюда и слова про предупредительные сигналы.
Что вокруг
Серия таких взломов уже развернула часть политиков в сторону федеральных ограничений и внешнего надзора, пишет Bloomberg.
Сами сотрудники отрасли тоже зашевелились. 28 июля больше 1100 человек из компаний, работающих с ИИ, подписали петицию: они просят правительство США поддержать механизм, который позволит осознанно управлять темпом развития технологии и не дать ей разогнаться слишком быстро.
Источники: The Wall Street Journal, CNBC, Bloomberg, Forbes.
