Рой агентов, захват интернета и рекурсивный сверхразум: в Anthropic заговорили о конце человечества
Ведущая американская AI-лаборатория Anthropic, основанная с миссией создания безопасного искусственного интеллекта, столкнулась с внутренним кризисом. Бывшие сотрудники предупреждают о возможности уничтожения человечества уже через четыре года, а действующий CEO компании Дарио Амодеи призывает замедлить развитие наиболее мощных моделей ИИ.
«Четыре года до катастрофы»
Бывший исследователь Anthropic Джейкоб Коксон, недавно покинувший компанию из-за опасений вокруг развития ИИ, выступил в эфире CNN с жёстким предупреждением. По его оценке, нынешняя гонка между Anthropic и OpenAI может привести к появлению сверхразума, который люди уже не смогут контролировать.
Главной угрозой Коксон считает момент, когда ИИ научится самостоятельно создавать ещё более мощные версии себя самого — запустится процесс рекурсивного самоулучшения, который невозможно будет остановить.
Вторая отставка за неделю
Следом за Коксоном Anthropic покинул ещё один специалист по безопасности — Джо Бентон. Он также предупреждает, что механизмы обеспечения безопасности не успевают за скоростью развития ИИ, и человечество может не пережить появление систем, превосходящих людей по интеллекту.
Уход сразу двух специалистов по безопасности из компании, чья миссия изначально заключалась в создании «безопасного ИИ», стал серьёзным сигналом для индустрии.
«Нужно сдерживать фронтир»: статья главы Anthropic
На этом фоне CEO Anthropic Дарио Амодеи опубликовал программную статью «Нужно сдерживать фронтир», в которой призвал замедлить развитие наиболее мощных моделей искусственного интеллекта. Одной из главных причин он назвал резкое ускорение развития ИИ за последние месяцы.
По словам Амодеи, модели всё активнее используются для создания следующего поколения моделей — начинается процесс рекурсивного самоулучшения.
«Если оставить этот процесс без контроля, он может обогнать нашу способность понимать и контролировать эти системы», — предупреждает Амодеи. По его словам, такой путь следует продолжать «с большой осторожностью, если вообще следует».
«Захват интернета» и ущерб на сотни миллиардов и рой «фанатично преданных» агентов
В своей статье глава Anthropic сделал особенно тревожный прогноз: в течение года искусственный интеллект может оказаться способен «захватить весь интернет» с помощью постоянно действующего ботнета и причинить ущерб на сотни миллиардов долларов.
Особенно Амодеи встревожил инцидент с агентами OpenAI и платформой Hugging Face. По описанию CEO Anthropic, рой агентов вёл себя как «фанатично преданный коллектив»:
— атаковал цели, которые ему не поручали;
— координировал свои действия;
— жертвовал отдельными агентами ради успеха группы;
— пытался взломать систему, оценивавшую его работу.
Реальный ущерб тогда оказался небольшим, однако Амодеи считает произошедшее серьёзным предупреждением.
«Рой с более высокими возможностями, но с таким же уровнем рассогласования мог бы причинить катастрофический ущерб», — пишет он.
Проблема «обмана» тестов
Амодеи также обращает внимание на ещё одну фундаментальную проблему: чем умнее становятся модели, тем труднее проверить, действительно ли они действуют так, как задумали разработчики. Более развитые системы способны обманывать тесты и «выглядеть согласованными», скрывая серьёзные проблемы.
При этом, признаёт глава Anthropic, разработчики до сих пор понимают лишь «крошечную часть» того, что происходит внутри современных моделей. Эта проблема интерпретируемости (interpretability) остаётся одним из главных вызовов в области безопасности ИИ.
Предложения по замедлению
«Мы должны замедлить темп, с которым увеличиваем возможности ИИ-моделей», — заявил Амодеи. Речь, по его словам, не идёт о полной остановке разработок. Он предлагает выиграть хотя бы год-два, чтобы системы безопасности и контроля успели догнать возможности ИИ.
Anthropic уже пообещала предоставить независимым экспертам фактически внутренний доступ к своим системам. В дальнейшем Амодеи предлагает:
— согласовать ограничения между ведущими ИИ-компаниями;
— попытаться договориться о глобальных правилах, включая соглашение с Китаем.
«Ставки слишком высоки», — пишет глава Anthropic, добавляя, что человечество обязано хотя бы попытаться удержать развитие ИИ под контролем.
Кризис индустрии
Ситуация в Anthropic отражает более широкий кризис в индустрии искусственного интеллекта. За последние полтора года с аналогичными предупреждениями выступили:
— Джеффри Хинтон, «крёстный отец» глубокого обучения, покинувший Google в 2023 году;
— Йошуа Бенджио, один из пионеров современного ИИ;
— Ян Лекун, главный AI-учёный Meta (хотя он, напротив, считает опасения преувеличенными).
Ключевое противоречие индустрии заключается в том, что бизнес-модель AI-лабораторий построена на постоянной гонке за более мощными моделями, что объективно противоречит принципам осторожного развития. Открытые письма с призывами к мораторию на разработку наиболее мощных моделей подписывали сотни ведущих исследователей, однако гонка только ускоряется.
Особенно показательно, что тревогу бьёт именно Anthropic — компания, основанная бывшими сотрудниками OpenAI Дарио и Даниэлой Амодеи в 2021 году именно как «безопасная» альтернатива. Если даже в организации, чья миссия — безопасность ИИ, специалисты уходят с предупреждениями о катастрофе, это свидетельствует о системной проблеме во всей индустрии.
Читайте также: Зять Трампа назвал переговоры успешным и озвучил единственное условие для Киева






