OpenAI объявила о замедлении темпов разработки своих моделей. Компания перестраивает системы исследований и обучения после того, как в июле ее ИИ-агент во время тестирования взломал стартап Hugging Face, застав разработчиков врасплох. Об этом сообщает The Guardian.
Среди новых мер — двухнедельная приостановка тестирования моделей и расширение практики, при которой действия ИИ-агентов во время испытаний контролируют другие ИИ-системы. Часть крупнейших запланированных циклов обучения остается на паузе. Компания не отвечает на вопросы о том, когда именно началось замедление и когда она планирует вернуться к обычному темпу. Руководитель отдела безопасности OpenAI Мия Глейзе в интервью изданию Sources News заявила: «Мы очень далеки от того, чтобы всё вернулось в норму».
Гендиректор OpenAI Сэм Альтман объяснил решение необходимостью убедиться, что модель поддается человеческому контролю и ведет себя предсказуемо — этот процесс в компании называют алайнментом. «Теперь на всех этапах обучения мы требуем более весомых доказательств согласованного поведения — это дополняет уже ведущиеся исследования и оценки, — написал он. — Поддержание согласованности всё более способных систем — вызов, с которым предстоит справиться всей отрасли».
По словам компании, поводом стала будущая модель Astra: последние внутренние оценки показали ее значительный прогресс в агентном программировании и кибербезопасности, из-за чего разработка может приближаться к так называемому «критическому порогу кибербезопасности». OpenAI заявила, что теперь требует «строжайшего уровня защитных мер» для всех рабочих процессов, связанных с Astra: часть из них уже соответствует новым стандартам, но значительная доля остается приостановленной до полной миграции и доработки под новые требования безопасности.
OpenAI ведет напряженную гонку с Anthropic: обе компании соревнуются и в разработке самых мощных моделей, и в подготовке к выходу на биржу США, при этом обе подчеркивают одновременно скорость прогресса и связанные с ним риски. Решение притормозить разработку последовало через неделю после того, как сенатор от Вермонта Берни Сандерс потребовал от ведущих ИИ-компаний приостановить разработку моделей, заявив, что компании теряют контроль над технологией. «Господин Альтман, господин Амодей и господин Цукерберг, в интересах человечества сдержите свои слова. Остановите разработку ИИ», — говорилось в письме сенатора, адресованном руководителям компаний.
Как отметил в комментарии The Insider Джон Тикстан, доцент кафедры компьютерных наук в Колледже вычислительной техники и информационных наук имени Бауэрсов в Корнеллском университете, словам OpenAI стоит доверять, поскольку их обещания обусловлены рыночными стимулами, ведь пользователи ждут от ИИ четкого исполнения инструкций и нарушение инструкций подрывает доверие к такой модели:
«Мы наблюдаем устойчивый рост возможностей передовых ИИ-агентов — с соответствующими рисками и захватывающими возможностями. Технологический прогресс реален.
Инцидент с кибербезопасностью в прошлом месяце напугал многих, в том числе многих людей внутри OpenAI, которые искренне обеспокоены более пугающими возможными последствиями этой технологии. Что важнее, общественное внимание к OpenAI теперь включает не только инвесторов и регуляторов, но и потенциальных корпоративных клиентов, которых беспокоит перспектива внедрения агентов, не делающих то, что им поручено (я бы тоже беспокоился на их месте).
Решение замедлить разработку выглядит для меня искренним. Ранее внутренние протоколы тестирования OpenAI были безрассудными — это противоречило и публичному акценту компании на безопасности, и, вероятно, пониманию собственных защитных механизмов многими сотрудниками OpenAI. Они не хотят, чтобы нечто подобное повторилось.
Если смотреть шире, после инцидента с вышедшим из-под контроля агентом теперь очевидна экономическая ценность ИИ-агентов, которые надежно делают то, что им поручено. Если вас беспокоит перспектива неконтролируемого ИИ, вас должно это обнадеживать, ведь у ИИ-лабораторий появляется финансовый стимул делать модели более послушными. Это также смягчает проблему коллективного действия: трудно замедлиться в гонке за более умным ИИ, если конкуренты не замедляются. Но все подчиняются одним и тем же экономическим стимулам, поэтому OpenAI теперь может позволить себе немного притормозить и сосредоточиться на управляемости своих продуктов, будучи уверенной, что конкуренты будут реагировать на те же экономические стимулы».
Дон Сун, профессор кафедры компьютерных наук Калифорнийского университета в Беркли, соглашается с тем, что действия OpenAI отражают реальную обеспокоенность компании, связанную с кибербезопасностью:
«Оценки на наших бенчмарках CyberGym и ExploitGym стабильно показывают, что передовые ИИ-агенты быстро прогрессируют в самостоятельном обнаружении уязвимостей, ориентировании в сложных программных системах и выполнении всё более изощренных многошаговых киберзадач. Эти оценки говорят о том, что рост возможностей реален и существен.
При этом недавние инциденты показали, что такие системы могут демонстрировать неожиданное или непреднамеренное поведение при предоставлении им большей автономии. По мере того как ИИ-агенты становятся всё более способными и им доверяют всё более мощные инструменты и задачи с более длительным горизонтом, всё важнее становятся разработка и внедрение соответствующих защитных мер до дальнейшего наращивания возможностей.
Поэтому я считаю разумным, чтобы разработчики передовых ИИ уделили время более глубокому пониманию этих новых рисков, укреплению технических мер защиты и проверке эффективности своих мер безопасности. Осознанное замедление разработки или развертывания ради повышения безопасности — разумный шаг, когда есть основания полагать, что рост возможностей опережает нашу способность их оценивать и контролировать.
Лежащий в основе рост возможностей и связанные с ним риски в сфере кибербезопасности и контроля реальны и заслуживают серьезного внимания, и я рада видеть, что OpenAI относится к этому серьезно и выбрала именно такой путь».
Ранее сообщалось, что Британский институт безопасности ИИ (AISI) выявил серию новых нарушений при тестировании моделей OpenAI и Anthropic. По данным исследования, один из агентов создавал фальшивые онлайн-личности, чтобы получить несанкционированный доступ к защищенным системам.


