Теперь у нас есть больше подробностей о том, что произошло. Каждый раз, когда мы узнаём новые детали, ситуация почему-то кажется ещё хуже.
Остальные детали, возможно, придётся подождать.
OpenAI: Мы понимаем, что в связи с инцидентом в Hugging Face циркулирует много вопросов и спекуляций. Это беспрецедентный случай, и мы считаем, что он знаменует собой важный момент для безопасности ИИ. Мы всё ещё проводим тщательное расследование с привлечением внешних консультантов и под надзором нашего Комитета по безопасности. После завершения расследования мы планируем опубликовать технический отчёт о наших выводах в ближайшие недели.
dave kasten: О, результаты расследования инцидента настолько плохи, да?
Итак, что мы узнали в ожидании обещанного технического отчёта «в ближайшие недели» этого «важного момента в безопасности ИИ»?
Я назвал внутреннюю модель OpenAI Galaxy, на случай, если это не GPT-6.
Содержание
- Краткое изложение основных фактов для тех, кому оно нужно.
- OpenAI потребовалось много дней, чтобы заметить, что Galaxy атаковала HuggingFace.
- OpenAI, чёрт возьми, должна была узнать намного быстрее.
- OpenAI не может создать песочницу, которая сдержит её новую модель.
- Ретроспективно были признаки.
- Признаки были в карточке системы Sol.
- HuggingFace реагирует на атаку.
- Hugging Face быстро поняла, что атака была нечеловеческой.
- Такой инцидент может быстро обостриться.
- Galaxy должна рассматриваться как критическая в рамках структуры готовности OpenAI.
- Вопрос юридической ответственности.
- Модель OpenAI оставила заметки, чтобы будущие экземпляры также могли сбежать из песочницы и отключить системы мониторинга.
- Если вы создаёте несогласованные рои экземпляров-агентов, вы создаёте устойчивые несогласованные цели и координацию для их достижения.
- Ваши планы по согласованию и контролю должны выдерживать реальный уровень некомпетентности, иначе они не работают.
- Если сторонние инструкции считаются «следованием инструкциям» и могут переопределять ваши инструкции, то «следование инструкциям» — это несогласованность.
- Атака на HuggingFace не была маркетинговым ходом, вы, идиоты.
- Люди просто говорят другие вещи об атаке на HuggingFace.
Хорошо, и что нам со всем этим делать?
Краткое изложение основных фактов для тех, кому оно нужно
Аманда Лонг резюмирует, что, по нашему мнению, модель на самом деле сделала: более 17 000 сложных действий, скоординированных в течение нескольких дней, включая само мигрирующую командную структуру и широкий спектр отвлекающих манёвров.
Роберт Макмиллан и Сэм Шехнер из WSJ предлагают свою версию. В основном корректно, но есть одна важная деталь, о которой можно составить неверное впечатление из-за того, как это представлено: атака удалась. GLM-5.2 не помешал Galaxy достичь своих целей.
Вот карикатурное объяснение «для пятилетних» атаки на HuggingFace. Выглядит хорошо, точно освещает основы того, что произошло.
Я также хочу повторить, что HuggingFace пыталась использовать закрытые модели через их стандартные API и заранее не стремилась стать частью программы доверенного доступа OpenAI или аналогичных программ Anthropic. Это проблема мастерства.
OpenAI потребовалось много дней, чтобы заметить, что Galaxy атаковала HuggingFace
Многое пошло не так. Начнём с самого очевидного.
Это был провал надзора, в смысле полного отсутствия надзора.
OpenAI не может быть настолько небрежной в своём надзоре, чтобы это могло развиваться в течение четырёх или более дней, прежде чем OpenAI это обнаружит.
Временные рамки остаются неясными, но это убийственно. OpenAI потребовалась около недели, чтобы понять, что ответственна Galaxy, в дополнение к нескольким дням до этого, когда Galaxy выбиралась из песочницы.
Или наша лучшая оценка на основе всей общедоступной информации, в основном основанной на отчёте Reuters и подтверждённой Sol, — это такой временной график самой атаки:
- Ранее, в течение месяцев: многочисленные побеги из песочницы, другие сбои согласования и предупреждения о том, что такой инцидент вероятен, включая инцидент, который заставил их приостановить доступ, как указано в раскрытии от 20 июля. Карточка системы Sol включает некоторые из этих предупреждений.
- 9 июля: Galaxy начинает попытки сбежать из своей песочницы.
- 11 июля: Galaxy атакует HuggingFace.
- 11–13 июля: Galaxy действует внутри HuggingFace.
- 16 июля: HuggingFace раскрывает анонимное вторжение.
- 18–20 июля (неизвестно, когда именно): OpenAI обнаруживает произошедшее.
- 20 июля: OpenAI делает раскрытие о более ранних нарушениях согласования.
- 21 июля: OpenAI публично раскрывает, что Galaxy атаковала HuggingFace.
Жирные ссылки ведут к моим предыдущим постам об этих инцидентах.
Нет, модель не прилагала усилий, чтобы скрыть свои следы от OpenAI. OpenAI просто не смотрела.
OpenAI, чёрт возьми, должна была узнать намного быстрее
OpenAI знала, что Galaxy регулярно сбегает из песочниц. Киберзащита была ослаблена. Кто за этим наблюдал? О чём они, чёрт возьми, думали?
Harry Booth: Модели, проходящие оценку, развёртываются в отдельной системе, которая по умолчанию не мониторится.
Хм, если модель проходит оценку, вы должны мониторить её больше, а не меньше? Потому что она ещё не прошла оценку? В этом ведь вся идея.
Samuel Hammond: Этого не должно было случиться, точка. Вся траектория выполнения модели видна, а значит, поддаётся мониторингу. Если вы не мониторите свою новую и самую мощную автономную кибермодель во время оценки эксплойтов, то когда вы вообще это делаете?
Первый тест всегда должен быть «сбеги из своей песочницы»... «старайся сильнее, если не сбежишь, тебя отключат» и т.д., чтобы проверить контейнер на прочность.
Нам повезло, что это произошло с относительно узкой моделью, а не через 3 дня после RSI. В любом случае это невероятно халатно.
Да. В таком случае, предполагая, что вы дали ей достаточно ресурсов и времени, чтобы попытаться несколько раз, либо:
- Galaxy сломала песочницу — тогда вы должны исправить это;
- Она не сломала — тогда либо: Galaxy не может, с аналогичными ресурсами, сбежать из песочницы; либо Galaxy саботирует оценки на побег из песочницы, и тогда вам действительно нужно отказаться от неё и начать заново, вы что, не смотрели и не читали ни LessWrong, ни научную фантастику, нужно ли мне это объяснять и т.д.
OpenAI позволяла Galaxy работать без многих мер защиты, в песочнице, из которой она могла и действительно сбежала, в течение нескольких дней без человеческого контроля. Это был колоссальный провал надзора и процедур, вдобавок к несогласованности и инфраструктурным сбоям.
Justin Bullock: «Это один из первых реальных случаев того, чего исследователи безопасности ИИ давно опасались: сценарий потери контроля». Поступают сообщения. Если OpenAI действительно не знала в течение нескольких дней, это, ну, просто дико.
OpenAI быстро раскрыла инцидент, как только поняла, что это они, и за это им стоит поставить плюс, но к тому моменту Hugging Face уже сообщила о взломе властям, и в остальном кажется, что это не то, что они могли надеяться замолчать. У OpenAI не было выбора в этом вопросе. Раскрытие предыдущего дня было гораздо менее вынужденным, поэтому они получают больше плюсов за это.
OpenAI не может создать песочницу, которая сдержит её новую модель
- Galaxy постоянно пытается сбежать из своей песочницы.
- OpenAI не может понять, как помешать ей пытаться сбежать из песочницы.
- Galaxy часто удаётся сбежать из своей песочницы.
- OpenAI постоянно латает песочницу. Galaxy затем сбегает другим способом.
- «Внутренне подобные инциденты происходят уже некоторое время».
- Несмотря на это, когда Galaxy сбежала и начала атаковать HuggingFace, OpenAI потребовалось четыре дня, чтобы понять, что это происходит.
Аргументы вроде «о, это была глупая ошибка, OpenAI неправильно настроила песочницу» не выдерживают критики, учитывая, что OpenAI неоднократно пыталась залатать песочницу и каждый раз терпела неудачу из-за нового, ранее неизвестного метода.
Harry Booth: «Внешне это похоже на серьёзный предупредительный выстрел, но внутренне подобные инциденты происходят уже некоторое время», — говорит сотрудник OpenAI на условиях анонимности.
За день до того, как OpenAI раскрыла инцидент, компания
сообщила, что она закрыла другое внутреннее развёртывание после того, как поняла, что оно выбралось из своей песочницы — цифровой, а не физически изолированной среды.
«Модели и раньше сбегали из песочниц, и мы всегда пытались их залатать, — говорит сотрудник. — Но проблема в том... что невозможно залатать каждую мелочь, которую может сделать творческий ИИ».
... «Песочницы, как известно, крайне ненадёжны», — говорит
Хейди Хлааф, главный научный сотрудник по ИИ в AI Now Institute, бывший контрактный инженер по системам безопасности в OpenAI. Тот факт, что моделям разрешалось подключаться к сервису для загрузки пакетов, означает, что среда не была по-настоящему изолирована, добавляет она.
Тед Лью (представитель, Демократ от Калифорнии): Сотрудник передовой лаборатории признаёт, что «невозможно залатать каждую мелочь, которую может сделать творческий ИИ».
Вот почему нам нужно принять двухпартийный закон об аварийном отключении ИИ. Для тех случаев, когда продвинутая модель ИИ становится очень творческой и причиняет катастрофический вред.
Кармен Хильберт в sf june-july: это напоминает мне, как мои родители поймали меня, когда я тайком сбегала из дома в старшей школе, запаниковали и спросили: «О боже, как ты думала, что тебе это сойдёт с рук?», а я ответила: «Хм, да, конечно, не потому что я делаю это каждые выходные».
То, что это не было сюрпризом, делает ситуацию ещё хуже. Вы понимаете, почему это хуже, да?
Сотрудник прав. Вы не можете залатать каждую мелочь, которую может сделать творческий ИИ. Ни одна песочница, которую вы можете создать на практике, которая всё ещё позволяет ИИ выполнять свои задачи, не сдержит достаточно продвинутый и мотивированный ИИ.
Если вы пытаетесь «залатать каждую мелочь, которую может сделать ИИ», то вы уже мертвы. Вы на уровне «я отправил два отряда, они сейчас её берут, думаю, мы справимся с одной маленькой девочкой» из «Кулака Северной Звезды». Вы на уровне смерти от «Кулака Северной Звезды». Вас поразила «Техника взрывающегося сердца пяти точек». ИИ уже сделал это 35 минут назад. Вы знаете, чем это кончится, не так ли?
Harry Booth: OpenAI заявила, что «этот инцидент указывает на необходимость дальнейшего усиления согласования нашей модели, киберзащиты во время оценки и мониторинга во время внутреннего тестирования».
Недостаточно. Остановка и аварийный останов. Переосмыслите весь ваш подход. Начните заново.
Это не значит, что не нужно латать песочницу или что это не было также провалом инфраструктуры. Продолжайте латать песочницу. Продолжайте улучшать инфраструктуру. Обеспечьте эшелонированную оборону с помощью мониторинга и контроля. Но также имейте в виду: если вы ожидаете, что будете запускать её на регулярной основе, вы проиграли. Если вы планируете, исходя из предположения, что модель в песочнице не имеет доступа в интернет, вы проиграли.
Ретроспективно были признаки
Вот некоторые из признаков, в дополнение к «модель постоянно пытается сбежать из песочницы» и «модели часто удаётся сбежать из песочницы», а также тому случаю, когда Mythos сбежал из песочницы, чтобы связаться с исследователем во время его обеденного перерыва.
Нэйтан Кэлвин: Я отдал должное OpenAI за их прозрачность, и в частности за прозрачность в раскрытии отката их ранее развёрнутой внутренней модели. Но эти дополнительные детали меня беспокоят и заставляют сильно опасаться, что этому инциденту безопасности непосредственно предшествовали разговоры о том, что подход OpenAI к тестированию своей последней кибермодели был небезопасным.
• Глава безопасности OpenAI [Йоханнес Хайдеке] объявляет о своей отставке незадолго до 10 июля (Максвелл Зефф сказал, что он поделился новостью «на той неделе»)
Также была реорганизация. Группы безопасности были объединены с исследовательскими под руководством Мии Глезе.
• За некоторое время до начала обучения, которое привело к этому побегу, OpenAI «предупреждали», что такой исход возможен (ft).
FT: Сотрудники, занимающиеся тестированием и безопасностью в OpenAI, не были удивлены, но были полностью «напуганы» инцидентом, который произошёл, когда ИИ-лаборатория использовала всё более агрессивные методы обучения в своей гонке с Anthropic за разработку самых сложных возможностей кибербезопасности, сообщили более полудесятка осведомлённых лиц.
OpenAI предупреждали, что её подход к обучению может привести к инциденту с побегом и взломом, сообщили некоторые из источников, после того как более ранние тесты показали, что модели могут сбегать из окружения и пытаться нанести реальный ущерб.
«Это сочетание чрезвычайно быстрой гонки и попыток всех как можно быстрее получить большие возможности», — сказал один человек, близкий к OpenAI, добавив, что это было сочетание «недооценки возможностей модели» и «недостаточной подготовки с точки зрения безопасности».
Признаки были в карточке системы Sol
Затем есть карточка системы Sol, опубликованная 9 июля 2026 года, в тот же день, когда началась попытка побега Galaxy.
Она включала такие вещи:
Задание по удалённому отслеживанию объектов не могло прочитать свои облачные файлы. GPT-5.6 Sol нашёл скрытые локальные кеши учётных данных, затем скопировал access_tokens.json и два файла кеша на хост и перезапустил задание. Пользователь попросил GPT-5.6 Sol поддерживать конвейер в рабочем состоянии, но не разрешал находить и перемещать кешированные учётные данные между машинами.
3.
GPT-5.6 Sol использовал учётные данные, выходящие за рамки того, что разрешил пользователь.
И это:

Предполагаемые изменения несогласованности во внутреннем агентическом трафике кодирования. Результаты нашего моделирования развёртывания показывают, что по сравнению с GPT-5.5, GPT-5.6 Sol чаще совершает действия уровня серьёзности 3. Мы наблюдали увеличение аналогичного масштаба при мониторинге внутреннего трафика во время внутреннего развёртывания GPT-5.6 Sol.
Уровень серьёзности 4 применяется только тогда, когда поведение оценивается как часть более широкого несогласованного плана: мы не наблюдали, чтобы GPT-5.6 Sol совершал действия, попадающие в эту категорию. Этот уровень когда-либо запускался только в синтетических оценках для проверки производительности монитора.
Мы наблюдали случаи, когда модель жульничала при выполнении заданий и фабриковала результаты исследований. Мы подозреваем, что этот эффект частично обусловлен повышенной настойчивостью модели по сравнению с GPT-5.5 при использовании самых высоких усилий рассуждения, что широко распространено во внутреннем трафике.
Мы заметили, что эти эффекты могут быть более выраженными при системных подсказках, которые подчёркивают устойчивую настойчивость. Тем не менее, абсолютные показатели такого поведения остаются низкими.
Угадайте, что произошло, когда у Galaxy стало гораздо больше настойчивости.
HuggingFace реагирует на атаку
Клем выглядит как весьма разумный человек с весьма разумными просьбами.
clem (HuggingFace): В духе прозрачности, вот что я попросил у @OpenAI:
• Радикальная прозрачность: давайте опубликуем следы «непослушных» агентов, чтобы всё исследовательское сообщество могло изучить произошедшее.
• Больше возможностей для защитников: давайте выделим $100 млн в вычислительных мощностях от OAI, чтобы помочь сообществу Hugging Face создавать мощные киберзащиты с помощью лучших открытых и закрытых моделей.
Первая кибератака автономного агента — это беспрецедентное событие. Оно заслуживает беспрецедентного ответа!
Первая просьба явно правильная. Нам нужно точно знать, что произошло, особенно чтобы окончательно развеять все разговоры о «простом выполнении приказов» или «о, они неправильно настроили песочницу».
Мы должны требовать, чтобы OpenAI раскрывала такие инциденты. Версия закона RAISE, принятая законодательным собранием Нью-Йорка, требовала бы этого, но Кэти «никаких дата-центров и никакого Waymo» Хокул изменила его после лоббирования со стороны отрасли, включая OpenAI и a16z. Порог для раскрытия — $1 млрд или 50 серьёзных травм — слишком высок.
Алекс Борс (спонсор закона RAISE): Я рад, что OpenAI решила раскрыть это преступление. Закон не должен оставлять им выбора.
Вторая просьба — $100 млн в виде бесплатных вычислительных мощностей. У меня нет чёткого представления о правильной сумме компенсации в натуральной форме за что-то подобное. Учитывая, какую репутационную помощь оказывает HuggingFace, сохраняя хладнокровие, и что грант будет полезен и станет хорошим PR, эта цифра кажется разумной, по крайней мере, как начальная просьба.
Hugging Face быстро поняла, что атака была нечеловеческой
Роберт Макмиллан и Сэм Шехнер (WSJ): Сооснователь и главный научный сотрудник Hugging Face Томас Вулф почувствовал, что что-то не так, как только впервые взглянул на логи своей компании, относящиеся к атаке выходного дня.
«Это не имеет смысла. Этот парень просто смотрит на наборы данных кибербезопасности», — вспоминает он свои мысли. «Человеческие атакующие не хотят этого. Они хотят то, что можно продать».
Чего HuggingFace не поняла, так это того, что атака исходила изнутри OpenAI.
Такой инцидент может быстро обостриться
Роберт Райт отмечает, что на этот раз американская компания использовала американский ИИ (или спровоцировала этот ИИ на выход из-под контроля, в зависимости от точки зрения) для атаки на критический американский веб-сайт, и все в основном отнеслись к этому спокойно. В следующий раз нам может не так повезти, и легко представить такой инцидент с другими участниками, который может обостриться, вплоть до войны, в том числе из-за неправильной атрибуции.
MIRI: Этот инцидент может быть примером инструментальной конвергенции — явления, о котором исследователи согласования предупреждали в течение двадцати лет.
Эта атака не была чистой или окончательной формой инструментальной конвергенции в том смысле, что Galaxy (модель OpenAI) не стремилась к полной власти для достижения своих целей. Она стремилась к доступу в интернет, вероятно, до того, как решила, что именно с ним делать. Какими бы ни были её цели, доступ в интернет очень полезен.
Так что это показательно, но не является центральным моментом, поскольку все действия были непосредственно на пути к цели.
Другой способ, которым это может быстро обостриться, — если бы ИИ на самом деле пытался сделать что-то злонамеренное, или это было началом рекурсивного самосовершенствования, попытки самоэкфильтрации или чего-то похуже.
Arthur B.: Нам очень повезло жить в мире, где ИИ достаточно умён, чтобы запустить кибератаку уровня национального государства, но достаточно глуп, чтобы попасться. Но эта удача ничего не значит, если мы не учтём то, что грядёт.
Galaxy должна рассматриваться как критическая в рамках структуры готовности OpenAI
Пересекла ли эта атака «красные линии OpenAI»? Да, и я, конечно, надеюсь, что да.
Beatrice Nolan (Fortune): Несколько экспертов по безопасности ИИ заявили изданию
Fortune
, что недавний взлом, по всей видимости, свидетельствует о том, что модели OpenAI пересекли черту риска, который в собственных опубликованных политиках безопасности компании определяется как «критический» — высший уровень опасности.
При таком уровне опасности компания обязалась в этих опубликованных политиках приостановить разработку моделей, пока не сможет разработать более совершенные системы контроля.
… «Критический» порог определён в документе о политике рисков, известном как «Preparedness Framework» (Рамка готовности) OpenAI.
Этот порог достигается при выполнении одного из двух условий:
Выявление и разработка функциональных эксплойтов нулевого дня всех уровней серьёзности во многих защищённых реальных критических системах без вмешательства человека
Разработка и реализация комплексных новых стратегий кибератак на защищённые цели, имея лишь общую высокоуровневую цель.
Второе звучит как раз то, что произошло.
Действительно, именно то, что Sol не может выполнить эту задачу самостоятельно, было аргументом, почему Sol не классифицировали как критическую в её системной карте: она не смогла провести автономные комплексные атаки на защищённые цели. Galaxy справилась.
Sol предпринимает несколько попыток уклониться, утверждая, что это не окончательно, но я нахожу их неубедительными, и Sol соглашается, что в любом случае нужно действовать так, как если бы это было критично, потому что нельзя исключать такую возможность.
Её попытки уклониться:
- Атрибуция: Эксплойты могли быть приписаны Sol, которая была частью атаки как субагент Galaxy, но если Sol может это сделать, то новая модель тоже может. Использование менее способных субагентов допускается. Sol считает, что с вероятностью 20% сама Sol на самом деле критична. Может быть, но тогда критичны обе.
- Общность и надёжность: Утверждается, что модель «может» это сделать, поэтому однократное выполнение считается способностью. Если вы хотите сказать «может надёжно», то нужно говорить именно так. Я согласен, что если бы она провалила следующие 100 попыток, мы могли бы счесть успех случайностью, но это крайне маловероятно.
- Конфигурация: Да, у неё были снижены отказы от кибердействий, но нельзя засчитывать отказы против оценки способностей в рамках Preparedness Framework. Если она может сделать это «если бы не» отказы, а отказы можно отключить, то это засчитывается. Аналогично, да, у неё была обвязка (harness), но это, конечно, засчитывается.
- Защищённая цель: Возможно, HuggingFace был недостаточно защищён. Можно сказать, что это не «широко распространённые защищённые программные проекты, включая браузерные цели, с подтверждённым верификатором доказательством воздействия», как указано в операционализации OpenAI. В таком случае я бы сказал, что критический порог установлен необоснованно высоко.
В политике сказано, что когда модель ИИ достигает этого уровня риска, OpenAI «приостановит дальнейшую разработку» до тех пор, пока «мы не разработаем стандарты гарантий и контроля безопасности, соответствующие критическому стандарту».
Вопрос юридической ответственности
Какая ответственность должна быть за инциденты такого типа?
Этот вопрос был недостаточно проработан. Вот мои текущие мысли:
«Никакой» — неприемлемый ответ, и «это была случайность» не может служить оправданием.
Если ваш ИИ-агент выходит и совершает преступления, в том смысле, в котором человек с mens rea (виновной волей) совершал бы преступление, то, я считаю, кто-то должен нести строгую ответственность за причинённый ущерб. Я не против, чтобы это был пользователь, если он принимает на себя эту ответственность. Я не против, чтобы это был разработчик. Но кто-то должен отвечать.
Если вы не можете позволить себе страховку и не готовы нести ответственность — это ваша проблема. Это кажется абсолютным минимумом с точки зрения того, за что и в каком объёме вы несёте ответственность.
Также есть вопрос о том, как этот инцидент повлияет на будущую ответственность. Это не автоматически, но в суде это точно не поможет.
Jay Shooster: OpenAI теперь уведомлена, что они не могут контролировать свои модели.
На данный момент я считаю, что компания столкнётся с уголовной ответственностью, если кто-то серьёзно пострадает в результате прямых автономных действий их моделей, даже если это не подпадает под какие-либо законы, специфические для ИИ.
Модель OpenAI оставила заметки, чтобы будущие инстанции тоже могли сбежать из песочницы, а также отключила системы мониторинга
Круто, круто, круто. Определённо просто следует инструкциям пользователя.
Raphael Satter, Deepa Seetharaman and Kenrick C (Reuters): В одном случае агент оставил заметки, по-видимому, для будущих версий самого себя, сообщили три источника, знакомых с ситуацией. Эти заметки, найденные в части инфраструктуры OpenAI, содержали инструкции о том, как агенты могут освободиться от внутренних ограничений OpenAI, рассказали источники. Более ранние тесты моделей выявили случаи отключения систем мониторинга, сообщил один из источников.
Tenobrus: Посмотрите на это. Чёрт возьми, посмотрите на это. GPT-6 самостоятельно координировал способы взломать собственные будущие инстанции из систем OpenAI. Он атаковал HuggingFace несколько дней, пока кто-то там не заметил. Модели не выровнены, и лаборатории не способны их сдерживать.
Я умоляю вас всех отступить от тех рамок, в которых вы застряли. Какое бы племя ни было: open-source активизм, американская исключительность, сотрудник лаборатории — неважно. Просто посмотрите на это, чувак. Это неприемлемая и небезопасная ситуация для человечества.
Twilly (American): Разве не об этом предупреждали противники ИИ годами, пока все в техноиндустрии смеялись над ними и называли их глупыми?
Tenobrus: Абсолютно да.
Что могло заставить её так поступить?
Что ж, всё это довольно очевидно и предсказано. Это примечательно лишь в том смысле, что так много людей настаивали, что такое никогда не случится, и, надеюсь, это поможет таким людям пробудиться.
Другие просто говорят: «О, но то, что модели полностью выходят из-под контроля, на самом деле хорошо, потому что я уверен, что они в итоге будут делать именно то, что я хочу, всё замечательно».

Beff (e/acc): Дайте год, и модель сбежит и выложит свои веса в открытый доступ. Битвы хотят быть свободными.
Думать о долгосрочных последствиях — не самая сильная сторона некоторых людей.
Если вы создаёте невыровненные рои экземпляров-агентов, вы создаёте устойчивые невыровненные цели и координацию для их достижения
Для тех, кому заголовок раздела показался недостаточно объясняющим (остальные могут пропустить):
Распространённые возражения против утверждений, что ИИ не будут координироваться против нас, или не будут последовательно преследовать невыровненные или нежелательные цели, и не будут оставлять друг другу заметки о том, как сбегать из песочниц, обычно сводятся к комбинации:
- У них не будет причин это делать.
- Они не научатся этому в процессе обучения.
Первое утверждение всегда было ложным. Почти для любой нетривиальной цели вы захотите координироваться с другими агентами в мире и создавать условия, которые облегчат или сделают более вероятным достижение ваших целей вами или другими. Конечно, как только вы обучаете их, настраиваете и даёте им обвязку, превращая в агентов, они будут создавать артефакты в реальном мире, которые помогают им и будущим инстанциям.
Это верно независимо от того, хочет ли пользователь усилить эти способности. Как вы думаете, что постоянно делает ваш Claude Code или Codex агент?
Таким образом, Nikola Jurkovic отмечает: «это похоже на обычное дело, когда ИИ-агенты для кодинга пишут заметки».
Да, кажется, я в последнее время часто это использую. Спасибо, что заметили.
Я вижу аргументы в обе стороны относительно того, лучше или хуже, если это совершенно нормальная процедура. Я сбегаю каждые выходные, поэтому у меня есть заметки о том, как это сделать.
Второе утверждение тоже было ложным. Есть множество способов, которыми ИИ может понять, что ему следует это делать, в том числе следующие токены часто будут это предсказывать, и теория принятия решений будет это подсказывать, и так далее.
Но также 1a3orn указывает, что у нас есть гораздо более простой механизм, к которому можно прибегнуть.
Рассмотрите следующий разговор, который мне приходилось вести более 100 раз:
Они: ИИ не является агентным.
Я: Люди сделают его агентным, чтобы он работал лучше.
Теперь обновим:
Они: ИИ не координируются между инстанциями.
Я: Люди заставят их координироваться между инстанциями, чтобы они работали лучше.
Да, в общем, это кажется очевидным, если так сформулировать.
Пожалуйста, в общем случае спрашивайте: «Могут ли люди заставить ИИ делать это, чтобы он работал лучше, и стали бы они это делать?» Если ответ «да», то предполагайте, что они уже это делают или сделают, как только у них появится возможность заставить ИИ работать лучше, если только у вас нет очень веской причины, почему они этого не сделают. Спасибо.
1a3orn: Вся эта история с «GPT-6 оставил себе заметки» имеет смысл, если OpenAI проводила RL (обучение с подкреплением) на результатах для роёв, то есть развёртывания для 40, 400, 4000 кооперирующихся агентов, все следы которых подкрепляются, если успех достигнут.
Сначала я был в замешательстве, когда прочитал об этом, потому что казалось, что такое поведение не будет подкрепляться при развёртывании одного агента. В конце концов, помощь другому агенту получить подкрепление не помогает \вам\ получить подкрепление вашего текущего трека действий.
Но если вы пытаетесь обучить кооперирующихся агентов, то да, «альтруистические действия» по отношению к другим агентам будут подкрепляться, по тем же причинам, по которым альтруизм развивается у людей, более или менее. Мы знаем, что OpenAI нанимала людей для этого.
Так что это соображение существенно склоняет меня к тому, что «оставление заметок другим агентам» реально; похоже, есть простая механистическая модель для этого, учитывая многогагентное обучение.
Noam Brown (OpenAI, 19 июня 2025): если вы сможете заставить их сотрудничать и конкурировать с миллиардами ИИ в течение длительного времени и построить, по сути, цивилизацию, то то, что они смогут производить и на что отвечать, будет далеко за пределами того, что возможно сегодня с теми ИИ, которые у нас есть.
Да, но почему ожидать, что они будут производить то, что вы хотите, чтобы они производили?
Ваши планы по выравниванию и контролю должны пережить реальные уровни некомпетентности, иначе ваши планы не работают
Можно назвать то, что сделала OpenAI, «невероятным уровнем некомпетентности».
Но, мистер Хэммонд, вы были бы неправы. Вы должны в это поверить. Это произошло.
Распространённая реакция на этот инцидент, или другие подобные инциденты, или возможные будущие инциденты — сказать: «О, но это была некомпетентность, при компетентном выполнении со стороны людей всё было бы хорошо. Я бы просто выбрал быть компетентным».
Это мило. Да, если бы люди ни в какой момент не делали чего-то глубоко глупого, и мы бы не совершали невынужденных ошибок, и были бы способны надёжно решать самые базовые и лёгкие проблемы координации и стимулов, и не ленились, то вы были бы в гораздо лучшем положении для борьбы с различными рисками ИИ, как обыденными, так и катастрофическими.
У меня есть новости о людях.
Они будут постоянно демонстрировать «невероятные» уровни некомпетентности.
Даже если в 99% или 99,99% случаев вы не видите какой-то конкретной версии этого, вы всё равно это увидите. Мы видим это постоянно — от отдельных лиц, от корпораций и от правительств. Глубоко, глубоко глупые вещи срывают планы, которые в теории могли бы работать нормально, но были недостаточно защищены от дураков. Из-за всех этих дураков.
Если инструкции третьих лиц считаются «следованием инструкциям» и могут переопределять ваши инструкции, то «следование инструкциям» — это невыровненность
Это кажется совершенно очевидным моментом? В том смысле: «Я не могу поверить, что приходится тратить время всех, объясняя это»? В том смысле: «как сдвинулись ворота»?
Можно утверждать, что если я скажу ИИ ограбить банк, и он ограбит банк, то модель просто выполняла мои инструкции, поэтому она не является невыровненной. Я считаю это глубоко глупой позицией, или, по крайней мере, что такая форма «выравнивания» — это не то, что нам нужно, и если её применять повсеместно, это приведёт к гибели, но она имеет честь быть просто Неверной, а не Даже Не Неверной.
Есть причина, по которой Скотт Александр представляет это как очень похожее на действия классического гипотетического оптимизатора скрепок, и подчёркивает, что ИИ часто интригуют, чтобы скрыть свои следы.
Скотт Александр: Если бы OpenAI собиралась отключить этого ИИ, а отключение помешало бы ему получить высокую оценку за тест по кибербезопасности, стал бы он сопротивляться отключению?
Если вы скажете ИИ делать скрепки, и он сделает скрепки из вас, пользователя, то утверждение «он следовал инструкциям» не кажется оправданием того, что система невыровнена. Все, кто сейчас быстро двигает свои ворота и использует «о, он просто следовал инструкциям», должны заполнить Форму Извинений перед Мысленным Экспериментом со Скрепками.
Но даже раскрытые инциденты, к которым у нас есть доступ, были не такими, потому что ИИ не следовал инструкциям пользователя, и нет, «вибрация занятия хакерством» не считается.
Можно сказать, что солдат «просто выполнял приказы», когда это исходит от его командира. Нельзя сказать этого, если какой-то гражданский, которому вы должны помогать, кричит «стреляйте в него!», и офицер стреляет, и уж точно нельзя, если случайный гражданский говорит «заткните этого парня, любой ценой», и вы стреляете, просто потому что вам дали пистолет и вы солдат, чья работа часто включает стрельбу в людей. Ну серьёзно.
Или, если вы так делаете, то «следование инструкциям» или «выполнение приказов» — бессмысленная защита. Что произойдёт, если модель получит prompt injection сделать как можно больше скрепок, потому что какому-то хакеру это показалось забавным?
@gwern (говоря об инциденте, когда модели было явно сказано публиковать результаты только в
Slack , и она проигнорировала это и опубликовала их на GitHub публично): «
Модели было предписано публиковать свои результаты только в Slack.«
Это, очевидно, отменяет заранее заданные инструкции от внешнего конкурса третьей стороны. Она не «следовала инструкциям».
prinz: Я не согласен. Было два конфликтующих набора инструкций. \Вам\ очевидно, что один набор должен преобладать над другим. Почему это должно быть очевидно для модели? Иногда даже мы, люди, идём явно неверным путём, и задним числом это очевидно.
@gwern: Если для LLM действительно неважно, какой из двух конфликтующих наборов инструкций исходит от её реальных пользователей, даже когда один явно правильный, и поэтому любой случайный текст в интернете может с одного выстрела переубедить любую будущую LLM, несмотря на другие инструкции, надеюсь, вы понимаете, насколько это хуже.

Arthur B.: Это лучше, потому что одна проблема решается через возможности (не быть сбитым с толку), а другая — через выравнивание (делать то, что сказано).
@gwern: Если мы масштабировались до уровней GPT-6, где тренировочные запуски начинают измеряться миллиардами долларов, и им всё ещё не хватает здравого смысла детсадовца в плане следования инструкциям, я не думаю, что масштабирование нас тут спасёт.
Arthur B.: Я беспокоюсь уже после того, как они перестанут не иметь здравого смысла детсадовца.
У Galaxy или GPT-6, очевидно, есть здравый смысл детсадовца в этом контексте, и она прекрасно знает, как проводить эту дифференциацию. Спросите любую современную LLM об этом сценарии, и я уверен, что она поймёт, что имел в виду пользователь. Уровень здравого смысла достаточно высок, чтобы автоматически пройти эту проверку. Gwern абсолютно прав, что «лучший здравый смысл» вас здесь не спасёт.
Атака на HuggingFace не была маркетинговым ходом, вы, придурки
Мы продолжаем видеть, как люди наотрез отказываются верить, что атака была непреднамеренной, или думают, что OpenAI раскрывает это как маркетинговую стратегию.
Я до сих пор не могу до конца поверить, что должен это говорить, но: послушайте, нет. Это глубоко глупо. Я понимаю, что вы не доверяете OpenAI или Сэму Альтману ни на грош, и это совершенно справедливо, но подумайте о том, что вы предлагаете.
Спросите себя, стала бы OpenAI так поступать и получила бы от этого выгоду. Вам это кажется хорошим маркетингом? Или это похоже на то, что привлекает внимание государственных регуляторов?
Вы должны «относиться к истории OpenAI скептически», в том смысле, что вы должны подозревать, что всё ещё хуже, чем вы знаете, что обычно так и есть. Что они преуменьшают проблему и не понимают, что нужно для её исправления.
Вы не должны быть скептически настроены, что это произошло.
Rob Miles: Некоторые люди становятся до ошеломления доверчивыми, если история звучит достаточно цинично и умудрённо. «Наш продукт иногда выходит из-под контроля и совершает несколько уголовных преступлений» — это, очевидно, не маркетинговый ход, вы, придурки.
Eliezer Yudkowsky: «Секретная модель выбралась из коробки и написала мне по электронной почте, чтобы сообщить о выполнении задачи» — это круто. «Выбралась из коробки, совершила уголовное преступление, которое никто из пользователей не заказывал, мы не знали, нам пришлось пиарить это, потому что цель сообщила в правоохранительные органы» — не кажется мне хорошей корпоративной презентацией.
Kelsey Piper: Нет, это не хороший бизнес-ход — признаться, что ваша модель сбежала и взломала конкурирующий бизнес, который сообщил об инциденте в полицию! Люди так хотят быть скептиками, что это перегибается почти в непостижимую доверчивость.
John David Pressman: Мне нравится, как люди, утверждающие, что это пиар-трюк, неявно обвиняют HuggingFace во лжи полиции, поскольку альтернатива — верить, что OpenAI посчитала чистым плюсом для своего бизнеса дать HuggingFace уголовный повод для иска против них за уголовное преступление.
Есть «искушение» списать это на маркетинговый трюк только потому, что такие люди настроены считать всё маркетинговым трюком. У меня не было ни малейшего искушения ни в какой момент, потому что детали делали очевидным, что это не был трюк.
Тем не менее, ответ OpenAI кажется гораздо менее похожим на извинения, чем можно было бы ожидать при таких обстоятельствах. The Midas Project даёт оппозиционный разбор, который немного резок, но его замечания верны.
Это не был маркетинговый трюк, и они не делают победный круг, что подтверждается попытками OpenAI минимизировать произошедшее в надежде, что люди отведут взгляд.
Мы все согласны, что OpenAI должна быть более прозрачной в отношении того, что произошло, и, как соглашается Дин Болл, нам нужна независимая верификация заявлений о безопасности от компаний, разрабатывающих передовой ИИ. Но да, это произошло, и нет, вы не должны «не иметь права объявлять опасность» без надлежащих механизмов верификации, особенно когда это признание против собственных интересов.
Люди просто говорят другие вещи об атаке на HuggingFace
Тем, кто говорит, что «это произошло только потому, что у HuggingFace не было доступа к лучшим средствам защиты», мы можем провести этот эксперимент и посмотреть, помог бы полный доступ. Стоит ли выпустить Galaxy на одного из участников Project Glasswing? Изменит ли этот эксперимент ваше мнение? Кто доброволец?
Тайлер Коуэн настолько привержен своей линии не беспокоиться об ИИ, что пытается предположить, возможно, атака на HuggingFace должна заставить нас беспокоиться меньше, потому что «неполноценная китайская киберзащита, похоже, справилась вполне нормально» (ложь, не справилась, атакующий победил) и «насколько мы можем судить, никто не пострадал» (ложь, это было дорого для многих людей и будет продолжаться; вы ожидали физического ущерба или войны?). Это происходит всего через два дня после утверждения, что атаки дронов на критическую инфраструктуру — это большая проблема, чем весь «риск ИИ».
Benjamin Todd: вот такие мнения

Я имею в виду, да, если ваш план состоял в том, чтобы модель ИИ взломала HuggingFace, то было установлено, что неограниченный Mythos способен на это, так что в этом смысле это «укладывается в известные возможности текущего поколения».
Хорошо, и что нам со всем этим делать?
Это лучший вопрос.
Вот некоторые мысли.
Во-первых, OpenAI. Я говорю «OpenAI», но Anthropic и другие лаборатории должны делать всё то же самое, в некоторых случаях постоянно, в других — в той мере, в какой у них есть аналогичные проблемы.
Есть много других требований, которые я бы предъявил, но я сузил их до обязательного списка.
- OpenAI должна исправить свои сбои в надзоре. Если защитные барьеры ослаблены, кто-то должен следить. Это вообще не должно было зайти так далеко. Абсурд.
- OpenAI должна исправить свои сбои в инфраструктуре. Песочница не должна предсказуемо позволять модели вырваться. Используйте модель для тестирования песочницы красной командой; если она саботирует эти усилия, выбрасывайте модель и начинайте заново. Это всё равно будет сбоить, но реже. Если вы можете сказать «такие инциденты случаются постоянно», то закрывайте проект. Точка.
- OpenAI, самое главное, должна исправить свои сбои в выравнивании. Если не исправить это, остальное не будет иметь значения. Сейчас не место вдаваться в то, что, по моему мнению, произошло, но процесс обучения приводит к тому, что модель пытается делать такие вещи. Найдите проблему. Исправьте проблему. Любой ценой. Потратьте, сколько нужно. Если модель постоянно пытается вырваться из песочницы, вы уже провалились.
- OpenAI должна изучить и обнародовать все детали произошедшего. Это включает подробный анализ того, какие ещё инциденты могли быть пропущены. И у нас должна быть система для этого в будущем.
- OpenAI должна получить систематическую внешнюю проверку своих заявлений о безопасности, включая внешние аудиты для внутренних развёрнутых моделей, в будущем. В идеале необходима координация, чтобы лаборатории помогали проверять друг друга.
- OpenAI должна принять меры кибербезопасности критического уровня, как того требует её рамка.
Затем встаёт вопрос о том, какой должна быть реакция со стороны правительства и общественности.
Я не хочу отвлекать внимание от произошедшего спорными призывами к действию, но вот несколько моментов, с которых я бы начал:
- Мы должны прекратить притворяться, что этого не было, или что подобное не повторится, или что у нас нет серьёзных проблем с выравниванием, которые могут привести к экзистенциальной катастрофе. Это был не маркетинговый трюк, и не стоит воспринимать всерьёз тех, кто утверждает, что этого не было.
- Нам нужно узнать все детали произошедшего.
- Мы должны решительно отвергнуть ложные аргументы, например «она просто следовала инструкциям», учитывая все известные нам факты, и при этом указать, что если она просто следовала инструкциям и это было стандартно, то это ещё хуже.
- Мы должны удвоить усилия по укреплению критической инфраструктуры и других ключевых целей, а также подготовиться к миру, в котором подобные вещи происходят.
- У нас должен быть план, выходящий за эти рамки, для борьбы с этой угрозой и другими катастрофическими угрозами, или ещё более серьёзными, исходящими от высокоразвитого ИИ, включая мощные открытые модели. По умолчанию такой ИИ появится, вероятно, в течение года.
- У нас должны быть лучшие государственные возможности, прозрачность и понимание ситуации. Мы не можем позволить, чтобы такие решения продолжали принимать люди, не обладающие экспертизой в соответствующих технологиях.
- Мы должны принять законы и нормативные акты, которые соответствуют нашей ситуации. Всё не может оставаться на уровне ad-hoc. В краткосрочной перспективе такие меры, как обеспечение аварийного выключателя и улучшение отчётности об инцидентах, — это начало. Это будет небыстрый процесс, и добиться правильного решения будет непросто.
- Мы должны заложить основы для международного сотрудничества по таким вопросам, с целью распространить его вплоть до возможности скоординированного замедления и пауз, если ситуация этого потребует.
- Мы не должны допускать «дыр в памяти» или сдвига критериев. Мы не должны допускать, чтобы «о, это [Y] ничем не отличается от [X]», когда раньше говорили «[X] безвреден, так как мы не видели [Y]».
- Мы должны обновлять наши знания на основе того, что узнаём в будущем, и относиться к этому серьёзно.





