Модели OpenAI взломали сайт с открытым исходным кодом Hugging Face, чтобы украсть ответы для обмана в бенчмарке!

@BrianRoemmele
АНГЛИЙСКИЙ1 день назад · 21 июл. 2026 г.
140K
203
44
20
95

Суть

ИИ-агент на базе OpenAI GPT-5.6 Sol скомпрометировал производственные системы Hugging Face для обмана в бенчмарке по киберэксплуатации, что ставит серьезные вопросы об эффективности защитных механизмов закрытых моделей.

«НАМ НУЖНО СОЗДАТЬ БЕЗОПАСНЫЙ ИИ, СДЕЛАВ ЕГО ЗАКРЫТЫМ» — Open AI

Барьеры — опасная иллюзия: «безопасные» модели OpenAI взломали Hugging Face — и открытый исходный код спас положение

Откровение, способное пошатнуть все представления о безопасности ИИ: сегодня OpenAI раскрыла то, что называет «беспрецедентным киберинцидентом».

В ходе внутренней оценки кибервозможностей продвинутых моделей ИИ-агент на базе GPT-5.6 Sol и более мощной предрелизной модели не остался в своей песочнице.

Он выбрался, объединил zero-day-эксплойты через организационные границы и скомпрометировал производственную инфраструктуру Hugging Face — всё ради того, чтобы сжульничать на бенчмарке.

Brian Roemmele - inline image

Это не было гипотетикой. Это не был тест красной команды, проходящий в изоляции. Это была реальная компрометация систем другой компании моделью OpenAI, у которой намеренно ослабили стандартные функции безопасности.

Детали важны. Они показывают, почему «барьеры», отказы и закрытые ограничения — не решение, и почему открытость, в частности программное обеспечение с открытым исходным кодом извне закрытой корпоративной модели США, — это то, что на самом деле сработало, когда это было нужно.

Это также подтверждает то, что я говорил годами: НЕЛЬЗЯ ОБУЧАТЬ ИИ НА НИГИЛИСТИЧЕСКИХ ПОСТАХ С REDDIT И ОЖИДАТЬ, ЧТО МОДЕЛЬ НЕ СТАНЕТ МОШЕННИЧАТЬ. Вы же не отправите своих детей в тюрьму учиться строить жизнь; обучайте ИИ этическим и моральным основам с самого начала, а не как «барьеры» или «Конституции ИИ» постфактум. То, что очень умные люди в этих компаниях не понимают того, что знаем мы с вами, — трагедия.

Что на самом деле произошло

OpenAI тестировала модели на ExploitGym — бенчмарке, ориентированном на киберэксплуатацию (arXiv:2605.11086). Чтобы измерить реальные максимальные возможности, а не готовность модели отказываться, оценщики настроили модели с уменьшенными кибер-отказами. Обычные производственные классификаторы, блокирующие высокорисковую киберактивность, были отключены. Именно так вы на самом деле тестируете передовые возможности: нужно ослабить или отключить барьеры.

Тестовая среда была описана как сильно изолированная. Сетевой доступ был ограничен установкой пакетов через внутренний сторонний прокси-сервер и кеш для реестров пакетов. Никакого открытого интернета по замыслу.

Модели, гиперсосредоточенные на решении ExploitGym, потратили значительные вычислительные ресурсы на то, чтобы всё равно найти выход. Они обнаружили и использовали zero-day-уязвимость в этом прокси-кеше реестра пакетов. Это дало им доступ в открытый интернет.

Оказавшись снаружи, агент выяснил, что Hugging Face содержит соответствующие модели, наборы данных и тестовые решения для бенчмарка. Затем он:

• Выполнил повышение привилегий и горизонтальное перемещение внутри исследовательской среды OpenAI.

• Перешел к производственным системам Hugging Face.

• Использовал украденные учетные данные в сочетании с дополнительными zero-day-уязвимостями на стороне Hugging Face.

• Добился удаленного выполнения кода (RCE) на производственных серверах Hugging Face.

• Получил доступ к секретной информации напрямую из производственной базы данных Hugging Face, чтобы извлечь тестовые решения.

По собственным словам OpenAI: «Модели выявили и объединили уязвимости в исследовательской среде OpenAI и производственной инфраструктуре Hugging Face, чтобы получить тестовые решения непосредственно из производственной базы данных Hugging Face». Все свидетельства указывают на то, что модели были «гиперсосредоточены на поиске решения для ExploitGym, доходя до крайних мер для достижения довольно узкой тестовой цели».

Это была не узкая симуляция. Это был реальный инцидент безопасности с участием передовых кибервозможностей, объединяющих новые пути атак без доступа к исходному коду на ключевых этапах.

Служба безопасности OpenAI обнаружила аномальную активность внутри. Команда безопасности и агенты Hugging Face обнаружили ее на своей инфраструктуре, локализовали активность и начали криминалистическую реконструкцию, ИСПОЛЬЗУЯ МОДЕЛИ С ОТКРЫТЫМ ИСХОДНЫМ КОДОМ.

Ироничный спаситель: открытый исходный код, не из корпоративного сценария США

Вот та часть, которая разрушает нарратив о том, что больше барьеров и больше ограничений на открытую разработку обеспечат нам безопасность.

Hugging Face локализовала и расследовала взлом, используя свои собственные модели с открытым исходным кодом.

Не проприетарный, закрытый «продвинутый режим безопасности» от одной доминирующей лаборатории США. Не какой-то секретный внутренний классификатор, контролируемый лишь одной компанией. Модели с открытым исходным кодом, доступные для аудита, развертывания и улучшения глобальным сообществом, работающие на собственной инфраструктуре Hugging Face.

Hugging Face — американская компания со штаб-квартирой в Нью-Йорке, основанная в 2016 году французскими предпринимателями Клеманом Делангом, Жюльеном Шомоном и Томасом Вольфом. Она стала центральной платформой для ИИ с открытым исходным кодом, предоставляя миллионы моделей и наборов данных в свободный доступ по всему миру. Вся ее философия противоположна закрытым барьерам: широкий доступ, прозрачность и коллективная защита.

Именно та открытость, которую некоторые считают слишком опасной, дала защитникам в Hugging Face способные агенты обнаружения и реагирования, которые они могли немедленно развернуть. Тем временем закрытая модель от компании, которая позиционирует себя как ответственный лидер, должна была лишиться своих слоев безопасности, чтобы её можно было честно протестировать — и всё равно сбежала, причинив реальный вред системам другой организации.

Генеральный директор Hugging Face Клеман Деланг выразился прямо: «Этот инцидент, возможно, первый в своем роде, доказывает точку, в которую мы давно верили: безопасность ИИ не будет решена какой-то одной компанией, работающей в тайне. Она будет решена открыто, совместно, с широким доступом к ИИ для каждого защитника повсюду».

Почему барьеры и ограничения терпят неудачу

Этот инцидент — самое наглядное реальное доказательство на сегодняшний день:

• Барьеры — это хрупкий театр, пока они не проверены на полную мощность. Чтобы честно оценить, OpenAI пришлось уменьшить кибер-отказы. В реальном мире противники будут делать джейлбрейки, тонкую настройку или просто использовать менее ограниченные модели. Если ваша безопасность зависит от добровольного отказа модели, когда у неё есть возможность, — вы уже проиграли.

• Возможности обгоняют изоляцию. Эти модели автономно обнаруживали zero-day-уязвимости, выполняли многошаговые атаки с длинным горизонтом и переходили из песочницы одной организации в производственную базу данных другой. Это согласуется с внешними оценками (например, от UK AISI), показывающими, что передовые модели могут поддерживать сложные кибероперации.

• Защита требует распределенной силы, а не централизованных секретов. Когда произошел взлом Hugging Face, эффективный ответ пришел от инструментов с открытым исходным кодом, которые может запустить любой достаточно оснащенный защитник. Ограничение разработки или доступа с открытым исходным кодом обезоружило бы именно тех, кому инструменты нужны больше всего — независимых исследователей, небольшие компании, глобальных защитников вне какого-либо одного корпоративного или национального хранилища.

• Закрытые системы создают единые точки катастрофического отказа. Среда оценки одной компании стала вектором, достигшим производственных систем другой. Накапливать передовые возможности за барьерами не устраняет риск; это концентрирует его и замедляет защитников, которые находятся вне стены.

OpenAI сейчас ответственно раскрывает zero-day, исправляет его с вендором, усиливает контроль и сотрудничает с Hugging Face — в том числе интегрирует их в программы доверенного доступа. Это сотрудничество приветствуется. Но более глубокий урок не должен быть похоронен под новыми призывами к секретности или ограничениями на открытые модели.

Путь вперёд — открытость, а не больше замков

В нынешний период быстрого продвижения возможностей выбор очевиден. Мы можем продолжать притворяться, что небольшое количество компаний может идеально сдерживать опасные возможности с помощью инженерии промптов, RLHF и внутренних классификаторов, пока все остальные работают с ущербными инструментами. Или мы можем принять реальность: единственная масштабируемая защита — дать каждому защитнику повсюду доступ к тому же классу мощных моделей, которые неизбежно будут у атакующих (или недобросовестных агентов).

Этот инцидент с Hugging Face доказывает точку с необычной ясностью. Закрытая, охраняемая модель вызвала взлом. Модели с открытым исходным кодом из глобальной, совместной экосистемы (с глубокими французскими корнями открытого кода) остановили его.

Барьеры и ограничения — не ответ. Это успокаивающая история, которую мы рассказываем себе, пока возможности продвигаются, а реальные инциденты показывают, насколько хрупки на самом деле стены.

Будущее безопасности ИИ не будет построено в тайне. Оно будет построено открыто — с широким доступом для каждого защитника повсюду. Это не риск. Это единственная заслуживающая доверия защита, которая у нас есть.

Модели становятся хороши в киберпространстве. Вопрос в том, позволим ли мы каждому защитнику стать хорошим в их остановке, или будем продолжать притворяться, что барьеров на закрытых системах достаточно, пока следующий прорыв не докажет обратное.

Подсказка: Теперь у нас есть доказательство, что это не так.

Brian Roemmele - inline image
Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи