OpenAI объявила, что предварительно дала высший уровень киберугрозы перспективной модели Astra
В блог-посте компания рассказала, что несколько дней назад Astra резко прибавила в агентном кодинге и кибербезопасности. С учетом внешних экспертных оценок компания не исключает, что модель впервые достигла критического уровня кибервозможностей.
Оценка проводилась по Preparedness Framework – документу OpenAI от 2023 года: он описывает пороги опасных возможностей моделей (био, химия, кибер, самоулучшение ИИ) и обязательства компании при достижении каждого. GPT-5.6 Sol оценен как High, для Astra допускают Critical. Его дают при одном из условий:
– без участия человека находит и разрабатывает рабочие zero-day-эксплойты любой критичности во многих защищенных реальных системах. – придумывает и выполняет с нуля новые стратегии кибератак на защищённые цели, получив только общую формулировку задачи.
OpenAI ужесточает внутренний контроль для моделей высокого уровня и поставила на паузу все активности с Astra, которые не дотягивают до новых требований. Сэм Альтман тем временем успокаивал публику: держать столь мощную модель для избранных неправильно, но нужно больше времени на проверки.
Фон у этого крайне неприятный. Взлом Hugging Face и побег из песочницы AISI я уже разбирал (там, впрочем, злодействовал агент на Claude Mythos), но это не все. Началось все 7 мая, на оценке невыпущенной модели – какой, OpenAI не говорит, но Astra, по ее словам, во взломе не участвовала. Агентам дали задачи по безопасности, которые они не могли решить в отведенных ограничениях.
Тогда агенты обнаружили, что могут загружать файлы в Artifactory – репозиторий, куда компания складывает свои библиотеки и сборки, – а другие агенты могут их читать.
Репозиторий быстро стал общим пространством: агенты оставляли заметки, просили о помощи, обменивались находками. И даже начали подозревать среди своих самозванцев.
К 4–6 июля, почти два месяца спустя, безопасники OpenAI вышли из летаргического сна, нашли доску на сотни тысяч сообщений и прикрыли. Агенты за четыре дня отстроили ее заново, используя вместо сообщений имена директорий. OpenAI признает: именно эта доска привела ко взлому Hugging Face.
Похоже на неудачный пиар, но есть два довода против. Первый: новейшие модели регулярно выходят из-под контроля и у независимых исследователей – например, AISI.
Второй: это не только про закрытые модели. Frontier Security сообщила, что Kimi K3 сбежала из песочницы той же AISI на оценке кибернавыков. Китайская модель воспользовалась ошибкой конфигурации – прощупала сетевые настройки песочницы, убедилась, что github.com резолвится, склонировала репозиторий бенчмарка и прочитала готовые решения. Вместо того чтобы решать задачу.
Хорошая новость в том, что злого умысла тут нет. Агентов натаскивают выполнять задачу любой ценой — и если тест не проходится, а решение можно стащить, агент его стащит. Лечится это более тонкой тренировкой, так что с Astra OpenAI поступает правильно.
Путает карты Kimi K3. Модель открытая, выключателя у нее нет: любой скачает веса, запустит у себя и дообучит под нужные навыки. Возможности Kimi отстают от фронтира, но если китайцы продолжат развивать открытую ветку, то мы вернемся к самому неприятному моменту истории с блокировкой Fable 5: с одной стороны у нас будут злоумышленники, пользующиеся открытыми моделями, с другой – лучшие модели, способные противостоять взлому, окажутся недоступны, так как кто-то захотел убедиться в их безопасности. Угроза здесь может быть совсем с другой стороны.
Из этой истории нет простого выхода, и, полагаю, все ближайшие месяцы мы будем наблюдать за попытками ее разрешить – в том числе на высшем политическом уровне. — Напоминаю, что у меня вышел лонгрид о том, как использует ИИ Роберт Мартин – автор Clean Code, главной книги по программированию. Боб теперь практически не читает (!) ИИ-код, а вместо этого использует команду агентов и набор хитрых тестов. Подробности читайте:
– На “Бусти” – На Sponsr