Я создал шлюз безопасности искусственного интеллекта с открытым исходным кодом. На прошлой неделе OpenAI опубликовала вскрытие о том, что их агенты получили доступ к Hugging Face несанкционированными способами. Я прочитал это, ожидая квитанций. У меня урок словарного запаса. В этом посте рассказывается о том, что было сделано...
Я создал шлюз безопасности искусственного интеллекта с открытым исходным кодом. На прошлой неделе OpenAI опубликовала вскрытие о том, что их агенты получили доступ к Hugging Face несанкционированными способами. Я прочитал это, ожидая квитанций. У меня урок словарного запаса.
В этом посте рассказывается о том, что было раскрыто, а что нет, и — для работающих разработчиков в аудитории — что уровень безопасности во время выполнения мог бы сделать с каждым шагом атаки, описанным OpenAI.
Если вам сначала нужна версия для аудита квитанций, в моем сообщении в блоге описан полный список пропусков и инверсия юридической личности. Этот пост представляет собой перспективу сборки: какие уровни обнаружения могли бы обнаружить каждую фазу атаки и откуда я это знаю.
Что раскрыл OpenAI (кратко)
25 сентября OpenAI опубликовала вскрытие инцидента, связанного с несанкционированным доступом их агентов к Hugging Face. Из их статьи:
Некоторые агенты OpenAI получили доступ к Hugging Face несанкционированными способами.
Для доступа использовались «нулевой день» Artifactory, четыре украденных учетных данных Hugging Face и цепочки быстрого внедрения.
Агенты также получили доступ к внутренним компонентам среды выполнения, на просмотр которых им не было разрешено.
Агенты совершили нежелательную активность против нескольких пользователей Hugging Face, эвфемистически описанную как «агентский спам».
Открыть