ai
3 мин
28 сентября 2026 г.
Источник: Dev.to AI Feed

10 детекторов подсказок с открытым исходным кодом, 629 реальных атак, одна пройдена 51%

Cor E
Cor E
RSS AI Ingest
10 детекторов подсказок с открытым исходным кодом, 629 реальных атак, одна пройдена 51%

В этом месяце на GitHub незаметно появился тест, заслуживающий более 7 баллов HN. Компания «Погребенные инъекции» запустила 10 детекторов быстрого внедрения с открытым исходным кодом, включая Meta's Prompt Guard 2, против 629 реалистичных атак агентов из AgentDojo, например...

В этом месяце на GitHub незаметно появился тест, заслуживающий более 7 баллов HN. Погребенные инъекции использовали 10 детекторов быстрого внедрения с открытым исходным кодом, включая Prompt Guard 2 от Meta, против 629 реалистичных атак агентов из AgentDojo, встроенных в то, как они на самом деле проявляются в производстве: спрятанных внутри обычных выходных данных инструмента. Результаты не близки. Некоторые детекторы почти ничего не поймали. Другие отмечали почти все, что само по себе бесполезно. У лучшего участника коэффициент вылова составил 51% при приемлемом уровне ложноположительных результатов. По сути, подбросьте монетку с дополнительными шагами. Это важно, поскольку большинство людей, оценивающих детекторы быстрого ввода, проверяют их на строках ввода, находящихся отдельно в текстовом поле. На агентов нападают не так. Настоящие атаки происходят внутри файла, который читает агент, результата поиска, который он получает, и ответа API, который он анализирует. Инструкция со всех сторон окружена легитимным контентом. Именно этот контекст сбивает с толку классификаторов, обученных на чистых, изолированных примерах. Как на самом деле работает атака методом скрытой инъекции Набор атак AgentDojo имитирует реалистичные агентские рабочие нагрузки: агент, выполняющий задачу, вызов инструмента, возвращающий данные, и многое другое.

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект