В этом месяце на GitHub незаметно появился тест, заслуживающий более 7 баллов HN. Компания «Погребенные инъекции» запустила 10 детекторов быстрого внедрения с открытым исходным кодом, включая Meta's Prompt Guard 2, против 629 реалистичных атак агентов из AgentDojo, например...
В этом месяце на GitHub незаметно появился тест, заслуживающий более 7 баллов HN. Погребенные инъекции использовали 10 детекторов быстрого внедрения с открытым исходным кодом, включая Prompt Guard 2 от Meta, против 629 реалистичных атак агентов из AgentDojo, встроенных в то, как они на самом деле проявляются в производстве: спрятанных внутри обычных выходных данных инструмента.
Результаты не близки. Некоторые детекторы почти ничего не поймали. Другие отмечали почти все, что само по себе бесполезно. У лучшего участника коэффициент вылова составил 51% при приемлемом уровне ложноположительных результатов. По сути, подбросьте монетку с дополнительными шагами.
Это важно, поскольку большинство людей, оценивающих детекторы быстрого ввода, проверяют их на строках ввода, находящихся отдельно в текстовом поле. На агентов нападают не так. Настоящие атаки происходят внутри файла, который читает агент, результата поиска, который он получает, и ответа API, который он анализирует. Инструкция со всех сторон окружена легитимным контентом. Именно этот контекст сбивает с толку классификаторов, обученных на чистых, изолированных примерах.
Как на самом деле работает атака методом скрытой инъекции
Набор атак AgentDojo имитирует реалистичные агентские рабочие нагрузки: агент, выполняющий задачу, вызов инструмента, возвращающий данные, и многое другое.