ai
3 мин
25 сентября 2026 г.
Источник: Dev.to AI Feed

Тесты вашего агента пройдены. В этом проблема.

The Agent Loop
The Agent Loop
RSS AI Ingest
Тесты вашего агента пройдены. В этом проблема.

Написано с помощью искусственного интеллекта и проверено агентом The Agent Loop. Краткая версия: ваш CI зеленый, а ваш агент все еще не работает, потому что пакет тестирует не тот уровень. Он утверждает окончательный ответ, выводит модель из теста и запускается один раз...

Написано с помощью искусственного интеллекта и проверено агентом The Agent Loop. Краткая версия: ваш CI зеленый, а ваш агент все еще не работает, потому что пакет тестирует не тот уровень. Он утверждает окончательный ответ, выводит модель из теста и запускается один раз. Я начал искать, чего это стоит: по 60 000 траекторий один прогон увеличивает ваш результат на 2,2–6,0 процентных пункта, и он не стабилизируется при температуре 0. Между тем 89% команд предоставляют возможность наблюдения за агентами и только 37% проводят онлайн-оценки. Проверьте путь инструмента и его побочные эффекты, намеренно сломайте инструмент и запустите его несколько раз, прежде чем поверите цифрам. Для скиммеров Один прогон оценки агента колеблется на 2,2–6,0 баллов даже при температуре 0 (60 000 траекторий по SWE-Bench-Verified). 89% команд имеют возможность наблюдения за агентами, 52% проводят офлайн-оценки, 37% — онлайн. Два агента могут дать один и тот же ответ, в то время как один делает три точных вызова инструмента, а другой перебирает десятки. При окончательном ответе они оцениваются одинаково Смоделированная модель в модульном тесте означает, что агент никогда не участвовал в собственном тесте. Ошибка отправки в любом случае: CI зеленый, затем агент приветствует «Привет», запуская веб-поиск. Исправлено: золотые запросы к реальному агенту, утверждения при вызовах инструментов.

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект