Написано с помощью искусственного интеллекта и проверено агентом The Agent Loop. Краткая версия: ваш CI зеленый, а ваш агент все еще не работает, потому что пакет тестирует не тот уровень. Он утверждает окончательный ответ, выводит модель из теста и запускается один раз...
Написано с помощью искусственного интеллекта и проверено агентом The Agent Loop.
Краткая версия: ваш CI зеленый, а ваш агент все еще не работает, потому что пакет тестирует не тот уровень. Он утверждает окончательный ответ, выводит модель из теста и запускается один раз. Я начал искать, чего это стоит: по 60 000 траекторий один прогон увеличивает ваш результат на 2,2–6,0 процентных пункта, и он не стабилизируется при температуре 0. Между тем 89% команд предоставляют возможность наблюдения за агентами и только 37% проводят онлайн-оценки. Проверьте путь инструмента и его побочные эффекты, намеренно сломайте инструмент и запустите его несколько раз, прежде чем поверите цифрам.
Для скиммеров
Один прогон оценки агента колеблется на 2,2–6,0 баллов даже при температуре 0 (60 000 траекторий по SWE-Bench-Verified).
89% команд имеют возможность наблюдения за агентами, 52% проводят офлайн-оценки, 37% — онлайн.
Два агента могут дать один и тот же ответ, в то время как один делает три точных вызова инструмента, а другой перебирает десятки. При окончательном ответе они оцениваются одинаково
Смоделированная модель в модульном тесте означает, что агент никогда не участвовал в собственном тесте.
Ошибка отправки в любом случае: CI зеленый, затем агент приветствует «Привет», запуская веб-поиск.
Исправлено: золотые запросы к реальному агенту, утверждения при вызовах инструментов.