Все измеряют расходы на агентов ИИ. Этому почти никто не мешает. Я потратил две недели на выпуски GitHub, трекеры ошибок и темы Show HN, читая, что на самом деле произошло с людьми, и сбои стали гораздо более повторяющимися, чем я ожидал. Масштаб ель...
Все измеряют расходы на агентов ИИ. Этому почти никто не мешает. Я потратил две недели на выпуски GitHub, трекеры ошибок и темы Show HN, читая, что на самом деле произошло с людьми, и сбои стали гораздо более повторяющимися, чем я ожидал.
Прежде всего, масштаб, так что это не абстрактно. Один отчет: 416 вызовов API и 112 057 985 входных токенов за один сеанс. Девять из десяти сеансов этого пользователя завершились неудачей, а некоторые продолжали совершать звонки в течение 20–23 часов после момента сбоя. Приборные панели все время работали идеально.
Ошибка первая: ворота проходят, затем меняется вызов.
Проверка бюджета проводится по запрошенной вами модели. Затем резервный маршрутизатор или маршрутизатор отправляет запрос в другое развертывание, и оно выставляет счет. Из litellm #41344: «Ничто не проверяет бюджет развертывания, которое фактически выставляет счета». Проверка была правильной и неактуальной.
Ошибка вторая: все проверяют сразу.
Каждый из пяти субагентов читает оставшийся бюджет. Все пятеро видят запас высоты. Все пятеро продолжают путь. Каждая отдельная проверка пройдена, а общая сумма превышает потолок. В спецификации безопасности Cisco это сформулировано точно: «несколько агентов могут наблюдать за оставшимся бюджетом и начинать вызовы моделей до следующего опроса губернатора».
Этот нет