LangGraph выдвинулся вперед: тест на уровне кода трех агентских фреймворков для 107 задач по инженерии данных Большинство тестов игнорируют реальные узкие места Тесты для агентских фреймворков не соответствуют действительности. Большинство из них измеряют синтетическую точность или вишнёвую точность...
LangGraph выдвинулся вперед: тест на уровне кода трех агентских фреймворков для 107 задач по инженерии данных
Большинство тестов игнорируют реальные узкие места
Тесты для агентских фреймворков не соответствуют действительности. Большинство из них измеряют синтетическую точность или выбирают игрушечные конвейеры, игнорируя стоимость, бесшумные сбои и противоречия кода в масштабе конвейера. Запуск цикла чат-бота не является настоящей автоматизацией. Реальные рабочие процессы включают в себя организацию сложной, многоэтапной обработки данных, контроль задержек и предотвращение неконтролируемого расходования токенов. Сложность кода, частота скрытых сбоев и стоимость задачи имеют большее значение, чем прокси-метрики, которые рекламируются в большинстве обзоров. В этом тесте основное внимание уделяется показателю успешности решения реальных задач, полной экономике токенов, холодной и горячей задержке, а также разногласиям в коде, которые блокируют внедрение.
Мы протестировали 107 реальных рабочих процессов обработки данных, а не демонстраций
Никакого искусственного пуха. Набор тестов: 107 задач по инженерии данных — извлечение, преобразование, вывод схемы, обнаружение аномалий, соединение между исходными кодами, оркестровка конвейеров — взятые из реальных рабочих процессов (с отредактированными данными). Каждая задача выполнялась в идентичных облачных средах с использованием OpenAI GPT-4o в качестве серверной части LLM, при этом каждая среда была настроена на максимальный успех и минимальный отказ.
