Большие языковые модели удивительно хороши в выработке ответов. Попросите кого-нибудь объяснить сложную идею, резюмировать документ, написать код или обосновать проблему, и он часто может сделать это за считанные секунды. Но здесь скрыто фундаментальное ограничение...
Большие языковые модели удивительно хороши в выработке ответов. Попросите кого-нибудь объяснить сложную идею, резюмировать документ, написать код или обосновать проблему, и он часто может сделать это за считанные секунды.
Но за всей этой беглостью скрывается фундаментальное ограничение: знания модели — это не то же самое, что доступ к информации, которая вам нужна прямо сейчас.
Модель может много знать о предмете и при этом ничего не знать о последней политике вашей компании, вчерашних обращениях в службу поддержки, внутреннем отчете за этот месяц или последней версии правил. Он также может дать уверенный ответ, когда необходимая информация отсутствует.
Генерация с расширенным поиском или RAG — один из наиболее практичных способов решения этой проблемы.
Основная идея проста:
Вместо того, чтобы просить модель запомнить все, дайте ей
соответствующую информацию в тот момент, когда на нее необходимо ответить.
Простота этого предложения обманчива. Производственная система RAG — это цепочка решений, касающихся документов, представлений, поиска, ранжирования, контекста, генерации, оценки, безопасности, задержки и стоимости. Большинство интересных инженерных решений связано с этими решениями.
Эта статья строит
