Первоначально опубликовано в блоге EnConvert. Я Кристин, нетехнический соучредитель EnConvert. Я не пишу код. Что я делаю, так это разговариваю с инженерами, которые его используют, и в этих разговорах всплывает одна вещь, более интересная...
Первоначально опубликовано в блоге EnConvert.
Я Кристин, нетехнический соучредитель EnConvert. Я не пишу код. Что я делаю, так это разговариваю с инженерами, которые создают с его помощью, и в этих разговорах одна вещь возникает чаще, чем что-либо еще: уровень приема ломается раньше уровня извлечения, и веб-контент обычно находится там, где он начинается.
Это не глубокое инженерное погружение. Это именно то, что я узнал, проведя достаточное количество этих разговоров, чтобы увидеть закономерность.
Что на самом деле возвращает сырое извлечение
Наведите стандартный инструмент извлечения на страницу документации или сообщение в блоге. Содержимое находится там. Как и все остальное.
Текст навигационной ссылки в верхней части вывода. В футере снова те же ссылки. Содержимое боковой панели смешивается с телом, в котором его разместил DOM. Экранированные символы HTML, такие как & и встроенные в прозу. URL-адреса изображений CMS отображаются в виде ссылок, которые ничего не значат за пределами исходной страницы.
На страницах, отображаемых с помощью JavaScript, ситуация хуже. Статическая выборка часто возвращает оболочку страницы с элементами-заполнителями там, где должно быть содержимое. Фактический текст был введен фреймворком после загрузки. У вас получится скелет.
Ничего из этого не