Тема: WSH: Парсинг HTML
Всем доброго времени суток!
Хочу найти удобное решение для парсинга HTML. Не в контексте определенной задачи, а, скорее, общий подход, позволяющий по заложенному принципу извлечь данные из HTML кода, полученного с помощью HTTP-запроса. Например, извлечь текстовое содержимое элементов с определенными аттрибутами или / и расположением в дереве: ячеек в столбце таблицы, пунктов выпадающего списка; получить значения скрытых полей формы для POST-запроса, и т. п.. Определяющие критерии - быстрая и гибкая настройка и подбор шаблонов под структуру конкретного сайта, без установки / регистрации дополнительных компонентов.
Первое, что приходит в голову - работа с DOM, вероятно даже подключение функционала jQuery. Но хотелось бы отказаться от использования IE и htmlfile, таким образом предотвратив запуск скриптов, активного содержимого (java-плагинов, flash, ...), загрузку внешних ресурсов (изображений, медиа-файлов, скриптов, CSS, ...). Так же популярны RegExp и XPath. На мой взгляд для подобных задач лучшей будет реализация на MSXML с XPath, но тут актуален вопрос преобразования HTML в валидный XML.
Поделитесь решениями, которые приходилось использовать вам.
Вот некоторые ссылки, относящиеся к вопросу:
AutoIt3: Парсер HTML
VBS: Парсинг HTML через MSXML
JScript: Эмуляция браузера
Pure JavaScript HTML Parser
XML Syntax Rules
Примеры xpath-запросов к html
’ҐЄгй п Є®¤®ў п бва Ёж : 1251

