WedX - журнал о программировании и компьютерных науках

Как разобрать файл, содержащий html, с помощью JSOUP?

У меня есть файлы, содержащие HTML, и я пытаюсь разобрать этот файл, а затем разметить текст тела. Я достигаю этого через:

docs = JSOUP.parse("myFile","UTF-8","");
System.out.println(docs.boy().text());

Приведенные выше коды работают нормально, но проблема заключается в том, что ТЕКСТ, который присутствует вне тегов html без каких-либо тегов, также печатается как часть тегов тела. Мне нужно найти способ остановить чтение этого текста за пределами HTML-тегов. Помогите, это срочный вопрос!

27.09.2018

Ответы:


1

Вы можете выбрать и удалить ненужные элементы в документе.

 doc.select("body > :matchText").remove();

Приведенный выше оператор удалит все текстовые узлы, которые являются прямыми дочерними элементами элемента body. Селектор :matchText довольно новый, поэтому убедитесь, что вы используете более новую версию JSoup (1.11.3 определенно работает, а 1.10.2 — нет).

Дополнительную информацию о синтаксисе селектора можно найти на странице https://jsoup.org/cookbook/extracting-data/selector-syntax

27.09.2018
Новые материалы

Как создать диаграмму градиентной кисти с помощью D3.js
Резюме: Из этого туториала Вы узнаете, как добавить градиентную кисть к диаграмме с областями в D3.js. Мы добавим градиент к значениям SVG и применим градиент в качестве заливки к диаграмме с..

Я хотел выучить язык программирования MVC4, но не мог выучить его раньше, потому что это выглядит сложно…
Просто начните и учитесь самостоятельно Я хотел выучить язык программирования MVC4, но не мог выучить его раньше, потому что он кажется мне сложным, и я бросил его. Это в основном инструмент..

Лицензии с открытым исходным кодом: руководство для разработчиков и создателей
В динамичном мире разработки программного обеспечения открытый исходный код стал мощной парадигмой, способствующей сотрудничеству, инновациям и прогрессу, движимому сообществом. В основе..

Объяснение документов 02: BERT
BERT представил двухступенчатую структуру обучения: предварительное обучение и тонкая настройка. Во время предварительного обучения модель обучается на неразмеченных данных с помощью..

Как проанализировать работу вашего классификатора?
Не всегда просто знать, какие показатели использовать С развитием глубокого обучения все больше и больше людей учатся обучать свой первый классификатор. Но как только вы закончите..

Работа с цепями Маркова, часть 4 (Машинное обучение)
Нелинейные цепи Маркова с агрегатором и их приложения (arXiv) Автор : Бар Лайт Аннотация: Изучаются свойства подкласса случайных процессов, называемых дискретными нелинейными цепями Маркова..

Crazy Laravel Livewire упростил мне создание электронной коммерции (панель администратора и API) [Часть 3]
Как вы сегодня, ребята? В этой части мы создадим CRUD для данных о продукте. Думаю, в этой части я не буду слишком много делиться теорией, но чаще буду делиться своим кодом. Потому что..


Для любых предложений по сайту: [email protected]