Перейти к содержимому

Метка web-crawler

Подборка 68 вопросов с тегом «web-crawler» на WikiRoot: ответы IT-специалистов по Windows, Linux, Excel, сетям и программированию.

68 вопросов

0 голосов
0 ответов
500 просмотров

Использование wget параллельно, поскольку он не многопоточный

Мне нужно скачать около 1 млн веб-страниц. У меня есть их прямые URL-адреса (в базе данных, но я могу разместить их где угодно в любом виде хранилища, базы данных или файла). Я про...

1 голос
0 ответов
358 просмотров

Любое расширение или плагин Chrome может автоматически сохранять просмотренные веб-страницы?

Я ищу программное обеспечение или расширение для браузера (лучше с Chrome), которое может сохранять все просмотренные мной веб-страницы автоматически на локальном компьютере. Наско...

2 голоса
2 ответа
475 просмотров

Является ли сайт, который нигде не связан, полностью скрыт?

Ответ: Вы правы в том, что основной метод обнаружения страниц (например, Google) - это просмотр ссылок. Однако есть и другие способы поиска сайтов. Например, у Google есть свои собственны...

1 голос
1 ответ
404 просмотра

Как сканировать большой список URL?

Ответ: У меня нет опыта работы с этим проектом, но, покинув, я нашел такой, который называется Scrapy . Он написан на Python и обсуждается в нескольких местах, например: на StackOverflow...

1 голос
0 ответов
512 просмотров

Как загрузить сайт рекурсивно, который стоит за Google Auth?

Я хочу рекурсивно загрузить веб-сайт, который стоит за Google Auth. Я нашел много ссылок в магазине Chrome, которые позволяют мне загрузить открытую в данный момент веб-страницу, н...

0 голосов
0 ответов
589 просмотров

Минимальное использование памяти в безголовом Firefox?

Я планирую запускать бот во многих отдельных параллельных экземплярах и хотел бы сохранить использование памяти на минимальном уровне. Боту нужен только функциональный JS и загрузк...

0 голосов
0 ответов
950 просмотров

xauth: (argv): 1: не удалось запросить расширение безопасности на дисплее ": 0"

Я пытаюсь настроить go-selenium, чтобы использовать его для тестирования веб-страниц. Я следовал инструкциям и завершил установку всех зависимостей, необходимых для веб-драйвера se...

0 голосов
1 ответ
502 просмотра

Запишите URL в текстовый файл, который соответствует шаблону

Ответ: Если вы используете Chrome, вы можете нажать, F12чтобы вызвать инструменты разработчика, а затем запустить следующий небольшой фрагмент в консоли, чтобы написать список ссылок: $("...

-3 голоса
3 ответа
852 просмотра

Как внедрить механизмы противоскребания для моего сайта на Amazon S3?

Ответ: Сервис AWS, который лучше всего подходит для этой работы, - это WAF, брандмауэр веб-приложений. Из раздела Автоматизация безопасности их документации: Боты и скребки: операторы общ...

-1 голос
1 ответ
1 179 просмотров

Сканирование сайта для файлов

Ответ: Первоначально я собирался предложить wgetв качестве решения, но после дальнейших исследований я заметил несколько вещей: PDF-файлы не хранятся на http://www.allitebooks.com (вместо...

0 голосов
0 ответов
410 просмотров

Centos 7 - Apache запрещает мой сканер безопасности веб-приложений

Я пытаюсь запустить сканирование своего веб-сайта с помощью Vega, но после того, как сканер отправил пару запросов, мой IP-адрес блокируется на 30 минут. Это не ошибка fail2ban (ко...

1 голос
1 ответ
1 319 просмотров

Как найти страницы, которые ссылаются на конкретную страницу?

Ответ: Вы можете использовать, wgetчтобы рекурсивно загрузить весь сайт: wget --recursive --page-requisites --html-extension --no-parent --domains www.fda.gov www.fda.gov Затем вы можете...

3 голоса
1 ответ
525 просмотров

Поиск страниц на веб-странице, содержащей определенную ссылку

Ответ: Если я хорошо помню, есть link:команда, которую вы можете написать на странице Google [ 1 ] : link: www.yoursite/path/to/yourfile.pdf Ссылается [ 2 ], что с info: siteвами можно по...

1 голос
0 ответов
930 просмотров

Как извлечь текст с сайтов

Я ищу способ автоматизировать извлечение текста из нескольких веб-сайтов в текстовый документ. При вставке в слово doc мне нужно его вставить, используя «форматирование слиянием»....

2 голоса
1 ответ
1 448 просмотров

Как назначить разные IP при сканировании веб-страниц

Ответ: У вас есть разные варианты для разных IP-адресов. Обычно вам нужно использовать какой-нибудь прокси, я обычно рекомендую выбрать хороший VPN, который позволит вам легко переключать...

-3 голоса
2 ответа
1 209 просмотров

Как я могу очистить только данные слова с веб-сайта?

Ответ: Вы можете использовать powershell для загрузки файла, а затем использовать HTML-анализатор для извлечения текста. Команда powershell для загрузки веб-страницы: Invoke-WebRequest ht...

0 голосов
0 ответов
331 просмотр

импорт веб-скрапинга на локальный сайт

Я ищу способ поиска определенного продукта на веб-сайте и извлечения данных из него, но без перехода непосредственно на этот веб-сайт, например, с локального веб-сайта, который зап...

-1 голос
1 ответ
598 просмотров

Перечислите все ссылки одного сайта на другой сайт

Ответ: Если вы работаете в Linux, я бы использовал страницу чтения Bash-скрипта с wget и анализировал ее, ища ссылки, а затем сканировал эти ссылки. Используйте Google для этого, есть мно...

1 голос
1 ответ
1 164 просмотра

Зеркальное отображение веб-сайта, имеющего страницы, использующие простой JavaScript

Ответ: In this particular case I've ended up with the following bash script: #!/bin/bash DOWNLOAD="wget -m -p -E -np -k" SITE="http://homepage.tinet.ie/~themma" $DOWNLOAD $SITE/ $DOWNLOAD...