Использование wget параллельно, поскольку он не многопоточный
Мне нужно скачать около 1 млн веб-страниц. У меня есть их прямые URL-адреса (в базе данных, но я могу разместить их где угодно в любом виде хранилища, базы данных или файла). Я про...
Подборка 68 вопросов с тегом «web-crawler» на WikiRoot: ответы IT-специалистов по Windows, Linux, Excel, сетям и программированию.
68 вопросов
Мне нужно скачать около 1 млн веб-страниц. У меня есть их прямые URL-адреса (в базе данных, но я могу разместить их где угодно в любом виде хранилища, базы данных или файла). Я про...
Я ищу программное обеспечение или расширение для браузера (лучше с Chrome), которое может сохранять все просмотренные мной веб-страницы автоматически на локальном компьютере. Наско...
Ответ: Вы правы в том, что основной метод обнаружения страниц (например, Google) - это просмотр ссылок. Однако есть и другие способы поиска сайтов. Например, у Google есть свои собственны...
Ответ: У меня нет опыта работы с этим проектом, но, покинув, я нашел такой, который называется Scrapy . Он написан на Python и обсуждается в нескольких местах, например: на StackOverflow...
Я хочу рекурсивно загрузить веб-сайт, который стоит за Google Auth. Я нашел много ссылок в магазине Chrome, которые позволяют мне загрузить открытую в данный момент веб-страницу, н...
Я планирую запускать бот во многих отдельных параллельных экземплярах и хотел бы сохранить использование памяти на минимальном уровне. Боту нужен только функциональный JS и загрузк...
Ответ: Я бы попробовал их интерфейс REST, см. Сервис RESTful : Отправка работы из командной строки curl -i -X POST -d \ '{"email": "john@doe.com", "dynamic": "True", "name": "some project...
Ответ: На данный момент я знаю только телемарафон, который может выполнять эту работу https://github.com/LonamiWebs/Telethon
Я пытаюсь настроить go-selenium, чтобы использовать его для тестирования веб-страниц. Я следовал инструкциям и завершил установку всех зависимостей, необходимых для веб-драйвера se...
Ответ: Если вы используете Chrome, вы можете нажать, F12чтобы вызвать инструменты разработчика, а затем запустить следующий небольшой фрагмент в консоли, чтобы написать список ссылок: $("...
Ответ: Сервис AWS, который лучше всего подходит для этой работы, - это WAF, брандмауэр веб-приложений. Из раздела Автоматизация безопасности их документации: Боты и скребки: операторы общ...
Ответ: Первоначально я собирался предложить wgetв качестве решения, но после дальнейших исследований я заметил несколько вещей: PDF-файлы не хранятся на http://www.allitebooks.com (вместо...
Я пытаюсь запустить сканирование своего веб-сайта с помощью Vega, но после того, как сканер отправил пару запросов, мой IP-адрес блокируется на 30 минут. Это не ошибка fail2ban (ко...
Ответ: Вы можете использовать, wgetчтобы рекурсивно загрузить весь сайт: wget --recursive --page-requisites --html-extension --no-parent --domains www.fda.gov www.fda.gov Затем вы можете...
Ответ: Если я хорошо помню, есть link:команда, которую вы можете написать на странице Google [ 1 ] : link: www.yoursite/path/to/yourfile.pdf Ссылается [ 2 ], что с info: siteвами можно по...
Я ищу способ автоматизировать извлечение текста из нескольких веб-сайтов в текстовый документ. При вставке в слово doc мне нужно его вставить, используя «форматирование слиянием»....
Ответ: У вас есть разные варианты для разных IP-адресов. Обычно вам нужно использовать какой-нибудь прокси, я обычно рекомендую выбрать хороший VPN, который позволит вам легко переключать...
Ответ: как ни странно, ответ был как-то удален. вот ответ: wget -r -l2 http://docs.oasis-open.org/ubl/os-UBL-2.0/xsd или же wget -r -np http://docs.oasis-open.org/ubl/os-UBL-2.0/xsd см. h...
Ответ: Используйте wget: wget --mirror -p --html-extension --convert-links www.example.com варианты объяснили: -p get all images, etc. needed to display HTML page. --mirror turns on recur...
Ответ: If your problem is about redirecting requests from www.subdomain to subdomain.somedomain, you can simple use RewriteRule in Apache or similar implementations in other webservers. Y...
Ответ: Вы можете использовать powershell для загрузки файла, а затем использовать HTML-анализатор для извлечения текста. Команда powershell для загрузки веб-страницы: Invoke-WebRequest ht...
Я хочу сделать зеркало веб-сайта, но ограничить отслеживание только конкретными ссылками. Команда: wget --recursive --page-requisites --html-extension --convert-links --domains lin...
Ответ: To give specific recommendations we'd have to see your code. However, HTML parsing is a very difficult problem; be sure to use an existing parsing library and don't attempt to crea...
Ответ: Am I just seeing the aftereffects of other sites that used this IP address? Part of me believes you are seeing traffic based on the IP address’ previous use. Think of it as being n...
Мне нужно иметь доступ ко всем ссылкам, таким как: http://www.thewebsitename.com/random_alphanumeric_code1.asp http://www.thewebsitename.com/random_alphanumeric_code2.asp и т. д. д...
Я ищу способ поиска определенного продукта на веб-сайте и извлечения данных из него, но без перехода непосредственно на этот веб-сайт, например, с локального веб-сайта, который зап...
Ответ: If you wanted to use code to do this you can do it in Perl using LWP::Simple or Mechanize modules. The following might have what you are after Find All Links from a web page using...
Ответ: Если вы работаете в Linux, я бы использовал страницу чтения Bash-скрипта с wget и анализировал ее, ища ссылки, а затем сканировал эти ссылки. Используйте Google для этого, есть мно...
Ответ: In this particular case I've ended up with the following bash script: #!/bin/bash DOWNLOAD="wget -m -p -E -np -k" SITE="http://homepage.tinet.ie/~themma" $DOWNLOAD $SITE/ $DOWNLOAD...
Ответ: The following might be considered: http://www.httrack.com - Allthough its built to download websites, but you can just generate a report with all link. http://scrapy.org/download/...
Ctrl+K или / — быстрый поиск Начните вводить запрос для поиска по сайту