Редактор темы

A-parser 1.1 - продвинутый парсер поисковых систем, suggest, pr, dmoz, whois, etc

Автор темы
1.2.160 - поддержка SQLite, проверка доменов на клей, Parse all results в SE::Yahoo

c9cb9bbe0f1ac30338327b96c6661592.png

Улучшения
  • Добавлена поддержка SQLite в JavaScript парсерах и шаблонизаторе, пример использования здесь
  • Добавлена защита от случайного закрытия окна парсера
  • В
    d3d85ea18c77d74807b8601453e39f4d.png
    SE::Yahoo добавлены Parse all results и Parse related to level
  • 3b9fb03eb4f4143786a0dc9caefe363d.png
    SE::Yandex::TIC полностью переписан, добавлена возможность проверять домены на клей
  • В
    2c0383637068b22e731186a7df096302.png
    Rank::MegaIndex добавлена поддержка ReCaptcha2
  • Улучшен парсинг сниппетов в
    36a93bf3c271b453c8e1bd64eb24e8ab.png
    SE:: DuckDuckGo
  • Улучшен сбор почт в
    bc27f1afcdd2b1b94c895408cf2e5cda.png
    HTML::EmailExtractor
Исправления в связи с изменениями в выдаче
  • Обновлен алгоритм Bypass Cloudflare
  • 4afa5aa897af7c90e098b7389b40f8f0.png
    SE::Bing::Translator почти полностью переписан в связи с изменением логики работы переводчика Bing
  • Исправлена работа
    c44fcd191c8ec576166d3b9910d0abee.png
    SE::Seznam с некоторыми видами запросов
  • Исправлен парсинг related keywords, а также мобильной выдачи в
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern
  • Исправлен парсинг related keywords в
    5fca79e10d960fd4dc2fd8bff3c0b816.png
    SE::Bing
  • Исправлена работа
    b8c2e0e7588ced7760d7638025c9a19e.png
    SE::IxQuick при работе с русскоязычными запросами
  • ba8a0aa2aad3ed377d1b80651d16ffe4.png
    SE::Yandex:: Direct,
    3e6e0ed09b6b46f980f25a7da8c61661.png
    SE::Google::ByImage,
    8aa438b3f371f86f72942130cbb8562f.png
    SE::Yandex::WordStat
Исправления
  • Исправлена работа
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern на IPv6 прокси
  • Исправлена ошибка, из-за которой
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern собирал ссылки с пометкой опасных сайтов в общий массив ссылок
  • Исправлена работа с оператором поиска + в
    5fca79e10d960fd4dc2fd8bff3c0b816.png
    SE::Bing
  • Исправлен парсинг запросов со спецсимволами в
    36a93bf3c271b453c8e1bd64eb24e8ab.png
    SE:: DuckDuckGo
  • Исправлена работа
    dcf4756d2e9cd056233209a2feea80b2.png
    Rank::MajesticSEO
  • Исправлен баг с overrideOpts в JS парсерах
  • Исправлена работа с переменными при их создании в Parse custom results, а также при использовании нижнего подчеркивания в именах в Конструкторе результатов
  • Исправлена работа tools.js, баг появился в одной из предыдущих версий
  • Исправлен баг, из-за которого А-Парсер падал на некоторых ОС, появился в одной из предыдущих версий
 
Автор темы
Видео урок: Создание JS парсеров. Работа с CAPTCHA
Третье видео в цикле уроков по созданию JavaScript парсеров. Здесь рассказано о том, как написать JS парсер, в котором будет поддержка антигейта для разгадывания каптч на страницах.


В уроке рассмотрено:
  • Создание JS-парсера для разгадывания капчи
  • Работа с объектом this.captcha внутри JavaScript кода
  • Описание процесса разгадывания каптчи, реализованного в A-Parser

Статья и готовый парсер: Создание JS парсеров. Работа с CAPTCHA.

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Автор темы
Сборник рецептов #22: проверка индексации в нескольких ПС, многоуровневый парсинг и поиск сабдоменов

22-й сборник рецептов. В нем мы разберемся, как проверять индексацию всех страниц сайта одновременно в нескольких поисковиках, научимся парсить данные по ссылкам из выдачи одним заданием и будем искать сабдомены на сайтах. Поехали!

Получение страниц сайта и проверка индексации в Google и Яндекс

Данный пресет позволяет спарсить ссылки на все страницы сайта и одновременно проверить их на предмет индексации поисковиками (в примере Google и Яндекс, можно по аналогии добавить другие ПС). Готовый пресет и описание по ссылке выше.
6bf74eb19665f2f4b74b0890ef4bb642.png


Парсим title и description для TOP10 поисковой выдачи по ключевому слову

Пример использования tools.query.add в JavaScript парсерах. Данный парсер получает ссылки из выдачи, после чего собирает из каждой страницы title и description. И все это одним заданием с максимальной производительностью, благодаря многопоточному парсингу. Парсер с описанием доступны по ссылке выше.
059466a14042f8c44bd7ca819da60e78.png


Поиск сабдоменов сайта

Небольшой пример, который демонстрирует, как собрать поддомены одного или нескольких сайтов. Используется
2dd510ecee78478c2faa07ffd46d1649.png
HTML::LinkExtractor и Parse to level для прохода вглубь по страницам сайта. При этом Конструктором результатов извлекаются из внутренних ссылок домены и выводятся с уникализацией по строке. Готовый пресет - по ссылке выше.
1a212badc02d29c3b30c25457903f714.png


Кроме этого:
Еще больше различных рецептов в нашем Каталоге!
Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники рецептов:
 
Автор темы
Сборник статей #3: пагинация, переменные и БД SQLite

В этом сборнике статей мы рассмотрим все возможные варианты решения задачи прохода по пагинации на сайтах, очень детально изучим работу с переменными в JavaScript парсерах, а также попробуем работать с базами данных SQLite на примере парсера курсов валют. Поехали!

Обзор вариантов прохода по пагинации

В A-Parser существует несколько способов, с помощью которых можно реализовать проход по пагинации. В связи с их разнообразием, становится актуальным вопрос выбора нужного алгоритма, который позволит максимально эффективно переходить по страницам в процессе парсинга. В этой статье мы постараемся разобраться с каждым из способов максимально подробно. Также будут показаны реальные примеры и даны рекомендации по оптимизации многостраничного парсинга. Статья - по ссылке выше.
d0e09c69159c80698bee65301d25b814.png


Переменные в парсерах JavaScript

JS парсеры в А-Парсере появились уже около года назад. Благодаря им стало возможным решать очень сложные задачи по парсингу, реализовывая практически любую логику. В этой статье мы максимально подробно изучим работу с разными типами переменных, а также узнаем, как можно оптимизировать работу сложных парсеров. Все это - в статье по ссылке выше.
314a1b349bdf4432fea93e1a0a575160.png


Разработка JS парсера с сохранением результата в SQLite

Начиная с версии 1.2.152 в A-Parser появилась возможность работать с БД SQLite.
В данной статье мы рассмотрим разработку JavaScript парсера, который будет парсить курсы валют из сайта finance.i.ua и сохранять их в БД. В результате получится парсер, в котором продемонстрированы основные операции с базами данных. Подробности, а также готовый парсер - по ссылке выше.
b3de01dcac932aef7f568e0951f7f677.png



Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки 🙂 ) - отписывайтесь здесь.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники статей
 
Автор темы
1.2.185 - увеличение скорости в SE::Google::Modern, новые возможности Net:: DNS, множество улучшений

22a279c0ad173f97918e3ecec4927a61.png

Улучшения
  • 65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern - многократно увеличена скорость парсинга
  • Множество улучшений в
    1c97e715b6ba98075b8301154aaa2364.png
    Net:: DNS:
    • Возможность указать несколько DNS и задать метод выбора
    • Бан нерабочих/плохих DNS по специальному эвристическому алгоритму
    • Возможность вывести в результат использованный DNS сервер при удачном запросе
  • В
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern добавлена опция Use sessions
  • В
    8aa438b3f371f86f72942130cbb8562f.png
    SE::Yandex::WordStat добавлена настройка пресета антигейта для логина
  • Также в
    8aa438b3f371f86f72942130cbb8562f.png
    SE::Yandex::WordStat удалены настройки Use logins/Use sessions, теперь они включены всегда
  • Добавлена возможность автоматического удаления задания из Завершенных
  • В макросе подстановок {num} добавлена поддержка обратного отсчета
  • В JavaScript парсерах добавлена возможность сохранения произвольных данных в сессии
  • В JavaScript парсерах добавлена возможность прямого сохранения в файл
  • В API методе oneRequest/bulkRequest добавлена возможность указать configPreset
  • В связи с неактуальностью удалены парсеры SE::Google::Mobile и SE::Yandex::Catalog
Исправления в связи с изменениями в выдаче
Исправления
  • Количество неудачных больше не обнуляется при постановке на паузу
  • Исправлена проблема с подключением Node.js модулей на Linux
  • Исправлено падение парсера в редких ситуациях при использовании JS парсеров
  • Решена проблема с подключением Node.js модулей lodash, sequelize
  • Исправлена ошибка итератора при равных границах в макросе {num}
 
Автор темы
Разгадывание рекаптч в JS парсере

Очередное видео в цикле уроков по созданию JavaScript парсеров. Здесь показано, как реализовать разгадывание рекаптч в JS парсере.



В уроке рассмотрено:
  • Описание и настройка парсера
    f6a57f4ff95530bedd05272419d24075.png
    Util::ReCaptcha2
  • Описание принципа работы ReCaptcha2
  • Создание кастомного JavaScript парсера с поддержкой разгадывания рекаптч

Ссылки:

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Автор темы
Сборник рецептов #23: категории сайтов, парсинг в YML и преобразование дат

23-й сборник рецептов. В нем мы будем парсить категории сайтов из Google, научимся формировать файлы YML, а также разберемся, как парсить даты и преобразовывать их в единый формат. Поехали!

Получение категорий сайтов из Google

Категоризация сайтов - довольно актуальная задача, но существует немного сервисов, которые могут ее решить. Поэтому, по ссылке выше можно взять небольшой парсер, который позволяет получать категории сайтов из Google.
d7206b11e10d4caab76b396e735edca2.png


Выгрузка товаров в формате YML

YML - это стандарт, разработанный Яндексом для работы с Маркетом. По своей сути, это файлы, схожие с XML, в которых содержится информация о товарах в интернет-магазине. Данный формат обеспечивает регулярное автоматическое обновление каталога на Яндекс.Маркет и позволяет отражать все актуальные изменения (наличие, цена, появление новых товаров). Пример парсинга интернет-магазина и сохранения собранных данных в YML можно посмотреть по ссылке выше.
57195cfd1ebbd081c8f7a750d28a0177.png


Парсим Google новости с датой и преобразуем ее

В поисковой выдаче Google возле новостей публикуется дата. Как правило, это могут быть метки "10 ч. назад" или "26 мая 2018 г.". Иногда может возникнуть задача спарсить все даты и привести их к единому виду. Как именно это сделать, можно узнать по ссылке выше.
9627a9819d66879f7231a12649b852b1.png


Кроме этого:
Еще больше различных рецептов в нашем Каталоге!

Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники рецептов:
 
Автор темы
1.2.216 - улучшения в SE::Google::Modern и JS парсерах, а также множество других

511265c3fe71c5d61bac5d591128402c.png


Улучшения
  • Зависимая задача в Цепочке заданий теперь запускается только когда файл результатов не пустой
  • Добавлен повтор без смены прокси при неудачной отправке рекаптчи в
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern
  • Добавлен бан прокси при получении 403 кода ответа в
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern
  • Процент неудачных запросов теперь отображается относительно числа выполненных запросов
  • Добавлена возможность вызвать URL после выполнения задания
  • Улучшен обзор каталогов при выборе файлов запросов
  • Добавлена поддержка setInterval в JavaScript парсерах
  • Уменьшено Wait between get status и улучшено логгирование в
    f6a57f4ff95530bedd05272419d24075.png
    Util::ReCaptcha2
  • Улучшена обработка редиректов
  • Добавлена защита от бесконечного выполнения в JavaScript парсерах
  • Значительно увеличены возможности check_content в JS парсерах
  • В ответе API метода info добавлены параметры workingTasks, activeThreads, activeProxyCheckerThreads
Исправления в связи с изменениями в выдаче
Исправления
  • Исправлено ведение лога при нескольких паузах задания
  • Исправлена ошибка, из-за которой запрос считался неудачным при пустой выдаче в
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern
  • Исправлена работа с url, содержащими фрагмент # в
    58f70831e093d4fc1ed5523c87106165.png
    Net::HTTP
  • Исправлен парсинг ссылок в
    2dd510ecee78478c2faa07ffd46d1649.png
    HTML::LinkExtractor
  • Исправлена работа опции Pages count в
    ec6f5f397c1761d53be929c2c4bc4d18.png
    SE::Yandex
  • Исправлен выбор файлов запросов на Windows 10
  • Исправлена ошибка, из-за которой иногда нельзя было удалить файл с запросами
  • Исправлено отображение проксичекера в конфиге потоков
  • Исправлена кодировка некоторых результатов в
    4e3fe4a23983b93d6cc0899a173448ef.png
    SE::Google::Suggest
  • Исправлена ситуация, когда не читались настройки из config.txt
 
Автор темы
Сборник рецептов #24: уведомление в Telegram об экспайре доменов, чекер РКН и работа с SQLite

24-й сборник рецептов. В нем мы научимся мониторить окончание срока регистрации доменов с уведомлением в Телеграм, сделаем альтернативный чекер сайтов в базе РКН, а также на простом примере парсера курсов валют изучим работу с базами данных. Поехали!

Получаем уведомления в Telegram об окончании срока регистрации доменов

Мониторинг сроков регистрации доменов - это довольно распространенная задача. A-Parser позволяет легко автоматизировать этот процесс. Более того, можно настроить получение прямо в Телеграм уведомлений о доменах, срок регистрации которых скоро закончится. Готовое решение для автоматической проверки с уведомлением - по ссылке выше.
ded73642fb419980f84a47ec4c076551.png


Проверка блокировки РосКомНадзора через GitHub

В А-Парсере есть стандартный парсер
99aee71f672f1ffd8b5517565e3c1d6d.png
Check::RosKomNadzor, который позволяет проверять наличие сайтов в базе РКН. Данные получаются напрямую из официального сервиса, для работы обязательно нужно подключать антигейт. Кроме того, официальный сервис РКН часто подвергается атакам, в связи с чем может быть недоступен. Но существуют альтернативные источники данных, доступность которых значительно выше и к тому же не требующие проверки в виде каптчи. Парсинг одного из таких источников и реализован в пресете по ссылке выше.
0aa3075655395db1d331ad3cd3addf89.png


Простой парсер обменника с записью в БД SQLite

Как известно, в A-Parser есть возможность чтения/записи данных в БД SQLite. В этом рецепте показано использование этого функционала на примере парсинга курсов валют. Готовый парсер доступен по ссылке выше.
f930c042e62b95f17e5ec5867bad5486.png


Еще больше различных рецептов в нашем Каталоге!

Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники рецептов:
 
Автор темы
1.2.246 - обновление базы Rank::CMS и новые функции в парсерах Baidu и MajesticSEO

2013a8d9104a7a386c9bf182ebe5fef8.png

Улучшения
  • В
    7d676421b17eefc4a3e8f822c44c5481.png
    Rank::CMS обновлена база определяемых движков, теперь поддерживается одновременно старый и новый формат apps.json (при обновлении рекомендуется также обновить apps.json)
  • 15220d51a8924ee135b6b2cb31ad0f65.png
    SE::Baidu полностью переписан:
    • добавлен парсинг related keywords
    • убран $cachedate из $serp, т.к. его похоже больше нет в выдаче
    • добавлена опция Get full link, преобразующая обрезанные ссылки в полные
    • исправлены некоторые регулярные выражения и баг с двойным http в ссылках
  • Изменения в
    dcf4756d2e9cd056233209a2feea80b2.png
    Rank::MajesticSEO:
    • Добавлен параметр Check type, позволяет выбрать тип проверки: Root Domain/Subdomin/URL
    • Убран параметр Extract domain
    • Исправлена работа в некоторых случаях
  • Улучшена отзывчивость в редакторе JavaScript парсеров
  • Улучшена работа
    bc27f1afcdd2b1b94c895408cf2e5cda.png
    HTML::EmailExtractor, устранены зависания, которые возникали на определенных страницах
  • Обновлен список регионов в парсерах Яндекс
  • Пустой результат в
    e80e0e3c2dad7ccb332a142fb58b598a.png
    SE::Google::Trends больше не считается неудачным запросом
  • Улучшена работа с сессиями в
    8aa438b3f371f86f72942130cbb8562f.png
    SE::Yandex::WordStat
Исправления в связи с изменениями в выдаче
  • Исправлен парсинг рекламы в
    ec6f5f397c1761d53be929c2c4bc4d18.png
    SE::Yandex
  • Исправлена работа, а также улучшен алгоритм парсинга в
    36a93bf3c271b453c8e1bd64eb24e8ab.png
    SE:😀uckDuckGo
  • Исправлено указание региона в парсерах Яндекс
  • Исправлен парсинг $ads.$i.visiblelink в
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern
  • Исправлен парсинг $totalcount в
    ba8a0aa2aad3ed377d1b80651d16ffe4.png
    SE::Yandex:😀irect
Исправления
  • Исправлена ошибка, из-за которой процент обработанных запросов мог быть больше 100
  • Исправлены ошибки, из-за которых парсинг мог зависать при снятии с паузы, а также сбивался перебор в макросах подстановок
  • Исправлено отображение кириллицы в $headers в
    58f70831e093d4fc1ed5523c87106165.png
    Net::HTTP
  • Исправлена ошибка в Конструкторе результатов, из-за которой в редких случаях парсер мог падать
  • Устранена проблема с кодировкой при работе с SQLite
  • Исправлена ошибка со сменой прокси в JavaScript парсерах
 
Автор темы
Сборник статей #4: добавление товаров в OpenCart и парсинг JSON

В 4-м сборнике статей будет рассмотрено добавление товаров в OpenCart, а также описано создание универсального парсера JSON. В каждой статье приложены готовые JS парсеры, используя которые, можно на реальных примерах изучить описанные методы и поэксперементировать с ними. Поехали!

Работаем с OpenCart. Часть 1. Вступление.

Данная статья начинает цикл об одной из наиболее часто запрашиваемых возможностей - заливке товаров в интернет-магазин. A-Parser - это универсальный инструмент, который кроме прочего может решать и такие задачи. Для тестов выбран движок OpenCart, в 1-й статье будет рассмотрена авторизация, получение списка товаров и добавление товара. Подробности, а также пример парсера - по ссылке выше.
a1db093f3bbd70cf9313d8755bcf913f.png


Парсинг JSON ответов и работа с их содержимым

JSON - это довольно популярный способ предоставления данных, который, например, часто используется при работе с API различных сервисов. В А-Парсере есть встроенные инструменты для работы с ним, но не всегда их применение может быть простым, иногда требуется дополнительно писать сложные шаблоны, используя шаблонизатор. Поэтому в статье по ссылке выше будет рассказано, как написать простой универсальный парсер JSON.
8b7211d5e60ea718f6fd0dbb65b08fa9.png


Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки 🙂 ) - отписывайтесь здесь.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники статей
 
Автор темы
Видео урок: Создание JS парсеров. Работа с SQLite
Продолжение цикла уроков по созданию JavaScript парсеров. В этом видео показано, как работать с базой данных SQLite в JS парсере.


В этом уроке рассмотрены:
  • Знакомство с языком запросов SQL
  • Создание простейшей базы данных SQLite при работе с JS-парсером
  • Получение и запись данных в базу SQLite при работе с JS-парсером
Ссылки:

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Автор темы
1.2.270 - новый парсер Rank::Curlie, множество доработок в Node.js функционале

0f4e156d177185d8abd1fe935438addb.png


Улучшения
  • Добавлен новый парсер
    97b3c4de7f1d6c87dadec78641458001.png
    Rank::Curlie
  • В
    2dd510ecee78478c2faa07ffd46d1649.png
    HTML::LinkExtractor улучшена обработка портов по умолчанию, теперь ссылки с портом приводятся к каноническому виду
  • Оптимизирована работа
    8aa438b3f371f86f72942130cbb8562f.png
    SE::Yandex::WordStat
  • Улучшена работа с сессиями в
    ec6f5f397c1761d53be929c2c4bc4d18.png
    SE::Yandex
  • Улучшена обработка некорректных ответов в
    ec6f5f397c1761d53be929c2c4bc4d18.png
    SE::Yandex
    4e3fe4a23983b93d6cc0899a173448ef.png
    SE::Google::Suggest
Исправления в связи с изменениями в выдаче
Исправления
  • Исправлена проблема с запуском на некоторых linux дистрибутивах
  • Исправлена загрузка node.js модулей в редких случаях на Windows
  • JS парсеры: добавлена поддержка dns.lookup и улучшена совместимость с модулем mysql2
  • JS парсеры: исправлен util.promisify
  • Исправлена работа некоторых Node.js модулей
  • В
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern и
    5fca79e10d960fd4dc2fd8bff3c0b816.png
    SE::Bing $totalcount при 0 результатов теперь возвращает 0
  • Исправлено логгирование в режиме foreground
 
Автор темы
25-й сборник рецептов
25-й сборник рецептов. В нем будет показан способ периодического парсинга с дозаписью результатов в таблицу, рассмотрен парсинг с помощью Node.js модуля Cheerio без использования регулярных выражений, а также показан парсер первой мобильной поисковой системы в Китае - Shenma. Поехали!

Периодическая проверка обратных ссылок с дозаписью результатов в таблицу
Пример решения одной из наиболее запрашиваемых задач - дозапись периодически получаемых результатов в одну и ту же таблицу. В качестве хранилища данных используется SQLite, при каждом запуске данные добавляются и выводятся в таблицу. Готовый пресет с комментариями - по ссылке выше.
f7ba40515695aaaf68f0ca45a4823a32.png


Парсер поисковой системы Haosou
Как известно, в основе почти любого парсера используются регулярные выражения, реже - XPath. Работа с этими методами требует определенных знаний, что в свою очередь может вызывать некоторые сложности. Поэтому существуют и другие методы. Использование одного из них на примере парсинга популярного в Китае поисковика Haosou, показано по ссылке выше.
0db4276e618d1d6f1500b74cd951a580.png


Парсер китайского поисковика Shenma
Еще один китайский поисковик в этом сборнике - Shenma. Это первая мобильная поисковая система в Китае, ориентирована в первую очередь на мобильные сайты. Пресет - по ссылке выше.
ccc3578c0914d298fece69eb554ac001.png


Еще больше различных рецептов в нашем Каталоге!
Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники рецептов:
 
Автор темы
Видео урок: Создание JS парсеров. Реализация подстановки запросов и их многопоточной обработки.
Продолжение цикла уроков по созданию JavaScript парсеров. В этом видео будет показано, как "на лету" добавлять запросы в задание и многопоточно их обрабатывать.
В одной из наших статей мы рассмотрели способ разработки парсера, который собирает ТОП 10 из выдачи поисковика, а затем по очереди парсит нужные данные по полученным ссылкам. Вроде все неплохо, но если у вас не 10 запросов, несколько тысяч? Задание будет выполняться очень долго, а время это самый драгоценный и не восполняемый ресурс.
К счастью в A-Parser есть такая замечательная вещь, как многоуровневый парсинг, который позволяет многократно увеличить скорость парсинга, и в этом видео мы рассмотрим как этой возможностью пользоваться.

В этом уроке рассмотрено:
  • Реализация раздельных процедур парсинга в зависимости от внешних условий, а именно - уровня парсинга
  • Подстановка запросов в задание "на лету"
  • Использование стандартных парсеров в кастомных JavaScript парсерах
Ссылки:
Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Автор темы
1.2.292 - новый парсер Яндекс ИКС, улучшения в работе с кодировками, оптимизации встроенных парсеров
bc8d4d5fffeb7221cd08a255f5bae4f2.png

Улучшения
  • Добавлен парсер
    b466f2fe47191bf47bb50ccb679b97d2.png
    SE::Yandex::SQI - парсер Индекса качества сайта (Яндекс ИКС)
  • Оптимизирована работа Очереди заданий
  • Добавлена поддержка множества экзотических кодировок китайского языка
  • Добавлена опция Save as UTF-8 with BOM, которая решает проблему определения кодировки при открытии сформированного CSV в Excel
  • 952f34b1f44b060a7d57c29953160b4e.png
    SE::Youtube полностью переписан с использованием современного юзерагента
  • 7a4cd152ecb74b64448420eaf438e0c0.png
    SE::AOL::Suggest оптимизирован и переписан на JavaScript
  • Улучшена работа
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google,
    65d863ceb0b578ac549596ea6cfbe3f9.png
    SE::Google::Modern,
    dcf4756d2e9cd056233209a2feea80b2.png
    Rank::MajesticSEO,
    5fca79e10d960fd4dc2fd8bff3c0b816.png
    SE::Bing,
    957c75b68a5cf937dafc6bc54fe24b41.png
    Shop::Amazon
Исправления в связи с изменениями в выдаче
Исправления
  • Исправлена работа
    0fe15996e76cd99d5a12158ee303f84b.png
    Net::Whois для некоторых доменных зон
  • Исправлена ошибка, при которой не импортировался пресет, если не установлены модули, используемые в нем
  • Исправлена кодировка при использовании fs.readdirSync в JS парсерах
 
Автор темы
Сборник статей #5: собственный канал в Telegram и массовое добавление товаров в OpenCart
В 5-м сборнике статей на реальном примере будет показано, как создать свой канал в Телеграме и полностью автоматизировать его наполнение контентом. Также мы продолжаем цикл статей по работе с OpenCart и во 2-й части будет рассмотрен вопрос массового добавления товаров. Как обычно, в каждой статье приложены готовые JS парсеры, используя которые, можно на реальных примерах изучить описанные методы и поэксперементировать с ними. Поехали!

Полноценный Telegram канал на базе A-Parser
В этой статье будет описан способ создания полноценного канала в Telegram c автоматизированным сбором контента и постингом сообщений через заданные интервалы. И конечно, все это на базе A-Parser. Все подробности, а также готовые пресеты - по ссылке выше.
c309aeb2388691f7c0c9c503fc2b51c1.png


Работаем с OpenCart. Часть 2. Массовое добавление товаров
Мы продолжаем цикл статей о заливке товаров в интернет-магазин на базе OpenCart. Во второй части будет рассмотрено массовое добавление товара. Подробности, а также пример готового парсера - по ссылке выше.
c3cae86ee84559087ee9bd72a1ff0897.png


Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки 🙂 ) - отписывайтесь здесь.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники статей
 
Автор темы
Видео урок: Массовое добавление товаров в OpenCart
Данный парсер является примером для разработки парсера работающего с OpenCart. Решение демонстрирует возможность сбора данных о товарах из стороннего сайта и заливку их на собственный сайт на базе OpenCart через API.
В этом уроке рассмотрены:
  • парсинг товаров из интернет-магазина
  • авторизация в OpenCart
  • работа с API OpenCart для публикации товаров

Статья и готовый пресет опубликованы в нашем Каталоге: Работаем с OpenCart. Часть 2. Массовое добавление товаров

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Автор темы
1.2.319 - новый парсер подсказок Youtube, поддержка модуля MySQL2, множество улучшений и оптимизаций
fb9c4472c244d521bc4c7abccf2639c6.png

Улучшения
  • Добавлен новый парсер
    47e49dbcce8b796c45703ef3005fa544.png
    SE::Youtube::Suggest
  • Добавлена совместимость с модулем mysql2 в JavaScript парсерах
  • В
    f6a57f4ff95530bedd05272419d24075.png
    Util::ReCaptcha2 добавлена поддержка сервиса R.I.P.captcha
  • В
    f68d61db03233c5bc4788aee68787e59.png
    SE::Bing::Suggest добавлена возможность выбора страны
  • Уменьшено потребление оперативной памяти, а также оптимизирована начальная загрузка, интерфейс теперь открывается быстрее
  • База регионов в
    ec6f5f397c1761d53be929c2c4bc4d18.png
    SE::Yandex обновлена и значительно увеличена
  • Для всех стандартных парсеров, кроме тех, которые работают на основе
    58f70831e093d4fc1ed5523c87106165.png
    Net::HTTP, из настроек убраны Max body size и Use gzip
  • Улучшен
    957c75b68a5cf937dafc6bc54fe24b41.png
    Shop::Amazon
Исправления в связи с изменениями в выдаче
Исправления
  • Исправлена работа с прокси при получении каптчи в
    e628100675f4ab45364b8f93c13a0b60.png
    SE::Yandex::Register
  • В очень редких случаях в
    ec6f5f397c1761d53be929c2c4bc4d18.png
    SE::Yandex могла возникать ошибка Content mismatch
  • Исправлен
    0fe15996e76cd99d5a12158ee303f84b.png
    Net::Whois при работе с .eu доменами
 
Автор темы
Видео урок: Полноценный Telegram канал на базе A-Parser
Это видео демонстрирует возможность создания полноценного Telegram канала на базе A-Parser. Парсер периодически и без вмешательства пользователя будет собирать контент и публиковать его на канале.
В уроке рассмотрены:
  • Регистрация и настройка канала в Телеграм.
  • Последовательное выполнение нескольких заданий.
  • Сохранение промежуточных данных в базу SQLite с последующим чтением.
  • Настройка пресета для постинга сообщений в Telegram-канал.
Статья с подробным описанием процесса создания: Полноценный Telegram канал на базе A-Parser
Ссылки на готовые пресеты:
Подсказки Google Play
Парсинг приложений со скидками в Google Play
Отправка сообщений в Telegram канал
Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 

Похожие темы Последние темы Популярные темы

Назад
Сверху