Channel name was changed to «Изучаем парсеры на Питоне🐍 [ru]»
Channel name was changed to «Learning parser on python🐍 [ru]»
Доброго времени суток, выкладываю первую часть урока по парсингу на питоне.
1. Первым делом устанавливаем библиотеку requests, выполнив команду pip install requests и импортируем ее в наш проект
2. Затем берем ссылку интересующего нас сайта (переменная url)
3. Создаем словарь headers, из браузера берем информацию user-agent и accept. Их можно найти открыв консоль разработчика в браузере (клавиша f12) зайти на вкладку networks, далее headers немного пролистав Request headers.
Он нам нужен для того, чтобы сайт не заподозрил подозрительную активность и не заблокировал нам доступ к своему контенту
4. Далее делаем запрос, передав url и headers, сохраняем в переменную response.
5. В переменную html мы передадим html код страницы применив к response свойство text, который нам понадобится в дальнейшем.
#parser #learning #requests
Наш чат: @Python_parsing_chat
1. Первым делом устанавливаем библиотеку requests, выполнив команду pip install requests и импортируем ее в наш проект
2. Затем берем ссылку интересующего нас сайта (переменная url)
3. Создаем словарь headers, из браузера берем информацию user-agent и accept. Их можно найти открыв консоль разработчика в браузере (клавиша f12) зайти на вкладку networks, далее headers немного пролистав Request headers.
Он нам нужен для того, чтобы сайт не заподозрил подозрительную активность и не заблокировал нам доступ к своему контенту
4. Далее делаем запрос, передав url и headers, сохраняем в переменную response.
5. В переменную html мы передадим html код страницы применив к response свойство text, который нам понадобится в дальнейшем.
#parser #learning #requests
Наш чат: @Python_parsing_chat
Доброго времени суток, выкладываю вторую часть урока по парсингу на питоне, код прилагаю
1. Устанавливаем через терминал библиотеку bs4, выполнив команду pip install bs4 и импортируем из нее BeautifulSoup
2. Создаем объект «супа». Передаем нашу ранее полученную переменную html, с кодом страницы и вид парсера «html.parser»
3. Теперь можно приступить к самому интересному, поиску и получению данных с сайта.
Для начала перейдем на нашу страницу, с которой мы хотим извлечь данные, это будет eldorado.ru/c/televizory/b/SONY/
Возьмем для примера телевизоры брэнда SONY
Откроем консоль разработчика, зайдем в раздел «elements» найдем блок товара, он находится в теге <li> с классом «sc-1w9a1pg-0». Создадим переменную blocks со всем блоками найденными при помощи findall, заметьте, что «class» записан с нижним подчеркиванием, т.к. class зарезервирован питоном. Для ‘link’ добавим ‘https://www.eldorado.ru’, что бы наша ссылка была полноценная
4. Создадим список data, в будущем в него будут записана наша собранная информация
5. Проходимся по всем блокам и собираем с них нужную нам информацию
Я для примера взял название позиции, артикул, цену и ссылку на сам товар, добавляя все полученное в список data
6. Выведем на печать все что у нас получилось, плюс выведем количество полученных позиций
Мы получили только 36 товаров из 49, т.к. мы прошлись только по одной странице, в следующий раз разберем пагинацию
#parser #learning #requests
Наш чат: @Python_parsing_chat
1. Устанавливаем через терминал библиотеку bs4, выполнив команду pip install bs4 и импортируем из нее BeautifulSoup
2. Создаем объект «супа». Передаем нашу ранее полученную переменную html, с кодом страницы и вид парсера «html.parser»
3. Теперь можно приступить к самому интересному, поиску и получению данных с сайта.
Для начала перейдем на нашу страницу, с которой мы хотим извлечь данные, это будет eldorado.ru/c/televizory/b/SONY/
Возьмем для примера телевизоры брэнда SONY
Откроем консоль разработчика, зайдем в раздел «elements» найдем блок товара, он находится в теге <li> с классом «sc-1w9a1pg-0». Создадим переменную blocks со всем блоками найденными при помощи findall, заметьте, что «class» записан с нижним подчеркиванием, т.к. class зарезервирован питоном. Для ‘link’ добавим ‘https://www.eldorado.ru’, что бы наша ссылка была полноценная
4. Создадим список data, в будущем в него будут записана наша собранная информация
5. Проходимся по всем блокам и собираем с них нужную нам информацию
Я для примера взял название позиции, артикул, цену и ссылку на сам товар, добавляя все полученное в список data
6. Выведем на печать все что у нас получилось, плюс выведем количество полученных позиций
Мы получили только 36 товаров из 49, т.к. мы прошлись только по одной странице, в следующий раз разберем пагинацию
#parser #learning #requests
Наш чат: @Python_parsing_chat
