Если нужно выгрузить датафрейм из Юпитера, то обычно используют[df.to_csv() (https://pandas.pydata.org/pandas-docs/stable/generated/pandas.DataFrame.to_csv.html) и потом ищут файлик. Иногда удобно выгрузить файлик прямо браузером https://gist.github.com/axmakarov/a83727d16cc75761ea5d0bce1a667d1c
Gist
download_from_ipython.py
GitHub Gist: instantly share code, notes, and snippets.
Курс машинного обучения Data Mining In Action от кафедры Алгоритмов и Технологий Программирования МФТИ https://www.youtube.com/channel/UCop3CelRVvrchG5lsPyxvHg/videos?flow=grid&sort=p&view=0
В Pandas одно и то же действие с данными можно выполнить несколькими способами. Например, отсортировать данные можно внутренней функцией sort_values() или использовать numpy'шный np.sort(). Добрый самаритянин сравнил производительность функций, чтобы мы тратили меньше времени на все эти слайсинги, сортировки и удаление дубликатов https://github.com/mm-mansour/Fast-Pandas
GitHub
GitHub - mm-mansour/Fast-Pandas: Benchmark for different operations in pandas against various dataframe sizes.
Benchmark for different operations in pandas against various dataframe sizes. - mm-mansour/Fast-Pandas
Крутая шпаргалка по Pandas https://github.com/pandas-dev/pandas/blob/master/doc/cheatsheet/Pandas_Cheat_Sheet.pdf
GitHub
pandas/doc/cheatsheet/Pandas_Cheat_Sheet.pdf at main · pandas-dev/pandas
Flexible and powerful data analysis / manipulation library for Python, providing labeled data structures similar to R data.frame objects, statistical functions, and much more - pandas-dev/pandas
Нашел библиотеку для автоматической генерации фич (feature, признаков, если говорить по-русски) для машинного обучения: https://www.featuretools.com/. Процесс генерации фич достаточно занимательный и творческий. Не уверен, что в ближайшую пятилетку получится автоматизировать его полностью, но библиотека точно облегчает жизнь аналитику, особенно если речь идет о достаточно простых признаках. Принцип работы достаточно прост: обычно аналитику приходится создавать фичи самому, применяя различные агрегирующие функции к определенной категории данных, а библиотека FeatureTools берет эту задачу на себя. Например, если мы пытаемся предсказать покупку клиентом определенного товара, то нам нужно изучить историю его прошлых покупок, а также пользователей похожих на него по каким-либо признакам: что чаще покупали люди, которые живут в том же городе и того же возраста, что и наш клиент; в какое время года чаще всего клиенты покупали определенный товар; как часто пользователь до этого просматривал страницу с этим товаром или похожим. Для каждого из таких параметров нам нужно сделать агрегаты, то есть взять все данные о покупках товара из определенного города и посчитать для него частоту покупок, средний чек, медиану по чеку и ещё кучу всяких параметров. Потом можно взять связку город и товар и сделать тоже самое. Всё это можно делать ручками, придумывая каждую фичу самостоятельно, а можно использовать библиотеку FeatureTools или ей подобную.