Data science проекты, которые помогут найти работу

Далеко не каждый, кто ищет место аналитика данных, уже работал на такой должности. Но каждый способен выполнить проекты, которые в итоге приведут его к работе мечты. Речь, конечно, идет о проектах, в которых вы примените свои знания data science, и исключительно качественно выполненных проектах.

Чем хороша проектная работа?

  • ее можно включить в резюме;
  • выполненные проекты свидетельствуют о вашей ответственности и мотивированности;
  • они показывают, что вы не боитесь масштабных задач;
  • вы покажете умение применять свои знания data science на практике;
  • они дадут вам возможность показать себя вместо того, чтобы рассказывать о себе;
  • в процессе выполнения проекта вы учитесь;

Как выбирать проекты?

Советует Кен Джи (Ken Jee) – консультант и специалист по анализу данных, специализирующийся в спортивной аналитике. Самое главное – ваш проект должен быть уникальным, желательно узкоспециальным. Такие проекты много скажут о вас работодателю. Проект должен быть либо интересен и близок лично вам, либо быть нацеленным на отрасль, в которой вы хотели бы работать.

Из чего состоит data science проект?

Все они развиваются по одному плану. Вы должны уметь подробно и доходчиво рассказать работодателю о каждой из ступеней, которые он проходит:

  • Планирование и утверждение цели проекта. Вы не всегда знаете, что найдете, но перед вами всегда должна стоять конкретная задача или вопрос. Ее необходимо сформулировать в самом начале.
  • Сбор данных. Источников масса — Google, Reddit и т.д. Вы можете находить и собственные данные – это выделит вас на фоне прочих кандидатов.
  • Агрегация и очистка данных. Это самая важная ступень, ведь подготовительная работа оказывает решающее влияние на результаты анализа данных.
  • Исследование данных. Здесь вам необходимо продемонстрировать, что вы понимаете специфику своих данных – каждый блок в отдельности и взаимодействие между ними. Для этого хорошо использовать визуализацию: гистограммы, диаграммы размаха и т.д.
  • Собственно, анализ данных. Здесь очень полезно будет делать сводные таблицы – для того, чтобы уловить разницу между разными группами данных или временными отрезками. На данном этапе также нужно активно использовать визуализацию.
  • Генерация признаков. Эта часть анализа чрезвычайно важна, однако выполнять ее можно параллельно с предыдущим пунктом. Наряду с созданием новых признаков (качество или свойство, присущее всем независимым объектам, анализ которых вы делаете) вы меняете данные так, что они будут более пригодны для анализа. Создавая новые признаки, проявляйте изобретательность. Например, если ваши данные – это некие географические объекты, вместо широты и долготы, указывайте расстояние до крупного населенного пункта.
  • Построение модели и оценка ее эффективности. Вам придется сравнить множество моделей для того, чтобы понять, какая из них лучше всего подходит для решения ваших задач. Внимательно отнеситесь и к самим методам оценки!
  • Практическое применение модели (пункт желательный, но не обязательный). Если соискатель места аналитика данных заставит свою модель жить на веб-сайте или программном интерфейсе приложение, это всегда производит самое благоприятное впечатление на работодателя – если не сказать больше.
  • Выводы. Всегда анализируйте свой выполненный проект, чтобы понять, что бы вы могли сделать лучше. Скорее всего, он не будет идеальным. Будьте готовы рассказать в интервью обо всех его недостатках (работодатель прекрасно сможет увидеть их сам).
  • Перспектива. Закончив один проект, тут же начинайте думать о другом. Вас могут спросить: «Над чем вы работаете?»

Источник: towardsdatascience.com

Прокрутка вверх