Что такое cache и persist в Spark?

cache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.

Короткий ответ

Что ответить на собеседовании

cache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.

Подробный разбор

Ответ с пояснениями

cache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.

Кеш обычно заполняется при выполнении action, а не в момент объявления. Уровень по умолчанию зависит от API: не переносите настройки RDD на DataFrame без проверки. После использования вызовите unpersist. RDD.persist.

Практика в реальном времени

Подготовьтесь к следующему собеседованию

Interview Boost учитывает вакансию, резюме и технологии и помогает сформулировать ответ прямо во время интервью.

Начать подготовку