cache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.
Что такое cache и persist в Spark?
cache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.
Короткий ответ
Что ответить на собеседовании
Подробный разбор
Ответ с пояснениями
cache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.
Кеш обычно заполняется при выполнении action, а не в момент объявления. Уровень по умолчанию зависит от API: не переносите настройки RDD на DataFrame без проверки. После использования вызовите unpersist. RDD.persist.