Почему маленькие файлы плохо подходят для Hadoop?

Множество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.

Короткий ответ

Что ответить на собеседовании

Множество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.

Подробный разбор

Ответ с пояснениями

Множество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.

Файлы объединяют в подходящие контейнеры или более крупные Parquet/ORC-файлы и контролируют их число после записи. Маленький файл не обязательно занимает на диске целый размер блока HDFS: проблема не сводится к такому округлению. Модель больших наборов HDFS.

Практика в реальном времени

Подготовьтесь к следующему собеседованию

Interview Boost учитывает вакансию, резюме и технологии и помогает сформулировать ответ прямо во время интервью.

Начать подготовку