Множество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.
Почему маленькие файлы плохо подходят для Hadoop?
Множество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.
Короткий ответ
Что ответить на собеседовании
Подробный разбор
Ответ с пояснениями
Множество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.
Файлы объединяют в подходящие контейнеры или более крупные Parquet/ORC-файлы и контролируют их число после записи. Маленький файл не обязательно занимает на диске целый размер блока HDFS: проблема не сводится к такому округлению. Модель больших наборов HDFS.