Что такое distribution key в Greenplum?
Distribution key — набор колонок, по значениям которого строки хешируются на сегменты Greenplum. Хороший ключ распределяет нагрузку достаточно равномерно и уменьшает пересылки для важных запросов.
Читать ответПодготовка к интервью
28 вопросов с собеседований в RWB (Wildberries & Russ)
Что проверяют на интервью
Подборка объединяет вопросы, отмеченные на этапах интервью в RWB (Wildberries & Russ). Здесь можно понять структуру технической проверки и заранее повторить связанные темы. В подборке чаще встречаются темы: data analyst, bi, sql.
Каталог
Distribution key — набор колонок, по значениям которого строки хешируются на сегменты Greenplum. Хороший ключ распределяет нагрузку достаточно равномерно и уменьшает пересылки для важных запросов.
Читать ответTransformation описывает новый набор данных, например filter или map, обычно без немедленного вычисления. Action требует результата, например count, collect или запись, и запускает выполнение зависимостей.
Читать ответСам по себе ORDER BY меняет порядок, но не количество строк результата. Количество изменяют фильтрация, группировка, DISTINCT, LIMIT/OFFSET и другие операции запроса.
Читать ответМножество маленьких файлов создаёт много метаданных в NameNode и накладных расходов на открытие, планирование и чтение. Это плохо соответствует модели HDFS, рассчитанной на крупные последовательные данные.
Читать ответОсновные части Hadoop — HDFS для распределённого хранения, YARN для управления ресурсами, MapReduce для пакетных вычислений и Common с общими библиотеками.
Читать ответРазделите интерес к построению потоков данных, поиску выводов и созданию системы отчётности. Затем выберите направление, опираясь на задачи, которые вам действительно нравились.
Читать ответJob — вычисление для получения результата; его делят на stages по границам shuffle. Stage состоит из tasks, каждая из которых обрабатывает свою партицию.
Читать ответSensor ждёт выполнения условия: появления файла, готовности данных или завершения внешней операции. После успеха зависимые задачи могут продолжить работу.
Читать ответУкажите реалистичный срок выхода с учётом передачи дел и уже взятых обязательств. Если дата зависит от согласования, назовите условие и срок уточнения.
Читать ответcache сохраняет вычисленные данные с уровнем хранения по умолчанию, а persist позволяет выбрать уровень явно. Это полезно, когда один промежуточный результат используется несколько раз.
Читать ответNameNode управляет пространством имён HDFS и метаданными файлов и блоков. DataNode хранит сами блоки и обслуживает чтение и запись данных клиентами.
Читать ответВ HDFS отказоустойчивость данных обеспечивают репликация блоков или erasure coding, а вычисления могут повторять задачи после сбоя. Для управляющих компонентов нужны отдельные механизмы высокой доступности.
Читать ответ