Что такое Big Data и где большие данные используют на практике
Большие данные - не соревнование на самый толстый Excel. Термин появляется, когда объём, скорость поступления или разнообразие информации требуют масштабируемой архитектуры и новых способов обработки.

Почему определения говорят о сложности, а не о гигабайтах
NIST описывает Big Data через характеристики наборов данных и требования к масштабируемой архитектуре. Фиксированной границы вроде «после одного терабайта начинается Big Data» нет. Один терабайт хорошо структурированных записей может спокойно жить в привычной базе, а быстрый поток из тысяч источников создаст сложность при меньшем объёме.
Часто используют признаки volume, velocity и variety: объём, скорость и разнообразие. К ним добавляют достоверность и ценность, но важнее не коллекционировать буквы V, а понимать ограничение системы. Что ломается: время расчёта, память, запись, качество, стоимость или возможность получить ответ вовремя?
Если нужна системная практика, сравните программы по python.

Финансовые организации анализируют операции и риски, но здесь особенно важны качество, объяснимость и защита данных.
Часть расчётов запускают пакетно, например ночью по накопленным данным. Другие делают потоково, когда задержка в минуты уже портит результат.
Смысл проекта - показать инженерное решение ограничения, а не насильно раздуть файл до сотни гигабайт.
Где Big Data действительно используют
В интернет-сервисах большие данные помогают строить рекомендации и анализировать поведение огромного числа сессий. В промышленности и энергетике обрабатывают телеметрию оборудования. В логистике сравнивают маршруты, загрузку и фактические сроки. В информационной безопасности ищут необычные последовательности событий среди журналов и сетевых сигналов.
Научные проекты работают с наблюдениями, моделированием и изображениями. Финансовые организации анализируют операции и риски, но здесь особенно важны качество, объяснимость и защита данных. Сфера сама по себе не делает проект «бигдатой»: маленькому магазину иногда полезнее нормальный отчёт по продажам, чем кластер из модных слов.

Из каких слоёв состоит система
Типовая архитектура включает источники, доставку событий, хранилища, вычислительные движки и слой потребления: витрины, API, отчёты или модели. Часть расчётов запускают пакетно, например ночью по накопленным данным. Другие делают потоково, когда задержка в минуты уже портит результат.
- источники и правила сбора;
- контроль схемы, качества и происхождения данных;
- распределённое хранение и вычисления;
- мониторинг стоимости, задержки и ошибок;
- доступ, безопасность и срок хранения.

Что изучать новичку
Затем - моделирование данных, пакетная обработка, очереди сообщений и распределённые системы. Конкретный инструмент меняется быстрее базовых принципов, поэтому не стройте обучение вокруг одного логотипа.
Смысл проекта - показать инженерное решение ограничения, а не насильно раздуть файл до сотни гигабайт.

Вывод KGAM. Сначала зафиксируйте нужный результат и ограничение, затем соберите минимальный черновик и проверьте его на реальной задаче. Такой порядок быстро показывает, где инструмент действительно помогает, а где только создаёт видимость бурной работы.