Масштабируемые системы хранения Huawei OceanStor Pacific — файлы, объекты и большие данные
Масштабируемая система хранения растёт узлами: ёмкость и производительность увеличиваются вместе. Разбираем отличия от классического массива, способы доступа, расчёт полезной ёмкости и требования к сети.
Масштабируемая система хранения строится не из контроллерной пары с дисковыми полками, а из одинаковых узлов: ёмкость и производительность растут вместе с их числом. Такая схема нужна там, где объём данных измеряется сотнями терабайт и петабайтами, а доступ идёт не по блокам из базы данных, а файлами и объектами — видеонаблюдение, результаты расчётов, медицинские изображения, архивы и обучающие наборы данных.
Разберём, чем масштабируемая система отличается от классического массива, какие способы доступа она даёт, как считается полезная ёмкость и что нужно для расчёта. Позиции лежат в разделе масштабируемых систем хранения Huawei OceanStor, классические массивы — в разделе систем хранения данных.
Чем масштабируемая система отличается от классического массива
- Рост производительности вместе с ёмкостью. В классическом массиве вся нагрузка проходит через контроллерную пару, и добавление полок расширения увеличивает объём, но не скорость. В масштабируемой системе каждый новый узел добавляет и то и другое.
- Единое пространство имён. Данные всех узлов видны как один каталог, приложению не нужно знать, на каком узле лежит файл.
- Защита данных. Вместо классических дисковых массивов применяется распределение блоков с избыточностью по узлам: отказ узла целиком не приводит к потере данных.
- Предел наращивания. Классический массив ограничен числом полок на контроллерную пару, масштабируемая система — числом узлов, и этот предел на порядок выше.
- Профиль нагрузки. Масштабируемая система рассчитана на поток и параллельный доступ множества клиентов. Под транзакционную базу данных с требованием минимальной задержки по-прежнему берут полностью твердотельный массив.
Способы доступа и под что они применяются
| Доступ | Что получает приложение | Типичная задача | На что смотреть |
|---|---|---|---|
| Файловый | сетевой каталог | видеонаблюдение, проектные данные, общий архив | число одновременных клиентов |
| Объектный | хранилище с обращением по ключу | резервные копии, наборы данных для обучения, архив снимков | совместимость интерфейса с приложением |
| Блочный | том для сервера | виртуализация, файловые системы приложений | задержка под нагрузкой |
| Для распределённых вычислений | параллельный доступ множества узлов | расчётные задачи, обработка больших наборов | пропускная способность сети между узлами |
Одна система может отдавать данные несколькими способами одновременно. Это избавляет от промежуточного копирования: набор, записанный по объектному интерфейсу, читается расчётными узлами как файлы.
Как считается полезная ёмкость
- Схема избыточности. Задаётся числом блоков данных и блоков контроля. Чем больше блоков контроля, тем больше отказов переживает система и тем меньше полезная доля сырой ёмкости.
- Число узлов. Схема избыточности не может быть шире, чем позволяет число узлов: на минимальной конфигурации доступны только простые схемы с большими накладными расходами.
- Резерв на восстановление. Часть ёмкости остаётся свободной, чтобы система восстановила избыточность после отказа диска или узла без остановки работы.
- Порог заполнения. При заполнении выше рекомендованного уровня падает скорость записи. Рабочей считается ёмкость до этого порога, а не полная.
- Типы накопителей. Ёмкие механические диски дают низкую стоимость терабайта для архива, твердотельные — скорость для активных данных. В смешанной конфигурации считается ёмкость каждого уровня отдельно.
Что учитывается при проектировании
- Сеть между узлами. Обмен между узлами идёт постоянно — при записи, восстановлении и перебалансировке. Полоса и задержка этой сети определяют производительность системы; обычно применяются коммутаторы CloudEngine.
- Клиентская сеть. Отделяется от межузловой, иначе восстановление после отказа узла отбирает полосу у приложений.
- Кабельная часть. Число соединений растёт с числом узлов; кабели и оптические модули закладываются в спецификацию сразу.
- Питание и место в стойке. Узлы занимают больше юнитов, чем контроллерная пара той же ёмкости, и потребляют пропорционально их числу.
- Программная часть. Функции репликации, снимков и многоуровневого хранения лицензируются отдельно — программное обеспечение для систем хранения учитывается в бюджете вместе с оборудованием.
- Порядок расширения. Узлы добавляются группами; минимальный шаг расширения проверяется заранее, чтобы рост не требовал закупки сразу половины системы.
Когда достаточно классического массива
- Объём данных измеряется десятками терабайт и растёт предсказуемо — массив среднего класса закрывает задачу проще и дешевле.
- Основная нагрузка — транзакционная база данных с требованием стабильно низкой задержки.
- Нужен только блочный доступ, файловый и объектный не требуются.
- Файловый доступ нужен на небольшом объёме — достаточно системы файлового доступа.
- В инфраструктуре уже стоят массивы предыдущих поколений, и расширение действующей системы обходится дешевле перехода на новую архитектуру.
Что прислать для расчёта
- Текущий объём данных и прирост за год.
- Способ доступа, который требуется приложениям: файловый, объектный, блочный.
- Профиль нагрузки — поток на запись, поток на чтение, число одновременных клиентов.
- Требования к доступности: сколько отказов дисков и узлов система должна переживать.
- Условия площадки: место в стойках, доступная мощность, действующая сеть.
- Планы по резервному копированию и репликации на вторую площадку.
Частые вопросы
Сколько узлов нужно минимально? Зависит от выбранной схемы избыточности: чем шире схема, тем больше узлов требуется. На минимальной конфигурации доступны простые схемы, и полезная доля ёмкости получается ниже.
Можно ли добавлять узлы разных поколений? Обычно можно, но при смешении поколений система работает по возможностям младшего. Порядок и ограничения расширения проверяются до первой закупки.
Что происходит при отказе узла? Данные остаются доступными за счёт избыточности, система начинает восстанавливать её на оставшихся узлах. На время восстановления часть полосы уходит на внутренний обмен.
Подходит ли такая система под виртуализацию? Подходит там, где важнее объём и параллельный доступ. Для сред с требованием минимальной задержки берут полностью твердотельный массив, а масштабируемую систему используют под архив и резервные копии.
Как считать бюджет на несколько лет? По плановому приросту данных с шагом расширения узлами и с учётом порога заполнения. Закупка «на вырост» в этой архитектуре не требуется — ёмкость добавляется по мере необходимости.
Что мы делаем
Считаем полезную ёмкость по схеме избыточности и порогу заполнения, а не по сырой ёмкости дисков, подбираем конфигурацию узлов под профиль нагрузки и способ доступа, проектируем межузловую и клиентскую сеть на коммутаторах Huawei, комплектуем поставку накопителями, кабелями, оптическими модулями и лицензиями, планируем порядок расширения на несколько лет вперёд.
Пришлите объём данных, прирост за год и требуемый способ доступа на sale@huawei.net.ru — рассчитаем конфигурацию под вашу нагрузку, покажем полезную ёмкость по вариантам избыточности и дадим спецификацию с ценами и сроками поставки.
