Настольная книга эксплуататора. Всё, что вы хотели знать о повседневной жизни датацентров, но боялись спросить - Алексей Жумыкин

Алексей Жумыкин
0
0
(0)
0 0

Аннотация:

Если перестанут работать дата-центры (ДЦ), вы не сможете заказать такси, отправить другу мем или оплатить коммунальные услуги через банковское приложение. За любыми, казалось бы, простыми действиями в интернете стоит «невидимая армия», или служба эксплуатации. Эти люди обеспечивают работу серверов и заботятся о том, чтобы информационный поток в наших девайсах никогда не прекращался.«Про работу службы эксплуатации уже появилось несколько не очень приятных стереотипов. На первых полосах бумажных газет о ней не прочитаешь, и в TikTok ее не увидишь. Существует даже мнение, что в дежурные идут для того, чтобы спокойно спать в ночную смену. Но все это совсем не так. От этих нескольких человек, находящихся в ночь с субботы на воскресенье на площадке, полностью зависит работа крупного банка, заказ еды или такси, сообщения мессенджеров, прогноз погоды – да трудно представить, какая часть информационного потока не идет сейчас через дата-центры».Деятельности дата-центров и посвящена книга Алексея Жумыкина, руководителя эксплуатации ДЦ «Яндекса». Автор, опираясь на собственный опыт, подробно объясняет процессы эксплуатации, рассказывает, как создать хорошую команду, и дает практические рекомендации по безопасности и техническому обслуживанию. Жумыкин простым языком говорит о сложных вещах: организации дата-центров, управлении мощностями, составлении документации, работе с подрядчиками, бюджетировании. В книге также приведены примеры того, как справляться с аварийными ситуациями. Для наглядности автор использует схемы, графики и таблицы, которые позволяют понять устройство оборудования и процессы внутри стандартных ДЦ.Зачем читать• Понять, как работают дата-центры.• Оценить и улучшить рабочие процессы внутри ДЦ.• Организовать первоклассную команду специалистов дата-центров.Вы узнаете• принципы эксплуатации оборудования, которые помогут избежать проблем;• мифы и легенды о работе дата-центров;• стоит ли привлекать подрядчиков в ДЦ;• как справляться с инцидентами на рабочем месте в ДЦ;• какие перспективы ожидают отрасль.Для когоДля руководителей, специалистов эксплуатации дата-центров и людей, желающих разобраться в работе центров обработки данных.

Настольная книга эксплуататора. Всё, что вы хотели знать о повседневной жизни датацентров, но боялись спросить - Алексей Жумыкин бестселлер бесплатно
0
0

Внимание! Аудиокнига может содержать контент только для совершеннолетних. Для несовершеннолетних прослушивание данного контента СТРОГО ЗАПРЕЩЕНО! Если в аудиокниге присутствует наличие пропаганды ЛГБТ и другого, запрещенного контента - просьба написать на почту pbn.book@gmail.com для удаления материала

Читать книгу "Настольная книга эксплуататора. Всё, что вы хотели знать о повседневной жизни датацентров, но боялись спросить - Алексей Жумыкин"


может увеличить маневренность в запуске новых проектов.

Теперь, когда в руках у нас такой мощный инструмент, посмотрим, как его можно эффективно использовать. Приведем примеры вопросов, ответы на которые содержатся среди линий графика.

Когда строить новый датацентр? Если отдел продаж датацентра предоставит свои планы на один-три года вперед, то, наложив их на существующие мощности, можно получить хорошее понимание того, когда и сколько серверов нужно вводить в эксплуатацию. Это позволит существенно точнее прогнозировать капитальные затраты на предстоящие периоды. Если же превышение мощностей небольшое, то можно либо переарендовать нужные площади у другого датацентра, либо начать переговоры о возможной переподписке.

Можно ли добавить еще нагрузки? Строго говоря, для ответа на этот вопрос достаточно посмотреть на построенные нами три графика (аллокацию по месту, по электричеству и по воздуху) и, если на всех трех графиках есть свободные ресурсы, то, конечно, можно. Очевидно, что допустимая величина люфта будет определяться минимальным запасом из всех доступных.

Как задействовать неиспользуемую мощность? Допустим, мы использовали все доступные стойкоместа, а у нас все еще остается значительное количество электрической мощности. Как одно из некрасивых, но вполне действенных решений можно предложить переброс электрической мощности из одной серверной в другую. Аналогично, если в одной серверной есть избыток холода, а в соседней – недостаток, можно рассмотреть объединение серверных по воздуху путем демонтажа перегородки. Ну и т. д.

Можно ли сейчас выключить часть инженерного оборудования для обслуживания? Даже если в данный момент мы работаем с выключенным резервным оборудованием, но реальная нагрузка существенно ниже, можно оценить, как изменится положение целевой и максимальной линии при отключении еще одной единицы, и принять осознанное решение.

Последний пример, кстати, подтверждает желательность постоянного наблюдения за текущей загрузкой датацентра дежурными, так как в случае инцидента они смогут быстро оценить, насколько критично то или иное происшествие для выполнения датацентром своего предназначения, иными словами соблюдения SLA[33].

По-настоящему эффективное использование нашего замечательного инструмента возможно, когда его силу и ценность понимают все вовлеченные в работу датацентра отделы. Я говорю об отделе продаж (или его аналоге, предоставляющем планы внутренних заказчиков), отделе строительства, эксплуатации и верхнеуровневом руководстве. Для синхронизации общей картины необходимо проводить регулярные встречи отделов, где должна обсуждаться текущая ситуация, текущие и стратегические планы и возможные варианты действий для реализации планов, например корректировки бюджета компании.

В заключение этой главы мы разберем несколько примеров ситуаций, когда «что-то пошло не так» с планированием ресурсов, и то, какие выводы можно сделать в каждом случае.

1. В первом примере голубая линия на некоторое время становится выше зеленой (реальное потребление выше аллокации). Такая ситуация вполне возможна и является результатом ошибки. Либо ошибки мониторинга, когда измеренное значение не соответствует реальному положению дел, либо неправильно определенной линии аллокации.

Если с первой причиной можно справиться достаточно быстро, проверив корректность данных мониторинга и при необходимости восстановив работоспособность системы, то во втором случае требуется внимательный анализ причины. Ситуация осложняется, если линия аллокации действительно определена неверно, и это может привести к пересмотру данных не только для одного конкретного сервера, но и всего датацентра, что существенно изменит картину по всем остальным машзалам, где применяется этот тип серверов.

Вероятность того, что данные искажены ошибкой в измерениях или расчетах, есть всегда, но мы разберем вероятные проблемы, обусловленные неправильным планированием или техническими причинами.

2. Зеленая линия выше оранжевой (аллокация мощностей выше целевого значения). Такая ситуация может случаться сплошь и рядом и на самом деле не является по-настоящему критической.

Прежде всего по своему определению линия аллокации является только резервированием под возможное использование мощности, но вполне вероятно, что оборудование никогда не начнет использовать такое количество мощности.

Кроме того, если такое пересечение находится в отдаленном будущем, то оно может выступать индикатором того, что мощности кончились и необходимо каким-то образом их наращивать или перераспределять.

Если же такая ситуация наблюдается сейчас или в ближайшее время, когда никаких действий по перераспределению мощностей предпринять нельзя, то и тогда паниковать не стоит. В конце концов, оборудование работает и все в норме. Нужно рассмотреть возможность отказа от проведения работ, связанных с отключением инженерного оборудования, понижающего степень резервирования, и установить пристальное наблюдение за состоянием всех систем до того момента, когда мощности будут разгружены.

3. Голубая линия выше оранжевой (реальное потребление выше целевого значения). Ситуация, очень похожая на предыдущую, с одним отличием: в прошлый раз работа без резервирования могла произойти, а теперь точно произошла. В таком случае обязателен запрет на проведение любых манипуляций с оборудованием, которые могут привести к снижению резервирования, а также незамедлительное информирование IT-специалистов для срочного планирования разгрузки мощностей.

4. На следующем примере зеленая линия находится выше красной (планируемое потребление выше максимальной возможности датацентра).

Если такая ситуация предстоит где-то далеко в будущем, то это всего лишь громкий звоночек о том, что необходимо срочно запланировать действия по разгрузке существующих мощностей или по запуску в эксплуатацию новых. Это обсуждение будет вестись на регулярных встречах отделов компании. Если же такая ситуация происходит здесь и сейчас, это еще не катастрофа, но повод немедленно эскалировать ситуацию до руководителей компании и организовать немедленную разгрузку страдающей части датацентра.

5. Голубая линия выше красной (реальное потребление выше максимальной возможности датацентра). Из всех представленных случаев этот – самый катастрофический.

Фактически мы имеем случай, когда реальное потребление датацентра превышает максимально допустимое. «Как такое возможно?!» – спросит внимательный инженер. На самом деле, такая ситуация возможна, потому что линия на графике не является физическим предохранителем, который срабатывает при достижении какого-то значения. В каждой ситуации нужно разбираться отдельно. Как пример, можно назвать превышение расхода электропотребления системами вентиляции, которое не привело к отключению нагрузки, потому что в этот момент электропотребление других систем было не максимально. Тем не менее это уже аварийная ситуация, реагировать на которую дежурная смена должна незамедлительно.

6. Голубая линия намного ниже зеленой (реальное потребление заметно ниже аллокации). Практически это совсем не аварийная ситуация, однако сигнал о том, что датацентр используется неэффективно. Причины, скорее всего, таятся в значительном снижении задач, выполняемых серверами в датацентре, поэтому стоит связаться с администраторами заказчиков и уточнить, временное ли это явление или долгосрочное.

Еще одной причиной существенного снижения реального потребления может быть замена серверов на новые, для которых неправильно посчитано максимальное потребление. Пересмотр методики тестирования и обновление значений в такой ситуации могут высвободить дополнительные ресурсы для установки большего количества серверов и, соответственно, более эффективного использования площадки.

Эффект от изменения реальной нагрузки автоматически нивелируется через некоторое время при статистическом методе расчета мощности, потребляемой сервером.

Разумеется, это только несколько примеров анализа ресурсов в датацентре. Но нашей задачей было продемонстрировать методику анализа, и, надеюсь, приведенных примеров было достаточно.

На этом можно было бы закончить рассмотрение темы управления ресурсами. Но в ее основе лежит несколько интересных идей по дальнейшей оптимизации работы датацентров, в том числе и автоматизированному расчету имеющихся мощностей. Этим идеям имеет смысл посвятить отдельную главу.

Глава 15

Динамическая аллокация ресурсов

Тщательно изучив то, как происходит управление мощностями, и доведя организацию процесса до совершенства, можно сделать следующий шаг: автоматизировать изменение допустимых параметров системы в зависимости от режима, в котором она находится. Получится своего рода умный дом для датацентров. Разберем несколько примеров, чтобы показать направление мысли. Хотя стоит помнить,

Читать книгу "Настольная книга эксплуататора. Всё, что вы хотели знать о повседневной жизни датацентров, но боялись спросить - Алексей Жумыкин" - Алексей Жумыкин бесплатно


0
0
Оцени книгу:
0 0
Комментарии
Минимальная длина комментария - 7 знаков.


LoveRead » Разная литература » Настольная книга эксплуататора. Всё, что вы хотели знать о повседневной жизни датацентров, но боялись спросить - Алексей Жумыкин
Внимание