GitHub не справляється з 2,9 мільярдами комітів на місяць

GitHub обробляє 2,9 млрд комітів на місяць та не встигає за навантаженням

GitHub обробляє 2,9 млрд комітів на місяць та не встигає за навантаженням

Платформа GitHub зіткнулася з викликом масштабного зростання: розповсюдження штучного інтелекту та автономних агентів перевантажило її інфраструктуру. Це призвело до майже восьмигодинного збою 17 серпня — вже другого великого інциденту за місяць. У відповідь компанія прискорює міграцію сервісів до хмари Microsoft Azure.

За новими даними, щомісячні обсяги роботи GitHub сягнули вражаючих масштабів: платформа обробляє 2,9 млрд комітів, що понад удвічі перевищує квітневий показник у 1,4 млрд, 130 млн об’єднаних pull request’ів та 24 млн нових репозиторіїв.

Причиною такого вибухового зростання став стрімкий розвиток інструментів розробки на базі ШІ та зміна самого підходу до створення програмного забезпечення. Попри зусилля з переходу на сучаснішу архітектуру, платформі не вдається масштабуватися достатньо швидко.

Що сталося під час збою 17 серпня

Згідно з технічним аналізом від технічного директора GitHub Влада Федорова, збій виник суто через проблеми зі масштабуванням, а не через внесення змін у код.

«Наше розслідування показало, що збій розпочався, коли трафік досяг нового піка, а критичний компонент інфраструктури в дата-центрі Central US не зміг масштабуватися разом із ним. Внаслідок цього брак потужності поширився всіма системами, спричинивши помилки аутентифікації та збої в роботі багатьох сервісів GitHub», — пояснив Федоров.

GitHub не справляється з 2,9 мільярдами комітів на місяць 2

3 млн нових ядер CPU виявилося замало

Проблема виникла не через відсутність розширення ресурсів. За даними CTO, компанія вже перенесла 58% навантаження платформи на Azure (у травні цей показник становив лише 12%), а також передала хмарі обслуговування половини всіх Git-операцій.

За поточний рік GitHub додав понад 3 млн процесорних ядер та 120 петабайтів високошвидкісного сховища.

Проте власні дата-центри сервісу досягли межі: обладнання встановлено настільки багато, наскільки це дозволяють наявні енергетичні потужності.

Федоров також визнав, що процеси управління не встигали за темпами змін: команда вже перенаправила ресурси на підвищення доступності, посилення тестування, моніторингу та сповіщень. Крім того, триває робота з ізоляції критичних систем і видалення спільних залежностей, щоб знизити ймовірність каскадних збоїв.

Для запобігання «штормам повторних запитів» та перевантаженню інфраструктури, GitHub уже впроваджує жорсткі ліміти на повторні спроби з’єднання та коригує таймаути між сервісами.

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *